技术思想家Andrej Karpathy · 2023年1月17日 · 1:56:20
从零手写 GPT:Karpathy 逐行带练
提示:播放器右下角「字幕」可开启 / 切换字幕语言;如视频提供中文字幕,可直接切换。
中文导读
全网最经典的 Transformer 入门实操:Karpathy 打开空白文件,近两小时带你在笔记本上写出能跑的 nano-GPT。注意力机制、多头注意力、残差连接、LayerNorm,每个概念都落成 PyTorch 代码。这是祛魅大模型最有效的一支视频。
关键观点
- GPT 核心 = 注意力:让 token 之间按相关性互相「通信」再预测下一个。
- 从零搭 Transformer:embedding → 多头注意力 → 前馈 → 残差 + LayerNorm → 输出头。
- 训练 = 抽样文本 → 算损失 → 反向传播,几百行代码全部讲完。
- 亲手训出莎士比亚文风小模型,直观看到「智能如何从预测里长出来」。
- 看完再读 GPT-2/GPT-3 论文,术语全部对得上。
原视频信息
- 讲者
- Andrej Karpathy
- 频道
- Andrej Karpathy
- 场合
- 个人频道「Zero to Hero」系列
- 日期 · 时长
- 2023年1月17日 · 1:56:20
Let's build GPT: from scratch, in code, spelled out.
在 YouTube 观看原片