老金出海AI · GO GLOBAL
AI 资讯 · 经典回放Andrej Karpathy · 2023年1月17日 · 1:56:20

从零手写 GPT:Karpathy 逐行带练

提示:播放器右下角「字幕」可开启 / 切换字幕语言;如视频提供中文字幕,可直接切换。

中文导读

全网最经典的 Transformer 入门实操:Karpathy 打开空白文件,从字符级 token 化开始,近两小时内带你在笔记本上写出一个能跑的 nano-GPT。注意力机制、多头注意力、残差连接、LayerNorm,每个概念都落成能运行的 PyTorch 代码。哪怕不写代码,跟着看一遍也能真正理解「注意力」到底在算什么——这是祛魅大模型最有效的一支视频。

关键观点

  • GPT 的全部核心就是一个公式:注意力 = 让 token 之间按相关性互相「通信」再预测下一个。
  • 从零搭出完整 Transformer:embedding → 多头注意力 → 前馈 → 残差 + LayerNorm → 输出头。
  • 训练就是不断抽样一批文本、算损失、反向传播——几百行代码全部讲完。
  • 亲手训出的莎士比亚文风小模型,让人直观看到「智能如何从预测里长出来」。
  • 看完再读 GPT-2/GPT-3 论文,术语全部对得上号。

原视频信息

讲者
Andrej Karpathy
频道
Andrej Karpathy
场合
个人频道「Zero to Hero」系列课
日期 · 时长
2023年1月17日 · 1:56:20

Let's build GPT: from scratch, in code, spelled out.

在 YouTube 观看原片