老金出海AI · GO GLOBAL
技术思想家Andrej Karpathy · 2023年1月17日 · 1:56:20

从零手写 GPT:Karpathy 逐行带练

提示:播放器右下角「字幕」可开启 / 切换字幕语言;如视频提供中文字幕,可直接切换。

项目详情
嘉宾Andrej Karpathy
频道Andrej Karpathy
日期2023年1月17日
时长1:56:20
格式视频
主题#llm · #engineering · #open-source

中文导读

全网最经典的 Transformer 入门实操:Karpathy 打开空白文件,近两小时带你在笔记本上写出能跑的 nano-GPT。注意力机制、多头注意力、残差连接、LayerNorm,每个概念都落成 PyTorch 代码。这是祛魅大模型最有效的一支视频。

关键观点

  • GPT 核心 = 注意力:让 token 之间按相关性互相「通信」再预测下一个。
  • 从零搭 Transformer:embedding → 多头注意力 → 前馈 → 残差 + LayerNorm → 输出头。
  • 训练 = 抽样文本 → 算损失 → 反向传播,几百行代码全部讲完。
  • 亲手训出莎士比亚文风小模型,直观看到「智能如何从预测里长出来」。
  • 看完再读 GPT-2/GPT-3 论文,术语全部对得上。

原视频信息

讲者
Andrej Karpathy
频道
Andrej Karpathy
场合
个人频道「Zero to Hero」系列
日期 · 时长
2023年1月17日 · 1:56:20

Let's build GPT: from scratch, in code, spelled out.

在 YouTube 观看原片

📚 来源与延伸

本页内容基于以下权威来源整理,可验证、可引用。

引用规范:请注明来源为老金出海(laojinchuhai.com)并保留原文链接。

老金出品 · 用 AI 提效

AllModelsAPI一个 key,调多家大模型

AllModelsAPI 是多模型 API 中转站:一个 key 调多家模型,OpenAI 兼容接口,现有代码改个 base_url 就能迁。它不是演示品——我们自己的生产环境每天都在用。

更多老金产品:Sellenca · 365AIOrg · 365Loopa · 365 Ops · 365Skill

相关内容

按主题 / 人物 / 专区自动互通