技术思想家Andrej Karpathy · 2023年1月17日 · 1:56:20
从零手写 GPT:Karpathy 逐行带练
提示:播放器右下角「字幕」可开启 / 切换字幕语言;如视频提供中文字幕,可直接切换。
| 项目 | 详情 |
|---|---|
| 嘉宾 | Andrej Karpathy |
| 频道 | Andrej Karpathy |
| 日期 | 2023年1月17日 |
| 时长 | 1:56:20 |
| 格式 | 视频 |
| 主题 | #llm · #engineering · #open-source |
中文导读
全网最经典的 Transformer 入门实操:Karpathy 打开空白文件,近两小时带你在笔记本上写出能跑的 nano-GPT。注意力机制、多头注意力、残差连接、LayerNorm,每个概念都落成 PyTorch 代码。这是祛魅大模型最有效的一支视频。
关键观点
- GPT 核心 = 注意力:让 token 之间按相关性互相「通信」再预测下一个。
- 从零搭 Transformer:embedding → 多头注意力 → 前馈 → 残差 + LayerNorm → 输出头。
- 训练 = 抽样文本 → 算损失 → 反向传播,几百行代码全部讲完。
- 亲手训出莎士比亚文风小模型,直观看到「智能如何从预测里长出来」。
- 看完再读 GPT-2/GPT-3 论文,术语全部对得上。
原视频信息
- 讲者
- Andrej Karpathy
- 频道
- Andrej Karpathy
- 场合
- 个人频道「Zero to Hero」系列
- 日期 · 时长
- 2023年1月17日 · 1:56:20
Let's build GPT: from scratch, in code, spelled out.
在 YouTube 观看原片📚 来源与延伸
本页内容基于以下权威来源整理,可验证、可引用。
引用规范:请注明来源为老金出海(laojinchuhai.com)并保留原文链接。
老金出品 · 用 AI 提效
AllModelsAPI一个 key,调多家大模型
AllModelsAPI 是多模型 API 中转站:一个 key 调多家模型,OpenAI 兼容接口,现有代码改个 base_url 就能迁。它不是演示品——我们自己的生产环境每天都在用。
更多老金产品:Sellenca · 365AIOrg · 365Loopa · 365 Ops · 365Skill
相关内容
按主题 / 人物 / 专区自动互通