AI 资讯 · 经典回放Andrej Karpathy · 2025年2月5日 · 3:31:23
深入拆解 ChatGPT 这类大模型(3.5 小时通识课)
提示:播放器右下角「字幕」可开启 / 切换字幕语言;如视频提供中文字幕,可直接切换。
中文导读
2025 年更新的「完整版」:Karpathy 用三个半小时把 ChatGPT 类产品的完整流水线端到端讲一遍——数据、分词、预训练、后训练、推理、工具使用、幻觉与防护。比 2023 年的一小时版深了整整一层,直接覆盖推理模型(thinking)和 RL 后训练这些新进展。适合抽一个下午系统补齐大模型认知,看完你和工程师聊天不再有代沟。
关键观点
- 完整流水线:从原始互联网数据到分词、预训练,再到监督微调与强化学习后训练。
- 幻觉不是 bug 是特性:模型永远在编「统计上最像」的回答,缓解要靠工具与检索。
- 推理模型的关键:让模型在回答前「多想一会儿」,用强化学习奖励对的思考链。
- 能力有「瑞士奶酪」结构:难题能做、简单题翻车,别把演示当生产力。
- 用好 ChatGPT 的实操:把上下文当内存管理,该开新对话就开新对话。
原视频信息
- 讲者
- Andrej Karpathy
- 频道
- Andrej Karpathy
- 场合
- 个人频道 3.5 小时通识大课
- 日期 · 时长
- 2025年2月5日 · 3:31:23
Deep Dive into LLMs like ChatGPT
在 YouTube 观看原片