AI 资讯 · 经典回放Andrej Karpathy · 2023年11月22日 · 59:48
一小时听懂大语言模型(Karpathy 公开课)
提示:播放器右下角「字幕」可开启 / 切换字幕语言;如视频提供中文字幕,可直接切换。
中文导读
这是 Karpathy 离开特斯拉后录的第一支公开通识课,一小时讲完大模型是什么、怎么训练出来、会往哪走。没有数学门槛,却把「模型 = 有损压缩的互联网」「下一个词预测如何长出智能」「RLHF 是什么」「为什么工具使用是方向」全讲清楚了。全网上千万播放,是中文圈无数科普文章的母本。团队里有非技术同事的,直接甩这一支。
关键观点
- 大模型的本质:把互联网文本有损压缩进权重,再用「预测下一个词」调用出来。
- 训练分两阶段:预训练拿到底座模型,微调(SFT + RLHF)把它变成会对话的助手。
- Scaling law:模型表现随算力/数据/参数平滑提升,且可提前预测——这是行业敢砸钱的底气。
- LLM 是「新操作系统的内核」:上下文窗口是内存,工具(浏览器/代码/检索)是外设。
- 安全面要早懂:提示注入、越狱、数据投毒都是真实攻击面,用 AI 必读的一课。
原视频信息
- 讲者
- Andrej Karpathy
- 频道
- Andrej Karpathy
- 场合
- 个人频道公开课(「忙人版」大模型导论)
- 日期 · 时长
- 2023年11月22日 · 59:48
[1hr Talk] Intro to Large Language Models
在 YouTube 观看原片