技术思想家Andrej Karpathy · 2023年11月22日 · 59:48
一小时听懂大语言模型(Karpathy 公开课)
提示:播放器右下角「字幕」可开启 / 切换字幕语言;如视频提供中文字幕,可直接切换。
中文导读
Karpathy 离开特斯拉后录的第一支公开通识课,一小时讲完大模型是什么、怎么训练出来、往哪走。没有数学门槛,却把「模型 = 有损压缩的互联网」「RLHF 是什么」「为什么工具使用是方向」讲清楚了。全网上千万播放,是中文圈无数科普文章的母本。
关键观点
- 大模型本质:把互联网文本有损压缩进权重,用「预测下一个词」调用出来。
- 训练分两阶段:预训练拿底座模型,微调(SFT + RLHF)变成会对话的助手。
- Scaling law:表现随算力/数据/参数平滑提升,且可提前预测。
- LLM 是「新操作系统的内核」:上下文窗口是内存,工具是外设。
- 安全面要早懂:提示注入、越狱、数据投毒都是真实攻击面。
原视频信息
- 讲者
- Andrej Karpathy
- 频道
- Andrej Karpathy
- 场合
- 个人频道公开课
- 日期 · 时长
- 2023年11月22日 · 59:48
[1hr Talk] Intro to Large Language Models
在 YouTube 观看原片