老金出海AI · GO GLOBAL
技术思想家Andrej Karpathy · 2023年11月22日 · 59:48

一小时听懂大语言模型(Karpathy 公开课)

提示:播放器右下角「字幕」可开启 / 切换字幕语言;如视频提供中文字幕,可直接切换。

中文导读

Karpathy 离开特斯拉后录的第一支公开通识课,一小时讲完大模型是什么、怎么训练出来、往哪走。没有数学门槛,却把「模型 = 有损压缩的互联网」「RLHF 是什么」「为什么工具使用是方向」讲清楚了。全网上千万播放,是中文圈无数科普文章的母本。

关键观点

  • 大模型本质:把互联网文本有损压缩进权重,用「预测下一个词」调用出来。
  • 训练分两阶段:预训练拿底座模型,微调(SFT + RLHF)变成会对话的助手。
  • Scaling law:表现随算力/数据/参数平滑提升,且可提前预测。
  • LLM 是「新操作系统的内核」:上下文窗口是内存,工具是外设。
  • 安全面要早懂:提示注入、越狱、数据投毒都是真实攻击面。

原视频信息

讲者
Andrej Karpathy
频道
Andrej Karpathy
场合
个人频道公开课
日期 · 时长
2023年11月22日 · 59:48

[1hr Talk] Intro to Large Language Models

在 YouTube 观看原片