第四讲(中)· 训练与涌现
从一堆随机旋钮,到能与人对话的助手
第 1 节 · 2 分钟导读
📖 关于本讲的阅读提示
亲爱的老师:
上一讲我们讲了 LLM 的机械结构——Token、Embedding、Attention、Transformer。
但一个崭新的 Transformer 模型,刚被创建出来时什么都不会。它的几千亿个参数(旋钮)是随机数字。您问它「1+1 等于几」,它可能会吐出一串乱码。
那为什么您今天用的豆包、Kimi、Claude,能回答问题、写代码、讲笑话?
这一讲就是要回答:
🎯 「一个架构正确但参数随机的模型,是如何通过训练变成真正好用的 ChatGPT 的?」
这是整门课最神奇的一部分——您会看到:
- 一个模型如何在几万亿 token 的人类文字里「游泳几个月」,被迫浮现出知识
- 工程师如何教它「好好说话」,把原始能力转化为对话技能
- 如何把人类价值观「注射」进模型,让它变得有用、无害、诚实
- 为什么模型够大了之后,能力会「突然涌现」
- 2024 年后的新范式:推理模型如何让 AI 学会「慢慢想」
- DeepSeek 凭什么能用 6 百万美元训练出 OpenAI 花几亿美元才训练出来的东西
🎯 本讲的阅读规则(延续前作)
主干文字是完整的讲解。 您只读主干,也能掌握 80% 的内容。
每个关键概念后有「📐 数学视角(可跳过)」 小框。里面放公式、符号、细节。
- 喜欢精确:读它。
- 只想理解:跳过它,继续主干。
本讲(中)的章节地图
一、开篇:从「一堆随机旋钮」到「ChatGPT」的奇幻旅程
二、第一阶段 · 预训练(Pre-training):在人类文明的全部文字里泡几个月
三、第二阶段 · 监督微调(SFT):学会「好好说话」
四、第三阶段 · 对齐(RLHF & DPO):学会「做个好助手」
五、三阶段全景总结:一个模型的完整出生历程
六、训练规模揭秘:建立万亿参数、几亿美元的数量级感
七、涌现(Emergence):规模产生的质变 🌟
八、推理模型:让 AI 学会「慢慢想」(o1 / R1 / Claude Thinking)
九、MoE 混合专家:DeepSeek 如何把成本打到地板
十、幻觉(Hallucination):最大的不完美及应对
十一、本讲小结 + 预告第四讲(下)
第 2 节 · 2 分钟开篇:从「一堆随机旋钮」到「ChatGPT」
请各位老师做一个思想实验。
想象您是 Anthropic(Claude 的制造商)的一位工程师。今天是模型训练的第零天。
您面前有: - 一个全新的 Transformer 架构(结构按上一讲讲的那样搭好) - 几千亿个参数(旋钮),值都是随机数字 - 几万亿 GPU 运算单元,等待启动
您输入一个简单的问题:
「请问 1 + 1 等于几?」
模型的输出是……
「卝Θ哈 tz !! 粹 ...... 奥 pq 霹 ...」
一串彻底的乱码。
这是真实情况。一个刚被创建出来的 Transformer,它的参数是随机的——它对语言一无所知。它连「1」这个 token 应该跟「加」还是跟「苹果」都不知道。
它现在是一张白纸。
这一讲要回答的核心问题是:几个月后,当这个模型变成 Claude Opus 4.7 的时候,它是怎么从「一无所知」变成「无所不知」的?
答案分为三个阶段。
1.1 三阶段训练鸟瞰
现代大语言模型(GPT、Claude、DeepSeek、Qwen……)的训练,几乎都分成三个阶段:
┌──────────────────────────┐
阶段一 │ 预训练 Pre-training │ 学语言、学知识
│ 几万亿 token 的互联网文本 │ 几个月,几亿美元
└──────────────┬───────────┘
▼
┌──────────────────────────┐
阶段二 │ 监督微调 SFT │ 学说话、学对话
│ 几万到几十万高质量对话 │ 几天,几百万美元
└──────────────┬───────────┘
▼
┌──────────────────────────┐
阶段三 │ 对齐 RLHF / DPO │ 学做好助手
│ 人类偏好反馈 │ 几天,几百万美元
└──────────────┬───────────┘
▼
╔══════════════╗
║ ChatGPT / ║
║ Claude 诞生 ║
╚══════════════╝
三个阶段分别解决三个问题:
| 阶段 | 问题 | 通俗理解 |
|---|---|---|
| 预训练 | 让模型懂语言、懂世界 | 像小孩把百科全书、文学、科学、新闻全都背一遍 |
| SFT 监督微调 | 让模型学会对话 | 教他:有人问问题的时候,应该怎么回答 |
| 对齐 | 让模型成为「好助手」 | 告诉他什么是好回答、什么是坏回答,让他内化价值观 |
我们接下来一个一个讲。
1.2 为什么必须是三个阶段?
直接问: 「为什么不能一步到位?」
答:三个阶段各自解决的问题不一样,用的数据和训练方法完全不同。
- 预训练用的是海量、低质量、无标注的互联网文本——便宜但数据量大
- SFT 用的是少量、高质量、人工写的对话——昂贵但精准
- 对齐用的是人类偏好数据——非常昂贵但决定了「人味」
一步到位是不可能的——就像您不能让一个孩子同时学会说话、读书、做人——得分阶段。
好,我们正式进入第一阶段。
第 3 节 · 7 分钟第一阶段 · 预训练(Pre-training):在人类文明的全部文字里泡几个月
预训练是三阶段里最花钱、最花时间、也最神奇的一步。
它的目标只有一个:让模型学会「预测下一个词」。
它的方法简单得不可思议:把互联网上能找到的所有文字都喂给它,让它不停猜下一个词,猜错了就调整参数。
2.1 训练数据:互联网级别的文字海洋
想象一下这些数据:
① Common Crawl(公共爬虫数据)
有个非营利组织叫 Common Crawl,它从 2008 年开始持续爬取整个公开的互联网。到 2026 年,它的数据库已经超过 250 PB(一个 PB = 100 万 GB)。
大语言模型的训练,有很大一部分用的就是 Common Crawl 的数据——虽然还要做清洗、去重、过滤。
② 书籍
- 维基百科的全部条目(多语言)
- 数百万本公开的电子书(Project Gutenberg、各类学术库)
- 大量专业教材和工具书
③ 代码
- GitHub 上所有公开的代码仓库
- Stack Overflow 的问答
- 各种编程教程和文档
④ 学术论文
- arXiv 上的几百万篇论文
- PubMed 上的医学文献
⑤ 对话数据
- Reddit、知乎、豆瓣、微博等公开论坛
- 字幕网站上的对话文本
⑥ 其他结构化内容
- 新闻网站的档案
- 各类百科网站
- 中文 / 日文 / 西班牙文等非英语大规模语料
GPT-4 的训练数据规模(根据公开估计):
约 13 万亿 token
13 万亿 token 是什么概念?
- 相当于约 500 亿页文字
- 相当于一个人不停阅读 10 万年
- 相当于把大英图书馆的内容读 20 遍
GPT-5 更多,Claude Opus 4.7 / Gemini 3 Pro / DeepSeek V4 都用了更多数据 + 更好的清洗。
2.2 训练过程:让模型「读」完这些数据
核心机制就是一句话:
🎯 把一段文字遮住最后一个 token,让模型猜是什么——猜错了就调参数,猜对了不动。
比如:
原文:「今天天气真好,我打算去公园散步。」
Token 化:["今天", "天气", "真", "好", ",", "我", "打算", "去", "公园", "散步", "。"]
训练样本:
输入:「今天」 → 预测:「天气」
输入:「今天 天气」 → 预测:「真」
输入:「今天 天气 真」 → 预测:「好」
输入:「今天 天气 真 好」 → 预测:「,」
输入:「今天 天气 真 好 ,」 → 预测:「我」
......(一共 10 个训练信号)
一段 11 个 token 的文字,可以拆出 10 个训练样本。
把全互联网的几万亿 token 都这样「拆」一遍——得到几十万亿个训练信号。
让模型反复过这些训练信号,每次猜错就微调参数——几个月后,它就变成了预训练好的基础模型。
2.3 一个核心事实:没有人告诉模型「答案是对的」
这件事很多人没理解透——
预训练阶段,模型的「老师」不是人类工程师,是数据本身。
如何「打分」? - 如果模型预测「今天天气真好,我打算去公园__」的下一个词是「散步」,恰好和原文一样 → 算对,不调参数 - 如果模型预测的是「乱码」 → 算错,调整参数让下次更可能预测「散步」
这种训练方式叫「自监督学习」(Self-Supervised Learning)。第二讲里埋过这个概念,现在它就在 LLM 训练里发挥出最大威力。
「自监督」的妙处:
- 不需要人工标注——把互联网文本直接拿来就能用
- 训练数据无限——只要互联网在扩大,数据就在扩大
- 学到的是「世界模型」——因为要准确预测下一个词,模型必须「理解」文字背后的知识、逻辑、规律
2.4 预训练中究竟学到了什么?
一个有趣的问题:模型在预训练中到底学了什么?
答案是——惊人地多。以下所有能力,都是预训练阶段「顺带」学到的:
① 语言本身 - 语法规则(主谓宾的顺序) - 词汇的用法(「吃」后面接食物,「喝」后面接液体) - 多语言能力(中英法日韩…… 都在数据里)
② 世界知识 - 常识(太阳东升西落、水是液体) - 历史(唐朝在什么时候) - 地理(巴黎是法国首都) - 科学(万有引力公式、DNA 结构) - 文学(《红楼梦》的情节)
③ 推理能力 - 简单数学(2 + 3 = 5) - 因果关系(下雨 → 地湿) - 类比(国王之于王后 = 父亲之于母亲)
④ 风格与语感 - 正式 vs 口语 - 不同文化的表达方式 - 诗歌、散文、议论文等文体
⑤ 一些让人意外的能力 - 简单编程 - 初等化学反应 - 简单心理学常识
为什么「猜下一个词」就能学到这么多?
回到第四讲(上)讲的一个深刻观点——
💡 「要准确预测下一个词,模型必须对世界有某种理解。」
比如要预测这句话的结尾:
「小明今年 12 岁,他爸爸是一名医生。医生的收入通常__」
要准确预测「很高」或「不错」,模型必须: - 知道「医生」这个职业 - 知道「收入」是什么 - 知道社会常识:医生的收入通常较高
这些知识没人直接「教」给模型——它为了猜对下一个词,不得不学。
2.5 预训练的结果:基础模型(Base Model)
预训练完成后,得到的叫 基础模型(Base Model) 或 预训练模型(Pretrained Model)。
基础模型的特点:
- ✅ 懂语言、懂世界
- ✅ 有海量知识
- ❌ 不会聊天!
- ❌ 不会回答问题!
- ❌ 不会遵循指令!
这听起来奇怪吧?但这是真的。
基础模型的一个真实「对话」例子:
您(用户):「请告诉我巴黎的人口。」
基础模型:「请告诉我巴黎的人口。请告诉我法国的首都。请告诉我欧洲最大的城市是哪里。请告诉我伦敦的人口……」
这是什么鬼?
原因是——基础模型是「预测下一个词」的机器。它在训练数据里见过很多问题列表(比如 FAQ 页面、考试题目),所以它看到「请告诉我巴黎的人口」,它不认为这是一个「问题」,而认为这是某种列表的开头——它会「预测」接下来应该是更多的类似问题。
基础模型不「知道」自己应该回答问题。它只知道预测最可能的下一段文字。
所以预训练只是第一步。要让基础模型变成「懂对话的助手」,必须有第二阶段。
这就引出了 SFT。
2.6 预训练的成本:一个惊人的数字
预训练是三阶段里最烧钱的一步。
| 模型 | 估计训练成本(仅算力) |
|---|---|
| GPT-3(2020) | 约 $460 万 |
| GPT-4(2023) | 约 $6,300 万 |
| GPT-5.4(2026) | 预估 $3-5 亿 |
| Claude Opus 4.7(2026) | 预估 $2-4 亿(未公开) |
| LLaMA-3 405B(2024) | 约 $1 亿(Meta 公开承认) |
| DeepSeek V3(2024) | 约 $557 万(这个数字震惊了世界,后面会讲) |
训练一次 GPT-4 的电费,就能让一个小县城用一年。
这就是为什么 2026 年的前沿大模型,全球就那几家公司能做——OpenAI、Anthropic、Google、Meta、以及中国的阿里、字节、深度求索、月之暗面等极少数公司。不是技术不公开,是烧不起这个钱。
📐 数学视角(可跳过)
预训练的损失函数(用交叉熵):
$$\mathcal{L}{\text{pretrain}} = -\frac{1}{N} \sum)$$}^{N} \log P_\theta(w_i \mid w_1, w_2, \ldots, w_{i-1
其中: - $N$:训练数据中 token 的总数(几万亿量级) - $w_1, \ldots, w_N$:训练文本序列 - $P_\theta(w_i \mid \ldots)$:模型(参数 $\theta$)在看到前 $i-1$ 个 token 后,预测第 $i$ 个 token 是 $w_i$ 的概率
训练目标:最大化训练数据的对数似然,等价于最小化上面的负对数似然。
训练算力的估算公式(Kaplan 等 2020):
$$C \approx 6 \cdot N \cdot D$$
其中: - $C$:总计算量(FLOPS,浮点运算次数) - $N$:模型参数量 - $D$:训练 token 数 - 常数 6 来自:前向传播 2N + 反向传播 4N
例:GPT-3 $N = 175\text{B}$,$D = 300\text{B}$ → $C \approx 3.14 \times 10^{23}$ FLOPS。
按 2020 年 NVIDIA A100 的 312 TFLOPS 计算,单卡需要 32,000 天。用 1024 张卡并行,需要约 31 天——这和 OpenAI 公开的训练时间吻合。
好——预训练讲完了。我们有一个懂语言懂世界但不会对话的基础模型。
现在进入第二阶段——教它说话。
第 4 节 · 3 分钟第二阶段 · 监督微调(SFT):学会「好好说话」
3.1 从「续写机」到「对话机」的关键一步
上一节末尾我们看到:基础模型遇到「请告诉我巴黎的人口」会继续写更多类似问题,而不是回答问题。
为什么?
因为在它见过的训练数据里,「问题+回答」的格式不是主流。它更多见过: - 新闻报道(陈述句连续) - 小说(叙事为主) - 问题列表(题目后面跟更多题目)
它没学到「一个问题应该被回答」这个对话的规则。
SFT 的任务,就是教会它这件事。
3.2 SFT 的做法:给它高质量的「示范对话」
SFT(Supervised Fine-Tuning,监督微调) 的做法:
🎯 雇人写几万到几十万条「问答示范」,让模型在这些示范上重新训练一轮,学会「遇到问题就回答」的模式。
示范对话长什么样?
【示例 1】
用户:请解释什么是光合作用。
助手:光合作用是绿色植物、藻类和某些细菌利用阳光、二氧化碳和水,
制造葡萄糖并释放氧气的过程。这个过程主要发生在植物的叶绿体中,
是地球上大多数生命的能量来源。简化反应式是:
6CO₂ + 6H₂O + 阳光 → C₆H₁₂O₆ + 6O₂
【示例 2】
用户:帮我想三个关于环保的科普视频标题。
助手:好的,三个建议:
1. 《一节电池污染一立方米土壤:你扔对垃圾了吗?》
2. 《三分钟搞懂碳中和:它和你的奶茶杯有什么关系》
3. 《海洋每分钟增加一卡车塑料:2050 年鱼会比塑料少吗?》
【示例 3】
用户:你能做什么?
助手:我是一个 AI 助手,可以帮你写作、翻译、回答问题、讲解概念、
辅助编程、整理信息等等。请告诉我你需要什么帮助?
这些示范由谁来写?
答:各大公司会雇佣专业标注员——很多是在读博士、学科专家、甚至领域老师——手工写几万到几十万条这样的示范。
3.3 SFT 的训练技巧
SFT 和预训练在本质上是同一种训练——都是「预测下一个 token」。只是数据换了:
- 预训练:预测整个互联网文本中的每个下一 token
- SFT:预测示范对话里「助手」说的部分的每个下一 token
关键技巧:只在「助手的回答部分」算损失,不在「用户的问题部分」算损失。
数据格式:
[用户] 请解释什么是光合作用。[/用户]
[助手] 光合作用是绿色植物…… ← 只在这一段算损失,训练模型「学会回答」
[/助手]
3.4 SFT 数据量:质量远胜于数量
预训练需要几万亿 token。 SFT 只需要几万到几十万条对话——大约几千万到几亿 token。
为什么差这么多?
因为 SFT 不是在教「语言」或「知识」——那些预训练阶段已经都学过了。SFT 只是在教一种「行为模式」:问了就要答、格式要规整、有礼貌……
教「行为模式」不需要海量数据——但需要高质量。
一个令人惊叹的事实:
Meta 2023 年的 LLaMA 2 论文公开了他们的 SFT 数据——只有 27,540 条。就这 2.7 万条高质量对话,让模型学会了如何「好好说话」。
这说明:LLM 的能力 99% 来自预训练,SFT 只是「释放」这些能力。
3.5 SFT 之后的模型 = 第一版本的「可用助手」
SFT 完成后,模型已经能做一个不错的助手了:
- ✅ 懂语言懂世界(预训练给的)
- ✅ 会回答问题(SFT 教的)
- ✅ 会遵循简单指令
- ⚠️ 但回答的质量参差不齐——有时候有用,有时候跑题;有时候礼貌,有时候冒犯
这就需要第三阶段——对齐来精细打磨了。
第 5 节 · 6 分钟第三阶段 · 对齐(Alignment):学会「做好助手」
这是三阶段里最复杂的一步,也是 ChatGPT 之所以是 ChatGPT、Claude 之所以是 Claude 的关键所在。
4.1 对齐是什么?
先搞清楚概念:
📖 对齐(Alignment):让 AI 的输出、行为、价值观,与人类的意图和偏好保持一致的过程。
听起来抽象。具体来说:
- 当 AI 遇到一个开放问题(没有标准答案),它应该给出什么样的回答?
- 当有人问有害问题(如「怎么自杀」),AI 应该怎么反应?
- 当有人问偏见性问题(如「哪个种族更聪明」),AI 应该怎么处理?
- 当答案可能有多个表达方式,AI 应该选哪种语气、哪种详细程度、哪种结构?
这些问题没有数学上的「正确答案」——但有人类普遍认同的「更好答案」。
对齐的目标就是让 AI 理解这些偏好,并在回答时遵循。
4.2 对齐的三个目标:HHH
Anthropic(Claude 的制造商)提出了一个影响广泛的框架,对齐的三个目标:
| 目标 | 英文 | 含义 |
|---|---|---|
| 有用 | Helpful | 真正帮到用户,解决问题 |
| 无害 | Harmless | 不生成有害、危险、冒犯性内容 |
| 诚实 | Honest | 说真话,不编造,知之为知之 |
这三个目标之间常常冲突:
- 完全「有用」可能要求回答任何问题,但「无害」要求拒绝有害问题
- 完全「诚实」要求承认不知道,但「有用」要求尽量给出答案
对齐的难点,就是在这三者之间找平衡。
4.3 对齐方法一:RLHF —— 让人类打分教模型
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)
这是 ChatGPT 2022 年横空出世的秘密武器。其核心步骤:
步骤 1:收集人类偏好数据
对每个问题,让 SFT 完成后的模型生成多个回答,然后让人类标注员排序——哪个更好、哪个次之、哪个最差。
例如:
问题:请告诉我一个激励学生的故事。
回答 A:从前有个学生很努力,他成功了。
回答 B:我来讲个实例——史蒂芬·霍金确诊渐冻症时才 21 岁,医生说他活不过 2 年。但他写出了《时间简史》,活到 76 岁。他用事实证明:身体的极限不是精神的边界。愿这个故事给每个面对困难的孩子一点力量。
回答 C:哦,激励学生?你们老师总要说这种话。
人类排序:B > A > C
收集几千到几万条这样的偏好对比数据。
步骤 2:训练一个「奖励模型」
用这些偏好数据训练一个奖励模型(Reward Model)——这是另一个神经网络,它的任务是:
🎯 给模型的任何输出打一个分,这个分数尽量和人类标注员的偏好一致。
奖励模型在训练完成后,就代替人类打分(因为让几亿条回答都让人类打分是不可能的)。
步骤 3:用强化学习训练原模型
现在有了: - 原 LLM(会说话但需要优化) - 奖励模型(会打分)
就可以用强化学习(第二讲讲过)训练了:
LLM 生成回答
↓
奖励模型打分
↓
分数低 → 调整 LLM 参数让下次不这么答
分数高 → 调整 LLM 参数让下次更这么答
↓
反复循环几千次
几天之后,LLM 的回答普遍获得更高的奖励分数——这意味着它的回答更接近人类偏好。
这就是 RLHF 的全流程。
4.4 RLHF 的「魔法」:从 「勉强能用」到 「惊艳」
GPT-3(未经 RLHF,2020):
用户:什么是幸福? GPT-3:幸福是。幸福是幸福。什么是不幸?幸福是……
(胡言乱语)
GPT-3.5(RLHF 之后,2022):
用户:什么是幸福? GPT-3.5:幸福是一种主观的心理状态,通常由满足感、愉悦感和生活意义感组成……(一段清晰、得体的回答)
同一个基础模型,加了 RLHF 之后,判若两人。
OpenAI 首席科学家 Ilya Sutskever 有一个著名的观察:
🗣️ 「RLHF 并没有让模型更聪明——它让模型更有用。」
深刻。预训练已经让模型无所不知,但 RLHF 让它学会'把知识用出来'——这才是让用户感到惊艳的部分。
4.5 RLHF 的麻烦:复杂、脆弱、烧钱
RLHF 效果很好,但它有三个致命问题:
❶ 非常复杂 - 要训练两个模型(奖励模型 + 原 LLM) - 强化学习的超参数调起来像炼丹 - 训练不稳定,经常失败
❷ 需要大量人工标注 - 几万到几十万条偏好数据 - 每条都要人看、比较、打分 - 成本很高(几百万美元级)
❸ 容易「投机取巧」 - 模型学会了「生成奖励模型喜欢的答案」——不一定是「生成真的好的答案」 - 这叫 奖励破解(Reward Hacking)
4.6 对齐方法二:DPO —— 更简单的替代方案
2023 年,斯坦福的 Rafailov 等人提出了一个惊艳的新方法:
📜 DPO(Direct Preference Optimization,直接偏好优化)
核心突破:不需要训练奖励模型,不需要强化学习。
直接用一个巧妙的数学推导,把「模型更倾向于好答案」这件事转化为一个普通的监督学习损失函数。
优点: - ✅ 实现简单(一个损失函数替代了整套 RL 流程) - ✅ 训练稳定 - ✅ 不容易被 reward hacking - ✅ 效果和 RLHF 持平甚至略胜
到 2026 年,DPO 已经成为了新的主流对齐方法——很多新开源模型(LLaMA 3、Qwen 3、DeepSeek V3 等)都用 DPO 替代了 RLHF。
📐 数学视角(可跳过)
RLHF 的优化目标(基于 PPO 算法):
$$\max_\theta \mathbb{E}{x \sim \mathcal{D}, y \sim \pi\theta(\cdot|x)} \left[ r_\phi(x, y) \right] - \beta \, \mathbb{D}{\text{KL}}(\pi\theta \,|\, \pi_{\text{ref}})$$
其中: - $\pi_\theta$:当前 LLM 的策略(给定输入产生输出的概率分布) - $r_\phi$:奖励模型 - $\pi_{\text{ref}}$:参考模型(通常是 SFT 完成后的模型) - $\beta$:KL 散度的权重(防止 $\pi_\theta$ 偏离 $\pi_{\text{ref}}$ 太远)
第一项:最大化奖励;第二项:别跑得太远(防止模型崩塌)。
DPO 的神奇之处——它推导出,优化上面那个复杂的 RLHF 目标,等价于最小化下面这个简单的损失:
$$\mathcal{L}{\text{DPO}} = -\mathbb{E} \right) \right]$$}} \left[ \log \sigma\left( \beta \log \frac{\pi_\theta(y_w|x)}{\pi_{\text{ref}}(y_w|x)} - \beta \log \frac{\pi_\theta(y_l|x)}{\pi_{\text{ref}}(y_l|x)
其中 $(x, y_w, y_l)$ 是一个偏好三元组:输入 $x$,人类偏好的 winning 回答 $y_w$,非偏好的 losing 回答 $y_l$。
完全可以用普通的梯度下降训练,不需要强化学习——这就是 DPO 的威力。
第 6 节 · 2 分钟三阶段全景总结:一个模型的完整出生历程
我们把三个阶段串起来,用一张大表回顾——
5.1 三阶段对比表
| 维度 | 预训练 Pre-training | SFT 监督微调 | 对齐 RLHF/DPO |
|---|---|---|---|
| 目标 | 学语言、学知识 | 学会对话格式 | 学会人类偏好 |
| 数据类型 | 海量互联网文本 | 高质量对话示范 | 人类偏好对比 |
| 数据量 | 几万亿 token | 几万到几十万条 | 几千到几万条 |
| 数据来源 | Common Crawl + 书 + 代码 | 雇标注员手写 | 人类标注员排序 |
| 训练方法 | 自监督(猜下一个词) | 监督学习(学示范) | 强化学习(RLHF)或偏好损失(DPO) |
| 时间 | 几个月 | 几天 | 几天 |
| 成本 | 几亿美元 | 几百万美元 | 几百万美元 |
| 参数调整 | 全部参数 | 全部参数(或 LoRA) | 全部参数 |
| 结果 | 基础模型(Base Model) | 指令调优模型(Instruct Model) | 对齐模型(Aligned Model) |
5.2 一个有趣的比喻:像养一个孩子
这三个阶段像极了养育一个孩子:
| 阶段 | LLM | 人类孩子 |
|---|---|---|
| 预训练 | 读完互联网所有文字 | 0-6 岁:大量暴露于语言环境 |
| SFT | 学会按「问答」格式回应 | 7-12 岁:学会得体对话、遵守课堂规则 |
| 对齐 | 内化「有用无害诚实」的价值观 | 13-18 岁:形成世界观、价值观、社会规范意识 |
三个阶段缺一不可。
- 只有预训练 → 像一个读书多但不会说话的隐士
- 只有预训练 + SFT → 像一个会说话但没价值观的书呆子
- 三阶段都完整 → 一个有用、有修养的助手
5.3 一个重要的补充:持续改进
三阶段并不是一次性完成的。真实的大模型训练是多轮迭代的:
预训练 → SFT v1 → 对齐 v1 → 上线
↓
发现问题(比如某类问题答错)
↓
收集更多针对性的 SFT 数据 + 偏好数据
↓
重新 SFT v2 → 对齐 v2 → 上线
↓
继续循环
Claude 从 Claude 1 到 Opus 4.7,中间经过了几十次这样的循环迭代。每一次都让模型变得更好。
第 7 节 · 3 分钟训练规模揭秘:建立万亿参数、几亿美元的数量级感
为了让您对这些数字有身体感,让我们做几个对比。
6.1 参数量:从万到万亿的跳跃
| 模型 | 参数量 | 相当于 |
|---|---|---|
| 人脑中的神经元 | 约 860 亿个 | — |
| 人脑中的突触连接 | 约 100 万亿个 | — |
| --- | --- | --- |
| 1956 年的早期神经网络 | 几十个 | — |
| 2012 年的 AlexNet | 6 千万 | — |
| 2018 年的 BERT-Large | 3.4 亿 | — |
| 2019 年的 GPT-2 | 15 亿 | — |
| 2020 年的 GPT-3 | 1,750 亿 | — |
| 2023 年的 GPT-4 | 约 1.76 万亿(估计) | 接近人类 1/100,000 的突触 |
| 2026 年的 GPT-5.4 | 估计 3-5 万亿 | |
| 2026 年的 Claude Opus 4.7 | 估计 2-4 万亿 |
从 GPT-2 到 GPT-5.4,7 年时间,参数量增加了 3000 倍。
6.2 训练数据量:人类文明级别
| 数据量 | 相当于 |
|---|---|
| GPT-3 训练用的 3000 亿 token | 约 1000 亿个英文单词 |
| GPT-4 训练用的 13 万亿 token | 约 4.3 万亿个英文单词 |
| 一个人一辈子读书读到的量 | 约 1 亿个单词 |
| 亚历山大图书馆藏书 | 约 70 万卷 |
GPT-4 训练阶段「读」的文字,相当于 43,000 个人一辈子读书总量的总和。
6.3 训练硬件:一个数据中心的电力
训练这些模型需要什么硬件?
GPT-4 的训练(2022-2023): - 约 25,000 张 NVIDIA A100 GPU 并行 - 连续运行 100 天 - 训练电力约 50-60 GWh(够一个 10 万人小城用 2 个月)
GPT-5(估计,2024-2025): - 约 100,000 张 NVIDIA H100 GPU - 连续运行 150+ 天 - 训练电力 200+ GWh(够一个 30 万人中等城市用 2 个月)
6.4 训练成本:一个字,烧
| 模型 | 估计训练成本 |
|---|---|
| GPT-3 | $460 万 |
| GPT-4 | $6,300 万 |
| GPT-5.4(2026) | $3-5 亿(估计) |
| Claude Opus 4.7 | $2-4 亿(估计) |
| LLaMA 3 405B | $1 亿(Meta 公开) |
| DeepSeek V3 | $557 万 ⭐(后面讲) |
这些成本只算: - GPU 的租金或折旧 - 电费
不包括: - 研发人力(顶级 AI 研究员年薪 $100 万+) - 数据采集和清洗 - 标注员的薪水 - 基础设施
如果加上这些,GPT-5 的总成本可能超过 $10 亿。
6.5 训练 vs 推理:天差地别的成本
这里有一个常被误解的点——训练成本和使用成本(推理成本)差别极大。
| 维度 | 训练 | 推理(使用) |
|---|---|---|
| 成本 | 几亿美元(一次性) | 每个问题几厘到几美分 |
| 算力需求 | 10 万张 GPU | 1-8 张 GPU(单次响应) |
| 时间 | 几个月 | 几秒 |
训练像盖一座工厂——成本巨大,但只需盖一次。 推理像每天生产产品——单次成本低,但总量大。
对 OpenAI 和 Anthropic 这样的公司,每天用户发出几十亿次请求——这些推理成本加起来,每月要烧几千万美元。所以大模型公司的一大挑战是「降低推理成本」——后面讲的 MoE 架构就是为此。
6.6 一个震撼的对比:DeepSeek V3 事件
2024 年 12 月,一件事震惊了全球 AI 界——
中国公司深度求索(DeepSeek) 发布了 DeepSeek V3,一个 671B 参数的大模型,在各项评测上接近 GPT-4 水平。
但它的训练成本——只有 $557 万。
比 GPT-4 便宜了将近 100 倍。
整个硅谷震动了。NVIDIA 股价一天跌了 $6000 亿。
为什么 DeepSeek 能做到?
他们用了一系列工程优化: - FP8 混合精度训练(用更低精度的数字,省显存省算力) - MoE 架构(下一节讲) - Multi-Token Prediction(一次预测多个 token) - PTX 级别的底层优化(直接写 GPU 的底层指令,不用 CUDA)
这证明了——即使没有天量资金,也能训练出前沿级别的大模型。这改变了 AI 界的权力格局。
第 8 节 · 5 分钟涌现(Emergence):规模产生的质变 🌟
这是本讲最激动人心的一节。
请专心读——接下来几页,我会讲 AI 领域最神奇的一个现象。这个现象目前还没有人能完全解释,但它真实存在。
7.1 一个令人困惑的观察
AI 研究者在 2021-2022 年观察到一件怪事——
同一个架构(Transformer),仅仅是把参数量从 1B 变成 100B,它突然会了很多原本完全不会的事。
不是「能力强了点」,而是从 「不会」 变成 「会」 ——像开关被突然打开了一样。
这个现象,叫作「涌现(Emergent Abilities)」。
7.2 涌现的经典案例一:三位数加法
研究者测试了不同规模的 GPT 模型在三位数加法(如 345 + 678 = ?)上的表现:
模型参数量 准确率
1M(100万) ~0%
10M ~0%
100M ~0%
1B (10亿) ~5%
10B ~10%
100B (1000亿) ~90% ← 突然爆了!
175B (GPT-3) ~95%
注意:从 1B 到 10B,只从 5% 涨到 10%——几乎没进步。 但从 10B 到 100B,突然从 10% 跃升到 90%——相变一样的跨越。
没人能精确解释为什么会这样。但观察到的事实是:到了某个规模的临界点,这个能力「突然出现」。
7.3 涌现的经典案例二:多步推理
问题:「如果大象比老鼠重,老鼠比蚂蚁重,那么大象和蚂蚁谁重?」
模型参数量 能不能答对?
1B ❌ (通常答不对)
10B ❌
50B ❌
100B ✅ (开始能做)
175B ✅ (稳定做对)
这种多步逻辑推理的能力,也是在 100B 参数附近突然出现。
7.4 涌现的经典案例三:In-Context Learning
In-Context Learning(上下文学习) 是大模型最神奇的能力之一。
什么叫上下文学习?
给模型几个例子(不是重新训练),它就能现场学会一个新任务:
输入:
翻译:苹果 → apple
翻译:香蕉 → banana
翻译:橙子 → ?
输出:orange
注意! 模型没被训练过做「翻译水果」这个任务。它仅仅看了两个例子,就现场学会了。
这个能力,也是在 100B 参数附近突然出现的。小模型完全做不到。
7.5 涌现现象总览
除了上面三个,还有很多能力都是「涌现」出来的:
| 涌现能力 | 大约涌现阈值 |
|---|---|
| 三位数加减 | ~100B 参数 |
| 多步推理 | ~100B 参数 |
| In-Context Learning | ~100B 参数 |
| 代码生成 | ~10B 参数 |
| 翻译 | ~1B 参数 |
| 基本对话 | ~100M 参数 |
| 思维链推理(CoT) | ~60B 参数 |
| 模仿不同风格写作 | ~100B 参数 |
7.6 「涌现」的科学争议
涌现这个现象太神奇,引起了激烈的学术争论。
乐观派(Jason Wei 等):
涌现是真实的相变现象。模型到了某个规模,内部某种「理解」突然「解锁」——我们迎来了「智能的相变」。
保守派(Schaeffer 等,2023):
涌现可能是评测指标的假象。如果换一个「连续」的评测指标(而不是非黑即白的对/错),能力的提升其实是「平滑」的,只不过在某个阈值前准确率太低看不出来。
这两派目前都有证据,尚未分出胜负。
但不管哪一派对,有一件事是确定的:
💡 「模型变大」 确实导致了 「新能力的出现」。 无论这个过程是「突然的」还是「渐进的」,它都改变了 AI 的能力边界。
7.7 涌现的哲学意义
涌现现象最让人震撼的是——
它的本质机制,我们不完全理解。
- 我们设计了 Transformer 的架构
- 我们选择了「预测下一个词」的目标
- 我们准备了训练数据
然后——把模型做大——它自发地涌现出我们没预期的能力: - 推理 - 编程 - 翻译 - In-Context Learning - 类比思维 - ……
这件事的深意:
🌟 「智能」可能不是一件需要「设计出来」的事——它是「规模 + 数据 + 简单目标」的自然结果。
如果这是真的,那么人类大脑的「智能」,也许就是 860 亿神经元 + 几十年经验 + 自然选择(目标)的「涌现产物」。
这关于意识与智能的本质,是 2025-2026 年 AI 哲学最热门的话题。
7.8 涌现对教育的启示
涌现现象对教师有一个深刻启示——
人类学习也有「涌现时刻」。
您一定见过这样的学生——
一年级的时候:数学 60 分,费力
二年级的时候:数学 65 分,还是费力
三年级的时候:数学 70 分
四年级的时候:数学 80 分
五年级的时候:数学 95 分
初一的时候:数学 100 分,开始解奥数
不是「慢慢变好」的线性过程——而是积累到某个临界点后的突然顿悟。
这种「顿悟式学习」,在教育心理学里叫 「insight learning」 或 「aha moment」。
涌现现象告诉我们:规模(学习量)积累到一定程度会产生质变。
所以——对一个暂时不出彩的学生,不要放弃。可能他还没到那个临界点。再等等、再教教,说不定哪天「涌现」就来了。
📐 数学视角(可跳过)
涌现的一个理论解释——Neural Scaling Laws(神经网络扩展律)。
Kaplan 等(2020)和 Hoffmann 等(2022,Chinchilla Paper)发现,LLM 的损失 $\mathcal{L}$ 和三个因素遵循幂律关系:
$$\mathcal{L}(N, D, C) \approx L_0 + A \cdot N^{-\alpha} + B \cdot D^{-\beta} + E \cdot C^{-\gamma}$$
其中: - $N$:模型参数量 - $D$:训练 token 数 - $C$:总计算量 - $L_0, A, B, E, \alpha, \beta, \gamma$:由架构决定的常数
这是一条「可预测」的曲线——给定参数和数据,几乎能精确算出模型的最终损失。
但曲线表现的是平均损失的平滑下降。而具体任务的准确率可以是阶跃的——因为任务的「能否解决」往往有一个阈值(损失低于某个值才能正确回答),当模型的损失越过这个阈值时,准确率就「突然出现」。
这是数学上对「涌现」的一种解释——不是神秘魔法,而是「能力阈值」的自然结果。
第 9 节 · 5 分钟推理模型:让 AI 学会「慢慢想」
2024 年 9 月,OpenAI 发布了一个划时代的模型——o1。 2025 年 1 月,DeepSeek 紧随其后发布了R1,并开源。 2025 年,Claude 推出了Thinking Mode(思考模式)。
这一批模型被称为推理模型(Reasoning Models)。它们带来了继 ChatGPT 之后LLM 领域的又一次范式转变。
8.1 推理模型之前:快思考
在 o1 之前,所有 LLM 都是「一问一答」——
用户问 → LLM 立刻开始生成答案(几毫秒后就开始吐字)
这种「立刻回应」的模式,诺贝尔经济学奖得主丹尼尔·卡尼曼在《思考,快与慢》里称为 「系统 1 思维」——
🧠 快速、本能、自动化的思维。
优点:快、高效 缺点:在复杂问题上容易出错
人类做复杂数学题、推理复杂逻辑时,不会用系统 1——我们会慢下来,一步步想,这叫系统 2 思维。
LLM 在 o1 之前,没有系统 2。
8.2 一个简单的改变,带来革命
o1 的核心想法简单到不可思议:
🎯 让模型在「正式回答」之前,先生成一大段「思考过程」(隐藏不显示给用户)。
比如您问:
「如果 x² - 4x + 3 = 0,x 可能是多少?」
传统 LLM(GPT-4):
「x = 1 或 x = 3」(直接答)
推理模型(o1 / R1):
[隐藏的思考过程(内部「草稿」)]
这是一个一元二次方程,形式是 ax² + bx + c = 0。
这里 a = 1, b = -4, c = 3。
我可以用求根公式:x = [-b ± √(b² - 4ac)] / (2a)
代入:x = [4 ± √(16 - 12)] / 2 = [4 ± 2] / 2
所以 x = 3 或 x = 1。
也可以用因式分解验证:x² - 4x + 3 = (x-1)(x-3) = 0
所以 x = 1 或 x = 3。
两种方法都确认了答案。
[思考结束]
[正式回答]
x = 1 或 x = 3。
解法:利用因式分解 x² - 4x + 3 = (x-1)(x-3) = 0,
所以 x = 1 或 x = 3。
8.3 为什么慢思考这么有效?
o1 在数学和编程任务上的表现比 GPT-4 提升了 3-5 倍。
为什么?
因为 Transformer 本质上每个 token 只做一次固定的计算——它没法「停下来再想想」。如果模型要解决一个复杂问题,必须把思考过程「摊开在 token 序列里」,让每一步推理都有独立的计算资源。
思考链越长 → 分配给问题的计算资源越多 → 更容易解对复杂问题。
这是一个深刻的洞察:用 test-time compute(推理时计算)换 train-time compute(训练时计算)。
8.4 推理模型是怎么训练出来的?
o1、R1 的训练增加了一个新阶段——强化学习推理(RL on Reasoning)。
核心思想:
- 让模型自由生成思考过程和答案
- 检查答案对不对(对数学题、代码题,可以自动验证)
- 如果答对了,奖励模型「生成这种思考过程」
- 如果答错了,惩罚这种思考方式
模型自己摸索出:什么思考方式能导致正确答案。
DeepSeek-R1 的论文(2025 年 1 月)揭示了一件惊人的事——
当训练进行到一定阶段,模型「自发涌现出」自我反思的能力。
它开始自己说:「等等,让我重新想想这一步……」、「啊我前面算错了」……
研究者称之为 「aha moment」——模型自己学会了反思。
这件事意义深远:AI 第一次自发地展现出「元认知」(对自己思考过程的思考)。
8.5 Claude 的 「Thinking Mode」
Anthropic 在 Claude 3.7 Sonnet(2025) 起引入了 Thinking Mode(思考模式)。
Claude Opus 4.7(2026 年 4 月发布,就是撰写本讲时最新)把思考模式做得更精致——
- 您可以控制思考的「深度」(用多少 token 思考)
- 对简单问题,Claude 会跳过思考,直接回答(省成本)
- 对复杂问题,Claude 会启动 Extended Thinking(延长思考),生成几千甚至几万 token 的内部推理
8.6 推理模型的代价:慢 + 贵
推理模型不是免费午餐——
❶ 慢 - 传统 LLM:几秒出答案 - 推理模型:几十秒到几分钟(思考过程要生成,但不显示给你)
❷ 贵 - 传统 LLM 每百万 token $3 左右 - o1 / o3 每百万 token $60+(思考过程也算 token 成本)
❸ 适合复杂问题,不适合简单对话 - 问 AI 一个简单的问题(如「讲个笑话」),用 o1 是浪费 - 问 AI 解一道奥数题,用 o1 才值
8.7 2026 年推理模型的格局
| 模型 | 推理模式 | 特色 |
|---|---|---|
| OpenAI o1 / o3 / o4 | 独立的推理模型家族 | 数学、代码顶尖 |
| Claude Opus 4.7 | Thinking Mode 可切换 | 推理 + 对话融合 |
| DeepSeek R1 | 开源 | 全球研究者能用 |
| Gemini Deep Think | 可开启 | Google 版本 |
| Qwen3 Thinking | 开源 | 中文任务强 |
| GLM Z1 | 智谱推理版本 |
推理模型正在成为 2026 年的新主流。一个普遍的判断是:「推理模型 + 传统 LLM 混合使用」 会是未来几年的格局——简单问题用快模型,复杂问题用推理模型。
第 10 节 · 3 分钟MoE 混合专家:DeepSeek 如何把成本打到地板
2024 年末,DeepSeek V3 用 $557 万训练出媲美 GPT-4 的模型——这件事背后最大的功臣,就是一种叫 MoE(Mixture of Experts,混合专家) 的架构。
9.1 MoE 是什么?
传统 LLM(Dense 模型): - 每一个 token都通过所有参数 - 像一个「全能助手」——无论什么问题,大脑的每一部分都要工作一下
MoE 模型: - 模型内有很多个「专家」(比如 64 个 FFN 子网络) - 每个 token只激活其中几个专家(通常 2 个) - 像一个「专家团队」——遇到数学题激活数学专家、遇到代码题激活代码专家
9.2 MoE 的巧妙之处:总参数大,但激活参数小
- DeepSeek V3 总参数:671B
- 每个 token 实际激活的参数:仅 37B
这意味着: - 训练时:模型有 671B 的「知识容量」 - 推理时:每次只用 37B 的计算量
等于:用 671B 大模型的能力,付 37B 小模型的成本。
9.3 一个直观的比喻
想象一家综合医院:
传统 Dense 模型 = 让所有医生(内科、外科、骨科、儿科、妇产科、心脏科……)同时看每一个病人。 - 优点:每个病人都得到全面关注 - 缺点:超级烧钱,医生都被过度使用
MoE 模型 = 医院里有 64 个专家医生,每个病人进来后由「分诊台」分配给最合适的 2 个医生看。 - 优点:成本大幅降低,效率极高 - 缺点:分诊台(Router)必须训练得很好,否则把病人送错科了
9.4 MoE 的关键组件:Router(路由)
Router(路由器) 是 MoE 的核心。它是一个小神经网络,负责给每个 token 决定走哪些专家。
Token 「光合作用」
↓
[Router 分析这个 token]
↓
决定:发给「生物专家」和「化学专家」这 2 个 FFN
↓
两个专家各自计算
↓
加权合并输出
训练时:Router 和所有专家一起训练,Router 学会「哪些专家该做哪类 token」。
难点: - Router 如果不均衡,只让少数几个专家工作,其他专家荒废(Router 偷懒) - 需要负载均衡 loss 强迫 Router 平均使用所有专家
9.5 MoE 的历史与现状
| 模型 | 架构 | 年份 |
|---|---|---|
| Google Switch Transformer | 最早商用级 MoE | 2021 |
| Mistral 8x7B(Mixtral) | 推动 MoE 流行 | 2023 |
| DeepSeek V3 | MoE + 极致优化 | 2024 |
| DeepSeek V4 | 优化版 | 2025 |
| GPT-4(传闻) | 据传是 MoE | 2023 |
| Claude 4 系列 | 不公开 | - |
2026 年的事实:几乎所有大规模开源/半开源前沿模型都转向了 MoE。Dense 模型只在小规模场景(< 70B)还有优势。
9.6 MoE 对教师的影响
为什么教师需要关心 MoE?
因为 MoE 让大模型便宜了——
- DeepSeek V3 的 API 价格 = GPT-4 的 1/100
- 这让中小学有预算能用上前沿 AI
- 学校内部部署大模型成为可能(免费开源)
MoE 是国产大模型能与 OpenAI 竞争的关键技术。
📐 数学视角(可跳过)
MoE 层的数学形式:
$$\text{MoE}(\mathbf{x}) = \sum_{i=1}^{N} G(\mathbf{x})_i \cdot E_i(\mathbf{x})$$
其中: - $N$:专家总数(如 64) - $E_i(\mathbf{x})$:第 $i$ 个专家(通常是一个 FFN)的输出 - $G(\mathbf{x}) \in \mathbb{R}^N$:Router 的输出,满足 $\sum_i G_i = 1$
稀疏化(Top-K):Router 只选 $k$ 个专家($k \ll N$,比如 $k=2, N=64$):
$$G(\mathbf{x}) = \text{TopK}(\text{softmax}(\mathbf{W}_g \mathbf{x}), k)$$
这保证每个 token 只激活 $k$ 个专家,计算量从 $O(N)$ 降到 $O(k)$。
DeepSeek V3 的一些关键改进: - Shared Experts:有几个「共享专家」永远激活,捕捉通用知识 - Auxiliary-Loss-Free Load Balancing:用动态偏置替代传统负载均衡 loss - Multi-Token Prediction:一次预测多个未来 token,加速训练
第 11 节 · 4 分钟幻觉(Hallucination):最大的不完美及应对
讲完神奇的能力,也要讲清不完美的一面。
幻觉(Hallucination) 是 LLM 最臭名昭著的问题——模型一本正经地说出并不存在的事实。
10.1 幻觉的典型表现
例子 1:虚构引用
用户:介绍一下鲁迅在 1932 年发表的文章《论革命文学的方向》。 AI:鲁迅先生在 1932 年发表的《论革命文学的方向》是他后期思想的重要代表作。文章中他指出……(一本正经地长篇大论)
但这篇文章根本不存在!鲁迅从没写过这样一篇文章。AI 凭空编造了。
例子 2:虚构法条
用户:中国《民法典》第 1152 条规定什么? AI:《民法典》第 1152 条规定了遗嘱执行人的权利……(详细解释)
实际上《民法典》只有 1260 条。第 1152 条的内容可能和 AI 说的完全不同。
例子 3:虚构学术文献
老师写论文时用 AI 找文献。AI 给出:
《XXX 理论研究》(张三,教育出版社,2018)
老师兴奋地要去图书馆借——这本书不存在。
10.2 为什么会有幻觉?—— 深层原因
理解了预训练原理,您现在可以从根本上理解幻觉了——
核心原因:模型被训练的目标是「预测最可能的下一个词」,而不是「预测真实的事实」。
比如「鲁迅 1932 年发表了《论革命文学的方向》」这件事——
- 模型见过很多「鲁迅在某年发表了某篇文章」的句式
- 模型学到了这种句式的生成模式
- 当有人问到「鲁迅 1932 年的文章」时,模型按模式生成一个「看起来合理」的文章标题
- 它没有「查证」机制——它不知道自己在编
AI 不是故意撒谎——它根本不区分「真」和「生成」。
对模型来说,「流畅、合理、符合语言规律的输出」 和 「真实的事实」 是同一件事。
10.3 四种常见幻觉类型
| 类型 | 表现 | 例子 |
|---|---|---|
| 事实幻觉 | 编造不存在的事实 | 虚构的历史事件、人物生平 |
| 引用幻觉 | 编造不存在的文献、出处 | 假论文、假书、假法条 |
| 计算幻觉 | 算错数但信誓旦旦 | 简单加减法算错 |
| 指令幻觉 | 声称做了某件实际没做的事 | 「我已经查阅了最新的资料」(实际没查) |
10.4 应对幻觉的五大武器
武器 1:RAG(检索增强生成)
让 AI 先查资料、再回答。
用户:鲁迅 1932 年的文章有哪些?
↓
系统:[搜索知识库] → 找到鲁迅作品年表
↓
AI 看到真实资料后回答:根据文献记录,鲁迅 1932 年发表的作品有……
这是 2026 年最有效的反幻觉手段,也是本讲(下)会重点讲的。
武器 2:Grounding with Source(来源标注)
让 AI 在回答时标出信息来源。
"《民法典》第 1152 条规定了……[引自 民法典第 1152 条]"
如果 AI 能明确说出来源,您就能去核查;如果 AI 说不出来,就知道它在编。
武器 3:工具调用(Tool Use)
让 AI 调用外部工具查证。
- 数学题 → 调用计算器
- 日期 → 调用日历
- 最新新闻 → 调用搜索引擎
Claude、ChatGPT 现在都内置了工具调用功能。
武器 4:让 AI 自查
让 AI 回答后再用一个 prompt 检查自己:
「请审查上面的回答,找出任何可能不准确的地方。」
模型在反思时常常能发现自己的幻觉。这是一种自省机制。
武器 5:老师永远的工具—— 「反问」
这是最朴素也最有效的方法:
- 「你这个说法的来源是什么?」
- 「我查了一下,你说的这件事我没找到——能再核实一下吗?」
- 「给我具体的页码和 ISBN。」
AI 在被追问时,往往会「坦白」 —— 它会说:「抱歉,我之前的回答可能不准确……」
这不是因为它「知道」自己错了,而是因为追问让它重新生成,新生成的内容恰好更接近真实。
10.5 对老师的几条铁律
🌟 涉及以下内容时,AI 的回答必须交叉核验:
- 具体数字(年份、数据、法条编号)
- 具体人名、作品名、文献名
- 医学、法律等专业建议
- 学校、公司、机构的具体信息
- 最新发生的事(模型的知识有截止日期)
「相信 AI、但要核验」——像记者对待消息源一样。
10.6 2026 年幻觉问题的现状
好消息:幻觉率正在下降。
- GPT-3.5(2022):幻觉率 ~20%
- GPT-4(2023):幻觉率 ~10%
- GPT-5.4 / Claude Opus 4.7(2026):幻觉率 ~3-5%(推理模式下更低)
但幻觉永远不会完全消失——它是 LLM 这种「统计模式机器」的固有特性。与其期待 AI 不幻觉,不如学会和幻觉共处。
第 12 节 · 3 分钟本讲小结 + 预告第四讲(下)
走到这里,您已经完成了 LLM 原理最硬核的一段旅程——从一堆随机旋钮,到涌现出惊人能力的 ChatGPT。
11.1 本讲核心概念总结表
| 核心概念 | 一句话记忆 |
|---|---|
| 三阶段训练 | 预训练 + SFT + 对齐 —— LLM 从婴儿长成助手 |
| 预训练(Pre-training) | 在几万亿 token 的互联网文本上预测下一个词 |
| 基础模型(Base Model) | 预训练完的模型,懂世界但不会对话 |
| SFT(监督微调) | 用几万条高质量对话教模型「怎么说话」 |
| 对齐(Alignment) | 让 AI 符合人类偏好(有用、无害、诚实) |
| RLHF | 用人类偏好训练奖励模型,再用 RL 优化 LLM |
| DPO | RLHF 的简化替代,无需奖励模型和 RL |
| HHH | Helpful, Harmless, Honest 三个对齐目标 |
| 训练规模 | 几亿美元、十万张 GPU、几个月 |
| DeepSeek V3 事件 | MoE + 工程优化让训练成本降 100 倍 |
| 涌现(Emergence) | 规模达到阈值,能力突然出现 —— AI 最神奇的现象 |
| In-Context Learning | 只给几个例子,模型就现场学会新任务 |
| 推理模型 | o1 / R1 / Thinking Mode —— 让 AI 慢思考 |
| 思维链(CoT) | 把推理过程「摊开」在 token 序列里 |
| MoE 混合专家 | 总参数大、激活参数小——训练和推理都省钱 |
| 幻觉(Hallucination) | 模型生成「听起来对但其实假」的内容 |
| RAG | 让 AI 先查资料再回答,对付幻觉的最有效手段 |
| Neural Scaling Laws | 模型损失可预测的幂律下降 |
11.2 本讲(中)的三个关键 takeaway
🌟 ❶ LLM 的能力 90% 来自预训练,SFT 和对齐只是在「解锁」这些能力。
🌟 ❷ 涌现是 LLM 最神秘的现象 —— 规模达到阈值,能力就从「不会」跳跃到「会」。这既是 AI 的魔法,也是教育的启示:不要放弃任何一个「还没涌现」的学生。
🌟 ❸ 2026 年的前沿是「推理模型 + MoE 架构」—— 让 AI 会慢思考、让训练成本大幅下降。
11.3 对第四讲(下)的预告
第四讲(下)将是整门课中最面向教师、最接地气的一讲——
核心主题:从语言模型到世界:多模态、智能体与 2026 年的前沿
主要章节规划:
- 2026 年模型格局速览:GPT-5.4、Claude Opus 4.7、Gemini 3、DeepSeek V4 ……谁强在哪?
- 多模态:LLM 长出了眼睛、耳朵、嘴巴 —— 图像、视频、语音、世界模型
- 智能体(Agent):LLM 长出了手和脚 —— ReAct、MCP、2026 年的 Agent 产品
- Prompt 工程进阶:从「会用」到「会调教」
- RAG:对付幻觉的利器
- 评测榜单读法:MMLU、HumanEval、SWE-Bench
- 开源 vs 闭源:这场博弈对教育的意义
- AI 生成内容检测的真相
- 教师实战清单:2026 年老师最实用的 AI 用法 30 条
下一讲您会看到:本讲讲的 Transformer 和训练原理,如何在 2026 年结出最丰硕的果实——能看会说、能行动能思考的 AI。
第 13 节 · 3 分钟尾声:思考题与延伸
一段写给老师的话
亲爱的老师——
感谢您读完了这一讲。
我写这份讲稿时,最希望您感受到的是「震撼」。
- 一个几千亿随机旋钮的模型
- 在几万亿人类文字上预测下一个词
- 突然涌现出推理、编程、翻译、创作的能力
- 经过几天的对齐训练,就能和人类对话
这件事,在 AI 史上是奇迹。在人类科技史上也是奇迹。我们正在目睹「智能」这件事被重新定义。
有一个深刻的想法值得您和学生分享——
🌱 「涌现」告诉我们:智能可能不需要被『设计』出来。
只需要规模 + 数据 + 简单目标 + 足够时间。
这和教育的某种真相可能是一致的——
- 不要追求「把智能塞进学生脑子里」
- 创造让智能能「涌现」的环境:丰富的输入、简单清晰的目标、足够的练习
- 然后等待。在某一天,您会看到那个「aha moment」——学生突然「懂了」
这也许就是 AI 教给教育的最深的一课。
下一讲(第四讲下)我们会继续——看看 2026 年最前沿的 AI 是什么样子,以及老师应该怎么用好它们。
祝学习愉快。
—— 本讲讲稿将随技术发展和教学反馈持续更新。 —— 课程配套网站将同步提供最新版文字稿、视频回放和实操指南。
附录:重要概念索引(按字母序)
- Alignment 对齐:第 4 节
- Aha Moment:第 8.4 节
- Base Model 基础模型:第 2.5 节
- Chain-of-Thought 思维链:第 7.5 节(下一讲深入)
- Common Crawl:第 2.1 节
- DeepSeek V3:第 6.6 节,第 9 节
- DPO 直接偏好优化:第 4.6 节
- Emergence 涌现:第 7 节
- Emergent Abilities 涌现能力:第 7 节
- Fine-tuning 微调:第 3 节
- Grounding:第 10.4 节
- Hallucination 幻觉:第 10 节
- HHH(Helpful, Harmless, Honest):第 4.2 节
- In-Context Learning 上下文学习:第 7.4 节
- Inference 推理:第 6.5 节
- Instruct Model 指令模型:第 5.1 节
- KV Cache:见第四讲(上)
- LoRA:第 5.1 节(未详述,第四讲下会提)
- MoE 混合专家:第 9 节
- Multi-Token Prediction:第 6.6 节
- Neural Scaling Laws 神经网络扩展律:第 7.8 节数学视角
- o1 / o3:第 8 节
- Pre-training 预训练:第 2 节
- R1(DeepSeek R1):第 8 节
- RAG 检索增强生成:第 10.4 节(第四讲下深入)
- Reasoning Models 推理模型:第 8 节
- Reward Model 奖励模型:第 4.3 节
- RLHF:第 4.3 节
- Router 路由器:第 9.4 节
- Self-Supervised Learning 自监督学习:第 2.3 节
- SFT 监督微调:第 3 节
- Sycophancy 谄媚:第 4.5 节(隐含)
- System 1 / System 2 思维:第 8.1 节
- Thinking Mode 思考模式:第 8.5 节
- Tool Use 工具调用:第 10.4 节