随课讲义13 节 · 约 49 分钟

第四讲(中)· 训练与涌现

从一堆随机旋钮,到能与人对话的助手

看这一讲的幻灯片 →第四讲的课堂幻灯片一套 45 页,第 33 页起对应本篇。

第 1 节 · 2 分钟导读

📖 关于本讲的阅读提示

亲爱的老师:

上一讲我们讲了 LLM 的机械结构——Token、Embedding、Attention、Transformer。

但一个崭新的 Transformer 模型,刚被创建出来时什么都不会。它的几千亿个参数(旋钮)是随机数字。您问它「1+1 等于几」,它可能会吐出一串乱码。

那为什么您今天用的豆包、Kimi、Claude,能回答问题、写代码、讲笑话?

这一讲就是要回答:

🎯 「一个架构正确但参数随机的模型,是如何通过训练变成真正好用的 ChatGPT 的?」

这是整门课最神奇的一部分——您会看到:

  • 一个模型如何在几万亿 token 的人类文字里「游泳几个月」,被迫浮现出知识
  • 工程师如何教它「好好说话」,把原始能力转化为对话技能
  • 如何把人类价值观「注射」进模型,让它变得有用、无害、诚实
  • 为什么模型够大了之后,能力会「突然涌现」
  • 2024 年后的新范式:推理模型如何让 AI 学会「慢慢想」
  • DeepSeek 凭什么能用 6 百万美元训练出 OpenAI 花几亿美元才训练出来的东西

🎯 本讲的阅读规则(延续前作)

主干文字是完整的讲解。 您只读主干,也能掌握 80% 的内容。

每个关键概念后有「📐 数学视角(可跳过)」 小框。里面放公式、符号、细节。

  • 喜欢精确:读它。
  • 只想理解:跳过它,继续主干。

本讲(中)的章节地图

一、开篇:从「一堆随机旋钮」到「ChatGPT」的奇幻旅程
二、第一阶段 · 预训练(Pre-training):在人类文明的全部文字里泡几个月
三、第二阶段 · 监督微调(SFT):学会「好好说话」
四、第三阶段 · 对齐(RLHF & DPO):学会「做个好助手」
五、三阶段全景总结:一个模型的完整出生历程
六、训练规模揭秘:建立万亿参数、几亿美元的数量级感
七、涌现(Emergence):规模产生的质变 🌟
八、推理模型:让 AI 学会「慢慢想」(o1 / R1 / Claude Thinking)
九、MoE 混合专家:DeepSeek 如何把成本打到地板
十、幻觉(Hallucination):最大的不完美及应对
十一、本讲小结 + 预告第四讲(下)

第 2 节 · 2 分钟开篇:从「一堆随机旋钮」到「ChatGPT」

请各位老师做一个思想实验。


想象您是 Anthropic(Claude 的制造商)的一位工程师。今天是模型训练的第零天

您面前有: - 一个全新的 Transformer 架构(结构按上一讲讲的那样搭好) - 几千亿个参数(旋钮),值都是随机数字 - 几万亿 GPU 运算单元,等待启动

您输入一个简单的问题:

「请问 1 + 1 等于几?」

模型的输出是……

「卝Θ哈 tz !! 粹 ...... 奥 pq 霹 ...」

一串彻底的乱码


这是真实情况。一个刚被创建出来的 Transformer,它的参数是随机的——它对语言一无所知。它连「1」这个 token 应该跟「加」还是跟「苹果」都不知道。

它现在是一张白纸。

这一讲要回答的核心问题是:几个月后,当这个模型变成 Claude Opus 4.7 的时候,它是怎么从「一无所知」变成「无所不知」的?

答案分为三个阶段


1.1 三阶段训练鸟瞰

现代大语言模型(GPT、Claude、DeepSeek、Qwen……)的训练,几乎都分成三个阶段:

         ┌──────────────────────────┐
  阶段一  │  预训练 Pre-training      │  学语言、学知识
         │  几万亿 token 的互联网文本  │  几个月,几亿美元
         └──────────────┬───────────┘
                        ▼
         ┌──────────────────────────┐
  阶段二  │  监督微调 SFT              │  学说话、学对话
         │  几万到几十万高质量对话     │  几天,几百万美元
         └──────────────┬───────────┘
                        ▼
         ┌──────────────────────────┐
  阶段三  │  对齐 RLHF / DPO           │  学做好助手
         │  人类偏好反馈              │  几天,几百万美元
         └──────────────┬───────────┘
                        ▼
                 ╔══════════════╗
                 ║  ChatGPT /   ║
                 ║  Claude 诞生 ║
                 ╚══════════════╝

三个阶段分别解决三个问题

阶段 问题 通俗理解
预训练 让模型懂语言、懂世界 像小孩把百科全书、文学、科学、新闻全都背一遍
SFT 监督微调 让模型学会对话 教他:有人问问题的时候,应该怎么回答
对齐 让模型成为「好助手」 告诉他什么是好回答、什么是坏回答,让他内化价值观

我们接下来一个一个讲。


1.2 为什么必须是三个阶段?

直接问: 「为什么不能一步到位?」

答:三个阶段各自解决的问题不一样,用的数据和训练方法完全不同

  • 预训练用的是海量、低质量、无标注的互联网文本——便宜但数据量大
  • SFT 用的是少量、高质量、人工写的对话——昂贵但精准
  • 对齐用的是人类偏好数据——非常昂贵但决定了「人味」

一步到位是不可能的——就像您不能让一个孩子同时学会说话、读书、做人——得分阶段。


好,我们正式进入第一阶段。


第 3 节 · 7 分钟第一阶段 · 预训练(Pre-training):在人类文明的全部文字里泡几个月

预训练是三阶段里最花钱、最花时间、也最神奇的一步。

它的目标只有一个:让模型学会「预测下一个词」。

它的方法简单得不可思议:把互联网上能找到的所有文字都喂给它,让它不停猜下一个词,猜错了就调整参数。


2.1 训练数据:互联网级别的文字海洋

想象一下这些数据:

① Common Crawl(公共爬虫数据)

有个非营利组织叫 Common Crawl,它从 2008 年开始持续爬取整个公开的互联网。到 2026 年,它的数据库已经超过 250 PB(一个 PB = 100 万 GB)。

大语言模型的训练,有很大一部分用的就是 Common Crawl 的数据——虽然还要做清洗、去重、过滤

② 书籍

  • 维基百科的全部条目(多语言)
  • 数百万本公开的电子书(Project Gutenberg、各类学术库)
  • 大量专业教材和工具书

③ 代码

  • GitHub 上所有公开的代码仓库
  • Stack Overflow 的问答
  • 各种编程教程和文档

④ 学术论文

  • arXiv 上的几百万篇论文
  • PubMed 上的医学文献

⑤ 对话数据

  • Reddit、知乎、豆瓣、微博等公开论坛
  • 字幕网站上的对话文本

⑥ 其他结构化内容

  • 新闻网站的档案
  • 各类百科网站
  • 中文 / 日文 / 西班牙文等非英语大规模语料

GPT-4 的训练数据规模(根据公开估计):

13 万亿 token

13 万亿 token 是什么概念?

  • 相当于约 500 亿页文字
  • 相当于一个人不停阅读 10 万年
  • 相当于把大英图书馆的内容读 20 遍

GPT-5 更多,Claude Opus 4.7 / Gemini 3 Pro / DeepSeek V4 都用了更多数据 + 更好的清洗


2.2 训练过程:让模型「读」完这些数据

核心机制就是一句话:

🎯 把一段文字遮住最后一个 token,让模型猜是什么——猜错了就调参数,猜对了不动。

比如:

原文:「今天天气真好,我打算去公园散步。」
Token 化:["今天", "天气", "真", "好", ",", "我", "打算", "去", "公园", "散步", "。"]

训练样本:
  输入:「今天」                      →  预测:「天气」
  输入:「今天 天气」                 →  预测:「真」
  输入:「今天 天气 真」              →  预测:「好」
  输入:「今天 天气 真 好」           →  预测:「,」
  输入:「今天 天气 真 好 ,」        →  预测:「我」
  ......(一共 10 个训练信号)

一段 11 个 token 的文字,可以拆出 10 个训练样本

把全互联网的几万亿 token 都这样「拆」一遍——得到几十万亿个训练信号

让模型反复过这些训练信号,每次猜错就微调参数——几个月后,它就变成了预训练好的基础模型


2.3 一个核心事实:没有人告诉模型「答案是对的」

这件事很多人没理解透——

预训练阶段,模型的「老师」不是人类工程师,是数据本身

如何「打分」? - 如果模型预测「今天天气真好,我打算去公园__」的下一个词是「散步」,恰好和原文一样 → 算对,不调参数 - 如果模型预测的是「乱码」 → 算错,调整参数让下次更可能预测「散步」

这种训练方式叫「自监督学习」(Self-Supervised Learning)。第二讲里埋过这个概念,现在它就在 LLM 训练里发挥出最大威力。


「自监督」的妙处

  • 不需要人工标注——把互联网文本直接拿来就能用
  • 训练数据无限——只要互联网在扩大,数据就在扩大
  • 学到的是「世界模型」——因为要准确预测下一个词,模型必须「理解」文字背后的知识、逻辑、规律

2.4 预训练中究竟学到了什么?

一个有趣的问题:模型在预训练中到底学了什么?

答案是——惊人地多。以下所有能力,都是预训练阶段「顺带」学到的:

① 语言本身 - 语法规则(主谓宾的顺序) - 词汇的用法(「吃」后面接食物,「喝」后面接液体) - 多语言能力(中英法日韩…… 都在数据里)

② 世界知识 - 常识(太阳东升西落、水是液体) - 历史(唐朝在什么时候) - 地理(巴黎是法国首都) - 科学(万有引力公式、DNA 结构) - 文学(《红楼梦》的情节)

③ 推理能力 - 简单数学(2 + 3 = 5) - 因果关系(下雨 → 地湿) - 类比(国王之于王后 = 父亲之于母亲)

④ 风格与语感 - 正式 vs 口语 - 不同文化的表达方式 - 诗歌、散文、议论文等文体

⑤ 一些让人意外的能力 - 简单编程 - 初等化学反应 - 简单心理学常识


为什么「猜下一个词」就能学到这么多?

回到第四讲(上)讲的一个深刻观点——

💡 「要准确预测下一个词,模型必须对世界有某种理解。」

比如要预测这句话的结尾:

「小明今年 12 岁,他爸爸是一名医生。医生的收入通常__」

要准确预测「很高」或「不错」,模型必须: - 知道「医生」这个职业 - 知道「收入」是什么 - 知道社会常识:医生的收入通常较高

这些知识没人直接「教」给模型——它为了猜对下一个词,不得不学


2.5 预训练的结果:基础模型(Base Model)

预训练完成后,得到的叫 基础模型(Base Model)预训练模型(Pretrained Model)

基础模型的特点

  • ✅ 懂语言、懂世界
  • ✅ 有海量知识
  • 不会聊天
  • 不会回答问题
  • 不会遵循指令

这听起来奇怪吧?但这是真的。


基础模型的一个真实「对话」例子

您(用户):「请告诉我巴黎的人口。」

基础模型:「请告诉我巴黎的人口。请告诉我法国的首都。请告诉我欧洲最大的城市是哪里。请告诉我伦敦的人口……」

这是什么鬼?

原因是——基础模型是「预测下一个词」的机器。它在训练数据里见过很多问题列表(比如 FAQ 页面、考试题目),所以它看到「请告诉我巴黎的人口」,它不认为这是一个「问题」,而认为这是某种列表的开头——它会「预测」接下来应该是更多的类似问题

基础模型不「知道」自己应该回答问题。它只知道预测最可能的下一段文字。


所以预训练只是第一步。要让基础模型变成「懂对话的助手」,必须有第二阶段

这就引出了 SFT。


2.6 预训练的成本:一个惊人的数字

预训练是三阶段里最烧钱的一步。

模型 估计训练成本(仅算力)
GPT-3(2020) 约 $460 万
GPT-4(2023) 约 $6,300 万
GPT-5.4(2026) 预估 $3-5 亿
Claude Opus 4.7(2026) 预估 $2-4 亿(未公开)
LLaMA-3 405B(2024) 约 $1 亿(Meta 公开承认)
DeepSeek V3(2024) 约 $557 万(这个数字震惊了世界,后面会讲)

训练一次 GPT-4 的电费,就能让一个小县城用一年

这就是为什么 2026 年的前沿大模型,全球就那几家公司能做——OpenAI、Anthropic、Google、Meta、以及中国的阿里、字节、深度求索、月之暗面等极少数公司。不是技术不公开,是烧不起这个钱


📐 数学视角(可跳过)

预训练的损失函数(用交叉熵):

$$\mathcal{L}{\text{pretrain}} = -\frac{1}{N} \sum)$$}^{N} \log P_\theta(w_i \mid w_1, w_2, \ldots, w_{i-1

其中: - $N$:训练数据中 token 的总数(几万亿量级) - $w_1, \ldots, w_N$:训练文本序列 - $P_\theta(w_i \mid \ldots)$:模型(参数 $\theta$)在看到前 $i-1$ 个 token 后,预测第 $i$ 个 token 是 $w_i$ 的概率

训练目标:最大化训练数据的对数似然,等价于最小化上面的负对数似然。

训练算力的估算公式(Kaplan 等 2020):

$$C \approx 6 \cdot N \cdot D$$

其中: - $C$:总计算量(FLOPS,浮点运算次数) - $N$:模型参数量 - $D$:训练 token 数 - 常数 6 来自:前向传播 2N + 反向传播 4N

例:GPT-3 $N = 175\text{B}$,$D = 300\text{B}$ → $C \approx 3.14 \times 10^{23}$ FLOPS。

按 2020 年 NVIDIA A100 的 312 TFLOPS 计算,单卡需要 32,000 天。用 1024 张卡并行,需要约 31 天——这和 OpenAI 公开的训练时间吻合。


好——预训练讲完了。我们有一个懂语言懂世界但不会对话的基础模型。

现在进入第二阶段——教它说话


第 4 节 · 3 分钟第二阶段 · 监督微调(SFT):学会「好好说话」

3.1 从「续写机」到「对话机」的关键一步

上一节末尾我们看到:基础模型遇到「请告诉我巴黎的人口」会继续写更多类似问题,而不是回答问题。

为什么?

因为在它见过的训练数据里,「问题+回答」的格式不是主流。它更多见过: - 新闻报道(陈述句连续) - 小说(叙事为主) - 问题列表(题目后面跟更多题目)

它没学到「一个问题应该被回答」这个对话的规则

SFT 的任务,就是教会它这件事。


3.2 SFT 的做法:给它高质量的「示范对话」

SFT(Supervised Fine-Tuning,监督微调) 的做法:

🎯 雇人写几万到几十万条「问答示范」,让模型在这些示范上重新训练一轮,学会「遇到问题就回答」的模式。

示范对话长什么样?

【示例 1】
用户:请解释什么是光合作用。
助手:光合作用是绿色植物、藻类和某些细菌利用阳光、二氧化碳和水,
     制造葡萄糖并释放氧气的过程。这个过程主要发生在植物的叶绿体中,
     是地球上大多数生命的能量来源。简化反应式是:
     6CO₂ + 6H₂O + 阳光 → C₆H₁₂O₆ + 6O₂

【示例 2】
用户:帮我想三个关于环保的科普视频标题。
助手:好的,三个建议:
1. 《一节电池污染一立方米土壤:你扔对垃圾了吗?》
2. 《三分钟搞懂碳中和:它和你的奶茶杯有什么关系》
3. 《海洋每分钟增加一卡车塑料:2050 年鱼会比塑料少吗?》

【示例 3】
用户:你能做什么?
助手:我是一个 AI 助手,可以帮你写作、翻译、回答问题、讲解概念、
     辅助编程、整理信息等等。请告诉我你需要什么帮助?

这些示范由谁来写

:各大公司会雇佣专业标注员——很多是在读博士、学科专家、甚至领域老师——手工写几万到几十万条这样的示范


3.3 SFT 的训练技巧

SFT 和预训练在本质上是同一种训练——都是「预测下一个 token」。只是数据换了

  • 预训练:预测整个互联网文本中的每个下一 token
  • SFT:预测示范对话里「助手」说的部分的每个下一 token

关键技巧:只在「助手的回答部分」算损失,不在「用户的问题部分」算损失。

数据格式:
  [用户] 请解释什么是光合作用。[/用户]
  [助手] 光合作用是绿色植物……           ← 只在这一段算损失,训练模型「学会回答」
  [/助手]

3.4 SFT 数据量:质量远胜于数量

预训练需要几万亿 tokenSFT 只需要几万到几十万条对话——大约几千万到几亿 token

为什么差这么多?

因为 SFT 不是在教「语言」或「知识」——那些预训练阶段已经都学过了。SFT 只是在教一种「行为模式」:问了就要答、格式要规整、有礼貌……

教「行为模式」不需要海量数据——但需要高质量


一个令人惊叹的事实

Meta 2023 年的 LLaMA 2 论文公开了他们的 SFT 数据——只有 27,540 条。就这 2.7 万条高质量对话,让模型学会了如何「好好说话」。

这说明LLM 的能力 99% 来自预训练,SFT 只是「释放」这些能力


3.5 SFT 之后的模型 = 第一版本的「可用助手」

SFT 完成后,模型已经能做一个不错的助手了:

  • ✅ 懂语言懂世界(预训练给的)
  • ✅ 会回答问题(SFT 教的)
  • ✅ 会遵循简单指令
  • ⚠️ 但回答的质量参差不齐——有时候有用,有时候跑题;有时候礼貌,有时候冒犯

这就需要第三阶段——对齐来精细打磨了。


第 5 节 · 6 分钟第三阶段 · 对齐(Alignment):学会「做好助手」

这是三阶段里最复杂的一步,也是 ChatGPT 之所以是 ChatGPT、Claude 之所以是 Claude 的关键所在。


4.1 对齐是什么?

先搞清楚概念:

📖 对齐(Alignment):让 AI 的输出行为价值观,与人类的意图和偏好保持一致的过程。

听起来抽象。具体来说:

  • 当 AI 遇到一个开放问题(没有标准答案),它应该给出什么样的回答?
  • 当有人问有害问题(如「怎么自杀」),AI 应该怎么反应?
  • 当有人问偏见性问题(如「哪个种族更聪明」),AI 应该怎么处理?
  • 当答案可能有多个表达方式,AI 应该选哪种语气、哪种详细程度、哪种结构?

这些问题没有数学上的「正确答案」——但有人类普遍认同的「更好答案」

对齐的目标就是让 AI 理解这些偏好,并在回答时遵循。


4.2 对齐的三个目标:HHH

Anthropic(Claude 的制造商)提出了一个影响广泛的框架,对齐的三个目标

目标 英文 含义
有用 Helpful 真正帮到用户,解决问题
无害 Harmless 不生成有害、危险、冒犯性内容
诚实 Honest 说真话,不编造,知之为知之

这三个目标之间常常冲突

  • 完全「有用」可能要求回答任何问题,但「无害」要求拒绝有害问题
  • 完全「诚实」要求承认不知道,但「有用」要求尽量给出答案

对齐的难点,就是在这三者之间找平衡


4.3 对齐方法一:RLHF —— 让人类打分教模型

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)

这是 ChatGPT 2022 年横空出世的秘密武器。其核心步骤:


步骤 1:收集人类偏好数据

对每个问题,让 SFT 完成后的模型生成多个回答,然后让人类标注员排序——哪个更好、哪个次之、哪个最差。

例如:

问题:请告诉我一个激励学生的故事。

回答 A:从前有个学生很努力,他成功了。
回答 B:我来讲个实例——史蒂芬·霍金确诊渐冻症时才 21 岁,医生说他活不过 2 年。但他写出了《时间简史》,活到 76 岁。他用事实证明:身体的极限不是精神的边界。愿这个故事给每个面对困难的孩子一点力量。
回答 C:哦,激励学生?你们老师总要说这种话。

人类排序:B > A > C

收集几千到几万条这样的偏好对比数据


步骤 2:训练一个「奖励模型」

用这些偏好数据训练一个奖励模型(Reward Model)——这是另一个神经网络,它的任务是:

🎯 给模型的任何输出打一个分,这个分数尽量和人类标注员的偏好一致。

奖励模型在训练完成后,就代替人类打分(因为让几亿条回答都让人类打分是不可能的)。


步骤 3:用强化学习训练原模型

现在有了: - 原 LLM(会说话但需要优化) - 奖励模型(会打分)

就可以用强化学习(第二讲讲过)训练了:

  LLM 生成回答
       ↓
  奖励模型打分
       ↓
  分数低 → 调整 LLM 参数让下次不这么答
  分数高 → 调整 LLM 参数让下次更这么答
       ↓
  反复循环几千次

几天之后,LLM 的回答普遍获得更高的奖励分数——这意味着它的回答更接近人类偏好

这就是 RLHF 的全流程


4.4 RLHF 的「魔法」:从 「勉强能用」到 「惊艳」

GPT-3(未经 RLHF,2020)

用户:什么是幸福? GPT-3:幸福是。幸福是幸福。什么是不幸?幸福是……

(胡言乱语)

GPT-3.5(RLHF 之后,2022)

用户:什么是幸福? GPT-3.5:幸福是一种主观的心理状态,通常由满足感、愉悦感和生活意义感组成……(一段清晰、得体的回答)

同一个基础模型,加了 RLHF 之后,判若两人


OpenAI 首席科学家 Ilya Sutskever 有一个著名的观察

🗣️ 「RLHF 并没有让模型更聪明——它让模型更有用。」

深刻。预训练已经让模型无所不知,但 RLHF 让它学会'把知识用出来'——这才是让用户感到惊艳的部分。


4.5 RLHF 的麻烦:复杂、脆弱、烧钱

RLHF 效果很好,但它有三个致命问题

❶ 非常复杂 - 要训练两个模型(奖励模型 + 原 LLM) - 强化学习的超参数调起来像炼丹 - 训练不稳定,经常失败

❷ 需要大量人工标注 - 几万到几十万条偏好数据 - 每条都要人看、比较、打分 - 成本很高(几百万美元级)

❸ 容易「投机取巧」 - 模型学会了「生成奖励模型喜欢的答案」——不一定是「生成真的好的答案」 - 这叫 奖励破解(Reward Hacking)


4.6 对齐方法二:DPO —— 更简单的替代方案

2023 年,斯坦福的 Rafailov 等人提出了一个惊艳的新方法:

📜 DPO(Direct Preference Optimization,直接偏好优化)

核心突破不需要训练奖励模型,不需要强化学习

直接用一个巧妙的数学推导,把「模型更倾向于好答案」这件事转化为一个普通的监督学习损失函数

优点: - ✅ 实现简单(一个损失函数替代了整套 RL 流程) - ✅ 训练稳定 - ✅ 不容易被 reward hacking - ✅ 效果和 RLHF 持平甚至略胜

到 2026 年DPO 已经成为了新的主流对齐方法——很多新开源模型(LLaMA 3、Qwen 3、DeepSeek V3 等)都用 DPO 替代了 RLHF。


📐 数学视角(可跳过)

RLHF 的优化目标(基于 PPO 算法):

$$\max_\theta \mathbb{E}{x \sim \mathcal{D}, y \sim \pi\theta(\cdot|x)} \left[ r_\phi(x, y) \right] - \beta \, \mathbb{D}{\text{KL}}(\pi\theta \,|\, \pi_{\text{ref}})$$

其中: - $\pi_\theta$:当前 LLM 的策略(给定输入产生输出的概率分布) - $r_\phi$:奖励模型 - $\pi_{\text{ref}}$:参考模型(通常是 SFT 完成后的模型) - $\beta$:KL 散度的权重(防止 $\pi_\theta$ 偏离 $\pi_{\text{ref}}$ 太远)

第一项:最大化奖励;第二项:别跑得太远(防止模型崩塌)。

DPO 的神奇之处——它推导出,优化上面那个复杂的 RLHF 目标,等价于最小化下面这个简单的损失:

$$\mathcal{L}{\text{DPO}} = -\mathbb{E} \right) \right]$$}} \left[ \log \sigma\left( \beta \log \frac{\pi_\theta(y_w|x)}{\pi_{\text{ref}}(y_w|x)} - \beta \log \frac{\pi_\theta(y_l|x)}{\pi_{\text{ref}}(y_l|x)

其中 $(x, y_w, y_l)$ 是一个偏好三元组:输入 $x$,人类偏好的 winning 回答 $y_w$,非偏好的 losing 回答 $y_l$。

完全可以用普通的梯度下降训练,不需要强化学习——这就是 DPO 的威力。


第 6 节 · 2 分钟三阶段全景总结:一个模型的完整出生历程

我们把三个阶段串起来,用一张大表回顾——

5.1 三阶段对比表

维度 预训练 Pre-training SFT 监督微调 对齐 RLHF/DPO
目标 学语言、学知识 学会对话格式 学会人类偏好
数据类型 海量互联网文本 高质量对话示范 人类偏好对比
数据量 几万亿 token 几万到几十万条 几千到几万条
数据来源 Common Crawl + 书 + 代码 雇标注员手写 人类标注员排序
训练方法 自监督(猜下一个词) 监督学习(学示范) 强化学习(RLHF)或偏好损失(DPO)
时间 几个月 几天 几天
成本 几亿美元 几百万美元 几百万美元
参数调整 全部参数 全部参数(或 LoRA) 全部参数
结果 基础模型(Base Model) 指令调优模型(Instruct Model) 对齐模型(Aligned Model)

5.2 一个有趣的比喻:像养一个孩子

这三个阶段像极了养育一个孩子

阶段 LLM 人类孩子
预训练 读完互联网所有文字 0-6 岁:大量暴露于语言环境
SFT 学会按「问答」格式回应 7-12 岁:学会得体对话、遵守课堂规则
对齐 内化「有用无害诚实」的价值观 13-18 岁:形成世界观、价值观、社会规范意识

三个阶段缺一不可

  • 只有预训练 → 像一个读书多但不会说话的隐士
  • 只有预训练 + SFT → 像一个会说话但没价值观的书呆子
  • 三阶段都完整 → 一个有用、有修养的助手

5.3 一个重要的补充:持续改进

三阶段并不是一次性完成的。真实的大模型训练是多轮迭代的

预训练 → SFT v1 → 对齐 v1 → 上线
                              ↓
                      发现问题(比如某类问题答错)
                              ↓
              收集更多针对性的 SFT 数据 + 偏好数据
                              ↓
                      重新 SFT v2 → 对齐 v2 → 上线
                              ↓
                           继续循环

Claude 从 Claude 1 到 Opus 4.7,中间经过了几十次这样的循环迭代。每一次都让模型变得更好。


第 7 节 · 3 分钟训练规模揭秘:建立万亿参数、几亿美元的数量级感

为了让您对这些数字有身体感,让我们做几个对比。


6.1 参数量:从万到万亿的跳跃

模型 参数量 相当于
人脑中的神经元 约 860 亿个
人脑中的突触连接 约 100 万亿个
--- --- ---
1956 年的早期神经网络 几十个
2012 年的 AlexNet 6 千万
2018 年的 BERT-Large 3.4 亿
2019 年的 GPT-2 15 亿
2020 年的 GPT-3 1,750 亿
2023 年的 GPT-4 约 1.76 万亿(估计) 接近人类 1/100,000 的突触
2026 年的 GPT-5.4 估计 3-5 万亿
2026 年的 Claude Opus 4.7 估计 2-4 万亿

从 GPT-2 到 GPT-5.4,7 年时间,参数量增加了 3000 倍


6.2 训练数据量:人类文明级别

数据量 相当于
GPT-3 训练用的 3000 亿 token 约 1000 亿个英文单词
GPT-4 训练用的 13 万亿 token 约 4.3 万亿个英文单词
一个人一辈子读书读到的量 约 1 亿个单词
亚历山大图书馆藏书 约 70 万卷

GPT-4 训练阶段「读」的文字,相当于 43,000 个人一辈子读书总量的总和


6.3 训练硬件:一个数据中心的电力

训练这些模型需要什么硬件?

GPT-4 的训练(2022-2023): - 约 25,000 张 NVIDIA A100 GPU 并行 - 连续运行 100 天 - 训练电力约 50-60 GWh(够一个 10 万人小城用 2 个月

GPT-5(估计,2024-2025): - 约 100,000 张 NVIDIA H100 GPU - 连续运行 150+ 天 - 训练电力 200+ GWh(够一个 30 万人中等城市用 2 个月


6.4 训练成本:一个字,烧

模型 估计训练成本
GPT-3 $460 万
GPT-4 $6,300 万
GPT-5.4(2026) $3-5 亿(估计)
Claude Opus 4.7 $2-4 亿(估计)
LLaMA 3 405B $1 亿(Meta 公开)
DeepSeek V3 $557 万 ⭐(后面讲)

这些成本只算: - GPU 的租金或折旧 - 电费

不包括: - 研发人力(顶级 AI 研究员年薪 $100 万+) - 数据采集和清洗 - 标注员的薪水 - 基础设施

如果加上这些GPT-5 的总成本可能超过 $10 亿


6.5 训练 vs 推理:天差地别的成本

这里有一个常被误解的点——训练成本和使用成本(推理成本)差别极大

维度 训练 推理(使用)
成本 几亿美元(一次性) 每个问题几厘到几美分
算力需求 10 万张 GPU 1-8 张 GPU(单次响应)
时间 几个月 几秒

训练像盖一座工厂——成本巨大,但只需盖一次。 推理像每天生产产品——单次成本低,但总量大。

对 OpenAI 和 Anthropic 这样的公司,每天用户发出几十亿次请求——这些推理成本加起来,每月要烧几千万美元。所以大模型公司的一大挑战是「降低推理成本」——后面讲的 MoE 架构就是为此。


6.6 一个震撼的对比:DeepSeek V3 事件

2024 年 12 月,一件事震惊了全球 AI 界——

中国公司深度求索(DeepSeek) 发布了 DeepSeek V3,一个 671B 参数的大模型,在各项评测上接近 GPT-4 水平。

但它的训练成本——只有 $557 万

比 GPT-4 便宜了将近 100 倍

整个硅谷震动了。NVIDIA 股价一天跌了 $6000 亿。

为什么 DeepSeek 能做到?

他们用了一系列工程优化: - FP8 混合精度训练(用更低精度的数字,省显存省算力) - MoE 架构(下一节讲) - Multi-Token Prediction(一次预测多个 token) - PTX 级别的底层优化(直接写 GPU 的底层指令,不用 CUDA)

这证明了——即使没有天量资金,也能训练出前沿级别的大模型。这改变了 AI 界的权力格局。


第 8 节 · 5 分钟涌现(Emergence):规模产生的质变 🌟

这是本讲最激动人心的一节。

请专心读——接下来几页,我会讲 AI 领域最神奇的一个现象。这个现象目前还没有人能完全解释,但它真实存在


7.1 一个令人困惑的观察

AI 研究者在 2021-2022 年观察到一件怪事——

同一个架构(Transformer),仅仅是把参数量从 1B 变成 100B,它突然会了很多原本完全不会的事

不是「能力强了点」,而是从 「不会」 变成 「会」 ——像开关被突然打开了一样。

这个现象,叫作「涌现(Emergent Abilities)」


7.2 涌现的经典案例一:三位数加法

研究者测试了不同规模的 GPT 模型在三位数加法(如 345 + 678 = ?)上的表现:

模型参数量         准确率
1M(100万)        ~0%
10M              ~0%
100M             ~0%
1B (10亿)        ~5%
10B             ~10%
100B (1000亿)   ~90%  ← 突然爆了!
175B (GPT-3)   ~95%

注意:从 1B 到 10B,只从 5% 涨到 10%——几乎没进步。 但从 10B 到 100B,突然从 10% 跃升到 90%——相变一样的跨越

没人能精确解释为什么会这样。但观察到的事实是:到了某个规模的临界点,这个能力「突然出现」


7.3 涌现的经典案例二:多步推理

问题:「如果大象比老鼠重,老鼠比蚂蚁重,那么大象和蚂蚁谁重?」

模型参数量    能不能答对?
1B          ❌ (通常答不对)
10B         ❌
50B         ❌
100B        ✅ (开始能做)
175B        ✅ (稳定做对)

这种多步逻辑推理的能力,也是在 100B 参数附近突然出现


7.4 涌现的经典案例三:In-Context Learning

In-Context Learning(上下文学习) 是大模型最神奇的能力之一。

什么叫上下文学习?

给模型几个例子(不是重新训练),它就能现场学会一个新任务:

输入:
  翻译:苹果 → apple
  翻译:香蕉 → banana
  翻译:橙子 → ?

输出:orange

注意! 模型没被训练过做「翻译水果」这个任务。它仅仅看了两个例子,就现场学会了

这个能力,也是在 100B 参数附近突然出现的。小模型完全做不到。


7.5 涌现现象总览

除了上面三个,还有很多能力都是「涌现」出来的:

涌现能力 大约涌现阈值
三位数加减 ~100B 参数
多步推理 ~100B 参数
In-Context Learning ~100B 参数
代码生成 ~10B 参数
翻译 ~1B 参数
基本对话 ~100M 参数
思维链推理(CoT) ~60B 参数
模仿不同风格写作 ~100B 参数

7.6 「涌现」的科学争议

涌现这个现象太神奇,引起了激烈的学术争论。

乐观派(Jason Wei 等):

涌现是真实的相变现象。模型到了某个规模,内部某种「理解」突然「解锁」——我们迎来了「智能的相变」。

保守派(Schaeffer 等,2023):

涌现可能是评测指标的假象。如果换一个「连续」的评测指标(而不是非黑即白的对/错),能力的提升其实是「平滑」的,只不过在某个阈值前准确率太低看不出来。

这两派目前都有证据,尚未分出胜负

不管哪一派对,有一件事是确定的:

💡 「模型变大」 确实导致了 「新能力的出现」。 无论这个过程是「突然的」还是「渐进的」,它都改变了 AI 的能力边界。


7.7 涌现的哲学意义

涌现现象最让人震撼的是——

它的本质机制,我们不完全理解

  • 我们设计了 Transformer 的架构
  • 我们选择了「预测下一个词」的目标
  • 我们准备了训练数据

然后——把模型做大——它自发地涌现出我们没预期的能力: - 推理 - 编程 - 翻译 - In-Context Learning - 类比思维 - ……

这件事的深意

🌟 「智能」可能不是一件需要「设计出来」的事——它是「规模 + 数据 + 简单目标」的自然结果。

如果这是真的,那么人类大脑的「智能」,也许就是 860 亿神经元 + 几十年经验 + 自然选择(目标)的「涌现产物」。

这关于意识与智能的本质,是 2025-2026 年 AI 哲学最热门的话题


7.8 涌现对教育的启示

涌现现象对教师有一个深刻启示——

人类学习也有「涌现时刻」

您一定见过这样的学生——

一年级的时候:数学 60 分,费力
二年级的时候:数学 65 分,还是费力
三年级的时候:数学 70 分
四年级的时候:数学 80 分
五年级的时候:数学 95 分
初一的时候:数学 100 分,开始解奥数

不是「慢慢变好」的线性过程——而是积累到某个临界点后的突然顿悟

这种「顿悟式学习」,在教育心理学里叫 「insight learning」 或 「aha moment」

涌现现象告诉我们规模(学习量)积累到一定程度会产生质变

所以——对一个暂时不出彩的学生,不要放弃。可能他还没到那个临界点。再等等、再教教,说不定哪天「涌现」就来了。


📐 数学视角(可跳过)

涌现的一个理论解释——Neural Scaling Laws(神经网络扩展律)。

Kaplan 等(2020)和 Hoffmann 等(2022,Chinchilla Paper)发现,LLM 的损失 $\mathcal{L}$ 和三个因素遵循幂律关系:

$$\mathcal{L}(N, D, C) \approx L_0 + A \cdot N^{-\alpha} + B \cdot D^{-\beta} + E \cdot C^{-\gamma}$$

其中: - $N$:模型参数量 - $D$:训练 token 数 - $C$:总计算量 - $L_0, A, B, E, \alpha, \beta, \gamma$:由架构决定的常数

这是一条「可预测」的曲线——给定参数和数据,几乎能精确算出模型的最终损失。

曲线表现的是平均损失的平滑下降。而具体任务的准确率可以是阶跃的——因为任务的「能否解决」往往有一个阈值(损失低于某个值才能正确回答),当模型的损失越过这个阈值时,准确率就「突然出现」。

这是数学上对「涌现」的一种解释——不是神秘魔法,而是「能力阈值」的自然结果


第 9 节 · 5 分钟推理模型:让 AI 学会「慢慢想」

2024 年 9 月,OpenAI 发布了一个划时代的模型——o12025 年 1 月,DeepSeek 紧随其后发布了R1,并开源。 2025 年,Claude 推出了Thinking Mode(思考模式)。

这一批模型被称为推理模型(Reasoning Models)。它们带来了继 ChatGPT 之后LLM 领域的又一次范式转变


8.1 推理模型之前:快思考

在 o1 之前,所有 LLM 都是「一问一答」——

用户问 → LLM 立刻开始生成答案(几毫秒后就开始吐字)

这种「立刻回应」的模式,诺贝尔经济学奖得主丹尼尔·卡尼曼在《思考,快与慢》里称为 「系统 1 思维」——

🧠 快速、本能、自动化的思维

优点:快、高效 缺点:在复杂问题上容易出错

人类做复杂数学题、推理复杂逻辑时,不会用系统 1——我们会慢下来,一步步想,这叫系统 2 思维

LLM 在 o1 之前,没有系统 2


8.2 一个简单的改变,带来革命

o1 的核心想法简单到不可思议

🎯 让模型在「正式回答」之前,先生成一大段「思考过程」(隐藏不显示给用户)。

比如您问:

「如果 x² - 4x + 3 = 0,x 可能是多少?」

传统 LLM(GPT-4)

「x = 1 或 x = 3」(直接答)

推理模型(o1 / R1)

[隐藏的思考过程(内部「草稿」)]
这是一个一元二次方程,形式是 ax² + bx + c = 0。
这里 a = 1, b = -4, c = 3。
我可以用求根公式:x = [-b ± √(b² - 4ac)] / (2a)
代入:x = [4 ± √(16 - 12)] / 2 = [4 ± 2] / 2
所以 x = 3 或 x = 1。
也可以用因式分解验证:x² - 4x + 3 = (x-1)(x-3) = 0
所以 x = 1 或 x = 3。
两种方法都确认了答案。
[思考结束]

[正式回答]
x = 1 或 x = 3。

解法:利用因式分解 x² - 4x + 3 = (x-1)(x-3) = 0,
所以 x = 1 或 x = 3。

8.3 为什么慢思考这么有效?

o1 在数学和编程任务上的表现比 GPT-4 提升了 3-5 倍

为什么?

因为 Transformer 本质上每个 token 只做一次固定的计算——它没法「停下来再想想」。如果模型要解决一个复杂问题,必须把思考过程「摊开在 token 序列里」,让每一步推理都有独立的计算资源。

思考链越长 → 分配给问题的计算资源越多 → 更容易解对复杂问题

这是一个深刻的洞察:用 test-time compute(推理时计算)换 train-time compute(训练时计算)


8.4 推理模型是怎么训练出来的?

o1、R1 的训练增加了一个新阶段——强化学习推理(RL on Reasoning)

核心思想:

  1. 让模型自由生成思考过程和答案
  2. 检查答案对不对(对数学题、代码题,可以自动验证)
  3. 如果答对了,奖励模型「生成这种思考过程」
  4. 如果答错了,惩罚这种思考方式

模型自己摸索出:什么思考方式能导致正确答案

DeepSeek-R1 的论文(2025 年 1 月)揭示了一件惊人的事——

当训练进行到一定阶段,模型「自发涌现出」自我反思的能力。

它开始自己说:「等等,让我重新想想这一步……」、「啊我前面算错了」……

研究者称之为 「aha moment」——模型自己学会了反思

这件事意义深远AI 第一次自发地展现出「元认知」(对自己思考过程的思考)


8.5 Claude 的 「Thinking Mode」

Anthropic 在 Claude 3.7 Sonnet(2025) 起引入了 Thinking Mode(思考模式)

Claude Opus 4.7(2026 年 4 月发布,就是撰写本讲时最新)把思考模式做得更精致——

  • 您可以控制思考的「深度」(用多少 token 思考)
  • 对简单问题,Claude 会跳过思考,直接回答(省成本)
  • 对复杂问题,Claude 会启动 Extended Thinking(延长思考),生成几千甚至几万 token 的内部推理

8.6 推理模型的代价:慢 + 贵

推理模型不是免费午餐——

❶ 慢 - 传统 LLM:几秒出答案 - 推理模型:几十秒到几分钟(思考过程要生成,但不显示给你)

❷ 贵 - 传统 LLM 每百万 token $3 左右 - o1 / o3 每百万 token $60+(思考过程也算 token 成本)

❸ 适合复杂问题,不适合简单对话 - 问 AI 一个简单的问题(如「讲个笑话」),用 o1 是浪费 - 问 AI 解一道奥数题,用 o1 才值


8.7 2026 年推理模型的格局

模型 推理模式 特色
OpenAI o1 / o3 / o4 独立的推理模型家族 数学、代码顶尖
Claude Opus 4.7 Thinking Mode 可切换 推理 + 对话融合
DeepSeek R1 开源 全球研究者能用
Gemini Deep Think 可开启 Google 版本
Qwen3 Thinking 开源 中文任务强
GLM Z1 智谱推理版本

推理模型正在成为 2026 年的新主流。一个普遍的判断是:「推理模型 + 传统 LLM 混合使用」 会是未来几年的格局——简单问题用快模型,复杂问题用推理模型。


第 10 节 · 3 分钟MoE 混合专家:DeepSeek 如何把成本打到地板

2024 年末,DeepSeek V3 用 $557 万训练出媲美 GPT-4 的模型——这件事背后最大的功臣,就是一种叫 MoE(Mixture of Experts,混合专家) 的架构。


9.1 MoE 是什么?

传统 LLM(Dense 模型): - 每一个 token通过所有参数 - 像一个「全能助手」——无论什么问题,大脑的每一部分都要工作一下

MoE 模型: - 模型内有很多个「专家」(比如 64 个 FFN 子网络) - 每个 token激活其中几个专家(通常 2 个) - 像一个「专家团队」——遇到数学题激活数学专家、遇到代码题激活代码专家


9.2 MoE 的巧妙之处:总参数大,但激活参数小

  • DeepSeek V3 总参数:671B
  • 每个 token 实际激活的参数:仅 37B

这意味着: - 训练时:模型有 671B 的「知识容量」 - 推理时:每次只用 37B 的计算量

等于:用 671B 大模型的能力,付 37B 小模型的成本


9.3 一个直观的比喻

想象一家综合医院

传统 Dense 模型 = 让所有医生(内科、外科、骨科、儿科、妇产科、心脏科……)同时看每一个病人。 - 优点:每个病人都得到全面关注 - 缺点:超级烧钱,医生都被过度使用

MoE 模型 = 医院里有 64 个专家医生,每个病人进来后由「分诊台」分配给最合适的 2 个医生看。 - 优点:成本大幅降低,效率极高 - 缺点:分诊台(Router)必须训练得很好,否则把病人送错科了


9.4 MoE 的关键组件:Router(路由)

Router(路由器) 是 MoE 的核心。它是一个小神经网络,负责给每个 token 决定走哪些专家

Token 「光合作用」
  ↓
[Router 分析这个 token]
  ↓
决定:发给「生物专家」和「化学专家」这 2 个 FFN
  ↓
两个专家各自计算
  ↓
加权合并输出

训练时:Router 和所有专家一起训练,Router 学会「哪些专家该做哪类 token」。

难点: - Router 如果不均衡,只让少数几个专家工作,其他专家荒废(Router 偷懒) - 需要负载均衡 loss 强迫 Router 平均使用所有专家


9.5 MoE 的历史与现状

模型 架构 年份
Google Switch Transformer 最早商用级 MoE 2021
Mistral 8x7B(Mixtral) 推动 MoE 流行 2023
DeepSeek V3 MoE + 极致优化 2024
DeepSeek V4 优化版 2025
GPT-4(传闻) 据传是 MoE 2023
Claude 4 系列 不公开 -

2026 年的事实几乎所有大规模开源/半开源前沿模型都转向了 MoE。Dense 模型只在小规模场景(< 70B)还有优势。


9.6 MoE 对教师的影响

为什么教师需要关心 MoE?

因为 MoE 让大模型便宜了——

  • DeepSeek V3 的 API 价格 = GPT-4 的 1/100
  • 这让中小学有预算能用上前沿 AI
  • 学校内部部署大模型成为可能(免费开源)

MoE 是国产大模型能与 OpenAI 竞争的关键技术


📐 数学视角(可跳过)

MoE 层的数学形式:

$$\text{MoE}(\mathbf{x}) = \sum_{i=1}^{N} G(\mathbf{x})_i \cdot E_i(\mathbf{x})$$

其中: - $N$:专家总数(如 64) - $E_i(\mathbf{x})$:第 $i$ 个专家(通常是一个 FFN)的输出 - $G(\mathbf{x}) \in \mathbb{R}^N$:Router 的输出,满足 $\sum_i G_i = 1$

稀疏化(Top-K):Router 只选 $k$ 个专家($k \ll N$,比如 $k=2, N=64$):

$$G(\mathbf{x}) = \text{TopK}(\text{softmax}(\mathbf{W}_g \mathbf{x}), k)$$

这保证每个 token 只激活 $k$ 个专家,计算量从 $O(N)$ 降到 $O(k)$。

DeepSeek V3 的一些关键改进: - Shared Experts:有几个「共享专家」永远激活,捕捉通用知识 - Auxiliary-Loss-Free Load Balancing:用动态偏置替代传统负载均衡 loss - Multi-Token Prediction:一次预测多个未来 token,加速训练


第 11 节 · 4 分钟幻觉(Hallucination):最大的不完美及应对

讲完神奇的能力,也要讲清不完美的一面。

幻觉(Hallucination) 是 LLM 最臭名昭著的问题——模型一本正经地说出并不存在的事实


10.1 幻觉的典型表现

例子 1:虚构引用

用户:介绍一下鲁迅在 1932 年发表的文章《论革命文学的方向》。 AI:鲁迅先生在 1932 年发表的《论革命文学的方向》是他后期思想的重要代表作。文章中他指出……(一本正经地长篇大论)

但这篇文章根本不存在!鲁迅从没写过这样一篇文章。AI 凭空编造了。

例子 2:虚构法条

用户:中国《民法典》第 1152 条规定什么? AI:《民法典》第 1152 条规定了遗嘱执行人的权利……(详细解释)

实际上《民法典》只有 1260 条。第 1152 条的内容可能和 AI 说的完全不同。

例子 3:虚构学术文献

老师写论文时用 AI 找文献。AI 给出:

《XXX 理论研究》(张三,教育出版社,2018)

老师兴奋地要去图书馆借——这本书不存在


10.2 为什么会有幻觉?—— 深层原因

理解了预训练原理,您现在可以从根本上理解幻觉了——

核心原因模型被训练的目标是「预测最可能的下一个词」,而不是「预测真实的事实」


比如「鲁迅 1932 年发表了《论革命文学的方向》」这件事——

  1. 模型见过很多「鲁迅在某年发表了某篇文章」的句式
  2. 模型学到了这种句式的生成模式
  3. 当有人问到「鲁迅 1932 年的文章」时,模型按模式生成一个「看起来合理」的文章标题
  4. 它没有「查证」机制——它不知道自己在编

AI 不是故意撒谎——它根本不区分「真」和「生成」

对模型来说,「流畅、合理、符合语言规律的输出」「真实的事实」 是同一件事。


10.3 四种常见幻觉类型

类型 表现 例子
事实幻觉 编造不存在的事实 虚构的历史事件、人物生平
引用幻觉 编造不存在的文献、出处 假论文、假书、假法条
计算幻觉 算错数但信誓旦旦 简单加减法算错
指令幻觉 声称做了某件实际没做的事 「我已经查阅了最新的资料」(实际没查)

10.4 应对幻觉的五大武器

武器 1:RAG(检索增强生成)

让 AI 先查资料、再回答

用户:鲁迅 1932 年的文章有哪些?
  ↓
系统:[搜索知识库] → 找到鲁迅作品年表
  ↓
AI 看到真实资料后回答:根据文献记录,鲁迅 1932 年发表的作品有……

这是 2026 年最有效的反幻觉手段,也是本讲(下)会重点讲的。


武器 2:Grounding with Source(来源标注)

让 AI 在回答时标出信息来源

"《民法典》第 1152 条规定了……[引自 民法典第 1152 条]"

如果 AI 能明确说出来源,您就能去核查;如果 AI 说不出来,就知道它在编。


武器 3:工具调用(Tool Use)

让 AI 调用外部工具查证

  • 数学题 → 调用计算器
  • 日期 → 调用日历
  • 最新新闻 → 调用搜索引擎

Claude、ChatGPT 现在都内置了工具调用功能。


武器 4:让 AI 自查

让 AI 回答后再用一个 prompt 检查自己

「请审查上面的回答,找出任何可能不准确的地方。」

模型在反思时常常能发现自己的幻觉。这是一种自省机制


武器 5:老师永远的工具—— 「反问

这是最朴素也最有效的方法:

  • 「你这个说法的来源是什么?」
  • 「我查了一下,你说的这件事我没找到——能再核实一下吗?」
  • 「给我具体的页码和 ISBN。」

AI 在被追问时,往往会「坦白」 —— 它会说:「抱歉,我之前的回答可能不准确……」

这不是因为它「知道」自己错了,而是因为追问让它重新生成,新生成的内容恰好更接近真实


10.5 对老师的几条铁律

🌟 涉及以下内容时,AI 的回答必须交叉核验

  1. 具体数字(年份、数据、法条编号)
  2. 具体人名、作品名、文献名
  3. 医学、法律等专业建议
  4. 学校、公司、机构的具体信息
  5. 最新发生的事(模型的知识有截止日期)

「相信 AI、但要核验」——像记者对待消息源一样


10.6 2026 年幻觉问题的现状

好消息:幻觉率正在下降

  • GPT-3.5(2022):幻觉率 ~20%
  • GPT-4(2023):幻觉率 ~10%
  • GPT-5.4 / Claude Opus 4.7(2026):幻觉率 ~3-5%(推理模式下更低)

幻觉永远不会完全消失——它是 LLM 这种「统计模式机器」的固有特性与其期待 AI 不幻觉,不如学会和幻觉共处


第 12 节 · 3 分钟本讲小结 + 预告第四讲(下)

走到这里,您已经完成了 LLM 原理最硬核的一段旅程——从一堆随机旋钮,到涌现出惊人能力的 ChatGPT。


11.1 本讲核心概念总结表

核心概念 一句话记忆
三阶段训练 预训练 + SFT + 对齐 —— LLM 从婴儿长成助手
预训练(Pre-training) 在几万亿 token 的互联网文本上预测下一个词
基础模型(Base Model) 预训练完的模型,懂世界但不会对话
SFT(监督微调) 用几万条高质量对话教模型「怎么说话」
对齐(Alignment) 让 AI 符合人类偏好(有用、无害、诚实)
RLHF 用人类偏好训练奖励模型,再用 RL 优化 LLM
DPO RLHF 的简化替代,无需奖励模型和 RL
HHH Helpful, Harmless, Honest 三个对齐目标
训练规模 几亿美元、十万张 GPU、几个月
DeepSeek V3 事件 MoE + 工程优化让训练成本降 100 倍
涌现(Emergence) 规模达到阈值,能力突然出现 —— AI 最神奇的现象
In-Context Learning 只给几个例子,模型就现场学会新任务
推理模型 o1 / R1 / Thinking Mode —— 让 AI 慢思考
思维链(CoT) 把推理过程「摊开」在 token 序列里
MoE 混合专家 总参数大、激活参数小——训练和推理都省钱
幻觉(Hallucination) 模型生成「听起来对但其实假」的内容
RAG 让 AI 先查资料再回答,对付幻觉的最有效手段
Neural Scaling Laws 模型损失可预测的幂律下降

11.2 本讲(中)的三个关键 takeaway

🌟 ❶ LLM 的能力 90% 来自预训练,SFT 和对齐只是在「解锁」这些能力。

🌟 ❷ 涌现是 LLM 最神秘的现象 —— 规模达到阈值,能力就从「不会」跳跃到「会」。这既是 AI 的魔法,也是教育的启示:不要放弃任何一个「还没涌现」的学生。

🌟 ❸ 2026 年的前沿是「推理模型 + MoE 架构」—— 让 AI 会慢思考、让训练成本大幅下降。


11.3 对第四讲(下)的预告

第四讲(下)将是整门课中最面向教师、最接地气的一讲——

核心主题从语言模型到世界:多模态、智能体与 2026 年的前沿

主要章节规划:

  • 2026 年模型格局速览:GPT-5.4、Claude Opus 4.7、Gemini 3、DeepSeek V4 ……谁强在哪?
  • 多模态:LLM 长出了眼睛、耳朵、嘴巴 —— 图像、视频、语音、世界模型
  • 智能体(Agent):LLM 长出了手和脚 —— ReAct、MCP、2026 年的 Agent 产品
  • Prompt 工程进阶:从「会用」到「会调教」
  • RAG:对付幻觉的利器
  • 评测榜单读法:MMLU、HumanEval、SWE-Bench
  • 开源 vs 闭源:这场博弈对教育的意义
  • AI 生成内容检测的真相
  • 教师实战清单:2026 年老师最实用的 AI 用法 30 条

下一讲您会看到本讲讲的 Transformer 和训练原理,如何在 2026 年结出最丰硕的果实——能看会说、能行动能思考的 AI


第 13 节 · 3 分钟尾声:思考题与延伸

一段写给老师的话

亲爱的老师——

感谢您读完了这一讲。

我写这份讲稿时,最希望您感受到的是「震撼」

  • 一个几千亿随机旋钮的模型
  • 几万亿人类文字上预测下一个词
  • 突然涌现出推理、编程、翻译、创作的能力
  • 经过几天的对齐训练,就能和人类对话

这件事,在 AI 史上是奇迹。在人类科技史上也是奇迹。我们正在目睹「智能」这件事被重新定义

有一个深刻的想法值得您和学生分享——

🌱 「涌现」告诉我们:智能可能不需要被『设计』出来。

只需要规模 + 数据 + 简单目标 + 足够时间。

这和教育的某种真相可能是一致的——

  • 不要追求「把智能塞进学生脑子里」
  • 创造让智能能「涌现」的环境:丰富的输入、简单清晰的目标、足够的练习
  • 然后等待。在某一天,您会看到那个「aha moment」——学生突然「懂了」

这也许就是 AI 教给教育的最深的一课。


下一讲(第四讲下)我们会继续——看看 2026 年最前沿的 AI 是什么样子,以及老师应该怎么用好它们

祝学习愉快。


—— 本讲讲稿将随技术发展和教学反馈持续更新。 —— 课程配套网站将同步提供最新版文字稿、视频回放和实操指南。


附录:重要概念索引(按字母序)

  • Alignment 对齐:第 4 节
  • Aha Moment:第 8.4 节
  • Base Model 基础模型:第 2.5 节
  • Chain-of-Thought 思维链:第 7.5 节(下一讲深入)
  • Common Crawl:第 2.1 节
  • DeepSeek V3:第 6.6 节,第 9 节
  • DPO 直接偏好优化:第 4.6 节
  • Emergence 涌现:第 7 节
  • Emergent Abilities 涌现能力:第 7 节
  • Fine-tuning 微调:第 3 节
  • Grounding:第 10.4 节
  • Hallucination 幻觉:第 10 节
  • HHH(Helpful, Harmless, Honest):第 4.2 节
  • In-Context Learning 上下文学习:第 7.4 节
  • Inference 推理:第 6.5 节
  • Instruct Model 指令模型:第 5.1 节
  • KV Cache:见第四讲(上)
  • LoRA:第 5.1 节(未详述,第四讲下会提)
  • MoE 混合专家:第 9 节
  • Multi-Token Prediction:第 6.6 节
  • Neural Scaling Laws 神经网络扩展律:第 7.8 节数学视角
  • o1 / o3:第 8 节
  • Pre-training 预训练:第 2 节
  • R1(DeepSeek R1):第 8 节
  • RAG 检索增强生成:第 10.4 节(第四讲下深入)
  • Reasoning Models 推理模型:第 8 节
  • Reward Model 奖励模型:第 4.3 节
  • RLHF:第 4.3 节
  • Router 路由器:第 9.4 节
  • Self-Supervised Learning 自监督学习:第 2.3 节
  • SFT 监督微调:第 3 节
  • Sycophancy 谄媚:第 4.5 节(隐含)
  • System 1 / System 2 思维:第 8.1 节
  • Thinking Mode 思考模式:第 8.5 节
  • Tool Use 工具调用:第 10.4 节