110 个词,按章排列
每个词一段话,说清它是什么、为什么重要、容易和什么混。术语按它第一次在正文里出现的章排列,所以从上往下读,也是一条学习路线。
第 1 章 · 你已经在用 AI 了
在海量文本上以「预测下一个 token」为目标训练的超大 Transformer 网络,参数从几十亿到上万亿。一个模型可以迁移到几乎所有与语言有关的任务。「基础模型」是更宽的说法,把处理图像、音频的同类模型也算进来。
一旦机器做到了某件事,人们就不再把那件事算作「智能」。计算、光学字符识别、语音输入、路线规划都经历过从 AI 明星课题到「普通软件」的转变。它解释了为什么「AI」这个词的边界总在往后退。
第 2 章 · 七十年,三次浪潮
第 3 章 · 不只是神经网络
强化学习特有的矛盾:是沿用已知有效的行动(利用),还是尝试未知的行动以发现可能更好的选择(探索)。只利用会困在平庸解,只探索拿不到稳定回报。监督学习的数据是给定的,不存在这个问题。
第 4 章 · 规则不是写出来的,是学出来的
数据没有标签,模型只能寻找结构:把样本自动分群、发现异常、压缩表示。它不告诉你每一群是什么,只告诉你数据里存在这样的分野。
第 5 章 · 真正的考试在训练集之外
模型太简单,连数据里真实的规律都抓不住,训练损失就降不下去。用一条直线去拟合一段明显的曲线就是欠拟合。与过拟合构成机器学习里永恒的拉锯。
把分类结果按「预测是/否 × 实际是/否」分成四格:真阳性、假阳性(误报)、假阴性(漏报)、真阴性。准确率、精确率、召回率都从这四格算出。
模型学到的全部是相关(什么与什么倾向于同时出现)。相关足以预测,不足以干预:给每个孩子发平板不会自动提高成绩。区分两者需要实验设计与领域知识,不是更大的模型。辛普森悖论是相关方向可被隐藏变量反转的例子。
第 6 章 · 一层一层看出一只猫
神经元求和之后的非线性函数(如「负数归零、正数照旧」)。没有它,堆多少层都只是一个线性变换;有了它,多层网络可以逼近几乎任何函数。非线性是神经网络一切能力的来源。
第 7 章 · 文字怎样变成数字
第 8 章 · 每个词都能看见其他词
序列里每个位置都根据与所有位置的相关度加权收集信息,从而让一个词的表示随上下文改变(「苹果」在「吃」旁边偏向水果)。对整个序列可并行计算,这是 Transformer 能扩展到超大规模的原因;代价是计算量随长度平方增长。
注意力的三个角色:每个词发出查询(我想知道什么),提供键(我能回答什么)和值(我愿意贡献的信息)。查询与各键比对得到权重,按权重对各值加权求和。三者由三个可训练矩阵从词向量变换而来。
同时用多组查询键值,每组(一个「头」)学习关注不同类型的关系(语法、指代、位置),最后把各头输出拼接。事后观察可见有的头专看前一个词、有的专追踪代词。
注意力机制本身不在乎词序,「猫追狗」与「狗追猫」无法区分。位置编码在每个词的向量上加入表示位置的信息,把顺序塞回一个本身与顺序无关的机制。
Transformer 模块里对每个位置单独做非线性变换的多层感知机。注意力在词间搬运信息,前馈网络消化它。模型的大部分参数在这里,研究者认为许多「知识」也存在这里;混合专家架构替换的就是它。
让每个子层的输出加上它的输入再往下传,信息可以绕过某层直行。2015 年提出,解决了深网络梯度消失的问题,使网络从几十层到上千层成为可能。Transformer 每个模块都带着它。
从下一个 token 的概率分布里选词的方式。贪心永远选最大者,稳定但单调;采样按概率随机抽。温度是调节旋钮:低温压尖分布、接近贪心,高温压平分布、更随机。top-k、top-p 限制候选范围。
第 9 章 · 从续写机到助手
第 10 章 · 它为什么会一本正经地胡说
第 11 章 · 模型长出了眼睛和手
从文字生成语音。近年越来越多地直接用语言模型预测「声音的 token」,能带情感、停顿与口音,几秒钟的样本足以克隆一个人的声音。这使声音不再能作为身份证明。