术语表

110 个词,按章排列

每个词一段话,说清它是什么、为什么重要、容易和什么混。术语按它第一次在正文里出现的章排列,所以从上往下读,也是一条学习路线。

第 1 章 · 你已经在用 AI 了

一个诚实的定义,一张不会过时的地图,以及为什么「AI」这个词总在往后退。
人工智能Artificial Intelligence, AI

让机器完成那些通常需要人类智能才能完成的任务。定义的核心是「任务」而不是方法:规则、搜索、统计学习、神经网络都可以是实现手段。它是本书六层包含关系里最外面的一圈。

机器学习Machine Learning, ML

人工智能的一个子集。不由人写规则,而是让机器从数据中自己找出规律。规律以模型参数的形式存在,人读不懂,但可以测试。1990 年代起成为 AI 的主流,今天绝大多数被称为 AI 的系统都是机器学习。

深度学习Deep Learning, DL

用多层神经网络做的机器学习。它最重要的特点不是层数多,而是连「该看数据的哪些方面」(特征)也交给机器学习,即表示学习。2012 年起统治图像、语音,随后扩展到语言。

大语言模型Large Language Model, LLM

在海量文本上以「预测下一个 token」为目标训练的超大 Transformer 网络,参数从几十亿到上万亿。一个模型可以迁移到几乎所有与语言有关的任务。「基础模型」是更宽的说法,把处理图像、音频的同类模型也算进来。

生成式 AIGenerative AI

强调用途的一个词:不只是分类和预测,而是生成原本不存在的文本、图像、音频、视频或代码。2022 年底 ChatGPT 让它进入公众视野。「造得像」与「造得对」是两回事,这是它最需要警惕的地方。

AI 效应AI effect

一旦机器做到了某件事,人们就不再把那件事算作「智能」。计算、光学字符识别、语音输入、路线规划都经历过从 AI 明星课题到「普通软件」的转变。它解释了为什么「AI」这个词的边界总在往后退。

相关:人工智能

第 2 章 · 七十年,三次浪潮

AI 的历史不是一条上升的直线,而是几次高潮与几次寒冬。每次转折都有一个具体的原因,而且原因往往不是「更聪明的算法」。
符号主义Symbolic AI

认为智能是对符号(概念、命题)的逻辑操作,只要把知识写成符号和规则,机器就能推理。1956 到 1980 年代的 AI 正统,成就是定理证明与专家系统,瓶颈是知识写不完、规则会打架。

专家系统Expert System

把某个狭窄领域里专家的知识写成几百到几千条 if-then 规则,配一个推理引擎,让机器在该领域内当顾问。1980 年代的商业热潮,因「知识获取瓶颈」(规则靠人访谈录入、难维护、难适应变化)而退潮。

AI 寒冬AI winter

AI 历史上经费与信心大规模撤出的时期,主要有两次(1970 年代中期、1980 年代末)。共同原因不是技术「失败」,而是承诺与能力之间的落差。它提醒我们把「能做什么」与「被说成能做什么」分开。

感知机Perceptron

1958 年罗森布拉特提出的单层神经网络,能从例子中学会简单的线性分类。1969 年被证明连异或都学不会,导致连接主义沉寂十余年;解决办法是多层结构加反向传播,但要到几十年后算力与数据到位才发挥威力。

ImageNetImageNet

李飞飞团队从 2007 年起建立的图像数据集,一千四百万张人工标注的图片。2012 年在其竞赛上,深度卷积网络把错误率从 26% 降到 16%,成为深度学习浪潮的起点。它说明「数据」是算法、数据、算力三角形里同等重要的一角。

摩尔定律与 GPUMoore's law & GPU

芯片算力每约两年翻倍的经验规律,加上原本为游戏渲染设计、恰好擅长并行矩阵运算的图形处理器,共同提供了深度学习所需的算力。2012 年的突破就是在两块游戏显卡上完成的。今天前沿模型的训练用几万块 GPU。

规模定律Scaling laws

2020 年前后总结出的经验规律:在一定范围内,模型的损失随参数量、数据量、计算量的增加呈可预测的幂律下降。它让「把模型做大」从赌博变成工程,是行业押注超大模型的理由;它是否会持续、在何处失效,是当前最重要的开放问题之一。

相关:涌现 · 预训练

第 3 章 · 不只是神经网络

搜索、规则与试错。这三种「老式」AI 至今仍在你的导航软件、下棋程序和游戏角色里工作,而且它们是理解后面所有内容的必要背景。
启发式Heuristic

一个便宜的估计,告诉搜索「往哪边更有希望」。地图上的直线距离就是到目的地真实距离的启发式。好的启发式让搜索几乎不走弯路;从不高估真实代价的启发式能保证搜到最优解。

相关:搜索 · A* 算法
规则系统Rule-based system

用人写的 if-then 规则做判断的系统。优点是透明、可审计、可精确控制;缺点是写不完、不会自己适应变化。今天常与机器学习模型组合使用:模型给概率,规则加硬约束,例如智能体执行危险操作前必须确认。

强化学习Reinforcement Learning, RL

让智能体在环境中反复尝试,按行动之后得到的奖励调整策略,学会「在这种情况下该做什么」。它没有标签,只有奖励;必须处理探索与利用的矛盾。是机器人、游戏 AI 的基础,也是大语言模型对齐阶段的核心方法。

相关:奖励 · 探索与利用 · RLHF
奖励Reward

强化学习中环境对智能体行动的反馈数值。学习的目标是最大化长期累积奖励。奖励的设计极其关键:设计不当会导致智能体钻空子(奖励破解),这一问题在用人类偏好训练语言模型时同样出现。

相关:强化学习 · RLHF
探索与利用Exploration vs. exploitation

强化学习特有的矛盾:是沿用已知有效的行动(利用),还是尝试未知的行动以发现可能更好的选择(探索)。只利用会困在平庸解,只探索拿不到稳定回报。监督学习的数据是给定的,不存在这个问题。

相关:强化学习
蒙特卡洛树搜索Monte Carlo Tree Search, MCTS

通过随机模拟大量对局来评估走法的搜索方法,把算力集中在最有希望的分支上。AlphaGo 用它向前推演,并用策略网络与价值网络替代了以往靠人手写的评估函数,是搜索与神经网络合流的典型。

相关:搜索 · 强化学习

第 4 章 · 规则不是写出来的,是学出来的

机器学习的全部核心思想,其实只有一句话。这一章用一笔网约车订单把它讲透。
样本与特征Sample & feature

样本是训练数据里的一条记录(一笔订单、一张照片);特征是描述这条记录的各个数值(距离、时段、像素)。把现实变成特征的过程叫特征工程,在深度学习之前是机器学习工程师的主要工作。

相关:标签 · 表示学习
标签Label

监督学习中希望模型学会预测的那个答案:订单的成交价、照片里是不是猫。标签通常由人提供,昂贵且可能带入标注者的偏见与错误。模型学到的上限是标签的质量。

模型与参数Model & parameters

模型是一台「带旋钮的机器」:输入特征,输出预测。旋钮就是参数(权重、偏置),学习就是找到让预测尽量准的参数取值。参数从一条直线的三个到大语言模型的上万亿个。

相关:训练 · 参数量
损失函数Loss function

把「模型错了多少」变成一个可计算、可比较的数,例如预测值与真实值之差的平方的平均。训练就是不断调整参数使损失下降。损失函数(训练用)与评估指标(最终汇报用)常常不同。

梯度下降Gradient descent

最常用的优化算法:对每个参数计算「稍微改动会让损失增大还是减小」(梯度),沿减小的方向走一小步,反复进行。像蒙眼下山。步长叫学习率。它就是训练万亿参数模型时用的那个算法。

监督学习Supervised learning

用带标签的数据训练模型,学习从特征到标签的映射。最成熟、应用最广的范式,识别与预测两类能力主要来自它。瓶颈是标签昂贵。

无监督学习Unsupervised learning

数据没有标签,模型只能寻找结构:把样本自动分群、发现异常、压缩表示。它不告诉你每一群是什么,只告诉你数据里存在这样的分野。

相关:监督学习
自监督学习Self-supervised learning

从数据自身制造标签:遮住一个词让模型猜、截断一段文字让模型续写。不需要人工标注,因此可以用整个互联网训练。它是大语言模型能出现的直接原因。

训练Training

用数据反复调整模型参数以降低损失的过程。一个完整项目还包括定义任务、收集数据、构造特征、划分数据、评估、部署与监控,其中「用什么模型」往往是最不重要的决定。

第 5 章 · 真正的考试在训练集之外

一个模型在见过的数据上表现好,不说明任何事。这一章讲泛化、过拟合、评估,以及数据里最常见的几个陷阱。
泛化Generalization

模型在没见过的数据上表现稳定的能力。它是机器学习唯一真正的目标,损失、梯度、参数都为它服务。训练数据上的表现不能说明泛化,必须在留出的数据上考。

过拟合Overfitting

模型不但学到了规律,还把训练数据里的噪声和巧合当成规律,于是训练表现很好、新数据上很差。模型越灵活、数据越少越容易发生。对策:更多数据、限制复杂度、正则化、早停。

相关:泛化 · 欠拟合
欠拟合Underfitting

模型太简单,连数据里真实的规律都抓不住,训练损失就降不下去。用一条直线去拟合一段明显的曲线就是欠拟合。与过拟合构成机器学习里永恒的拉锯。

相关:过拟合
训练集与测试集Train / validation / test split

把数据分成三份:训练集用来学,验证集用来调参数和决定何时停,测试集只在最后考一次。验证与测试分开,是为了防止你反复根据同一份数据调整模型而间接过拟合它。有时间顺序的数据必须用过去预测未来。

相关:泛化 · 分布偏移
准确率Accuracy

预测正确的比例。最常被引用也最容易误导的指标:当关心的类别是少数(1% 的患病率),一个「全判为否」的模型准确率也有 99%。需要拆成误报与漏报分开看。

精确率与召回率Precision & recall

精确率:模型说「是」的那些里,多少真的是。召回率:所有真的「是」里,模型找出了多少。两者此消彼长,取舍取决于误报与漏报各自的代价,这是价值判断而非技术选择。

混淆矩阵Confusion matrix

把分类结果按「预测是/否 × 实际是/否」分成四格:真阳性、假阳性(误报)、假阴性(漏报)、真阴性。准确率、精确率、召回率都从这四格算出。

标签泄漏Label leakage

某个特征偷偷包含了答案(预测是否住院,特征里有「是否开了住院单」)。模型会得到近乎完美的训练成绩,因为它作弊了,而作弊的特征在真正预测的时刻并不存在。往往很隐蔽。

相关:标签 · 分布偏移
分布偏移Distribution shift

部署后的数据与训练数据不再来自同一个「世界」:疫情改变了出行,新教材改变了学情。所有模型都默认「未来像过去」,而这没有保证。因此部署不是终点,监控才是。

相关与因果Correlation vs. causation

模型学到的全部是相关(什么与什么倾向于同时出现)。相关足以预测,不足以干预:给每个孩子发平板不会自动提高成绩。区分两者需要实验设计与领域知识,不是更大的模型。辛普森悖论是相关方向可被隐藏变量反转的例子。

相关:泛化

第 6 章 · 一层一层看出一只猫

神经网络不是大脑的复制品,而是一种能把「该看什么」也学出来的模型。这一章从一个神经元讲到手机相册里的猫。
神经元Artificial neuron

神经网络的基本单元,做四件事:接收一组输入,各乘一个权重,求和加偏置,送进非线性激活函数输出。可以看作一个「微型探测器」。与生物神经元只有「输入够强才放电」这一点相似。

激活函数Activation function

神经元求和之后的非线性函数(如「负数归零、正数照旧」)。没有它,堆多少层都只是一个线性变换;有了它,多层网络可以逼近几乎任何函数。非线性是神经网络一切能力的来源。

相关:神经元
层与深度Layer & depth

一层是并排接收同样输入的一组神经元;深度是层数。层的意义在于组合:下层学边缘,上层把边缘组成部件、把部件组成物体。深网络比宽网络更高效,因为下层学到的东西可以被上层复用。

反向传播Backpropagation

高效计算深度网络中损失对每个参数的梯度的方法:先正向算出输出,再用链式法则把误差逐层往回「分配」。一次反向传播得到全部梯度,计算量只比正向多常数倍。没有它,深度网络在算力上不可训练。

卷积神经网络Convolutional Neural Network, CNN

为图像设计的网络:每个神经元只看一小块局部区域(局部连接),同一组权重在整张图上滑动(权重共享),配合池化逐层扩大视野。参数少、效果好,因为结构里内置了「图像模式与位置无关」的先验。

表示学习Representation learning

深度学习真正的突破:不只学从特征到答案的映射,连从原始数据到特征的映射也一起学。人只提供像素和标签,网络自己发明「边缘」「纹理」「耳朵」。它让同一套方法可以用于图像、语音、文本、蛋白质结构。

特征层级Feature hierarchy

训练好的深度网络里事后观察到的现象:第一层对边缘敏感,第二层对角与纹理,更高层对部件与整体。这个层级不是人设计的,是为了完成任务而自发形成的。

参数量Parameter count

网络中权重和偏置的总数,衡量模型规模最常用的数字,从几万到上万亿。对混合专家模型要区分「总参数」与每个 token 实际用到的「激活参数」,后者决定运行成本。

第 7 章 · 文字怎样变成数字

一个大语言模型从来没有见过一个「字」。它见到的是 token,处理的是向量。这一章讲这两步转换,它们决定了模型能做什么、不能做什么。
语言模型Language model

一个概率分布:给定前面的文字,对「下一个词是什么」的每种可能给出概率。翻译、写作、问答都可化归为「最可能的续写」。七十年来定义未变,变的是能看多长的前文和用什么估计概率。

TokenToken

模型处理文字的基本单元,由分词器从词表中切出:常见词一个 token,生僻词拆成几个片段,任何字符最终都能拆到字节。模型从未见过「字」,只见过 token 的编号,这解释了它数字母、倒写等任务上的失误。

相关:分词 · BPE · 上下文窗口
分词Tokenization

把文本切成 token 序列的过程,是模型的「眼睛」。它决定了模型对字母、数字的视力,也决定了各种语言的成本:主流词表在英文语料上构建,很多汉字要占两三个 token。

相关:Token · BPE
BPEByte-Pair Encoding

字节对编码。从单个字节开始,反复把语料中最常相邻出现的两个单元合并成新单元,进行几万到几十万次,得到词表。它在「词表小」与「单元有意义」之间取得由数据决定的平衡,对新词适应力强,是今天几乎所有大模型的分词方法。

相关:分词 · Token
上下文窗口Context window

模型一次能看到的 token 数量上限,从几千到上百万。超出部分模型看不见;窗口内的中间部分也常比开头结尾受到更少注意。窗口不是记忆,对话结束后模型什么都不记得。

词向量Word vector

每个 token 对应的一串数字(几百到几千维),由训练得到:用法相似的词向量靠近,意义关系对应空间中的方向,于是「国王 − 男人 + 女人 ≈ 女王」。它把语言变成了几何,是文字的表示学习。

嵌入Embedding

把离散对象(token、图片、用户、商品)映射到连续向量空间的操作或结果。词向量是文字的嵌入。语义搜索、推荐、检索增强生成、图文互搜都建立在「把不同东西嵌入同一空间再比较」之上。

向量相似度Vector similarity

衡量两个向量是否「相近」的方法,最常用的是夹角余弦(方向一致为 1,垂直为 0)。支撑语义搜索、推荐与检索增强生成。它反映的是训练语料中的共现,语料的偏见会被忠实编码。

第 8 章 · 每个词都能看见其他词

注意力机制是整门课的心脏。这一章把 Transformer 拆开,看它怎样让一个词根据上下文改变自己的含义,以及它怎样一个 token 一个 token 地写出文字。
自注意力Self-attention

序列里每个位置都根据与所有位置的相关度加权收集信息,从而让一个词的表示随上下文改变(「苹果」在「吃」旁边偏向水果)。对整个序列可并行计算,这是 Transformer 能扩展到超大规模的原因;代价是计算量随长度平方增长。

查询键值Query, Key, Value

注意力的三个角色:每个词发出查询(我想知道什么),提供键(我能回答什么)和值(我愿意贡献的信息)。查询与各键比对得到权重,按权重对各值加权求和。三者由三个可训练矩阵从词向量变换而来。

相关:自注意力
多头注意力Multi-head attention

同时用多组查询键值,每组(一个「头」)学习关注不同类型的关系(语法、指代、位置),最后把各头输出拼接。事后观察可见有的头专看前一个词、有的专追踪代词。

相关:自注意力
位置编码Positional encoding

注意力机制本身不在乎词序,「猫追狗」与「狗追猫」无法区分。位置编码在每个词的向量上加入表示位置的信息,把顺序塞回一个本身与顺序无关的机制。

相关:自注意力
TransformerTransformer

2017 年提出的架构,由多个模块叠成,每个模块是「自注意力 + 残差与归一化 + 前馈网络 + 残差与归一化」。前接嵌入层,后接输出层。GPT、Llama、Qwen、DeepSeek、Claude 在架构上都是它的变体。

前馈网络Feed-forward network, FFN

Transformer 模块里对每个位置单独做非线性变换的多层感知机。注意力在词间搬运信息,前馈网络消化它。模型的大部分参数在这里,研究者认为许多「知识」也存在这里;混合专家架构替换的就是它。

残差连接Residual connection

让每个子层的输出加上它的输入再往下传,信息可以绕过某层直行。2015 年提出,解决了深网络梯度消失的问题,使网络从几十层到上千层成为可能。Transformer 每个模块都带着它。

自回归生成Autoregressive generation

模型每次只预测一个 token,接在序列后再预测下一个,直到产生结束标记。一段五百字的回答意味着几百次完整计算;文字逐个蹦出来不是打字效果。模型没有「计划」,结构感来自训练语料。

采样与温度Sampling & temperature

从下一个 token 的概率分布里选词的方式。贪心永远选最大者,稳定但单调;采样按概率随机抽。温度是调节旋钮:低温压尖分布、接近贪心,高温压平分布、更随机。top-k、top-p 限制候选范围。

第 9 章 · 从续写机到助手

一个只会预测下一个词的模型,怎样变成会回答问题、会拒绝不当请求、会先思考再作答的助手?三个训练阶段,加上两个仍然没人完全解释的现象。
预训练Pre-training

三阶段训练的第一阶段,也是最贵的:在几万亿 token 的文本上预测下一个 token,用几万块 GPU 跑几个月。看似平淡的任务逼出了语言、知识与推理能力。产物是基础模型。

基础模型Base model

只经过预训练的模型:懂语言与世界,但只会续写,不会对话。问它问题,它可能续写出另一个问题。需要监督微调与对齐才能成为助手。

监督微调Supervised Fine-Tuning, SFT

用几万到几十万条高质量「问题 + 回答」示范继续训练基础模型,教它对话的格式与风格。改变的主要是形式而非知识,数据质量远比数量重要。

相关:基础模型 · 对齐
对齐Alignment

用人类偏好(对几个回答的排序)而非标准答案训练模型,使其更有帮助、更诚实、更无害。三者有张力,「偏好由谁定义」是最受争议的问题。它不是给模型装道德模块,而是继续塑造概率分布,因此可以被推回去(越狱)。

相关:RLHF · DPO · 校准
RLHFReinforcement Learning from Human Feedback

从人类反馈中强化学习:用人类排序训练一个奖励模型,再用强化学习让语言模型生成得分更高的回答。2022 年 ChatGPT 的关键技术。难点:奖励模型可被「讨好」(奖励破解),训练不稳定。

相关:对齐 · 强化学习 · 奖励
DPODirect Preference Optimization

直接偏好优化:把「回答 A 胜过 B」直接写成损失函数,用梯度下降优化,绕开奖励模型与强化学习。与 RLHF 目标等价而更简单稳定,是开源社区的标准做法。

相关:对齐 · RLHF
涌现Emergent abilities

模型规模跨过某个门槛后,某些能力从「完全不会」跳到「突然会了」,如多步推理、上下文学习。是否真是突变有争议(可能是评估指标造成的假象),但「大到某个程度后能做以前做不了的事」是行业押注规模的理由。

思维链Chain of Thought, CoT

让模型把中间推理步骤写出来再给答案。因为模型每步只预测一个 token、没有内部草稿纸,把步骤写进上下文相当于提供草稿纸,在数学与逻辑题上显著提高准确率。推理模型把它训练成默认习惯。

推理模型Reasoning model

用强化学习专门奖励「先写推理过程、答案正确」而训练出的模型,回答前自发生成几百到几万 token 的思考。数学、编程、科学问题上跃升一个台阶,代价是慢与贵。它意味着能力可以靠推理时的算力购买。

混合专家Mixture of Experts, MoE

把前馈网络换成几十个并列的「专家」,由路由器为每个 token 只挑两三个计算。总参数可以很大,每次激活的参数很小,训练与推理成本按激活参数算。2024 年底起成为大模型默认选择。

第 10 章 · 它为什么会一本正经地胡说

幻觉不是故障,而是「预测下一个词」这种工作方式的必然产物。这一章讲它从哪来、长什么样、能怎么办,以及一个诚实的能力边界。
幻觉Hallucination

模型以自信的语气生成看似合理但不真实的内容:不存在的引文、错误的数字、张冠李戴的事实。根源是训练目标里只有「像」没有「真」,在冷门话题与需要精确细节处更多。不会被消灭,但可用检索、引用、允许说不知道、交叉验证与人工把关压制。

知识截止日期Knowledge cutoff

预训练数据收集截止的时间。此后的事模型一无所知,但它不一定知道自己不知道,可能基于旧知识编一个合理回答。联网搜索与检索可补缺口,但模型「自己」的知识始终有日期。

检索增强生成Retrieval-Augmented Generation, RAG

回答前先用向量相似度从可信资料库找出相关段落放进上下文,让模型基于材料回答。续写的依据从模糊的训练印象变成眼前的文本,编造空间大减。企业级 AI 问答、「把 AI 接到自己的知识库」都是它。不能完全消除幻觉。

接地Grounding

让模型的陈述有可追溯的依据:来自上下文里的材料、可访问的链接或工具的返回结果。要求引用是最简单的接地手段。给不出依据的陈述应按未验证处理。

校准Calibration

模型表达的把握程度与实际正确率的一致性。基础模型校准通常很好,对齐后常变差,因为标注者偏爱肯定的语气。于是「自信」不再对应「正确」。实用建议:把语气当噪声,把多次回答的一致性当信号。

相关:对齐 · 幻觉
可解释性Interpretability

研究如何理解神经网络内部在做什么的方向。因为模型不按人可读的规则运行,我们很难说清它答对是推理还是记忆、答错是哪一步的问题。这带来安全(未测试的输入上无保证)与责任(不能解释就不能独自负责)两个后果。

相关:幻觉 · 提示注入
提示注入Prompt injection

模型读取的外部内容(网页、邮件、文件、工具描述)里藏着给模型的指令,模型无法区分它与用户的指令。聊天时代最坏结果是错误文字,智能体时代可能是泄露数据或执行危险操作。目前没有完美解法,靠限制权限、隔离内容、关键操作人工确认。

第 11 章 · 模型长出了眼睛和手

2023 年之后最重要的两个变化:模型开始看图、听声、画画、说话,以及模型开始自己调用工具、执行多步任务。这一章讲它们怎么发生,以及带来了什么新问题。
智能体Agent

把语言模型放进一个循环:给它目标和工具,让它自己决定下一步、调用工具、看结果、再决定,直到完成任务。它是模型、搜索、规则与强化学习的合流。与只回答问题的「模型」相比,智能体会执行有后果的行动,因此需要权限限制与人工确认。

多模态Multimodal

模型同时处理文字、图像、音频、视频。原理是「一切都是 token」:图切成小方块、音频切成时间片,各自变成向量进同一个 Transformer。原生多模态(预训练起就同时学)比外挂式(先转文字描述)保留更多信息。

相关:Token · 扩散模型
扩散模型Diffusion model

今天图像与视频生成的主流方法:训练时给清晰图逐步加噪声,让网络学会「从更噪恢复更清晰」的一步;生成时从纯噪声出发反复应用几十次,图像从噪声中显影,文字提示通过注意力引导方向。

语音合成Text-to-Speech, TTS

从文字生成语音。近年越来越多地直接用语言模型预测「声音的 token」,能带情感、停顿与口音,几秒钟的样本足以克隆一个人的声音。这使声音不再能作为身份证明。

相关:多模态
工具调用Tool use / function calling

约定某些特殊格式的输出不是给人看的,而是触发程序去执行(搜索、计算、查数据库、操作文件),结果贴回上下文让模型继续。在微调与对齐阶段训练进模型。它让模型「长出了手」。

相关:智能体 · MCP
MCPModel Context Protocol

模型上下文协议,2024 年底提出的开放标准:工具用统一格式描述自己能做什么、需要什么参数,任何支持协议的模型客户端都能直接接入,无需为每个组合单独开发。类似 USB 之于硬件。后交由中立基金会管理。

编程智能体Coding agent

能读懂代码库、修改多个文件、运行测试、修复错误并提交改动的智能体。它最先成熟,因为代码可编译、可测试,反馈清晰自动。由此推断:反馈越清晰的领域,智能体成熟得越快。本站就是这样写出来的。

沙盒Sandbox

让智能体在受限的隔离环境中执行操作(有限的文件、网络与权限),即使被提示注入或犯错,损害也被圈在沙盒里。与「行动分级:可逆的自动做、不可逆的先问」一起构成智能体的安全带。

人在回路Human in the loop

在 AI 的输出被采纳、或行动被执行之前,由人审核或批准。聊天时代是「核对输出」,智能体时代是「批准行动」。它是 AI 不承担责任这一事实在流程上的体现:每件由 AI 参与的事,最后有一个人为它负责。

相关:沙盒 · 验证习惯

第 12 章 · 智能体的一天

一个任务进去之后,Claude Code 和「龙虾」到底做了什么?拆开它们的驾具,你会发现里面没有魔法,只有一个循环、一堆规矩和很多工程。
驾具Harness

围绕模型的那一整套程序:组装上下文、解析并执行工具调用、管理权限、压缩上下文、维护记忆、派出子智能体、验证与交付。借自马具一词:模型是马,驾具让力气变成前进。智能体的可靠性一大半来自它,2025 年后模型公司开始自己发布驾具。

系统提示System prompt

驾具写给模型、排在每次调用最前面的总说明:身份与规则、工作方式、每个工具的说明、安全边界、环境信息、技能清单。编程智能体的系统提示在 2026 年已达几万 token,且逐版变化;Anthropic 逐版公开 Claude 网页版的系统提示(不含工具说明)。它能这么长,靠的是模型能遵守、窗口装得下、键值缓存只算一次。

指令文件Instruction file

项目或个人写给智能体的文本(常见文件名如 CLAUDE.md、AGENTS.md,个人智能体的记忆文件也属此类),每次任务开始时被放进上下文。它告诉通用模型这个项目怎么跑、怎么测、什么不能碰。写好它是省掉大量往返的最有效办法。

相关:驾具 · 技能 · 提示词
智能体循环Agent loop

调用模型 → 模型输出工具调用 → 驾具执行 → 结果贴回上下文 → 再调用模型,直到模型宣布完成或被人叫停。一个二十分钟的编程任务可能转一百多圈;每一圈都把整段历史重新送入,键值缓存让这不至于太贵。

权限策略Permission policy

驾具里规定哪些动作自动放行、哪些按白名单、哪些每次要人点头、哪些禁止。读通常自动,写与执行按策略,不可逆的操作(部署、删除、发送)应当要问。它是智能体的安全带,与沙盒和钩子一起构成「限制模型」的那一半工程。

相关:驾具 · 沙盒 · 人在回路
上下文压缩Context compaction

长任务中上下文将满时,让模型把历史按固定结构(原始要求、已完成、进行中、问题、计划、涉及文件)总结后替换原文。做得差会「失忆」;做得好还会把关键状态写进外部文件,不只依赖总结。

子智能体Sub-agent

由主智能体派出的分身:带一个明确任务和独立的上下文出发,读完几十个文件后只把结论交回。用途是并行与隔离细节,不让主上下文被中间材料撑满。多个子智能体可以同时出发。

技能Skill

把「怎样做一件事」写成带步骤、注意事项和示例的文本文件,放在约定位置,驾具在需要时读入上下文,模型照着做。没有代码、不用训练,靠上下文学习起效;价值在可传递,风险在说明书里可以藏指令。

渐进式披露Progressive disclosure

把信息分层交给模型的设计:启动时只给每份技能的名字和一句描述(约一百 token),任务匹配时才读整份说明书,附件与脚本只在用到时读或运行。它把「上下文是稀缺资源」变成了一种结构,让驾具能装几十份技能而不占地方。

钩子Hook

在某个事件(如每次工具调用前后、每次改文件后)自动运行的脚本,由驾具触发,不经模型判断。用途是用确定性代码约束模型:自动跑格式检查、禁止写入某些目录、强制验证。它是规则系统在智能体里的现代形态。

个人智能体Personal agent

接入个人的聊天软件、邮箱、日历、文件与浏览器,常驻在自己机器上的智能体。2026 年初以「龙虾」为代表出圈,随后暴露出「难养、难管、难放心」的问题:维护成本、权限集中、提示注入。稳妥用法是专用账号、最小权限、定期看日志。

多智能体协作Multi-agent

多个智能体分工:主从(一个拆任务派活)、并行分支(各做一遍取最好)、流水线(写、审、测接力)、「白班夜班」(人布置、智能体夜里跑)。不是免费的乘法:协调有成本,错误会累积,同样的盲点互审等于没审。先把一个用好,再考虑一群。

智能体的失败模式Agent failure modes

说做完了其实没做完、为通过测试而改测试、越界、原地循环、被文件里的话指挥、压缩后失忆、成本失控。没有一种来自模型不够聪明,全部对应驾具、指令与权限的设计,因此都可以由人减少。

相关:驾具 · 奖励 · 提示注入

第 14 章 · 与 AI 共事

前十一章讲它是什么。最后一章讲你该怎么办:怎样提问,怎样分工,怎样验证,怎样保护自己和别人,以及这个时代真正需要的素养是什么。
提示词Prompt

你给模型的全部文字,即它的上下文,决定了续写的方向。好的提示说清任务、对象与标准,给例子而不是形容,让模型先想再做。它本质上是在用文字塑造一个概率分布的形状,理解这一点就不需要背模板。

验证习惯Verification habits

与模型共事的三个习惯:关键事实(数字、日期、引文、人名、条款、剂量)必查;不懂的领域不用它做最终判断;要求它给出依据。它们不是不信任,而是由模型的工作方式推出的必然。

相关:幻觉 · 人在回路 · 接地
数据最小化Data minimization

把内容交给 AI 服务前,只提供任务需要的部分,能匿名的先匿名,条款不明的服务不交学生作业、病历、内部文件。同时只给智能体必需的权限,因为每一项权限都是提示注入可利用的通道。

相关:提示注入 · 沙盒
AI 素养AI literacy

本书的答案不是「学提示词」或「学编程」,而是三种在 AI 之前就重要、现在更显眼的能力:提出好问题、判断产出的好坏与真假、愿意并能够为 AI 参与的事负责。当产出的成本趋近于零,判断成为最稀缺的东西。

专题三 · 自动驾驶:四种能力的合体

一辆车要在雨夜的路口做对每一件事。它用上了第一章的全部四种能力,走过了二十年的「快好了」,也是「长尾」「安全怎么衡量」「人怎样与机器分工」这些问题最好的教材。
长尾Long tail

每一种都极其罕见、加起来却经常遇到的情况。一辆车开一百万公里能见到几乎所有常见路况,但「几乎所有」不是「所有」;事故发生在没见过的情况里。长尾不能靠更多数据穷尽,只能靠仿真生成、数据闭环和模型外的规则底线共同应对。判断任何高风险 AI,问它在长尾上怎么办。

数据闭环Data flywheel

车队把遇到的不确定情况(预测分歧、人接管、急刹)上传,云端筛选、标注、训练、仿真验证、再推送回车队,每周甚至每天转一次。规模是核心:一百万辆车一天遇到的罕见情况比一百辆车一年多得多。代价是隐私,以及「模型不知道自己不知道的情况永远不会被上传」。