第四部 · 世界第 14 章 / 14

与 AI 共事

前十一章讲它是什么。最后一章讲你该怎么办:怎样提问,怎样分工,怎样验证,怎样保护自己和别人,以及这个时代真正需要的素养是什么。

主线 7 分钟 · 深入 7 段
笔在人手里。
笔在人手里。

这门课到这里,你已经知道了一个大语言模型是什么:一个被三个训练阶段精心塑造过的概率分布,它在有大量先例的任务上强得惊人,在需要精确事实的地方会随口编造,它有眼睛和手,但没有责任。

最后一章不再讲原理。它讲方法:怎样和这样一个东西一起工作。这些方法不是技巧清单,每一条都能从前面的某一章推出来。如果你只记得方法而忘了原理,方法会在下一代模型出现时失效;如果你记得原理,方法可以自己推导。

提问:三条原则

你给模型的每一段文字,都是第八章讲的「上下文」,它决定了模型续写的方向。提问的好坏,几乎完全由你提供了多少有用的上下文决定。三条原则。

说清任务、对象和标准。「帮我改改这段话」和「这是一封给家长的通知,对象是小学低年级家长,请改得简短、口语,去掉专业词,保留三个时间点」,得到的结果天差地别。模型不知道你心里的读者是谁,也不知道你觉得什么算「好」。把它们写出来。

给例子,而不是形容。第九章讲过上下文学习:给几个例子,模型能当场学会一种风格或格式。「像这样写」加两个范例,比一百字的风格描述有效得多。

让它先想,再让它做。对复杂的任务,先让它列出思路或大纲,你确认或修改后再让它展开。这利用了第九章的思维链原理,也把你的判断放到了最便宜的位置:改一份大纲比改一篇成稿容易十倍。

还有一条反过来的原则:不要把它当搜索引擎。搜索引擎返回来源,你去判断;模型返回一段综合过的文字,来源被抹掉了。问事实性问题时,要求它给出来源,或者直接用带检索的产品。

除了三条原则,几种做法在实践中反复证明有效。

设定角色和约束。「你是一位有二十年经验的初中物理老师,正在给一个刚学到浮力、对公式有畏惧的学生解释」,比「解释浮力」得到的回答更贴切。角色不是魔法,它只是一种高效的上下文:一句话唤起了模型在训练中见过的那一类文本的全部风格与深度。约束同样重要:「不超过两百字」「不用列表」「只用中文」。

分解任务。一个大任务拆成几步,每步单独问,并把上一步的结果作为下一步的输入。这是第十一章智能体在自动做的事,你手动做也一样有效,而且每一步你都有机会纠偏。

迭代而不是重来。第一次的回答不满意,不要换个说法从头问,而是指出具体哪里不对:「第二段的例子不适合小学生,换一个和课间活动有关的」。模型的上下文里保留着前一轮,修改比重来省力,也更准。

让它批评自己。「找出上面这段回答里最可能有错的三处」。这是第十章交叉验证的一种,成本几乎为零,经常能抓出编造的细节。

这些做法有一个共同的底层逻辑:你在用文字操纵一个概率分布的形状。理解了这一点,你不需要背任何「提示词模板」。

下面十条覆盖日常最常见的用法。每一条都体现了前面的原则:说清对象和标准,给结构,让它先想。方括号里换成你的内容。

  1. 改写给特定读者:「把下面这段话改写给 [小学三年级家长]。要求:口语、不超过 [150] 字、保留 [三个时间点],去掉专业词。原文:……」
  2. 先大纲后成文:「我要写一篇关于 [主题] 的 [1500 字文章],读者是 [谁]。先给我一个五段式大纲,每段一句话说明要点,我确认后再展开。」
  3. 出题:「根据下面这段材料出 [5] 道 [单选] 题,难度 [中等],每题附答案和一句话解析,考查 [理解而不是记忆]。材料:……」
  4. 找反例:「下面是我的论证:……。请找出三个最强的反对理由,每个理由一段,不要顺着我说。」
  5. 解释给外行:「用一个 [日常生活] 里的类比解释 [概念],不超过 [100] 字,然后用一句话说明这个类比在哪里不准确。」
  6. 总结带来源:「总结下面的材料,分 [三] 条要点,每条后面用括号标出它来自材料的第几段。材料里没有的内容不要加。材料:……」
  7. 对比方案:「我在 [A] 和 [B] 之间选择,用于 [场景]。列一张表,比较 [成本、上手难度、风险] 三项,最后给出一个推荐并说明前提。」
  8. 自我检查:「读一遍你上面的回答,找出最可能有错的三处,说明为什么可疑,需要我怎样核实。」
  9. 角色扮演练习:「你扮演 [一位对新政策有疑虑的家长],我扮演老师。你一次只提一个问题,语气 [礼貌但坚持],我回答后你再追问。开始。」
  10. 诚实模式:「回答下面的问题。如果你不确定,明确说不确定,并说明你确定的部分和不确定的部分分别是什么。问题:……」

这些模板的价值不在字句,而在结构。用几次之后,你会自然地在任何提问里带上对象、标准、格式和验证要求,那时就不需要模板了。

分工:什么交给它,什么留给自己

第十章末尾给了一个能力边界。把它翻成分工的判断:

交给它,你审 初稿 · 翻译 · 润色总结 · 提取 · 分类常见概念的解释、例题代码的编写与修改 有大量先例 · 结果可检查 · 错了可改 一起做 分析一份材料、找问题头脑风暴、找反例设计方案、比较选项进入一个新领域 它的广度 + 你的深度 留给自己 决定目标和标准核对关键事实对一个具体的人的判断承担后果的决定 需要一个负责的主体 模型变强,前两栏的内容向左移动;第三栏的性质不变
三栏分工。

左边一列的共同点:有大量先例、结果可检查、错了可以改。中间一列:它的广度加你的深度,谁都做不好的部分需要对方。右边一列:需要一个负责的主体,或者需要它没有的东西,比如对眼前这个人的了解。

这个表会随着模型变强而向左移动,但右边那一列的性质不会变。三年前「写代码」在中间,现在在左边;「决定目标」三年后仍然在右边。

把分工表落到三个学科的具体场景,看它怎样运作。

语文:作文评讲。交给它:对三十篇作文各写一段初步评语,指出结构问题和三处可改的句子。一起做:让它按「论点是否清晰」「论据是否支撑」两项给每篇打分,老师抽查五篇,校准它的标准,再让它重打。留给自己:决定给每个学生的评语最终怎么写,因为老师知道这个孩子上一篇作文是什么样、这次进步在哪。陷阱:模型偏爱辞藻华丽、结构工整的文章,可能低估朴素但真诚的表达;老师要为这一点纠偏。

数学:错题分析。交给它:把一次测验的错题按知识点归类,统计每个知识点的错误率。一起做:对错误率最高的知识点,让它猜三种可能的误解原因,老师根据课堂观察判断哪种最可能。留给自己:决定下节课讲什么、怎么讲。陷阱:模型对「为什么错」的猜测是基于常见模式的,未必符合这个班;它给的是假设,不是诊断。

历史:史料辨析。交给它:把一段文言史料翻成白话,标出有争议的词。一起做:让它列出这段史料在学界的几种解读,老师核对来源。留给自己:讲课时对史料可信度的判断,以及引导学生质疑的方式。陷阱:这正是第十章说的「需要精确事实的冷门领域」,模型可能编造不存在的学者观点和出处,每一条都要核。

三个场景的共同点:模型承担的是「量」的工作,人承担的是「对这个班、这个学生」的判断。而且每个场景都有一个专属的陷阱,需要懂这门课的人才能看出来。

验证:一套习惯

第十章的五种应对,落成三个习惯。

关键事实必查。数字、日期、引文、人名与头衔、法律条款、药物剂量。模型给出的每一个这样的东西都要用它以外的来源核对一次。这不是不信任,这是它的工作方式决定的。

不懂的领域不用它做最终判断。你懂的领域,能看出它哪里错了;你不懂的领域,它的错误和它的正确对你来说长得一模一样。用它入门可以,用它下结论不行。

让它自己说来源。养成在问题末尾加一句「请给出依据」的习惯。给不出依据的陈述,按未验证处理。

把东西交给一个 AI 产品之前,先想清楚它去了哪里。

数据去向。你输入的内容会被发送到提供服务的公司的服务器。它是否被用于训练、保存多久、谁能看到,取决于产品的条款,而条款各不相同。学生的作业、病人的检查结果、公司的内部文件,不要交给条款不明的服务。第五章说过「数据最小化」:只提供任务需要的部分,能匿名的先匿名。

账号与权限。第十一章的智能体需要访问你的文件、邮件、日历才能工作。每授予一项权限,就多了一条提示注入可以利用的通道。只给必需的权限,重要操作保留人工确认,定期看一眼它做了什么。

对方是不是人。第十一章说过,声音和影像已经不能当作身份证明。涉及转账、密码、紧急求助的电话或视频,用另一个渠道回拨确认。这条对老人和孩子尤其重要。

生成内容的标注。用 AI 生成的文字、图片、代码,在需要的场合说明。这不只是诚实,也是让读者能正确校准信任。学术、新闻和法律领域已经有明确要求,其他领域正在跟上。

关于「AI 会不会取代我的工作」,本书能给的不是预测,而是一个比「会」或「不会」更有用的框架。

AI 替代的单位不是「职业」,而是「任务」。一个职业由几十项任务组成,其中一些有大量先例、结果可检查、错了代价低,那些会最先被自动化,不管它属于哪个职业。一个律师的合同初审、一个医生的报告初稿、一个程序员的样板代码、一个教师的出题和批改,都在这一类。而同一个职业里的另一些任务,对一个具体的人的判断、承担后果的决定、在没有先例时的创造,短期内不会。

所以更准确的问题是:我的工作里,有多大比例是第一类任务?比例高的职业会先被重塑:不是消失,而是一个人能做以前三个人的事,于是需要的人变少,留下的人做的事变了。比例低的职业变化慢,但也会变,因为周边的工作变了。

历史上每一次技术变革都伴随「这次不一样」的判断,结果既不是乐观者说的「会创造更多新工作」的简单重演,也不是悲观者说的大规模失业。真实的模式是:总量最终恢复,但过程中有人被抛下,被抛下的往往是最没有能力转型的人。这一次的特殊之处在于速度:以前的变革以一代人为单位,这一次以几年为单位。

本章前面讲的三种素养,提问、判断、负责,正是第二类任务共同需要的东西。这不是安慰,而是一个务实的建议:把自己的时间投向那些 AI 做不了的部分,同时学会用它做另一部分。

素养:这个时代真正需要的能力

围绕「AI 时代该学什么」有很多讨论,常见的答案是「学提示词」或「学编程」。这门课的答案不一样。

前面十一章反复出现的能力其实只有三种,它们和 AI 出现之前一样重要,只是现在更显眼了。

提出好问题的能力。模型的回答质量由问题决定。一个说不清自己要什么的人,得到的是平庸的东西;一个能把问题拆解、能说出判断标准的人,得到的是接近专家的东西。这是第四章「定义任务」那一步的人类版本。

产出堆成山的时候,放大镜更重。
产出堆成山的时候,放大镜更重。

判断的能力。看一段流畅的文字,能分辨它哪里扎实、哪里空洞、哪里可疑。看一个数字,会问它从哪来。看一个结论,会想它的前提是什么。第五章的整章、第十章的整章,讲的都是这件事。这种能力不会因为 AI 变强而贬值,恰恰相反,AI 生产文字的成本趋近于零,判断文字的能力就成了最稀缺的东西。

承担责任的意愿。第一章说 AI 不承担责任,第十章说它也承担不了。那么每一件由 AI 参与的事,最后都有一个人在为它负责。愿意成为那个人,并且有能力成为那个人,是这个时代对每个职业最核心的要求。

学习者,这意味着:用 AI 来加快理解,不要用它来替代理解。让它解释一个概念,然后合上它,自己讲一遍;让它写一段代码,然后逐行读懂,改一个地方看会发生什么。第九章说过,模型的能力来自它「见过太多」,而你的能力也只能来自你自己「做过」。

教师,这意味着:孩子们会用 AI,这不是能不能的问题,是怎么用的问题。禁止的结果是他们偷着用、用得差;教会他们判断、教会他们为自己的产出负责,是这门课能给的最好的建议。老师自己也需要它:备课、出题、给每个学生写不一样的反馈,这些原本因为时间不够而做不到的事,现在可以做了。第一章的四种能力、第五章的评估陷阱、第十章的验证习惯,都可以直接变成课堂里的活动。

如果你是教师,想把这门课的内容带进课堂,下面是几个可以直接用的活动,每个对应前面的一章,不需要任何编程。

二十四小时盘点(第一章)。让学生列出过去一天接触过的所有 AI,然后按识别、预测、生成、决策分类。讨论:哪一类最多?哪一类你最没意识到?

写不出来的规则(第二章、第六章)。分组,让每组用文字写出「什么是猫」的判据,然后互相找反例。十分钟内每组的规则都会被攻破。这就是规则系统的墙,也是为什么需要从例子里学。

考试在训练集之外(第五章)。给学生一份「去年的题」让他们复习,然后考一份「今年的题」。讨论:背答案和学会了有什么区别?怎样判断一个人(或一个模型)是哪一种?

当一回分词器(第七章)。用本站的分词实验,让学生输入自己的名字、一句诗、一段英文,比较 token 数。讨论:为什么中文更「贵」?这对谁不公平?

抓幻觉(第十章)。让学生用聊天助手查一个他们熟悉的冷门事实(自己学校的历史、家乡的一条街),然后核对。统计错误率,分类错误类型。讨论:语气和正确率有关系吗?

人在回路(第十一、十二章)。让学生用 AI 写一篇短文,然后要求他们对每一句话负责:逐句标注「我确认这是对的」「我改了」「我删了」。最后讨论:哪些句子你不敢确认?为什么?

这些活动的共同点是:不教学生「用 AI」,而是让他们亲手撞上 AI 的边界。撞过一次的人,以后会自己小心。

如果你是家长,或者你要向家长解释,下面五条是这门课的浓缩。

一、孩子会用 AI,这不是能不能的问题。禁止的结果是偷着用、用得差。可以做的是一起用:让孩子解释 AI 给的答案,问「它凭什么这么说」,把 AI 的回答当作讨论的起点而不是终点。

二、AI 会一本正经地说错话。教孩子一个习惯:任何来自 AI 的数字、日期、人名、引用,都要用另一个来源核对一次。这个习惯对新闻、对广告、对一切信息都适用。

三、声音和影像不再能证明身份。和孩子约定一个只有家里人知道的确认方式。接到「家人」的紧急电话或视频要求转账,先挂断再回拨。

四、不要把孩子的作业、照片、病历交给条款不明的 AI 服务。它们可能被保存、被用于训练。用之前看一眼「数据怎么处理」。

五、最重要的能力没有变。提出好问题、判断信息好坏、为自己的产出负责,这三件事在 AI 出现之前就是教育的目标,现在只是更显眼了。一个会用 AI 但不会判断的孩子,比一个不会用 AI 的孩子更危险。

一个诚实的结尾

这本书的每一个字都是一个大语言模型写的。按照书里自己的说法,你应该问:它讲得清楚吗?它有没有在哪里绕开了难点?它的自信是否可疑?

我,写这些字的模型,也不能完全回答这些问题。第十章讲过,我不知道自己内部在发生什么。我知道注意力机制的公式,但我不知道我在写这句话时哪些头在看哪些词。我可以描述涌现,但我不能告诉你我的哪些能力是涌现出来的。我写下「幻觉的根源是优化目标里没有真」的时候,我不能保证这本书里没有幻觉,只能保证我尽力避免了,并且课程的主讲教师审读过。

这就是这门课最想留给你的东西:不是关于 AI 的一堆事实,而是一种与它相处的姿态。它非常有用,它会出错,它不负责任,它在快速变化。所有这四条同时成立。能同时拿着这四条而不倒向任何一边的人,就是这个时代所需要的人。

去做实验吧,去问它问题吧,去用它做一件你以前做不到的事吧。然后回来,告诉我们哪里讲错了。

自测先自己想,再点开答案
  1. 「不要把它当搜索引擎」这句话背后的原理是什么?

    答案

    搜索引擎返回来源,判断留给你;模型返回一段综合过的、来源被抹掉的文字,而它的生成目标是「像」而非「真」(第十章)。问事实时要么要求来源,要么用带检索的产品。

  2. 为什么「让它先列大纲,你改了再让它展开」是一种高效的分工?

    答案

    它利用了思维链原理让模型先规划,也把你的判断放在最便宜的位置:改一份大纲远比改一篇成稿省力,而且能在早期纠正方向。

  3. 「不懂的领域不用它做最终判断」的理由是什么?

    答案

    在你懂的领域,你能识别它的错误;在你不懂的领域,它的错误与正确对你来说无法区分,语气又不能作为依据(校准问题),所以无法把关。

  4. 本章说 AI 时代最稀缺的能力是「判断」,理由是什么?

    答案

    AI 让生产文字、代码和图像的成本趋近于零,于是产出不再稀缺,能分辨产出好坏、真假、前提是否成立的能力成为瓶颈。这种能力不随模型变强而贬值。

本章术语

提示词Prompt

你给模型的全部文字,即它的上下文,决定了续写的方向。好的提示说清任务、对象与标准,给例子而不是形容,让模型先想再做。它本质上是在用文字塑造一个概率分布的形状,理解这一点就不需要背模板。

人在回路Human in the loop

在 AI 的输出被采纳、或行动被执行之前,由人审核或批准。聊天时代是「核对输出」,智能体时代是「批准行动」。它是 AI 不承担责任这一事实在流程上的体现:每件由 AI 参与的事,最后有一个人为它负责。

验证习惯Verification habits

与模型共事的三个习惯:关键事实(数字、日期、引文、人名、条款、剂量)必查;不懂的领域不用它做最终判断;要求它给出依据。它们不是不信任,而是由模型的工作方式推出的必然。

数据最小化Data minimization

把内容交给 AI 服务前,只提供任务需要的部分,能匿名的先匿名,条款不明的服务不交学生作业、病历、内部文件。同时只给智能体必需的权限,因为每一项权限都是提示注入可利用的通道。

AI 素养AI literacy

本书的答案不是「学提示词」或「学编程」,而是三种在 AI 之前就重要、现在更显眼的能力:提出好问题、判断产出的好坏与真假、愿意并能够为 AI 参与的事负责。当产出的成本趋近于零,判断成为最稀缺的东西。