第四部 · 世界第 13 章 / 14

AI 做科学:从 AlphaFold 说起

一个困扰生物学五十年的问题被一个神经网络在两年内解决了大半,然后同样的事在气象、材料、数学、药物上接连发生。这篇写给不做 AI 的科学与工程研究者:它在你的领域能做什么,怎样开始,哪里要小心。

主线 19 分钟 · 深入 2 段
一条链在空中折成一个结。
一条链在空中折成一个结。

2020 年 11 月 30 日,两年一度的蛋白质结构预测竞赛公布结果。一个来自 DeepMind 的系统,在大多数题目上给出了与实验测定几乎一致的答案。竞赛的发起人说:「在某种意义上,问题解决了。」这个问题,生物学家已经攻了五十年。

四年后,它的两位主要作者获得诺贝尔化学奖。同一个十年里,AI 模型开始比超级计算机更准地预报天气,提出了几十万种从未合成过的晶体,在国际数学奥林匹克上拿到金牌水平的分数,把一个候选药物送进了临床试验。

这一章写给一个特定的读者:你在学校里学的是化学、物理、生物、材料、土木、机械、医学,不是计算机;你听说 AI 正在改变你的领域,想知道它到底改变了什么、怎么改变的,以及你该从哪里开始。它比别的章长。前半部分把 AlphaFold 讲透,因为它是所有故事的原型;后半部分走过其他领域;最后是共同模式、边界,和一份路线图。

一、原型:AlphaFold

问题

蛋白质是生命的机器:消化、免疫、肌肉收缩、光合作用,都由蛋白质完成。每种蛋白质是一条由二十种氨基酸按特定顺序连成的链,几十到几千个单元。链在细胞里自发折叠成一个精确的三维形状,形状决定功能:一个酶的口袋刚好容纳它要切割的分子,一个抗体的表面刚好贴合它要识别的病毒。

链的顺序(序列)容易测,几十年前就能大规模测定;形状(结构)极难测,需要把蛋白质结晶后用 X 射线衍射,或者用冷冻电镜,一个结构常常要一个博士生做几年,有些几十年也做不出来。到 2020 年,人类知道两亿条序列,只测出了十几万个结构。

「从序列预测结构」这个问题 1972 年就被明确提出:既然折叠是自发的,序列里就应该包含形状的全部信息。但一条链可能的形状数量是天文数字,而物理模拟每一个原子的相互作用,算力上遥不可及。五十年里,这个问题有过很多部分进展,没有解决。

为什么是注意力

AlphaFold 的第二代(2020 年那个)核心是一个 Transformer 的变体。这不是巧合。

第八章讲过,注意力让序列里每个位置都能看见其他位置。蛋白质折叠正是这样一个问题:链上相距很远的两个氨基酸,折叠后可能紧挨着,它们之间的关系决定形状。语言里「苹果」要看「吃」来确定含义,蛋白质里第 30 个氨基酸要看第 200 个来确定位置。同一个机制,换了一种序列。

AlphaFold 还用了一个生物学特有的线索:进化。同一种蛋白质在不同物种里的序列略有差异,但形状相同。如果两个位置在进化中总是一起变化(一个变了另一个也变),它们很可能在空间上接触。系统把几百条相关物种的序列排在一起,让注意力在「序列内」和「序列间」两个方向上工作,从进化的痕迹里读出接触关系。

网络的另一半直接在三维空间里工作:它输出每个原子的坐标,并反复修正,像雕塑一样一轮轮把形状调准。整个系统从序列到坐标端到端训练,训练数据就是那十几万个已知结构。第六章的表示学习在这里的形式是:网络自己学出了「什么样的序列片段倾向于折成螺旋、什么样的折成片层」,没有人告诉它化学规则。

AlphaFold 有一个常被忽略但极其重要的设计:它对每个氨基酸的位置输出一个置信度分数。

这个分数经过校准(第十章讲过这个词):分数高的区域,实验验证后确实准确;分数低的区域,往往是蛋白质里本来就没有固定形状的部分,或者是网络确实拿不准的地方。生物学家于是可以只信任高置信度的部分,把低置信度的部分当作「待实验」。

这与第十章讲的大语言模型形成了鲜明对比:语言模型在编造时和在陈述事实时语气一样自信,而 AlphaFold 会告诉你它哪里不确定。一个科学工具能被信任,不是因为它总是对,而是因为它知道并说出自己何时可能错。这是所有高风险 AI 应该学习的设计,也是你评价任何「AI 做科学」的工具时该问的第一个问题:它给不给置信度?置信度校准过吗?

它改变了什么

2021 年,DeepMind 与欧洲生物信息研究所合作,用 AlphaFold 预测了人类的全部两万种蛋白质的结构,随后扩展到几乎所有已知序列,两亿多个结构,全部免费公开。一个原本要一个博士生做几年的事,变成了在数据库里搜一下。

它改变的不只是速度。以前,研究者选择研究哪个蛋白质,部分取决于「能不能测出结构」;现在,任何蛋白质的大致形状都是已知的起点。药物设计、酶的改造、疾病机制的研究,都从「先想办法得到结构」变成了「从结构出发」。2024 年的第三代系统进一步预测蛋白质与其他分子(DNA、RNA、小分子药物、离子)的复合体,把这条路延伸到了药物研发的核心;同年它的代码对学术界开放,开源社区随后复现了同类模型。

2024 年 10 月,诺贝尔化学奖的一半授予 AlphaFold 的两位主要作者,另一半授予用计算方法设计全新蛋白质的大卫·贝克。第一章的深入段落提过这件事:当一个 AI 系统能拿化学奖,它就不再是「计算机的事」。

它没有解决什么

诚实地列出边界,比赞美更有用。

它预测的是静态形状。蛋白质在细胞里是动的,很多功能来自形状的变化。AlphaFold 给出的是一个「代表性」的形状,不是运动过程。

它依赖进化线索。对于没有近亲序列的蛋白质(人工设计的、或者极罕见的),它的准确率明显下降,因为它读不到进化的痕迹。

它不解释为什么。它给出形状,不给出折叠的物理过程。五十年的科学问题是「折叠是怎样发生的」,AlphaFold 回答的是「折叠的结果是什么」。这是第十章讲的黑箱在科学里的形态:一个有用的预测器,不等于一个理论。

它不做实验。预测再准也是预测,重要的结构仍然需要实验验证,尤其是那些置信度低的区域。它改变了实验的起点,没有取代实验。

二、从预测到设计:造出自然界没有的蛋白质

AlphaFold 回答「这条链会折成什么」,反过来的问题更有野心:「我想要这个形状(比如一个刚好能抓住某个病毒表面的口袋),该用什么序列?」这叫蛋白质设计,贝克的实验室做了二十年。

2023 年,扩散模型(第十一章讲的画图的那种)被用到了这里:从一团随机的原子坐标出发,逐步「去噪」成一个稳定的蛋白质骨架,再为骨架配上序列。设计的蛋白质在实验室里合成出来,相当比例真的折成了设计的形状并具有设计的功能:结合某个靶点的抗体、切割某种塑料的酶、能在体内组装成纳米笼的部件。以前设计一个可用的蛋白质要几年,现在几周。

这是「生成」这种能力进入科学的方式。第一章说生成是造出原本不存在的东西;在这里,不存在的东西是一个分子,而它是否真的有用,由实验室说了算。

三、材料:几十万种从未存在过的晶体

材料科学有和蛋白质类似的结构:已知几十万种晶体的结构和性质(一个公开数据库积累了二十年),目标是找到新的、稳定的、有某种性质(导电、储能、催化)的材料。

2023 年底,DeepMind 发布了一个用图神经网络(把晶体表示为原子的图,让信息在原子之间传递,第八章注意力的近亲)训练的系统,预测了两百二十万种新晶体,其中约三十八万种被判断为热力学稳定,相当于把人类已知的稳定晶体数量扩大了近十倍。同时期,伯克利的一个团队让一个自动化实验室(机器人臂、炉子、X 射线仪器,由一个规划算法调度)在十七天里合成并验证了几十种其中的材料。

自动实验室:算法提出,机器人合成,仪器验证,下一轮。
自动实验室:算法提出,机器人合成,仪器验证,下一轮。

这个故事的后半段同样重要:随后有材料学家指出,那几十万种「新」材料里相当一部分只是已知材料的微小变体,真正有实用价值的很少,而且「热力学稳定」不等于「能合成出来」。这不是失败,是科学的正常流程,但它提醒了一件事:AI 生成候选的速度远超实验验证的速度,瓶颈从「想到」变成了「验证」。自动实验室正是为了解决这个瓶颈,它是 AI 做科学里「数据闭环」(专题三《自动驾驶》讲过这个词)的实验室版本。

四、天气:一分钟对几小时

天气预报可能是 AI 走得最顺的一个科学领域,原因值得细看。

数值天气预报(1950 年代起) 把大气切成几亿个格子,按物理方程逐步推演超级计算机 · 一次十天预报几小时 · 几十年的方程与调参解释力强,物理一致,但极限受分辨率与算力约束 AI 预报(2022 年起) 用四十年的再分析数据训练:给定此刻,预测六小时后一块芯片 · 一次十天预报一分钟 · 多数指标追平或超过不解方程,从历史里学;极端事件与物理一致性是短板 为什么气象是 AI 最顺的一个领域 · 数据:全球气象机构几十年的「再分析」数据集,格式统一、覆盖全球、免费 · 目标:明确到一个数字(明天几点、哪里、多少度、多少雨) · 检验:每一天都在给出新的标准答案,预报和现实的差距立刻可见 2023 年起几个团队(含中国的团队)相继发布;2025 年起主要气象机构把 AI 模型纳入业务预报,与数值模型并行、互相校验。
数值预报与 AI 预报:不解方程,从四十年的历史里学。

传统的数值天气预报把大气切成几亿个格子,用物理方程逐步推演,需要超级计算机跑几个小时。它是二十世纪最伟大的工程成就之一,几十年里预报能力每十年延长一天。

2022 到 2023 年,几个团队相继发布了 AI 模型:不解方程,而是用全球气象机构几十年的「再分析」数据(把观测和模型融合成的全球格点历史)训练一个网络,给定此刻的大气状态,预测六小时后的,再迭代下去。华为的团队、DeepMind、英伟达、上海的团队都发布了各自的版本,在十天预报的大多数指标上追平或超过了最好的数值模型,而计算只需要一块芯片跑一分钟。2024 年,生成式的版本进一步给出概率预报(几十种可能的未来),对台风路径这类问题尤其有用。2025 年起,主要气象机构开始把 AI 模型纳入业务预报,与数值模型并行运行、互相校验。

一张网罩住地球:几亿个格点,四十年的历史。
一张网罩住地球:几亿个格点,四十年的历史。

为什么气象这么顺?第一,数据:几十年、全球、格式统一、免费。第二,目标:明确到一个数字。第三,检验:每一天现实都在给出新的标准答案。这三条正是下一节要讲的共同模式。它的短板同样典型:AI 模型对训练数据里罕见的极端事件(百年一遇的暴雨)不如物理模型可靠,有时会给出物理上不自洽的场(比如能量不守恒)。所以业务上是两者并行,而不是替代。

五、数学:当答案可以被机器检验

数学看起来离「数据」最远,却在 2024 年成为 AI 最引人注目的舞台。

2024 年 1 月,一个系统在国际数学奥林匹克的几何题上达到金牌选手的水平,方法是让语言模型提出「辅助线」(第三章的启发式),让一个符号引擎做严格推演。同年 7 月,另一个系统在整套奥赛题上拿到银牌分数,它的证明用形式化语言写出,由一个证明检验器逐行核验,不可能有幻觉。2025 年,通用的推理模型(第九章讲的那种,不做专门的数学训练)也达到了金牌水平。

一条辅助线:提出的是模型,检验的是逻辑。
一条辅助线:提出的是模型,检验的是逻辑。

数学之所以适合,是因为它有最完美的「第三角」:一个形式化的证明要么通过检验器,要么不通过,没有中间状态,没有幻觉的空间。模型可以尽情提出,检验器负责否决,第三章的搜索加第九章的强化学习在这里有了最干净的奖励信号。这也是数学家真正开始用它的方式:不是让它证明大定理,而是让它把一个想法形式化、检查一个引理、在文献里找一个相关结果。几位知名数学家公开描述了这种协作,它更像第十四章的「一起做」而不是「交给它」。

边界同样清楚:奥赛题是有标准答案、短证明的题;研究级的数学问题需要新概念,而「提出值得证明的定理」到 2026 年仍然是人的事。

六、药物与医学:最慢的闭环

药物研发是 AI 被寄予最大期望、也最难兑现的领域,原因是它的闭环最慢:一个候选分子从设计到证明对人有效,要十年和十亿美元。

AI 在这条链上的位置越来越多:找靶点(从基因和文献里找出与疾病相关的蛋白质),设计分子(生成能结合靶点的候选,AlphaFold 的第三代直接预测分子与蛋白质怎样结合),预测性质(毒性、代谢、能否口服),优化临床试验的设计。2023 年,一个由 AI 找到靶点、AI 设计分子的候选药物进入了二期临床,是第一个「端到端 AI」的药物走到这一步。到 2026 年,几十个 AI 参与设计的分子在临床试验中,但还没有一个走完全程上市。

这里的教训是第五章的:临床试验就是「测试集」,而它的结果要等很多年。在结果出来之前,「AI 发现了新药」都是「AI 提出了候选」。医学影像是另一条线,闭环快得多:识别视网膜病变、乳腺 X 光片上的钙化点、病理切片里的肿瘤,深度学习在多项任务上达到或超过专科医生,一些系统已经进入常规使用。但第五章的公平性问题在这里最尖锐:在一家医院的数据上训练的模型,换一家医院、换一种设备,准确率可能明显下降。

七、物理与工程

核聚变。2022 年,DeepMind 与瑞士的一个实验装置合作,用第三章的强化学习控制托卡马克里的等离子体:几十个磁线圈的电流每秒调整上万次,把上亿度的等离子体维持在设计的形状里。控制器在仿真里训练,然后在真实装置上工作。这是「学习出来的控制器」在极端物理环境里的第一次。

芯片设计。把芯片上几百万个元件的布局当作一盘棋,用强化学习在几小时内完成人类工程师几周的工作。它被用在了真实的芯片上,也引发了关于评估方法的争议,这个争议本身是科学界处理「AI 声称」的一次演练。

流体与结构。用神经网络替代昂贵的数值模拟(流体力学、有限元),几秒钟给出近似解,用于设计早期的快速迭代,精确解仍由传统模拟给出。这是工程领域最普遍的用法:AI 做「代理模型」,不替代物理,而是替代物理模拟的等待。

天文与粒子物理。望远镜和对撞机产生的数据量早已超过人能看的范围,深度学习负责分类星系、筛选事件、发现异常。这里 AI 的角色最朴素:第一章的识别能力,用在人看不过来的地方。

八、基因与生命

基因组是一种文本:四个字母写成的三十亿长的序列。第七到九章的语言模型技术几乎可以原样搬过来。2023 年,一个系统对人类基因组中所有可能的单点突变(七千多万种)给出了「可能致病」或「可能良性」的判断,把此前只有百分之几被分类的突变一次性覆盖,成为临床遗传诊断的参考之一。2024 年之后,「基因组语言模型」开始在整段 DNA 上预训练,并生成新的序列;「单细胞基础模型」在几千万个细胞的表达数据上预训练,用于识别细胞类型和预测扰动的效果。

这些模型的价值和边界与 AlphaFold 一样:它们是强大的预测器,不是机制的解释;它们在训练数据覆盖的物种和条件下可靠,在之外不可靠。

九、共同模式与共同边界

走过八个领域,可以把它们叠在一起看。

大量结构化的数据 明确的预测目标 能检验答案的办法 三个都有,深度学习就能在里面找到人没找到的规律 蛋白质:十几万个结构 · 预测结构 · 竞赛盲测 气象:四十年再分析 · 预报十天 · 明天的观测 材料:几十万晶体 · 稳定性 · 实验合成 数学:形式化文献 · 定理成立否 · 证明检验器 缺第三角最危险:预测器可以「看起来很准」而无人能证伪。缺第一角就回到第四章的表格模型,同样有用,只是不「深」。 共同的边界:预测而非解释;训练分布之外不可信;实验闭环不可省。
三角形:数据、目标、检验。缺哪一角,AI 做科学就会变成什么样。

共同模式是一个三角形。大量结构化的数据(结构库、再分析、晶体库、基因组),一个明确的预测目标(结构、明天的温度、稳定性、是否致病),以及能检验答案的办法(竞赛盲测、实验合成、明天的观测、证明检验器)。三角俱全的领域(蛋白质、气象、数学)进展最快;缺第三角的领域(药物)进展最慢,因为预测可以看起来很准而无人能证伪;缺第一角的领域回到第四章的表格模型,同样有用,只是不「深」。

如果你想判断 AI 在自己领域能走多远,先画这个三角:我的领域有多少可用的数据?目标能不能写成一个数?答案能不能被检验,多快?

共同边界有三条。预测而非解释:所有这些系统都回答「是什么」,不回答「为什么」,而科学的目标里有一半是「为什么」。训练分布之外不可信:极端天气、无进化线索的蛋白质、换一家医院的影像,都是第五章的分布偏移。实验闭环不可省:材料的故事最清楚,AI 提出候选的速度远超验证的速度,瓶颈在验证。

第十二章讲的智能体进入科学之后,出现了一类被称为「AI 科学家」的系统:让模型自己提出假设、设计实验(在计算上或通过自动实验室)、分析结果、写论文。2025 年,一篇完全由这类系统生成的论文通过了一个学术会议研讨会的同行评审(评审者事先同意参与实验);同年,一个多智能体系统提出了一种已上市药物的新用途假设并被实验初步支持;一家大公司的「AI 联合科学家」在几天内独立重现了一个实验室花了十年才发现的细菌基因转移机制的假设。

这些结果真实,也需要按第五章的方式读:它们是精心挑选的成功案例,系统在多少次尝试里成功了一次通常不公布;「重现已知发现」不等于「做出未知发现」;论文通过评审不等于论文重要。但方向是清楚的:科学工作里那些「有大量先例、可以被检验」的部分,文献综述、常规分析、假设的初筛、代码,正在被智能体接手,第十四章的分工表在科学里同样成立。留给人的是提出值得问的问题、设计能证伪的实验、判断一个结果是否重要。这三件事,恰好是科学训练的核心。

十、给不做 AI 的研究者:从哪里开始

最后是实用建议,按投入从小到大。

先用现成的。AlphaFold 数据库、开放权重的天气模型、公开的材料预测、基因突变的分类,这些是免费的、有文档的、经过同行检验的工具。用它们做你研究的起点,不需要训练任何东西。第一步是知道自己领域有哪些这样的工具。

你的数据加标准方法。你实验室积累的几千条测量数据,配上第四章的梯度提升树或一个小网络,常常已经能发现有用的规律。这一步的陷阱全在第五章:划分数据要按时间或按批次,防止泄漏,报告在没见过的数据上的表现,按子集拆开看。大多数「AI 在某领域的应用」论文的错误出在这里,而不是模型。

让编程智能体做数据分析。第十二章讲的编程智能体,对科研数据处理特别有用:读文件、清洗、画图、跑统计、写脚本,都是「有大量先例、结果可检查」的任务。你不需要会写代码,需要会读结果、会核对。这是对非计算机专业研究者影响最直接的一件事。

找一个懂两边的人。领域知识决定问什么、数据里有什么陷阱、结果是否合理;AI 知识决定用什么方法、怎样避免第五章的坑。最好的工作几乎都来自两边都在的合作。

发表时说清楚。报告基线(简单方法能做到多少),报告在分布之外的表现,公开数据和代码,给出置信度。AI 做科学最大的风险不是它做不到,而是它「看起来做到了」。

带走一句话

AI 做科学的共同模式是数据、目标、检验的三角;共同边界是预测不是解释、分布之外不可信、实验不可省。它把「先想办法得到答案」变成了「从答案出发」,而提出值得问的问题、设计能证伪的实验、判断结果是否重要,仍然是科学家的工作。

自测先自己想,再点开答案
  1. 语言模型和蛋白质结构预测看起来毫不相关,AlphaFold 为什么能用注意力机制?

    答案

    两者都是「序列里相距很远的元素之间有决定性的关系」:词义要看上下文,氨基酸的位置要看链上远处的伙伴。注意力正是让序列里每个位置看见其他位置的机制。

  2. 为什么气象是 AI 走得最顺的领域,而药物最慢?

    答案

    气象三角俱全:几十年的全球数据、明确的目标、每天都有新的标准答案。药物缺第三角:验证要十年和十亿美元,预测可以看起来很准而长期无法证伪。

  3. 「AI 发现了几十万种新材料」这句话该怎样读?

    答案

    它提出了几十万种候选,其中相当部分是已知材料的微小变体,热力学稳定不等于能合成。瓶颈从「想到」变成了「验证」,所以自动实验室才重要。

  4. 数学为什么适合 AI,又为什么研究级数学仍然是人的事?

    答案

    形式化证明有完美的检验器,模型尽情提出、检验器负责否决,没有幻觉的空间。但奥赛题有标准答案、证明短;研究级问题需要新概念,「提出值得证明的定理」到 2026 年仍是人的事。

  5. 一位化学老师想在自己的研究里用 AI,本篇建议的第一步是什么?最常见的错误在哪一章?

    答案

    先用现成的工具(AlphaFold 数据库、公开的预测模型)做研究的起点;其次用自己的数据加标准方法。最常见的错误在第五章:数据划分、泄漏、分布之外的表现。

本章术语

自注意力Self-attention

序列里每个位置都根据与所有位置的相关度加权收集信息,从而让一个词的表示随上下文改变(「苹果」在「吃」旁边偏向水果)。对整个序列可并行计算,这是 Transformer 能扩展到超大规模的原因;代价是计算量随长度平方增长。

TransformerTransformer

2017 年提出的架构,由多个模块叠成,每个模块是「自注意力 + 残差与归一化 + 前馈网络 + 残差与归一化」。前接嵌入层,后接输出层。GPT、Llama、Qwen、DeepSeek、Claude 在架构上都是它的变体。

表示学习Representation learning

深度学习真正的突破:不只学从特征到答案的映射,连从原始数据到特征的映射也一起学。人只提供像素和标签,网络自己发明「边缘」「纹理」「耳朵」。它让同一套方法可以用于图像、语音、文本、蛋白质结构。

校准Calibration

模型表达的把握程度与实际正确率的一致性。基础模型校准通常很好,对齐后常变差,因为标注者偏爱肯定的语气。于是「自信」不再对应「正确」。实用建议:把语气当噪声,把多次回答的一致性当信号。

分布偏移Distribution shift

部署后的数据与训练数据不再来自同一个「世界」:疫情改变了出行,新教材改变了学情。所有模型都默认「未来像过去」,而这没有保证。因此部署不是终点,监控才是。

智能体Agent

把语言模型放进一个循环:给它目标和工具,让它自己决定下一步、调用工具、看结果、再决定,直到完成任务。它是模型、搜索、规则与强化学习的合流。与只回答问题的「模型」相比,智能体会执行有后果的行动,因此需要权限限制与人工确认。