第五部 · 拓展专题专题六 / 共 6 篇

AI 与开源

深度学习的每一次浪潮都站在开源的肩上,而 2025 年之后,最好用的开放模型多来自中国。这一篇讲开源在 AI 里意味着什么、不意味着什么,为什么公司愿意开源,以及这本书自己为什么开源。

主线 12 分钟
一张长桌,谁都可以拿走一块,也可以放上自己的。
一张长桌,谁都可以拿走一块,也可以放上自己的。

2025 年 1 月 20 日,一家杭州公司发布了一个推理模型,能力接近当时最强的闭源模型,权重完全开放,许可证允许任何人商用,技术报告把训练方法写得足够清楚,几周内世界各地的团队复现出了它的核心结果。一周后,全球最大的芯片公司市值单日蒸发几千亿美元。

这件事被叫作 AI 的「斯普特尼克时刻」,但它更是一个开源时刻:它证明了前沿能力可以被公开、被复现、被建立在上面。这篇专题讲开源与 AI 的关系。它比看起来复杂:「开源模型」这个词常常名不副实,公司开源的动机并不都是理想主义,而开源也不等于人人都能训练。最后会讲到这本书自己:它的代码、文字和图都是开放的,以及为什么。

一、三层,加一层

「开源」在软件里的含义清楚:代码公开,可以读、改、再分发。搬到 AI 上,一个模型有三样东西可以开或不开。

代码框架、训练脚本、推理引擎 · 深度学习框架从第一天就开源· 没有它就没有 2012 之后的浪潮· 许可证成熟:MIT、Apache-2.0开放程度:最高 数据训练集、评测集、标注 · 公开数据集推动了每一次突破· 前沿模型的配方是核心机密· 版权与隐私让它最难开放开放程度:最低 权重训练完的几千亿个参数 · 能运行、能微调、能蒸馏· 不能复现:没有数据与过程· 许可证五花八门,要看清开放程度:2024 起大幅提高 「开源模型」多数只开放了右边一层,准确的说法是「开放权重」;三层都开放、能从头复现的模型很少。 看一个模型「开不开」,问三个问题:权重能下载吗?许可证允许商用和修改吗?数据和训练代码公开了吗? 还有第四层:算力。三层全开,训练前沿模型仍需几万块 GPU。开源降低了使用的门槛,没有降低训练的门槛。
代码、数据、权重三层;第四层算力,开源降低不了。

代码:训练脚本、推理引擎、框架。这一层的开放程度最高,而且历史最久。深度学习的每一个主流框架,从 2010 年前后的学术工具到 2015 年后大公司发布的框架,从第一天起就是开源的。没有它们,2012 年之后的浪潮不可能发生:一个博士生可以在一周内复现最新论文,是因为代码就在那里。

数据:训练集、评测集、标注。公开数据集推动了每一次突破,第二章的 ImageNet 是最著名的例子;网页抓取的公开语料让任何团队都能起步。但前沿模型的完整数据配方是核心机密,而且版权与隐私让训练数据成为最难开放的一层。「我们用了哪些数据」是今天大多数「开源模型」不回答的问题。

权重:训练完的那几千亿个参数。开放权重意味着你可以下载、运行、微调、蒸馏,在自己的服务器上用它,而不必把数据发给任何公司。2024 年之后,这一层的开放程度大幅提高。但权重不等于可复现:没有数据和训练过程,你只能使用它,不能重新造出它。

算力是第四层,也是开源改变不了的一层。三层全开,训练一个前沿模型仍然需要几万块 GPU、几个月、几亿元。开源大幅降低了使用微调的门槛(专题五讲过一块 GPU 能做什么),没有降低从头训练的门槛。这是理解 AI 开源格局的关键:它让能力扩散,但训练能力仍然集中。

二、「开放权重」不是「开源」

因为上面的分层,「开源模型」这个词常常被滥用。一个只开放了权重、许可证限制商用、不公开数据的模型,在传统软件的意义上不算开源。开源促进会在 2024 年发布了「开源 AI」的定义,要求代码、权重和足够详细的数据信息都开放,能让人复现。按这个标准,多数「开源模型」应该叫「开放权重模型」,只有少数完全符合。

许可证是这一层的细节,值得看清。宽松的许可证(Apache-2.0、MIT)允许任何用途,包括商用和修改,只要求保留版权声明;2025 年之后中国主要团队的开放模型多用它们。一些公司用自定义许可证:允许使用,但对月活用户超过某个数字的企业另有条款,或者禁止用于训练竞争模型。还有「开源」但禁止商用的。用之前读一遍许可证,尤其是打算把它放进产品的时候。

一个实用的判断顺序:权重能下载吗?许可证允许我打算的用途吗?训练代码和数据说明公开了吗?三个都是,才是完整意义的开源;只有第一个,是「可用」。

三、公司为什么开源

花几亿训练的东西送出去,动机值得认真看,因为它决定了开源会不会持续。

生态与标准。一个被广泛使用的开放模型,会带来围绕它的工具、微调版本、教程和人才。使用者越多,它越可能成为「默认」,而默认的制定者获得话语权。深度学习框架的历史就是这样:开源框架赢了,闭源的输了。

追赶者的策略。落后的一方开源,是把自己的产品变成对方的竞争对手。2023 年一家大公司开放其模型权重,一部分动机是它在闭源竞争中并不领先;2025 年中国团队的开源浪潮,也有这个逻辑:在无法获得最先进芯片的条件下,用开放换取生态、人才和影响力。

科学传统。AI 研究者来自学术界,公开论文和代码是他们的习惯;很多开源决定是研究团队推动的,不完全是商业算计。2025 年那份写得足够清楚的技术报告,让全世界的研究者复现和改进它,这是科学的方式。

降低成本。开源社区免费做了大量工作:找 bug、做量化、写推理引擎、适配硬件。一家公司自己做这些要花很多钱。

反面的动机也要知道。有些「开源」是营销:开放一个小版本,闭源大版本;或者用限制性许可证在「开源」的名义下保留控制。第五章说要追问数据来源,这里同样要追问「开了什么、留了什么」。

四、中国的开源浪潮

到 2026 年,一个被广泛承认的事实是:全球下载量和使用量最大的开放权重模型,多数来自中国团队。

这个格局是 2024 年下半年到 2025 年形成的。杭州的团队用工程优化把训练成本压低一个数量级,并把权重与方法完全公开;阿里的通义千问系列以宽松许可证发布了从几亿到几千亿参数的完整家族,成为全球被微调最多的底座;智谱、月之暗面、MiniMax、阶跃星辰等相继开放高水平的模型,包括万亿参数级的混合专家模型。海外的开发者社区、初创公司和研究机构大量采用它们,不是出于任何立场,而是因为它们好用、便宜、许可证宽松。

对中国的高校,这意味着第十二章说过的那件事:在自己的服务器上运行接近前沿的模型,从不可能变成了预算问题。本站的伴读助手就跑在校内的开放模型服务上。它也意味着一个新的责任:当中国团队成为开源的主要供给者,安全、许可证、数据透明度的标准,也需要由这些团队和使用它们的机构共同建立。

这件事正在被组织起来。聚焦人工智能赋能高等教育的重点难点问题,人工智能开放联盟正在为行业的发展赋能、形成合力;其中上海交通大学牵头承担「启悟学习社区」的建设,发动广大师生参与开源众创生态建设,激发年轻人的活力。它的思路和这一节说的是同一件事:高校既然是开放模型最大的使用者之一,就不该只做使用者。

对读这本书的人,这件事的含义很具体。你在课上写的一份讲义、一套习题、一个能跑起来的示例、一份技能文件(第十二章),在旧的做法里是一门课的附件,在这样的社区里可以是别人课程的起点。本站是这种做法的一个样本:它不是上述项目的一部分,但遵循同一套规矩——全部内容和代码公开在仓库里(见第六节),谁都可以拿去改成自己学校的版本。

五、风险与争论

开源在 AI 里的争论比在软件里激烈,因为模型能做的事不同。

双重用途。一个开放权重的模型可以被去掉安全对齐(第九章说过对齐可以被推回去,对开放权重尤其容易),用于生成有害内容、诈骗、恶意代码。闭源模型可以在服务端加护栏,开放权重一旦发布就收不回来。支持开源的一方指出,这些能力的门槛并不由开源模型决定,而透明本身就是一种安全:更多人能检查它。这个争论没有结论,各国的监管在 2025 年前后开始区分「开放权重」与「闭源服务」的不同义务。

责任。一个开放模型被下游用坏了,责任在谁?软件开源有几十年的法律实践,模型没有。

「开源」掩盖的集中。第一节说过,训练能力仍然集中在能负担几万块 GPU 的机构。开放权重让使用扩散,但「谁决定下一代模型长什么样」并没有扩散。把开源等同于民主化,是一种常见的误读。

可持续性。开源模型的训练由少数公司出钱,它们的动机可能变化。2025 年之后已经有团队从开放转向部分闭源。使用者要有「这个底座可能不再更新」的准备。

六、开源与教育

教育里的「开放」有更长的历史。2001 年起,一所美国大学把几乎全部课程材料免费放到网上,二十年里被几亿人使用;维基百科用开放协作写成了最大的百科全书;开放教育资源运动让教材、习题、课件可以自由复制和改编。这些不是 AI,但它们是 AI 训练数据里最有价值的一部分,也是这本书的先例。

这本书自己是开源的。代码、十四章正文、专题、术语表、示意图、插画的提示词,都放在一个公开的仓库里,任何人可以阅读、复制、改编、翻译,用于自己的课程。做这个决定的理由和上面讲的一样:一本讲「AI 是什么」的书,如果自己是封闭的,说服力会差很多;开放让别人能检查它、纠正它、在它上面盖自己的东西;一所大学的课程如果能被另一所大学直接用起来,它的价值就翻倍了。

它也遵守自己的规矩。文字与图用允许非商业性复制与改编的许可证,要求署名与同样方式共享;代码用宽松的许可证;课堂的原始讲义与幻灯片属于主讲教师,按教师的意愿处理;生成插画的提示词公开,图本身可以复用。仓库的说明文件写明了这些。

七、怎样参与

如果你是研究者或教师,开源的参与方式比想象的多。

使用并注明。用开放模型做研究或教学,在论文和课件里写明用了哪个模型、哪个版本、什么许可证。这是对开放者最基本的回报,也让你的工作可复现。

报告问题。发现模型的错误、许可证的模糊、文档的缺失,去仓库里提出来。开源项目最缺的不是赞美,是准确的问题报告。

贡献数据与评测。你的领域的公开数据集、评测题库、技能文件(第十二章),是开源生态里最稀缺的东西,也最适合非 AI 专业的人贡献。

选择许可证。当你开放自己的东西:代码用 MIT 或 Apache-2.0;数据用知识共享许可证,并说明来源和许可;模型权重用 Apache-2.0 或 MIT,并写清训练数据的说明;文档与教材用允许改编的知识共享许可证。写一份「模型卡」或「数据卡」:做了什么、用了什么数据、在什么上评测过、已知的局限。这几百字比许可证本身更能决定别人能不能放心用。

教学生开源的规矩。用了别人的东西要署名,改了别人的东西要说明,发布自己的东西要写清许可。这是第十四章「为自己的产出负责」在开源里的形式。

带走一句话

AI 的开源分三层:代码几乎全开,数据几乎不开,权重正在开。多数「开源模型」是「开放权重」,能用不能复现;开源让能力扩散,训练能力仍然集中。它的动机混合了理想与策略,它的风险真实但不比闭源更大。这本书自己开源,是因为一本讲 AI 的书应当经得起检查。

自测先自己想,再点开答案
  1. 「开源模型」和「开放权重模型」的区别是什么?

    答案

    开放权重只开放训练完的参数,能运行、微调、蒸馏,但没有数据和训练过程,不能复现。完整的开源要求代码、权重和足够的数据信息都开放,能让人重新造出它。多数「开源模型」属于前者。

  2. 开源降低了什么门槛,没有降低什么门槛?

    答案

    降低了使用和微调的门槛:一块 GPU 就能在开放模型上工作。没有降低从头训练的门槛:前沿模型仍需几万块 GPU、几个月、几亿元,训练能力仍然集中在少数机构。

  3. 公司为什么愿意把花几亿训练的模型开放?举两个不同性质的理由。

    答案

    策略性的:追赶者用开放换生态、人才与影响力,让自己成为默认。科学性的:研究者习惯公开论文与代码,公开的技术报告让全世界复现与改进。此外还有降低成本(社区做工具)与营销。

  4. 用一个开放模型做产品之前,该做哪三项检查?

    答案

    权重能否下载;许可证是否允许打算的用途(尤其商用与修改);训练代码与数据说明是否公开。还要有「底座可能不再更新」的准备。

本章术语

大语言模型Large Language Model, LLM

在海量文本上以「预测下一个 token」为目标训练的超大 Transformer 网络,参数从几十亿到上万亿。一个模型可以迁移到几乎所有与语言有关的任务。「基础模型」是更宽的说法,把处理图像、音频的同类模型也算进来。

预训练Pre-training

三阶段训练的第一阶段,也是最贵的:在几万亿 token 的文本上预测下一个 token,用几万块 GPU 跑几个月。看似平淡的任务逼出了语言、知识与推理能力。产物是基础模型。

混合专家Mixture of Experts, MoE

把前馈网络换成几十个并列的「专家」,由路由器为每个 token 只挑两三个计算。总参数可以很大,每次激活的参数很小,训练与推理成本按激活参数算。2024 年底起成为大模型默认选择。

个人智能体Personal agent

接入个人的聊天软件、邮箱、日历、文件与浏览器,常驻在自己机器上的智能体。2026 年初以「龙虾」为代表出圈,随后暴露出「难养、难管、难放心」的问题:维护成本、权限集中、提示注入。稳妥用法是专用账号、最小权限、定期看日志。