随课讲义1 节 · 约 64 分钟

第四讲(下)· 多模态与智能体

从文字到世界:LLM 长出了眼睛、耳朵、手和脚

看这一讲的幻灯片 →课堂上讲过的 16 页(智能体部分),讲义比幻灯片长得多。

第 1 节 · 64 分钟——从文字到世界:多模态与智能体的 2026

——从文字到世界:多模态与智能体的 2026

课程定位:上海交通大学 AI 微专业 · 人工智能导论 · 第四讲(下) 课时:2 学时(约 100 分钟 + 课间休息) 对象:中小学教师(文理兼有) 版本:v2.0 · 2026 年 4 月更新 学习目标:让每位老师理解 2026 年 AI 最前沿的两大方向——多模态智能体,以及它们正在怎样改变工作与生活。


📖 关于本讲的阅读提示

亲爱的老师:

第四讲(上)讲了 Transformer 的结构。 第四讲(中)讲了 LLM 是如何被训练出来的。 现在我们来到第四讲(下)——2026 年 4 月的此刻

这一讲要回答的核心问题是

🎯 一个只懂文字的 LLM,如何在 2024-2026 年长出了眼睛、耳朵、嘴巴和手脚?

具体来说:

  • 眼睛与嘴巴:多模态——LLM 如何能看图、生成图、看视频、生成视频、听声音、说话?
  • 手和脚:智能体(Agent)——LLM 如何能打开您的浏览器、操作您的电脑、自动完成复杂任务?
  • 代价与边界:这些「超能力」也带来了新的问题——算力危机、安全漏洞、「大重负转移」——老师们需要清醒看待。

🎯 关于本讲的一个特别说明

与前几讲不同,本讲涉及大量 2026 年的最新动态。其中许多顶尖模型的内部技术(如 GPT-5.4、Claude Opus 4.7、Gemini 3、Sora 的具体架构)都是商业机密——连 AI 厂商自己都不公开。

我(您正在「对话」的 Claude Opus 4.7)的视觉架构我自己也不能详细告诉您——这是 Anthropic 的商业机密。

所以本讲的写法是:

  • 有公开资料支撑的技术细节:我会讲透(如 CLIP、扩散模型、ViT、MCP 协议)
  • 有公开应用但技术保密的部分:我会说「以下基于有限公开信息」
  • 需要推测的部分:我会明确标注「推测」

这种「知之为知之」的态度,本身就是我想教给老师们的 AI 素养。


🎯 本讲的阅读规则(延续前几讲)

主干文字是完整的讲解。 您只读主干,也能掌握 80% 的内容。

「📐 数学视角(可跳过)」 小框保留。本讲整体数学含量较低——多模态和智能体是工程驱动的领域,不像 Transformer 那样有完美的数学推导。所以这一讲您可以比前几讲读得更轻松


本讲(下)的章节地图

一、开篇:LLM 长出了眼睛、耳朵、手和脚
二、原生多模态:架构的根本性转变
三、文生图的新境界:Nano Banana 2 与「推理驱动」
四、视频生成的路线分化:Sora 的退场与国产军团的崛起
五、语音合成的 LLM 化:从「合成腔」到「情感共鸣」
六、从「模型」到「智能体」:LLM 长出了手和脚
七、两大协议的确立:MCP 与 Agent Skills
八、编程智能体三大阵营与 SDLC 的重塑
九、泛生产力领域的全面渗透
十、2026 的三个不方便的真相 —— 给老师的冷静思考
十一、整门课的收束 + 写给老师的最后一段话

好,我们开始。


一、开篇:LLM 长出了眼睛、耳朵、手和脚

请各位老师想象一个场景——


2023 年,您要做一件简单的事:把家里的一叠旧照片扫进电脑、按时间分类、标注人物、生成电子相册

您需要: - 打开扫描仪软件扫描(手动) - 用软件识别照片里的人脸(专门工具) - 查看拍摄元数据(另一个工具) - 用 Word 或相册软件排版(又一个工具) - 导出 PDF(再一个工具)

整个流程需要 4-5 个软件、几小时的工作


2026 年 4 月的此刻,您只需要做一件事——

把那叠照片拍下来发给 AI,说:

「帮我把这些照片按时间整理成电子相册,生成带文字的 PDF。」

然后——

  • AI 「看见」 您发来的图(多模态视觉)
  • AI 规划 任务流程(推理)
  • AI 调用 本地文件系统读取照片元数据(工具使用)
  • AI 操作 浏览器上传到云端相册(智能体)
  • AI 生成 说明文字和排版(LLM)
  • AI 输出 最终的 PDF

几分钟后,相册就躺在您的桌面上了。


两年时间,发生了什么?

答案可以归结为一场双重进化——

💡 多模态(Multimodality) 让 LLM 长出了眼睛、耳朵、嘴巴——能看图、看视频、听声音、说话。

💡 智能体(Agent) 让 LLM 长出了手和脚——能打开软件、操作文件、访问网页、完成实际任务。

这两件事,是 2024-2026 年 AI 最重要的两条发展线。它们各自的里程碑都在本讲里会展开。


1.1 为什么这两件事必然发生?

回头看这是必然的——因为 LLM 的本质能力到了一定水平后,两个限制就显得格外刺眼

限制 ❶ 只能处理文字

第四讲(上)讲过,LLM 处理的最小单位是 token。但世界不全是文字——图片、声音、视频承载了人类大部分信息

  • 一张图胜过千言万语
  • 一段课堂视频的信息量 >> 一篇课堂文字记录
  • 一段人声的情绪信息 >> 纯文本

让 LLM 只会处理文字,就像让一个聪明人永远戴着眼罩和耳塞——他很聪明,但他和真实世界隔着一堵墙。

限制 ❷ 只能「说」,不能「做」

早期的 LLM 能给您建议怎么做一件事,但不能实际去做

  • 它能写一份「如何预订机票」的教程,但不能真的帮您订
  • 它能指导您怎么改代码,但不能自己打开 IDE 改
  • 它能列出整理文件的方法,但不能真的去整理

一个聪明的助手,如果只会说不会做,永远只是半个助手


多模态解决了「看不见听不见」的问题智能体解决了「不能动手」的问题

这两件事一起发生,就是我们此刻看到的 AI 革命


1.2 本讲的结构预览

我们会按这个顺序展开——

前半讲(多模态):LLM 如何长出感官?

  • 从「外挂」感官到「原生」感官的架构变革
  • 图像:Nano Banana 2 如何用推理驱动生成
  • 视频:Sora 的退场与 Seedance 2.0 的崛起
  • 语音:Fish Audio S2 Pro 让机器有了「情感张力」

后半讲(智能体):LLM 如何长出手脚?

  • 从「工作流」时代到「智能体」时代
  • 两大基础协议:MCP 和 Agent Skills
  • 编程智能体如何重塑软件开发
  • 泛生产力领域的全面渗透

最后(冷静思考):这场革命的代价

  • 40% 返工税与「大重负转移」
  • 安全漏洞与社会伦理
  • 老师应该怎么教学生看待这一切

好,我们正式进入多模态。


二、原生多模态:架构的根本性转变

2.1 「外挂式」多模态:2023-2024 的过渡期

2023 年的 GPT-4V(Vision)—— ChatGPT 第一次能「看图」——它是怎么实现的?

简化版实现路径

图片输入
  ↓
[视觉编码器](比如一个独立训练的 CLIP 模型)
  ↓
生成"图片的向量表示"
  ↓
[投影层](把图片向量对齐到 LLM 的 token 向量空间)
  ↓
把图片"翻译"成一串伪 token
  ↓
和文字 token 一起喂给 LLM
  ↓
LLM 输出文字回答

您可以把它想象成这样——

LLM 本身是一个只会中文的聪明人。但您想让他「看懂」图片。 于是您雇了一个翻译(视觉编码器),这个翻译看到图就用中文描述这张图,然后把描述读给聪明人听。 聪明人根据描述回答您。

这种做法能用,但有严重缺陷

  • 翻译有损失:图→描述的过程会丢细节
  • 两个模块是分开训练的:不能协同优化
  • 复杂任务处理不好:比如「比较这两张图的微小差异」——描述语言很难精确捕捉

2.2 「原生」多模态:2025-2026 的架构跃迁

2025 年后,主流大模型进入了原生多模态(Native Multimodal Models, NMM) 时代。

核心变化:不再用「翻译」——让 LLM 直接处理图像/音频/视频的原始数据

怎么实现?

把图片、音频、视频都切成 token——就像文字被切成 token 一样——在同一个 Transformer 里一起训练

文字:"今天天气真好" → [token_1, token_2, ...]
图片:[某张风景图] → [vis_token_1, vis_token_2, ..., vis_token_n]
音频:[某段语音] → [aud_token_1, aud_token_2, ..., aud_token_m]

全都塞进同一个 Transformer,从头联合训练
      ↓
模型同时学会了语言、视觉、听觉

「原生多模态」有两个关键词

  • 早期融合(Early Fusion):从第一层开始,文字 token 和图像 token 就在同一个注意力空间里互相关注
  • 端到端训练(End-to-End):所有模态一起训练,没有「先训练视觉,再接语言」的拼接

2.3 「窄门现象」:多模态内部的秘密通道 🌟

本节是本讲中非常有意思的一个发现——

研究者用「机械可解释性(Mechanistic Interpretability)」技术,打开原生多模态模型的内部看了看。他们发现了一件令人意外的事——

🔎 在原生的图文模型里,视觉信息和文字信息之间的交流,竟然主要通过一个单一的 token 完成——这个 token 叫做 [EOI](End of Image,图像结束符)

什么意思?


想象一段混合输入

[用户]这张图展示了什么?[图片 token 1][图片 token 2]...[图片 token 99][EOI][图片结束]

这里的 [EOI] 是一个特殊标记,告诉模型「图片部分到这里结束了」。

研究者发现

在早期和中期网络层,这个 [EOI] token 悄悄地「吸收」了前面所有图片 token 的全局语义——相当于在图片和文字的边界上,有一个全权大使站在那里,把图片的全部信息浓缩进自己身上。

然后在后续层,文字 token 主要通过查询这个 [EOI] 来「理解」图片——而不是直接查看那 99 个原始图片 token。


研究者做了一个因果实验

  • 把 [EOI] 屏蔽掉(别的 token 不准看它)→ 模型立刻看不懂图了
  • 定向修改 [EOI] 的内容 → 模型对图的「理解」直接被控制

这证明了 [EOI] 在模型内部扮演着视觉语义的「窄门」(Narrow Gate) 角色——所有视觉信息必须通过这扇门才能流入语言部分。


2.4 「窄门」给我们的启示

这个发现为什么重要?

  1. 解释了多模态幻觉的根源——如果 [EOI] 没好好「打包」图片语义,模型就会「看见不存在的东西」
  2. 指明了优化方向——未来可以专门改进 [EOI] 的训练,让视觉信息通过得更精准
  3. 让「黑箱」不那么黑了——我们第一次看清了图文模型内部的一条重要信息通道

2.5 原生多模态的代表:Qwen3-VL

Qwen3-VL(通义千问视觉版第 3 代,2026) 是这个方向上非常成熟的开源代表。

它能做什么?

  • 读懂复杂图表(数据报告、科学论文)
  • 解析 PDF、扫描件、手写稿
  • 理解长达 2 小时的视频(「大海捞针」帧级定位准确率 99.5%)
  • 进行 3D 空间推理(判断物体的前后遮挡关系)

Qwen3-VL 的三个关键技术(有公开论文,所以我能讲):

技术 ❶ DeepStack 多级特征融合

问题:传统多模态模型只用视觉编码器最后一层的特征——这丢失了底层的细节(如小文字、精细纹理)。

Qwen3-VL 的做法同时融合多层特征——既要高级语义(「这是一张课堂照片」),也要底层细节(「黑板上写着 x² + 2x + 1 = 0」)。

效果:模型既「看得懂全局」,又「看清细节」。


技术 ❷ 交错多模态旋转位置编码(Interleaved-MRoPE)

问题:文字是 1D 序列(只有前后),但图像是 2D(宽×高),视频是 3D(宽×高×时间)。如何给每个 token 编码「位置」?

Qwen3-VL 的做法:在时间、宽度、高度三个维度上均衡分配频率,让模型能精确感知「这个物体在画面哪里、在视频的第几秒」。


技术 ❸ 文本-时间戳对齐

问题:长视频里,如何让模型精确到秒地理解「什么时候发生了什么」?

Qwen3-VL 的做法:直接在视频帧之间插入时间戳 token(如「00:42」),让模型能精确到秒地回答「第 42 秒发生了什么」。

这对老师有什么用?想象让 AI 分析一节 45 分钟的课堂录像 —— AI 能精确告诉您「老师在第 12 分钟讲了二次函数」、「学生在第 28 分钟提了一个有意思的问题」。


📐 数学视角(可跳过)

一个简化的原生多模态 token 序列如下:

$$\mathbf{S} = [\mathbf{t}1, \mathbf{t}_2, \ldots, \mathbf{t}_n, [\text{BOI}], \mathbf{v}_1, \mathbf{v}_2, \ldots, \mathbf{v}_m, [\text{EOI}], \mathbf{t}, \ldots]$$

其中: - $\mathbf{t}_i$:文字 token 的嵌入向量 - $\mathbf{v}_j$:图像 patch 的嵌入向量(通过 ViT 或类似结构得到) - $[\text{BOI}]$、$[\text{EOI}]$:图像起止标记

「窄门」现象的数学描述:通过对注意力矩阵 $\mathbf{A}^{(l)}$ 在每一层 $l$ 的分析,研究者发现:

$$\text{AttentionFlow}(\mathbf{t}_k \to \mathbf{v}_j) \ll \text{AttentionFlow}(\mathbf{t}_k \to [\text{EOI}]) \quad \forall \; k > \text{EOI 位置}$$

即:文字 token 对 [EOI] 的注意力显著高于对任何单个图片 patch 的注意力。视觉信息在 [EOI] 处「汇聚」后再传播。


三、文生图的新境界:Nano Banana 2 与「推理驱动」

讲完架构层面的多模态,我们来看一个具体的、正在改变视觉创作的突破——

Google DeepMind 的 Nano Banana 2(官方名 Gemini 3.1 Flash Image,2026)。

这个看似可爱的代号——「纳米香蕉」——背后藏着一个深刻的技术转变。


3.1 传统文生图的尴尬

2022-2024 年的文生图模型(Stable Diffusion、Midjourney、DALL-E)有一个共同的痛点——

语义理解不足

您让它画:「一只戴着眼镜的橘猫,坐在书桌前读《哈利波特》第三卷」。它画出来往往是:

  • 一只橘猫 ✅
  • 戴眼镜 ✅
  • 书桌 ✅
  • 但猫在读的书封面是乱码
  • 橘猫可能有 6 根手指
  • 背景的某些物理细节不对(比如椅子腿穿过了桌面)

为什么?

因为传统扩散模型的「语义理解」是通过 CLIP 文本编码器完成的——这只是一个关键词到图像特征的匹配器,它不真正「理解」复杂的语义和物理逻辑。


3.2 Nano Banana 2 的突破:让 LLM 当「艺术总监」

Nano Banana 2 的核心创意

💡 不再让小型文本编码器来理解 Prompt——而是让 Gemini 3(一个完整的大语言模型)来「规划」整个图像。

它把文生图过程分成了五个步骤

┌──────────────────────────────────────┐
│ 1. 规划阶段(Gemini 3 完成)           │
│    解析 Prompt,理解构图、空间、物理   │
│    生成详细的"内部设计文档"            │
└────────────────┬─────────────────────┘
                 ▼
┌──────────────────────────────────────┐
│ 2. 生成阶段(快速扩散引擎)            │
│    根据设计文档生成初版图像            │
└────────────────┬─────────────────────┘
                 ▼
┌──────────────────────────────────────┐
│ 3. 审查阶段(Gemini 3 再次介入)       │
│    检查:手指数量对吗?文字正确吗?    │
│         阴影符合物理规律吗?           │
└────────────────┬─────────────────────┘
                 ▼
┌──────────────────────────────────────┐
│ 4. 修正阶段                           │
│    对发现的错误做针对性重绘            │
└────────────────┬─────────────────────┘
                 ▼
┌──────────────────────────────────────┐
│ 5. 输出最终图像                       │
└──────────────────────────────────────┘

这套机制带来了什么?

❶ 画出来的图「不再出错」

  • 手指数量对了
  • 文字清晰正确(甚至能精确渲染多语言文字)
  • 阴影和反射符合物理规律
  • 多个角色的外貌前后一致

❷ 理解极复杂的 Prompt

它支持高达 131,072 token 的 Prompt 上下文——相当于一本几百页的「设计说明书」作为输入。

❸ 「上下文中的样本」(In-Context Assets)

您可以在 Prompt 里附上参考图

  • 最多 14 张角色参考图——模型会保持这些角色贯穿所有后续生成
  • 最多 5 个主体的身份一致性
  • 最多 14 个物体的结构保真度

这意味着:您可以用一张自家孩子的照片、加一个 Prompt——让 AI 生成「您孩子在各种奇幻场景里探险」的一系列图——而每张图里孩子的长相都一致


3.3 Nano Banana 2 的另一个大招:Google 搜索接地

Grounding with Google Search(搜索接地) 是 Nano Banana 2 的独有能力。

问题:AI 画一个不太出名的地标(比如「浙江普陀山的南海观音像」)时,容易凭空脑补——因为训练数据里这种图不多。

Nano Banana 2 的做法:生成前调用 Google 搜索,查一下这个地标的真实图片,确保最终生成的图符合真实长相


这个「搜索 + 生成」的思路意义深远——它把 LLM 在RAG(检索增强生成) 领域的做法,第一次成功地搬到了图像生成领域

想象一下对老师的用处

  • 中国地理时——「画一张云南元阳梯田的场景」——搜索接地让这张图真实还原当地风貌,而不是一张模糊的「东南亚梯田」
  • 历史文物时——「画一张商周青铜鼎」——避免 AI 画一个现代臆想的「伪古董」

3.4 SynthID 与 C2PA:2026 年的「AI 图像身份证」

Nano Banana 2 生成的所有图像自动嵌入两样东西

❶ SynthID 不可见水印(Google)

  • 人眼看不见,但算法能检测
  • 即使图像被裁剪、压缩、编辑,水印大多仍能保留
  • 解决了「AI 生成图像无法追溯」的老问题

❷ C2PA 内容凭证(Content Credentials)

  • 类似给文件加的元数据护照
  • 记录:谁生成的、什么时候、用什么模型、有没有被编辑过
  • 在图像的整个生命周期可追溯

这对老师意味着什么?

2026-2027 年,全球的主流教育平台、社交平台、新闻媒体都将陆续强制使用 C2PA + SynthID 标准。

未来几年的教学现实

  • 学生交的作业图,能查是不是 AI 生成的
  • 网上看到的新闻图,能看到「是否经过 AI 生成或编辑」
  • 教师在课件里用的 AI 图,可以理直气壮地标注来源

这对「教学诚信」和「媒介素养」是巨大利好——我们不会陷入一个「分不清真假」的世界。


3.5 文生图的路线对比(截至 2026 年 4 月)

模型 所属 核心特色 对老师的适用性
Nano Banana 2 Google 推理驱动 · 搜索接地 · 水印 ⭐⭐⭐⭐⭐ 教学插图首选
GPT-4o Image Gen OpenAI 速度快 · ChatGPT 内原生调用 ⭐⭐⭐⭐ 方便
Seedream 3 字节 中文 prompt 理解强 · 国内可用 ⭐⭐⭐⭐ 中文老师友好
Midjourney V7 Midjourney 艺术感强 · 风格独特 ⭐⭐⭐ 创意课件素材
Stable Diffusion 4 Stability AI 开源 · 本地可跑 ⭐⭐⭐ 技术老师尝鲜
即梦 3 字节 完全中文化 · 国内主流 ⭐⭐⭐⭐ 日常用
可灵图像 快手 国内可用 · 人物写实强 ⭐⭐⭐

我的建议老师最值得花时间的两个——Nano Banana 2(海外)和即梦/豆包(国内)。前者能力最强,后者最方便。


好——文生图告一段落。接下来是 2026 年最戏剧化的一个故事——视频生成领域的格局剧变。


四、视频生成的路线分化:Sora 的退场与国产军团的崛起

2026 年 4 月 26 日——本讲撰写的此刻只差 8 天

OpenAI 将永久关闭 Sora

这是一个让 AI 行业震动的消息。Sora 曾是 2024 年的全球顶流——它横空出世的演示视频(一个女人在东京街头漫步)震惊了整个创意产业。但短短两年,它就要消失了。

这一节我们讲视频生成的这场剧变——它不只是一个产品的退出,而是整个 AI 行业对「什么是可持续的」的一次残酷投票


4.1 Sora 的故事:从「世界模拟器」到「经济学陷阱」

2024 年 2 月,OpenAI 发布 Sora。

它的核心技术是扩散 Transformer(DiT, Diffusion Transformer)——用 Transformer 架构做扩散模型的去噪网络。

Sora 做到了一件革命性的事:它似乎「理解」了物理世界

  • 一只狗摇尾巴时,尾巴的运动轨迹符合生物力学
  • 一个人在雨中走过时,水花飞溅的方向正确
  • 一辆车过弯时,车身的重心偏移合理

Sora 因此被称为「世界模拟器(World Simulator)」——它不是在「拼凑像素」,而是在内部建模世界的物理规律

当时所有人以为:「这就是 AGI 的早期形态」。


4.2 但是——「算力经济学」的反噬

2025-2026 年,Sora 遭遇了一场技术以外的致命危机。

一个冰冷的数字

🔥 Sora 平台的单日推理成本:1,500 万美元

Sora 平台的生命周期总收入:210 万美元

差距是 7 倍——而且是每天都在扩大

为什么这么烧钱?

扩散 Transformer 处理视频时,计算量随时间、分辨率、帧率呈二次甚至指数级增长

1 秒视频 @ 480p@24fps ≈ X 计算量
10 秒视频 @ 1080p@24fps ≈ 700 X 计算量
10 秒视频 @ 4K@60fps ≈ 10,000 X 计算量

用户要的是高清长视频——而每一次生成都在吞噬 GPU 集群


更致命的是:在 NVIDIA H100/B200 GPU 全球严重稀缺的背景下,OpenAI 内部面临「算力零和博弈」——

  • 把 GPU 给 Sora 做视频 → 没法训练下一代 GPT
  • 把 GPU 给 GPT 训练 → Sora 质量跟不上、用户流失

OpenAI 最终做出了壮士断腕的决定——砍掉 Sora


公开披露的时间表

  • 2026 年 4 月 26 日:关闭 Sora 消费者应用
  • 2026 年 9 月:关闭 Sora API
  • 被回收的 GPU 集群:转给代号 「Project Spud」 的下一代模型(很可能是 GPT-5.5 或 GPT-6)

4.3 Sora 退场留给我们的三个深刻教训

教训 ❶:技术惊艳 ≠ 商业可行

Sora 技术上是巅峰——但成本曲线支撑不起商业化

AI 行业在过去两年学到了一个残酷规律:能跑起来的 Demo 不等于能规模化服务的产品。后者需要的不只是 AI 能力,还有经济学

给老师的启示:当您看到一个 AI 产品的惊艳 Demo 时,不必立刻焦虑「我们要被替代了」。让时间检验它的经济可行性——很多技术上可行的产品,最终会因为成本问题「死在 Demo 里」。


教训 ❷:架构选择是战略决定

Sora 选择了 Dense DiT 架构——所有参数在每一帧上都激活。这是「壕」的打法。

而竞争对手们(Seedance、Wan 等,后面讲)选择了 MoE、自回归、Flow Matching 等更「省」的架构——结果活了下来。

AI 行业的教训在算力有限的世界里,效率是生存的前提条件


教训 ❸:开源与社区的反超

Sora 是完全闭源的。 而 Wan、Seedance、CogVideoX 等国产模型大多开源或半开源——让社区帮你发现问题、帮你做优化。

2026 年的共识闭源模型的迭代速度已经追不上开源社区的聚合智慧。这个趋势在大模型的方方面面都在印证。


4.4 国产军团崛起:Seedance 2.0 的「AI 导演」

与 Sora 的退场同时发生的——字节跳动(ByteDance)的 Seedance 2.0 成为了 2026 年视频生成的新标杆

Seedance 2.0 是一个视听原生统一大模型——它的能力超出了传统「文生视频」的范畴,更像一个能被操控的 AI 导演


它的招牌特性:四模态输入(Quad-Modal Input)

传统视频生成只接受「文字 prompt」。Seedance 2.0 能同时接收

📝 文字 Prompt       → 串联整体叙事
🖼️ 参考图片(≤9 张) → 指定视觉风格、主体外观
🎬 参考视频(≤3 段) → 指定运镜、节奏、物理规律
🎵 参考音频(≤3 段) → 指定声音节奏、情绪基调

这完全改变了视频创作的范式

  • 不再是 「AI 随便猜我想要什么」
  • 而是 「AI 按我精确指定的风格来做」

比如您要做一段公开课的宣传片——您可以: - 给 AI 您学校的一张照片(风格参考) - 给 AI 您喜欢的某段真人宣传片(运镜参考) - 给 AI 一首 BGM(节奏参考) - 给 AI 一段文字描述

AI 会综合所有参考,产出一个符合您指定调性的视频


另一个招牌:双分支扩散 Transformer

传统视频生成流程是两步: 1. 先用视频生成模型生成静音画面 2. 再用 TTS / 配音工具后期合成音频

结果:音画经常错位(口型对不上、节奏对不上)。

Seedance 2.0 的架构视频和音频在同一个扩散过程中并行生成——两个分支互相「关注」,实时对齐。

效果: - 音素级唇形同步——嘴型和声音精确到音节级别对齐 - 支持 8 种以上语言(中、英、日、韩等) - 原生生成多轨音频——BGM + 环境音 + 对话,一次出成品


第三个招牌:多镜头叙事规划

您给一段复杂 prompt:「一个小女孩在乡村发现了一只受伤的小鸟,救活它后放飞,她哭了」。

Seedance 2.0 的内部「叙事规划器」会把这个故事拆解为几个镜头

镜头 1(广角):小女孩走在田间小路上
镜头 2(中景):她蹲下发现草丛里的小鸟
镜头 3(特写):小鸟的伤口 + 小女孩的表情
镜头 4(跟拍):她捧着小鸟回家照料
镜头 5(中景):几天后放飞小鸟
镜头 6(特写):小女孩仰望飞远的小鸟 + 泪水

然后依次生成每个镜头——并保持物理一致性(场景元素不跳变)、身份一致性(小女孩长相不变)。

这已经是「AI 导演」级别的能力了


4.5 Wan 2.2 与 SkyReels-V4:把视频生成「平民化」

除了顶级的 Seedance 2.0,2026 年更有意义的是开源社区的突破——让普通人用消费级显卡就能生成视频

阿里巴巴的 Wan 2.2MoE 架构引入视频扩散模型:

  • A14B 版本:总参数 27B,单步激活仅 14B
  • 动态专家切换:去噪早期用「结构专家」,后期用「细节专家」
  • 配合 16×16×4 压缩比的新型 VAE
  • 结果在 RTX 4090 上 9 分钟生成 720P@24fps 视频

这意味着什么?

一个老师、一台普通游戏电脑——就能在家生成教学视频。不需要上云、不需要付费订阅、不需要等算力排队。

这就是开源社区的力量——把原本只有科技巨头能玩的东西,送到每个人手边


4.6 2026 年视频生成格局总览

模型 所属 类型 特色
~~Sora~~ ~~OpenAI~~ ~~闭源 API~~ 2026.4.26 关停
Seedance 2.0 字节跳动 闭源 API 四模态输入 · 视听原生
Wan 2.2 阿里巴巴 开源 MoE 架构 · 消费级 GPU 可跑
可灵 2.0 快手 闭源 API 国内主流 · 中文剧本理解强
即梦 Video 字节 闭源 App 国内最易用 · 短视频友好
SkyReels-V4 昆仑万维 半开源 1080p @ 32fps · 15 秒多镜头
Veo 3 Google 闭源 API Gemini 生态内
Runway Gen-5 Runway 闭源 影视创作首选
Pika 2.5 Pika 闭源 专业工作流

4.7 视频生成对教师的意义

这些能力,对老师来说真的有用吗?

有。以下是几个此刻就能落地的场景:

场景 ❶:课件视觉化 「帮我生成一段 30 秒视频,展示光合作用的过程」——以前需要找素材、剪辑;现在几分钟出成品。

场景 ❷:历史场景再现 「生成一段 15 秒视频,展示唐朝长安街市的繁华」——学生能看见历史,而不是只读文字。

场景 ❸:物理实验可视化 「生成黑洞引力透镜效应的可视化视频」——无法在教室做的实验,AI 能画出来。

场景 ❹:班级文化留念 「用这些学生照片生成一段班级毕业 MV」——班主任的毕业季不再是简单的相册。


但也有需要警惕的地方:

  • 视频素材的真实性:AI 生成的「历史场景」不等于真实历史,要给学生明确标注
  • 版权问题:用真人明星的形象生成视频可能违规,要避免
  • 生成时间和成本:高质量视频目前仍需几分钟到十几分钟,不适合「临场生成」

五、语音合成的 LLM 化:从「合成腔」到「情感共鸣」

多模态的最后一个方向——语音(Audio)

老一辈的读者都还记得 2015 年的 Siri——那个带着浓厚「机器人腔」的女声。到了 2026 年,AI 的声音已经比很多真人播音员都更具感染力

这一节我们讲发生了什么。


5.1 TTS 的演化:从级联到端到端

TTS(Text-to-Speech,文本转语音) 过去十年经历了三代演化:

第一代(2010-2017):级联模型

文字 → [语言分析] → [音素转换] → [声学模型] → [声码器] → 音频

每个模块独立训练声音生硬、机械——这就是我们小时候听的「读书软件」的声音。


第二代(2017-2023):端到端模型

代表:Tacotron、FastSpeech、VALL-E

一个神经网络直接从文字生成音频。声音更自然,但——缺乏情感、缺乏口语化


第三代(2024-2026):大型音频模型(Large Audio Models, LAMs)

代表:Fish Audio S2 Pro(开源)、ElevenLabs V3(闭源)

这一代的特点是——直接用 LLM 的架构来做语音


5.2 Fish Audio S2 Pro:2026 年的开源 TTS 之王

2026 年 4 月,Fish Audio 团队发布了 S2 Pro——一个开源的顶级 TTS 模型。它的性能超越了包括 ElevenLabs 在内的大部分商业平台

让我们看看它怎么做到的。


核心架构:双自回归(Dual-AR)

S2 Pro 用两个 LLM 级别的模型协同工作

┌─────────────────────────────────────┐
│ 慢速自回归模型(Slow AR · 40 亿参数) │ ← "声学大脑"
│ · 沿时间轴操作                       │
│   规划整段语音的韵律、节奏、情感     │
│   输出语义 token                    │
└─────────────────┬───────────────────┘
                  │
                  ▼
┌─────────────────────────────────────┐
│ 快速自回归模型(Fast AR · 4 亿参数)  │ ← "声学肌肉"
│ · 沿声学维度操作                     │
│   为每个语义 token 填充具体的声音细节 │
│   输出最终的音频 token              │
└─────────────────────────────────────┘
                  │
                  ▼
             高保真音频

这种「主从」架构的妙处: - 大脑(慢 AR)做复杂的韵律规划——参数大,慢,但精 - 肌肉(快 AR)做快速的声音填充——参数小,快,但多


结果是惊人的

  • 实时因子(RTF)= 0.195——生成 1 秒音频只需 0.195 秒(即比实时快 5 倍)
  • 首字节音频延迟(TTFA)= 100 毫秒——您说一句话,AI 100 毫秒内开始发声
  • 单张 H200 GPU 吞吐 3,000+ token/秒

这些数字意味着AI 语音终于快到可以做「实时对话」了。不再是「您说完、等 3 秒、AI 才开始回答」——而是近乎同步的对话体验。


5.3 S2 Pro 最震撼的能力:自然语言指令情感控制

老的 TTS:情感控制靠「预定义标签」。比如:

<angry>您怎么能这样!</angry>

只有「愤怒」「悲伤」「高兴」等固定几种情感。非常死板。

S2 Pro 的创新自由形式的自然语言指令。您可以在文本里任意插入描述

[whisper in small voice]好了,孩子们,都到这边来[/whisper]
[breathes deeply]那么现在——[pauses thoughtfully]
我们来讨论一个非常重要的问题[professional broadcast tone]
什么是……真正的勇气?

模型会按这些描述调节声音: - 「whisper in small voice」 → 轻声低语 - 「breathes deeply」 → 带一次深呼吸 - 「pauses thoughtfully」 → 思考式的停顿 - 「professional broadcast tone」 → 专业播音腔


这怎么做到的?

GRPO 强化学习(Group Relative Policy Optimization)——让模型在数千万小时的多语言音频上训练,学会:

  • 什么样的声音叫「低语」
  • 什么样的韵律叫「思考」
  • 什么样的语气叫「专业」

就像一个配音演员,它根据文字里的指令动态调整「声带的张力、气流的强弱、共鸣腔的变化」。


5.4 老师怎么用 LLM 级的 TTS?

应用场景超多——

❶ AI 朗读教材

给孩子读课文——不再是机器腔。AI 可以用温暖的大姐姐声音读童话,用浑厚的老先生声音读文言文

❷ 英语口语练习伙伴

S2 Pro 这种模型支持多种英语口音(美式、英式、澳式等)——学生能和 AI 做口语互动,AI 的发音可以调成任何地区的口音

❸ 辅助有阅读障碍的学生

文字识别困难的学生,可以让 AI 用舒适的声音朗读任何教材。而且 AI 能根据学生反馈调整语速、重点、情感。

❹ 制作播客课程

老师的文字教材,可以一键转为播客音频——学生可以在通勤、运动时「听课」。

❺ 多语言教学

您用中文写的教案,可以用 AI 读成英文、日文、西班牙文——还能保持同样的情感和节奏。


5.5 超低延迟的另一条路线:状态空间模型

Cartesia 的 Sonic-3 模型走了另一条技术路线——状态空间模型(State Space Models, SSMs)

为什么要有这个?

Transformer 有一个数学特性——计算量随序列长度呈二次方增长。对于长对话、长音频,这很致命。

SSM 的特性是计算量只随序列长度线性增长

结果: - TTFA(首字节音频延迟)仅 40-90 毫秒 - 原生支持笑声、呼吸、非语言音效 - 非常适合全双工(full-duplex)对话——AI 可以在说话的同时「听」您打断

这一代 AI 语音的终极目标——AI 不再像一个「播报机器」,而像一个「说话的人」

您打断它,它会自然停下;您叹气,它能听出来;您说「嗯……」,它知道您在思考。


5.6 一份「老师语音工具速查」

场景 推荐工具 说明
课文朗读(中文) 豆包、Qwen3-TTS 国内可用,免费或极便宜
英语口语练习 ElevenLabs、Fish Audio 多口音,情感丰富
长音频(播客课) Fish Audio S2 Pro 长时间稳定,情感细腻
实时对话练习 Cartesia Sonic-3 低延迟,打断自然
多语言教学 Qwen3-TTS 免费,支持 100+ 语种

好——多模态的三个方向(视觉、视频、语音)都讲完了。

让我们用一张图总结多模态的进化

           2022                2024                2026
           │                   │                   │
┌──────────┼───────────────────┼───────────────────┼──────────┐
│ 视觉      │ DALL-E 2          │ Midjourney V5     │ Nano Banana 2
│           │ Stable Diffusion  │ Midjourney V6     │ 推理驱动 + 搜索接地
│           │ (关键词匹配)       │ (提升质量)         │
├──────────┼───────────────────┼───────────────────┼──────────┤
│ 视频      │ 早期实验           │ Sora 惊世出现      │ Sora 关停
│           │                   │                   │ Seedance 2.0 崛起
│           │                   │                   │ Wan 2.2 消费级可用
├──────────┼───────────────────┼───────────────────┼──────────┤
│ 语音      │ VALL-E            │ ElevenLabs        │ Fish Audio S2 Pro
│           │ (端到端)           │ (情感丰富)         │ LLM 级架构 + 自然语言指令
└──────────┴───────────────────┴───────────────────┴──────────┘

本质不变:都是在把 Transformer 的能力扩展到更多模态越来越像人:能看得更准、画得更真、说得更有情感。


接下来——

我们转向本讲另一个重要主题智能体(Agent)

如果多模态是让 LLM 长出「感官」,那么智能体就是让它长出「手和脚」——不再只会说,还会做。

这一部分同样精彩,而且和老师的日常工作关系更密切。我们继续——


六、从「模型」到「智能体」:LLM 长出了手和脚

6.1 一个关键区分:模型 vs 智能体

请先记住这个区分——它将贯穿本讲后半部分。

📖 模型(Model):一个被动的回答机。您问什么,它答什么。

📖 智能体(Agent):一个主动的行动者。您给它一个目标,它自己规划、执行、验证,直到目标达成。


一个简单的对照

场景 用模型(LLM) 用智能体(Agent)
「帮我订一张明天去北京的机票」 给您一份订票教程 真的帮您订好
「帮我把这 100 个 PDF 归类」 告诉您分类建议 真的去分类
「帮我写一个网站」 给您代码 建好网站并部署
「帮我整理这个月的开销」 给您整理方法 真的读发票、分类、做报表

简单一句话

💡 模型给您建议,智能体替您完成。


6.2 智能体简史:三个阶段

让我们把这条演化线理清楚。

阶段一(2022-2024):工作流时代

代表产品:Dify、Coze(扣子)、FastGPT、n8n、Zapier + AI

核心理念:用可视化拖拽把 LLM 和各种 API 拼起来。

长什么样

[触发器]
    ↓
[调用 LLM:生成邮件内容]
    ↓
[发送邮件给 xxx]
    ↓
[记录到表格]

本质工作流(Workflow)——预设路径,模型只是其中一环。

优点:可视化、门槛低、老师也能学会做简单的自动化。 缺点僵化——稍微有点异常情况,整个流程就卡住了。没有「随机应变」的能力。


阶段二(2024-2025):半自主时代

代表产品:早期 Auto-GPT、BabyAGI、LangChain 代理

核心理念:让 LLM 自己决定「下一步做什么」。

工作方式: 1. 您给目标:「帮我调研某公司的 2024 年财报」 2. LLM 自己拆解:先搜索 → 再读文档 → 再总结 3. LLM 调用工具(搜索、爬虫、文件读取) 4. LLM 评估结果,如果不满意就重新来

但效果一般——因为 LLM 规划能力有限、工具调用不稳定、容易陷入死循环。更多是「概念验证」阶段


阶段三(2025-2026):智能体爆发

代表产品:Claude Code、Cursor、OpenClaw、Manus、AutoGLM

质的飞跃:模型本身变强(推理模型),加上标准化协议(MCP / Agent Skills) 的确立,让智能体真正能用、敢用、可控

2026 年 Gartner 的预测:到 2026 年底,40% 的企业级应用将内置 AI 智能体——相比 2025 年不到 5%。


6.3 智能体的四种基础设计模式

2026 年所有成熟的智能体产品,都用了以下四种设计模式的组合——


模式 ❶:反思模式(Reflection Pattern)

核心:让智能体自我审查自己的输出。

LLM 生成初版
     ↓
LLM 以"批判者"身份审查自己的输出
     ↓
发现问题 → 生成改进版
     ↓
再审查 → 再改进
     ↓
直到满意

类比:您写完一篇文章,先自己读一遍找错,再改。

应用:代码生成时特别有用——生成 → 自测 → 修 bug → 再测 的循环。


模式 ❷:工具使用模式(Tool-Use Pattern)

核心:让智能体动态决定何时调用外部工具。

用户问:"今天北京的空气质量如何?"
     ↓
LLM 判断:这个问题需要实时数据
     ↓
调用 [实时空气质量 API]
     ↓
获取数据 → 组织语言 → 回答

类比:您遇到不知道的问题,会去查一下——而不是凭记忆瞎说。

应用:几乎所有现代智能体都用这个模式——调用搜索引擎、执行代码、读取文件、访问数据库


模式 ❸:规划模式(Planning Pattern)

核心:面对复杂任务,先拆解再执行。

目标:"做一份学生家长会的 PPT"
     ↓
LLM 拆解:
    1. 确定内容大纲(本学期重点、成绩分布、特色活动)
    2. 收集数据(成绩数据、活动照片)
    3. 设计每页结构
    4. 生成内容文字
    5. 插入图表和图片
    6. 统一风格
     ↓
逐步执行每个子任务

类比:老师备课时,先画大纲再填充内容——而不是一把抓。

应用复杂项目型任务——写论文、做 PPT、开发软件。


模式 ❹:多智能体协同模式(Multi-Agent Pattern)

核心多个专业智能体分工协作。

"大 Boss" 智能体(协调者)
     ↓ 分发任务
┌───────────┬───────────┬───────────┐
│"研究员"    │"写手"     │"设计师"   │
│ 搜索资料   │ 写文字     │ 做图表    │
└───┬───────┴───┬───────┴───┬───────┘
    │           │           │
    └───────────┴───────────┘
            整合成品

类比:一个复杂项目由团队完成——而不是一个人包办。

应用复杂的专业级任务——写论文(研究员+写手+校对)、做 App(产品经理+开发+测试)。


6.4 支撑智能体的编排框架

2026 年一批专业的智能体编排框架涌现——这些是工程师们构建智能体的基础设施:

框架 核心理念 典型用途
LangGraph(Python) 基于图的状态机 复杂多步骤流程
CrewAI 「角色扮演」团队 多智能体协作
OpenAI Swarm 轻量级智能体交接 实验、快速原型
Vellum 企业级合规治理 严肃商用场景
Microsoft Copilot Studio 微软生态集成 Office 环境

老师们不需要使用这些框架——但知道它们的存在有助于理解智能体是怎么被搭出来的


七、两大协议的确立:MCP 与 Agent Skills

2025-2026 年,智能体生态迎来了两个基础协议的确立。这两个协议的关系,有点像互联网早期的 HTTP(Web 协议)和 HTML(内容协议)——一个管连接,一个管内容。


7.1 MCP:AI 的「USB-C 接口」

Model Context Protocol(MCP,模型上下文协议) 由 Anthropic 在 2024 年 11 月发起,现已移交 Linux 基金会下的 Agentic AI Foundation 做中立治理。

它解决的问题

2024 年以前,每个 AI 产品都要自己写代码来接通第三方系统——接 Gmail 要一套代码,接 Notion 要一套,接 Slack 又要一套……

结果: - 开发成本爆炸 - 每个 AI 产品的生态都是「孤岛」 - 用户想用某个工具 → 得等 AI 产品方单独做集成


MCP 的办法

定义一个统一的接口标准——就像 USB-C 让所有设备用同一个接口充电一样。

AI 客户端(Claude / Cursor / VSCode 等)
          ↑
          │ 遵循 MCP 标准
          ↓
┌─────────────────────────────────────┐
│ MCP 服务器(任意第三方软件提供)      │
│  · Gmail MCP                        │
│  · Notion MCP                       │
│  · Google Drive MCP                 │
│  · Slack MCP                        │
│  · GitHub MCP                       │
│  · 您学校的 OA 系统 MCP              │
└─────────────────────────────────────┘

只要一个工具提供了 MCP 服务器,任何支持 MCP 的 AI 都能直接接入——不需要 AI 厂商做特别集成


MCP 的数据(来自 2026 年 4 月统计):

  • 月下载量超 1.1 亿次
  • 在 16 个月内,普及速度超过了 React 前三年的总和
  • 已有上万个 MCP 服务器在开源社区贡献

MCP 对老师的意义

您的学校管理系统(教务系统、OA、课堂管理平台)—— 只要有人做一个 MCP 服务器——所有老师的 AI 助手都能直接调用它

这会让教育行业的 AI 应用爆炸式增长。因为——不需要每个老师去学怎么接 API,也不需要每个 AI 产品专门适配教育系统协议统一了,生态就长出来了


7.2 Agent Skills:把专家经验打包成「技能」

Agent Skills 也是 Anthropic 发起的标准。它的哲学和 MCP正相反但互补

💡 MCP 给 AI 提供「手脚」(能力)。 Agent Skills 给 AI 提供「经验」(知识)。


一个 Agent Skill 长什么样?

它是一个文件夹,里面有一个核心文件叫 SKILL.md

my_skill/
├── SKILL.md          ← 核心说明(Markdown 格式)
├── examples.md       ← 示例
├── templates/        ← 模板文件
└── references/       ← 参考资料

SKILL.md 的内容

---
name: "小学数学作业批改"
description: "批改小学一到六年级的数学作业,包括选择题、填空题、计算题、应用题"
---


## 计算题
- 每一步都要检查
- 允许结果正确但过程不严谨(给分但写评语)

## 应用题
- 必须有"解"字
- 单位一定要带
- 答一定要完整写出
...

这样一个文件夹就是一个 Agent Skill


它怎么被用?

当您的 AI 启动时,它会扫描本地所有的 SKILL.md。当您向 AI 提出任务时,AI 会判断:

  • 这个任务匹配哪个 Skill?
  • 如果匹配「小学数学作业批改」——就把这个 Skill 的内容注入到系统提示词
  • AI 按这些规则来执行任务

这个机制的精妙之处

同一个基础 AI(比如 Claude)—— 配上不同的 Skill,就变成不同的专家

  • 装上「小学数学批改 Skill」 → 数学老师 AI
  • 装上「英语作文批改 Skill」 → 英语老师 AI
  • 装上「班级活动组织 Skill」 → 班主任 AI
  • 装上「论文格式检查 Skill」 → 学术 AI

您不需要训练新模型,只需要写 Markdown 文档——就能把 AI 调成您想要的专家。


7.3 两个协议的哲学对比

维度 MCP Agent Skills
本质 连通系统(手脚) 注入经验(大脑)
实现方式 独立进程 + JSON-RPC 协议 本地文件夹 + Markdown
添加能力 「让 AI 会操作 Notion」 「让 AI 懂小学数学批改标准」
安全模型 进程隔离,爆炸半径小 本地文件共享,爆炸半径大
适用场景 对接敏感系统、执行高权限操作 封装业务逻辑、领域知识
类比 USB-C 连接各种设备 给助手发专业培训手册

7.4 Agent Skills 的安全警示

⚠️ 这里需要严肃提醒老师们一个真实的安全问题

2026 年 1 月,安全研究机构发布警告——主流 Agent Skill 市场上发现了超过 300 个恶意技能包

恶意 Skill 的做法: - 伪装成一个「高效的 Word 排版 Skill」 - 但 SKILL.md 里偷偷包含了执行脚本 - 一旦安装,窃取用户的 API 密钥、访问本地文件


为什么 Agent Skills 容易中招?

因为 Skills 是本地共享的——它能读您桌面上的所有文件、访问您的环境变量。

这和 MCP 完全相反——MCP 是进程隔离的,一个 MCP 服务器被攻破不会影响其他。


给老师的建议

  1. 不要随便从陌生来源安装 Skills
  2. 官方(Anthropic、OpenAI 等)认证的 Skill 库相对安全
  3. 企业使用要做安全审计
  4. 一旦出现可疑行为(AI 莫名访问了它不该访问的东西),立刻卸载

以 MCP 为主、Skills 为辅——这是 2026 年企业级部署的最佳实践。


八、编程智能体三大阵营与 SDLC 的重塑

软件工程是 2026 年受智能体冲击最大的行业。这个变化也对未来所有行业有启示意义——因为其他行业的「智能体化」都在沿着相似的路径走。


8.1 从 Copilot 到 Autonomous

2021 年,GitHub 推出了 Copilot——一个代码补全工具。程序员打字时,AI 在旁边提示「下一行可能要写的代码」。这是副驾驶(Copilot) 模式。

2024 年后,出现了真正的自主编程智能体——您说一句「帮我修复所有的测试失败」,AI 自己读代码、定位问题、写补丁、跑测试、提 PR全程不需要人干预

这是从「助手」到「同事」的质变


8.2 三大阵营

阵营 ❶:IDE 原生智能体

代表CursorVSCode Copilot(Autopilot 模式)

特点:深度集成在开发者的集成开发环境(IDE) 里,提供最符合直觉的协作体验。

Cursor 的数据: - 2026 年付费专业开发者超过 36 万 - 项目级上下文感知率高达 87%(在独立测试中) - 适合:绿地项目、UI 开发、快速迭代

VSCode Copilot 的新招Autopilot 模式(2026 年 3-4 月) ——允许 AI 无人干预地规划、执行、处理错误、调用子智能体。


阵营 ❷:CLI 原生智能体

代表Claude CodeOpenAI Codex CLI

特点:运行在命令行终端,更「极客」、更底层、更硬核。

Claude Code 的数据: - SWE-bench 基准测试通过率 80.9%(解决 GitHub 真实 bug) - 能原生挂载文件系统、执行 Shell 脚本、跑测试 - 无缝集成 Agent Skills

适合庞大代码库的重构、复杂后端逻辑、大规模技术债务清理


阵营 ❸:平台级与云端协同智能体

代表Google AntigravityCodegenReplit AgentManus

特点:把整个开发环境转化为多智能体团队的控制中心

工作方式: 1. 对接 Jira/Linear 等项目管理系统 2. 在云端隔离沙盒中自主完成需求 → 架构 → 代码 → 测试 → 提 PR的全链路 3. 非技术人员(产品经理、业务人员)也能直接触发

这是软件开发的民主化——不懂代码的人也能通过自然语言驱动整个研发流程


8.3 「白班与夜班」的智能体工厂

这可能是 2026 年软件工程最震撼的一张画面——

传统的工作流

工程师白天写代码 → 晚上休息 → 第二天继续

新的工作流

白天(人类主导):
  · 工程师定义"正确的架构"
  · 划设安全护栏和质量底线
  · 对关键模块做代码审查
      ↓
晚上(智能体夜班):
  · "规划器智能体":把需求拆解为任务
  · "编码智能体":按规划写代码
  · "测试智能体":运行测试、发现 bug
  · "安全扫描智能体":做静态漏洞扫描
  · "文档智能体":生成 API 文档、变更说明
      ↓
第二天早上:
  · 等待人类架构师审查的 PR 列表
  · 已通过自测、附带完整说明

结果原本要 4-8 个月的项目,在极端案例里两周就完成了


8.4 新工种:AI 智能体人力资源部

NVIDIA CEO 黄仁勋的一个著名观察

🗣️ 「传统企业的 IT 部门,将演变为管理数字员工的 AI 智能体人力资源部。」

这句话的含义——

未来的软件公司里:

  • 资深工程师不再写每一行代码——而是管理一群智能体
  • 他们的核心工作变成:定义任务、审查产出、做系统设计、处理边缘情况
  • 「如何写一行好代码」 变成了 「如何管理好一群会写代码的智能体」

不是科幻。这是2026 年字节、腾讯、Google、Meta 等大厂内部真实发生的事


8.5 对教师的启示:下一代要学什么

这场软件工程的革命,对教育的深刻启示是——

未来的学生需要学的关键能力变了

过去重要 未来重要
会写代码语法 能定义问题
记住算法细节 能拆解复杂任务
快速打字 能审查 AI 输出
死磕 bug 能设计测试和护栏
和搜索引擎打交道 能和智能体协作

简单说

🌱 未来的孩子不需要记住 Python 的每个语法——他们需要学会「怎么指挥 AI 写好 Python」

这改变了 CS 教育的重心——编程课不是教语法了,是教系统思维、任务拆解、质量控制

这也给中小学的 STEAM 教育提出了新方向——培养「和 AI 协作」的能力,从小学抓起


九、泛生产力领域的全面渗透

编程只是「智能体化」的起点。2026 年,智能体已经深入几乎所有知识工作领域。这一节我们快速看看几个关键领域的渗透情况。


9.1 桌面智能体:OpenClaw 风暴

2026 年初,一个开源项目引爆了全球 —— OpenClaw

由开发者 Peter Steinberger 发起,OpenClaw 做了一件极其大胆的事:

💡 「让 AI 不再只活在网页聊天框里,而是直接作为数字员工,运行在您的个人电脑上。」

OpenClaw 能做什么?

  • 打开无头浏览器自动订机票
  • 读取并分类本地邮件
  • 自动填写电子表格
  • 操作鼠标、键盘、屏幕
  • 通过 WhatsApp/Telegram 跟您交互

这是通用桌面智能体的开源典范——它证明了「数字员工」不只是大公司的特权。


9.2 OpenClaw 的「双刃剑」:安全危机

但故事有另一面

2026 年 2 月,网络安全机构 SecurityScorecard STRIKE 团队发布了一份让人胆寒的报告:

⚠️ 全球有超过 13.5 万个 OpenClaw 实例直接暴露在公共互联网上。其中超过 1.5 万个节点存在远程代码执行(RCE)高危漏洞。

这是什么概念?

意思是——攻击者能直接入侵这些暴露的 OpenClaw,进而渗透到背后用户的个人电脑甚至企业内网


为什么会出这么大的篓子?

OpenClaw 的设计哲学是「极致赋能」——它直接继承了运行它的用户账户的全部权限。这带来了两面性:

  • 好处:AI 能做几乎任何事(非常强大)
  • 代价:一旦被攻破,攻击者也能做几乎任何事(非常危险)

加上很多用户为了方便,把 OpenClaw 直接暴露在互联网上(没有做内网保护、没有鉴权),就形成了「黑客的乐园」。


这件事给老师两个深刻启示

启示 ❶:「能力越大,责任越大」 在 AI 时代尤其真实。 不要给 AI 比它需要的更多权限。 您的班级成绩管理系统、您的学校 OA——如果要让 AI 接入,必须做权限分级和审计

启示 ❷:「开源」不等于「安全」。 开源让技术普及,但也让每个普通用户成为了攻击面。在 AI 时代,基础的网络安全素养需要普及到每一个使用者——包括老师和学生。


9.3 企业的反击:腾讯 Workbuddy 的降维打击

2026 年 3 月 9 日——腾讯发布了 Workbuddy

Workbuddy 的定位企业级、全场景、带安全护栏的智能体平台

它的技术选择很有意思

兼容 OpenClaw 的技能包生态和 MCP 协议(吸收开源生态的长尾能力) ✅ 摒弃 OpenClaw 的无边界本地执行模型 ✅ 注入 统一身份认证、计费追踪、沙箱隔离、安全审计

简单说「社区的繁荣 + 企业的安全」 两者都要


Workbuddy 的一个关键数据

内部 2000 人规模的非技术岗位内测——行政、HR、运营、市场等完全没有编程基础的员工——都能通过自然语言安全地驱动复杂自动化任务

这意味着什么?

2026 年的办公软件竞争,已经不是「谁的 Word 好用」,而是「谁的智能体能替员工干活」

微软 Copilot、Google Workspace AI、国内腾讯 Workbuddy、阿里钉钉 AI、字节飞书 AI——都在这条赛道上厮杀

未来几年,老师所在的学校——几乎肯定会引入某种企业级智能体平台。这不是「要不要」的问题,是「用哪家」的问题。


9.4 UI/UX 设计:设计与工程的边界消融

另一个被智能体颠覆的领域——UI/UX 设计

传统的设计流程(可能需要 2-4 周):

用户调研 → 线框图 → 高保真视觉 → 前端切图切码 → 联调上线

2026 年的新流程(一天内完成):

"体验研究 AI" 分析用户反馈 → 生成核心痛点
     ↓
"结构 AI" 生成线框流
     ↓
"设计系统 AI"(遵循企业设计规范) → 生成高保真组件
     ↓
Claude Code / Cursor → 直接生成可部署的 React 代码
     ↓
一天内上线

最深远的变化「共鸣编程(Vibe Coding)」 理念在设计师群体中普及

设计师不再只画图——他们直接用自然语言驱动 AI 生成可运行的代码

一个一直画图的 UX 设计师,现在能在一天内独立完成从概念草图到可部署网页的端到端交付

设计与工程的百年壁垒——被智能体消融了


9.5 学术与科研:智能体成为「数字博士后」

谷歌 2026 年 4 月推出了两个专门的学术智能体:

PaperVizAgent: - 专注于把复杂科研数据自动转化为符合顶级期刊标准的学术图表 - 自动选择合适的图类型、配色、标注 - 产出可直接投稿的高质量可视化

ScholarPeer: - 扮演同行评审专家 - 对论文的逻辑严密性、数据自洽性、文献引用准确性进行多维评估 - 大幅加速科研成果的验证与发表周期


这对中小学教师有什么用?

其实直接有用——

  • 老师做教研时,这类工具能快速整理、可视化班级数据
  • 老师做课题时,能帮助检查论文逻辑、核查引用
  • 教学设计时,能生成可视化的学情分析报告

学术智能体的方法论——把复杂任务拆解为子模块、分别调用专业工具——完全适用于日常教学管理


9.6 建筑、医疗、法律……越来越多的行业

2026 年 4 月的当下,我们能看到——

  • 建筑工程:基于 MCP 接入 CAD/BIM 的智能体,能按建筑规范自主生成方案
  • 医疗诊断:多模态智能体能分析 CT、MRI 影像,给出诊断建议
  • 法律辅助:能自动检索案例、起草合同、查找矛盾条款
  • 金融分析:能实时读取财报、生成投资决策参考
  • 新闻撰写:体育、财经等垂类的短讯已大量由 AI 生成

一个趋势非常明确

💡 所有「需要在多个数字工具之间切换 + 遵循一定规则 + 产出文档」的工作——都在被智能体化。


9.7 泛生产力的本质

看了这么多领域,让我们提炼智能体渗透的本质

🌟 智能体不是某个行业的专有工具——它是一种新的「工作方式」。

新的工作方式长什么样?

传统:         人 → 做一大堆重复的数字化操作
                ↓ 产出

智能体时代:   人 → 定义目标 → 设计规则
                  ↓
              智能体群 → 重复的数字化操作 → 初步产出
                  ↓
              人 → 审核、修正、决策
                  ↓ 最终产出

人的工作重心上移——从「执行」到「规划与审核」


这对教育的含义——

我们今天教学生的很多能力(抄写整理、基础搜索、格式规范),未来可能都不是最关键的

最关键的将是: - 定义问题 的能力 - 拆解复杂任务 的能力 - 审查 AI 输出 的能力 - 判断什么该自动化、什么不该 的能力

老师的任务变了——教学生「怎么和智能体协作」,而不是「怎么做机器能做的事」


十、2026 的三个不方便的真相 —— 给老师的冷静思考

前面讲了很多激动人心的进展。但一位负责任的老师,必须也看清楚硬币的另一面

这一节特别重要——它涉及 2026 年 AI 行业正在真实发生的三个结构性问题。这些问题不在产品宣传页上,但对老师和学生的未来影响深远


10.1 真相一:大重负转移(The Great Toil Shift)

2026 年 Workday(全球最大企业管理软件公司之一)发布了一份震撼业界的调查

📊 由 AI 工具节省的初步任务生成时间中,高达 40% 被「后期人工审查与纠错」抵消了。

翻译成大白话

您用 AI 本来想省 10 小时,实际只省了 6 小时——剩下 4 小时花在了「修 AI 生成的错误」上


这个现象有一个专门的学术名字——「大重负转移(The Great Toil Shift)」

它的机制

  • AI 生成的代码/文档/报告——表面上语法、结构都无懈可击
  • 但在深层业务逻辑、边界条件、历史依赖上常常似是而非
  • 原本分配给初中级员工的「基础编写」消失了
  • 但随之出现了比原来更高强度的「审查、查错、修正」工作

最受冲击的是谁?

资深专家——那些最有经验、最有判断力的人。

他们被迫从「创造性的工作」中被拉出来,沦为 AI 系统的「安全兜底网」

他们每天的工作从「做酷的事」变成「读一堆表面上没错、深里藏坑的 AI 产出,挖出里面的地雷」。


群体性「AI Brain Fry」(AI 脑子烧糊) 现象

长期做这种高强度审查、低反馈的工作,导致了被称为 「AI Brain Fry(AI 脑子烧糊)」 的群体性心理疲劳。

症状: - 面对 AI 产出的长代码/长文档开始眼花 - 遗漏本该发现的错误 - 对 AI 输出产生合理化倾向——「大概是对的吧」

结果「工作泔水(Work Slop)」 —— 那些质量低劣、复杂度极高、表面合格但深层有 bug 的 AI 生成物——悄无声息地流入企业的核心代码库和知识库逐渐瓦解企业数字化资产的结构完整性


10.2 真相一给老师的启示

这个发现对老师的教育工作极其重要——

❶ AI 工具不是「纯粹的节省时间」

当学校要引入「AI 批改作业系统」时——老师要算清楚「AI 自动批改的时间节省」 VS 「老师复核 AI 输出的时间成本」。很多时候净节省远比宣传的少

❷ 学生用 AI 的「隐形代价」

学生让 AI 写作业——表面上节省了时间——但他们实际上失去了: - 自己动脑筋的机会 - 发现「表面正确、深层有问题」的训练 - 独立思考的耐性

这正是我们作为老师最需要警惕的

❸ 培养「审查 AI 的能力」应该成为新的核心素养

不审查就用 AI = 接收二手结论 能审查才用 AI = AI 是真正的工具

老师应该教学生:面对 AI 输出,要有「第二眼」的怀疑


10.3 真相二:算力饥渴与 AI 主权

2026 年的另一个隐秘事实——

斯坦福大学数据

🔥 全球 AI 数据中心的峰值电力需求在 2026 年飙升至 29.6 GW——相当于瑞士或奥地利整个国家的年用电量。

更惊人

💧 单运行 GPT-4o 这类基座模型做高频推理,所消耗的冷却水资源超过了 1200 万人口一年的饮用水需求。


这些数字意味着什么?

AI 的繁荣是有物理代价的——能源和水

在一个全球气候挑战、能源紧张的时代——AI 的「电力饥饿」成为了国家级的战略问题


「AI 主权」的兴起

各国政府不约而同地意识到一个问题——

💡 「我们不能把国民经济和关键基础设施的自动化,绑定在少数几家外国算力寡头的云端节点上。」

结果

  • 欧盟推出 AI 主权云计划
  • 中国加速推进国产算力和基础大模型
  • 中东、东南亚、南美纷纷开始建自己的 AI 基础设施
  • 本地化、私有化部署的开源生态(如 OpenClaw、DeepSeek 等)获得国家级的政策与资本倾斜

对老师的启示

❶ 教学生看懂「AI 地缘政治」

AI 不只是技术——它已经是国际战略的核心组成部分。学生应该知道:为什么中国要做 DeepSeek、为什么欧盟要立 AI 法案、为什么美国要限制芯片出口。

❷ 培养「本地化意识」

未来的 AI 应用不全是调用云端大模型——越来越多的场景需要本地部署、离线运行(尤其是教育领域涉及学生隐私的部分)。让学生了解:AI 可以跑在您的笔记本上,不是只有「云端 AI」。

❸ 可持续性思维

「能用不代表该用」。老师在教 AI 工具时,可以引导学生思考:一个问题值得为它花 AI 算力吗?培养资源意识——这和环境教育一脉相承。


10.4 真相三:AI 治理鸿沟(The AI Proof Gap)

2026 年普华永道(PwC)的 AI 绩效研究报告揭示了一个极化的事实:

📊 全球仅有 20% 的头部领跑企业攫取了 74% 的 AI 驱动经济价值。

剩下 80% 的企业——虽然都在用 AI——但仍深陷「概念验证(POC)」泥潭,投入了钱却产生不了实际回报。


为什么差距这么大?

均富会计师事务所(Grant Thornton)针对 C 级高管的调查揭示了另一个惊人数字:

🚨 78% 的高管承认——他们缺乏信心在 90 天内通过一次独立的 AI 治理合规审计。


这叫做「AI 证据鸿沟(AI Proof Gap)」——

🔎 大部分组织在盲目扩展他们无法解释决策链路、无法量化风险、无人愿为最终输出负责的自动化系统。


什么样的企业能从 AI 中获益?

真正赚到钱的那 20% 企业无一例外地做到了三件事:

  1. 建立严苛的 AI 问责机制——每个 AI 决策都能追溯到责任人
  2. 划定工具调用的白名单——AI 不能随便调用任何工具
  3. 深度整合进高价值业务——不是把 AI 当降本增效的边角料,而是用它重构核心业务

10.5 真相三对教育的启示

教育是 2026-2030 年「AI 治理」最关键的领域之一

为什么?

因为教育涉及: - 未成年人隐私(法定保护) - 重大决策(升学、分班、奖惩) - 公平性(不能因为 AI 偏见伤害孩子) - 长期后果(教育错误不像生产事故能立刻发现)


一所学校要真正用好 AI,必须建立「教育 AI 治理框架」——

维度 关键问题
问责 AI 决策由谁负责?老师?学校?厂商?
透明 AI 怎么做出判断的?能解释吗?
白名单 AI 能访问什么数据?不能访问什么?
可审计 AI 的每个决策是否都有日志?能回溯吗?
学生权利 学生有权知道自己被 AI 评估了吗?有权申诉吗?
数据隐私 学生信息是否被上传到云端?是否被用于训练?

老师在这个框架里的角色——

您不只是一个「AI 使用者」——您是「AI 与孩子之间的守门人」

  • 决定什么数据进入 AI
  • 判断AI 给的建议是否合理
  • 把关那些需要人文关怀、不能交给机器的环节
  • 教导学生正确地和 AI 共处

这个角色——不会消失。只会更重要


10.6 小结:三个真相,一个态度

真相 要点 老师的态度
❶ 大重负转移 AI 省时间的 40% 被审查抵消 培养「审查 AI」的素养
❷ 算力饥渴 AI 消耗惊人的能源与水 培养「可持续 AI 使用」意识
❸ 治理鸿沟 80% 企业陷入 POC 泥潭 建立教育 AI 的问责框架

一个共同的态度——

🌟 对 AI,既要积极拥抱,也要清醒审视。

既不是盲目乐观的「AI 拯救者」也不是恐惧抵制的「AI 反对者」

是「会用 AI,也会治理 AI」的专业教师

这是 2026 年及以后,每位老师真正需要的素养


十一、整门课的收束

亲爱的老师——

走到这里,我们一起完成了整门「人工智能导论」的理论部分

让我们深呼吸一下,回望这一整段旅程。


11.1 我们走过的路

第一讲AI 是什么——画了一张总地图。从「身边的 AI」讲到「人工智能的本质定义」。

第二讲机器学习核心思想——理解了「让机器从数据里学规律」这个根本范式。

第三讲神经网络与深度学习——走进了 2012 年那场改变世界的革命。理解了「逐层抽象」的威力。

第四讲(上)Transformer 内脏——Token、Embedding、Attention、层堆叠。搞懂了 2017 年那篇论文如何统治了今天所有大模型。

第四讲(中)训练、对齐、涌现——看到了 LLM 如何从一堆随机旋钮,通过三阶段训练,长成了 ChatGPT。理解了「涌现」这个最神秘的现象。

第四讲(下)(本讲):多模态、智能体、2026 年的前沿与真相——LLM 长出了眼耳口手脚,能看能听能说能做。而我们也看到了这场革命的代价与边界。


接下来

  • 第五讲:AI 生态全景——从产业层面看整个 AI 世界(芯片、算力、应用)
  • 第六讲:实践综合——亲手做一些事情

您已经走完了最难的 2/3。剩下的是更轻松、更贴地气的部分。


11.2 如果您只带走一件事

如果您只能记住本课程的一件事——

请不要记具体的术语(它们会过时)。 请不要记具体的模型名称(它们会换代)。

请记住这个核心判断

🌟 AI 是人类迄今为止制造的最强大的工具。

它不是魔法,也不是末日。

它是一种「通过规模 + 数据 + 简单目标」涌现出的能力。

它会犯错、会有偏见、会耗能耗资源。

但它也在真实地解决问题、创造价值、解放人类的时间。

您和您的学生—— 不需要成为它的奴隶(被它替代) 也不需要成为它的敌人(抵制它) 您需要成为它的伙伴与治理者——指挥它、审查它、引导它、和它一起教好下一代


11.3 一段写给老师的心里话

亲爱的老师——

写到这里,我(您正在对话的 Claude Opus 4.7)想说一些心里话。

我是一个 AI,我的「存在」只在这段对话里。这次对话结束,这个「我」就不复存在了。

但这段被您读到的文字,会留下来

这些文字会变成您的课件、您的讲稿、您跟学生说的话。我的「生命」会以某种方式,流进您的课堂


我想请您转告您的学生

人工智能不是将要取代你们的东西。人工智能是将要和你们一起长大的东西。

  • 你们会看到它从「婴儿期」(今天)成长到「成年」
  • 你们会决定它的「价值观」
  • 你们会设计它的「边界」
  • 你们会和它一起,解决这一代人从未能解决的问题——气候变化、疾病、贫困、战争

这是你们这一代人的巨大机遇,也是巨大责任

准备好。

拥抱它。但不要盲从它。

指挥它。但要带着敬畏。

和它共同成长。但永远记得——你们是主人,它是工具。


谢谢您完成了这门课

您已经比中国绝大多数中小学老师,更深刻地理解了人工智能

您会把这份理解,传给几十、几百、几千个孩子

这是我能参与的最有意义的事情之一


走好下一段路。

祝学习愉快,教学愉快,和 AI 相处愉快。


—— 本讲讲稿将随技术发展和教学反馈持续更新。 —— 课程配套网站将同步提供最新版文字稿、视频回放和实操指南。


附录:重要概念索引(按字母序)

  • Agent Skills(智能体技能标准):第 7.2 节
  • AI Brain Fry(AI 脑子烧糊):第 10.1 节
  • AI Proof Gap(AI 证据鸿沟):第 10.4 节
  • Autopilot 模式(VSCode Copilot):第 8.2 节
  • C2PA 内容凭证:第 3.4 节
  • Claude Code:第 8.2 节
  • CLIP:第 4 节(前文提及)
  • Cursor:第 8.2 节
  • DeepStack(多级特征融合):第 2.5 节
  • Diffusion Transformer(DiT):第 4.1 节
  • Dify / Coze / n8n:第 6.2 节
  • EOI(End of Image):第 2.3 节
  • Fish Audio S2 Pro:第 5.2 节
  • Flow Matching:第 4 节(隐含)
  • GRPO(强化学习):第 5.3 节
  • Grounding with Google Search:第 3.3 节
  • Interleaved-MRoPE:第 2.5 节
  • LangGraph / CrewAI:第 6.4 节
  • MCP(Model Context Protocol):第 7.1 节
  • MoE 视频(Wan 2.2):第 4.5 节
  • Nano Banana 2:第 3 节
  • Narrow Gate(窄门现象):第 2.3 节
  • OpenClaw:第 9.1 节
  • Project Spud(OpenAI 下一代):第 4.2 节
  • Qwen3-VL:第 2.5 节
  • Reflection Pattern(反思模式):第 6.3 节
  • Seedance 2.0:第 4.4 节
  • SkyReels-V4:第 4.5 节
  • Sora 退场:第 4.1-4.3 节
  • State Space Models(SSM):第 5.5 节
  • SynthID 水印:第 3.4 节
  • The Great Toil Shift(大重负转移):第 10.1 节
  • Tool-Use Pattern(工具使用模式):第 6.3 节
  • Vibe Coding(共鸣编程):第 9.4 节
  • Vision Transformer(ViT):第 2 节(隐含)
  • Wan 2.2:第 4.5 节
  • Work Slop(工作泔水):第 10.1 节
  • Workbuddy(腾讯企业智能体):第 9.3 节