第三讲 · 神经网络与深度学习
手机相册里的看图、搜图与生成
第 1 节 · 3 分钟导读:手机相册里的 AI
封面:手机相册里的 AI

这一页的作用是把本讲的技术主题落到一个人人都熟悉的生活入口:手机相册。我们不从公式、模型名、论文开始,而是从一个非常具体的问题开始:手机相册为什么能在几千张照片里找到“猫”?
请先注意副标题:“机器怎样自己学会看见一只猫?”这句话里最重要的词是“自己学会”。传统程序通常是人写规则,机器照着规则执行;深度学习的变化是,人不再把“什么是猫”的全部规则写出来,而是给模型大量照片和答案,让模型在训练中自己找到有用线索。
本讲会沿着同一条主线展开:先看相册如何认猫狗,再看它如何搜索照片,再看它如何生成一张猫图,最后讨论它为什么会出错、为什么不能盲信。学习时请始终带着这个问题:每一个新术语,到底在手机相册系统中负责哪一步?
今天先记住这一句话

这一页是全讲的“压舱石”。深度学习可以被一句话概括:用很多层神经网络,让机器从原始数据里自动学出层级化特征表示。这句话看上去长,但可以拆成三部分理解。
第一是“很多层”。深度学习不是一个大规则,也不是一个单独判断器,而是很多层计算单元逐层处理信息。第二是“自动学特征”。以猫狗照片为例,人不用手写“猫耳朵尖、胡须多、眼睛圆”的规则,模型会在大量照片中自己发现哪些线索有用。第三是“层级化特征表示”。模型不是一下子看见“猫”,而是先看到边缘、纹理,再组合成耳朵、眼睛,最后形成猫的概念。
这也是为什么这节课不急着背 CNN、Transformer、Diffusion 等模型名。名字会很多,但核心只有一个:深度学习的强大来自“多层网络自动学表示”。只要这一句话抓住,后面的每个架构都能放回同一张地图里理解。
一条主线:手机相册里的猫狗 AI

这一页说明整节课的组织方式。我们尽量不在不同案例之间来回跳,而是把所有概念都放回同一个系统:手机相册里的猫狗 AI。
第一段讲“神经元”。神经元可以理解成一个小判断器:某个线索够强,它就亮起来。第二段讲“层”。一张照片从像素进入模型,经过很多层,逐渐变成边缘、纹理、部件和整体对象。第三段讲“训练”。模型不是天生会认猫,而是在认错之后把错误反向传回去,慢慢调整权重。第四段讲“四大架构”。CNN 负责看图,Transformer 负责读搜索词和做图文对齐,Diffusion 负责生成图像,RNN/LSTM 作为历史角色帮助理解序列模型。第五段讲“爆发与边界”。深度学习的爆发依赖算法、数据和算力,同时它也有黑箱、偏差和隐私问题。
学生看这页时,可以把它当作本讲目录。后面每讲到一个术语,都问一句:它在手机相册里到底做什么?这样就不会被模型名吓住。
- 深度学习一句话:用很多层神经网络,让机器从原始数据里自动学出层级化特征表示。
- 本讲主线是一部手机相册:认猫狗 → 搜照片 → 画猫 → 谈边界。
- 关键词是「自己学会」——人不再写死规则,而是给数据,让模型自己找有用的线索。
第 2 节 · 2 分钟开场:搜索「猫」凭什么能找出来
开场互动:搜索“猫”凭什么能找出来?

这一页适合用来开场提问。请学生想象自己的手机里有几千张照片:旅行照、孩子照、宠物照、截图、饭菜、风景。现在在相册搜索框里输入“猫”,系统为什么能把猫的照片找出来?
先让大家猜几种可能:它是不是看了文件名?是不是看了拍摄地点?是不是因为照片旁边有文字说明?这些解释有时成立,但并不能解释所有情况。很多照片没有文件名提示,也没有“猫”这个文字标签;有些照片只有半张猫脸,光线很暗,甚至猫躲在沙发下面,相册仍然可能找到。
这就把问题推到核心:相册并不是简单查关键词,而是对照片内容做了视觉理解。更准确地说,它把图片转成内部表示,再把这个表示与“猫”的概念或搜索词进行匹配。今天要解释的,正是这个“内部表示”如何从训练中学出来。
如果让你写规则:什么是猫?

这一页要让学生体会传统特征工程的困难。人类看一只猫,往往一眼就知道;但如果要写成程序规则,就会很快发现写不全。
比如说“猫有尖耳朵”,但很多狗也有尖耳朵,而且猫耳朵可能被遮住。说“猫有胡须”,但照片太小、逆光、侧脸时,胡须可能根本看不清。说“猫毛茸茸”,兔子、狗、玩具也毛茸茸,短毛猫还不一定明显。说“猫眼睛形状特殊”,角度、光照、闭眼、遮挡都会改变外观。
这说明一个重要事实:人类直觉很强,但很难把直觉完整翻译成规则。传统机器学习依赖人工特征,问题就在这里。深度学习的革命点不是“机器比人更会写规则”,而是把“写规则”这件事换成“从样本里学规则”。
- 相册搜「猫」不是查文件名或关键词,而是对照片内容做了视觉理解。
- 人一眼能认猫,却很难把直觉写成完整规则——这正是传统特征工程的困境。
- 深度学习的革命点:把「写规则」换成「从样本里学规则」。
第 3 节 · 4 分钟照片在机器眼里,先是一堆数字
一张猫照片,在机器眼里先是一堆数字

这一页是从生活经验进入数学输入的桥梁。前一页我们问“什么是猫”,但如果不先说明机器到底看到了什么,后面的 x、w、像素、特征都会显得有点悬空。请先抓住一句话:人眼看到的是猫,机器接收到的是数字。
左侧可以先看“人眼看到的照片”。我们一眼会说:这是一只猫,有耳朵、眼睛、胡须、毛色和姿态。但这些词都是人的概念,计算机刚拿到图片时并没有这些概念。
中间把照片局部放大,可以看到一个个像素格。每个小格都记录颜色,通常可以拆成红、绿、蓝三个通道,也就是 RGB 数字。整张图就是一个巨大的数字矩阵。
右侧再把这些数字送入神经网络。神经网络处理的不是“猫”这个词,而是大量数字之间的关系:哪些地方亮暗变化明显,哪些区域颜色相近,哪些边缘组合成耳朵或眼睛。
这页的重点是:深度学习不是绕过数字,而是让机器从数字里一步步学出意义。后面讲神经元输入、权重、层和训练,其实都从这一步开始。
传统特征工程撞上的三堵墙

这一页把上一页的猫狗例子推广到更一般的困境。传统方法的核心思路是:工程师先设计边缘、角点、纹理、颜色直方图等特征,再把这些特征交给分类器。但这样做有三个问题。
第一,规则难写全。复杂对象有太多姿态、光照和背景变化,人很难预先设计足够完备的特征。第二,换任务要重写。识别猫狗、识别人脸、识别车牌,看似都是视觉任务,但过去往往要为每个任务单独设计特征。第三,上限受人限制。模型只能在“人想到的特征”上做分类,如果关键线索没有被写进去,模型再努力也很难突破。
2012 年之后,表示学习改变了这套流程。原始像素可以直接进入深度网络,网络自己在训练中学出从低级到高级的特征。人的工作从“逐条写特征”转向“准备数据、设计目标、检查边界”。这也是深度学习真正改变 AI 工作方式的地方。
一次 ImageNet 比赛,把 AI 的工作方式改写了

这一页是历史背景。2012 年不是神经网络第一次出现,但它是深度学习真正爆发的标志性年份。那一年,AlexNet 在 ImageNet 图像识别比赛中大幅领先传统手工特征方法,计算机视觉领域因此发生转向。
2012 年以前,研究者像“手工做教具”一样,设计 HOG、SIFT 等特征,然后把特征交给分类器。这种方法可解释、数据要求相对较低,但面对复杂图像、复杂光照和复杂姿态时,特征很快不够用。
2012 年之后,深度卷积网络直接处理原始图像,让网络自己学出边缘、纹理、部件和物体的层级表示。这里不是说人完全不重要,而是人的工作位置发生变化:从“写规则”转向“提供数据、设计网络、定义目标、评估风险”。
这页还可以强调四个关键词:大量图片、深层网络、GPU 训练、错误率下降。它们共同说明:深度学习爆发不是单一原因,而是算法、数据和算力同时成熟的结果。
- 在机器眼里,一张照片先是一个巨大的 RGB 数字矩阵。
- 传统特征工程撞上三堵墙:规则难写全、换任务要重写、上限受人限制。
- 2012 年 AlexNet 在 ImageNet 上的胜利,把「人写特征」改成「网络自己学特征」。
第 4 节 · 2 分钟相册里的四个 AI 能力,与训练数据
手机相册里的四个 AI 能力

这一页把整讲主线拆成四个能力。第一是“认猫狗”:一张照片进来,系统输出猫、狗、风景等类别的概率,这会引出神经元、层和 CNN。第二是“搜照片”:输入“草地上的狗”,相册找出匹配照片,这会引出 Transformer、图文对齐和向量空间。第三是“画一只猫”:从噪声开始,按提示生成一张新猫图,这会引出 Diffusion。第四是“保持清醒”:相册可能认错、学偏,也可能涉及隐私,这会引出黑箱、数据边界和人工复核。
学生可以把这一页看成“产品能力地图”。深度学习不是孤零零的算法,而是被拆成不同岗位,嵌入到真实应用中。我们不是为了背模型名而学模型名,而是为了理解:一个 AI 产品背后,通常有不同架构负责不同工作。
AI 不是靠一张图开悟,而是看很多“照片 + 答案”

这一页解释训练数据长什么样。手机相册能认猫狗,不是因为它看了一张猫图之后突然开悟,而是因为训练阶段看过大量样本,而且很多样本带有正确答案。
左侧是一批照片:猫、狗、风景、室内、人物、草地等。对模型来说,每一张照片都是一个样本。中间给每张照片加上标签,比如“猫”“狗”“风景”。这些标签就是模型学习时的标准答案。
右侧是训练循环的雏形。模型一开始可能会乱猜,比如把狗预测成猫。它把预测和真实标签一对比,就能知道自己错了多少。后面的损失函数、反向传播、梯度下降,本质上都是围绕“错了以后怎么改”展开。
这里可以用学生学习作类比。学生不是看一道例题就学会,而是做题、对答案、订正、再练。训练数据就是 AI 的练习册,标签就是答案,损失就是错题分数,反向传播就是订正过程。
还要提醒:数据多不等于数据好。角度、光线、遮挡、品种、背景都要丰富,否则模型容易只会背特定样子,不能泛化到新照片。
- 相册四能力:认猫狗、搜照片、画猫、保持清醒(边界),分别对应不同架构。
- AI 不是看一张图开悟,而是看大量「照片 + 答案」训练出来的。
- 数据多 ≠ 数据好:角度、光线、遮挡、品种都要丰富,否则学不会泛化。
第 5 节 · 7 分钟神经元:一个小判断器
神经元,一个小判断器

这一页是第一部分的章节页。它提醒学生:神经网络虽然听起来很复杂,但最基本的计算单元其实很简单,就是“神经元”。
本章要回答两个问题。第一,一个神经元到底做什么?第二,为什么大量简单神经元连接起来,会形成复杂能力?可以先把神经元想象成一个小判断器:输入很多线索,它根据线索的重要程度做一个综合判断。如果证据够强,就输出一个信号;证据不够,就不输出或输出很弱。
这页也提前埋下“权重”的概念。深度学习中真正被训练出来的,主要就是大量权重。看懂一个神经元如何使用权重,就能理解后面训练为什么是“不断调旋钮”。
生物神经元:信号够强才放电

这一页用生物神经元作直观入口,但需要强调:深度学习只是借用了大脑的启发,并不是完整复制大脑。
可以这样理解:生物神经元从树突接收来自其他神经元的信号,不同信号有强有弱。细胞体把这些信号综合起来,如果总信号超过某个阈值,就会沿着轴突向下一级神经元传递信号,也就是“放电”。如果总信号不够强,它就保持相对沉默。
把这个过程类比成“投票开关”很容易讲:很多线索一起投票,票数够了,开关就亮;票数不够,开关就不亮。人工神经元把这种直觉变成了数学形式:输入、权重、求和、激活。
一定要避免一个误解:人工神经网络不是人脑复制品。它只是借用了“很多简单单元连接起来可以产生复杂能力”的思想。今天的深度模型本质上仍然是数学机器。
一个人工神经元的四步

这一页是人工神经元的核心结构。可以按四步讲:输入、加权、求和、激活。
第一步,神经元接收输入线索,比如边缘、纹理、颜色、位置。第二步,每条线索乘以一个权重。权重表示这条线索有多重要。第三步,把所有加权后的线索加在一起,再加上一个偏置 b。偏置可以理解为整体阈值或基础倾向。第四步,把求和结果送入激活函数 f(z),决定这个神经元是否“亮起来”。
公式 z = w1x1 + w2x2 + ... + b,输出 y = f(z),可以轻轻带过。重点不是让学生计算,而是让学生看懂:神经元并不神秘,它只是把不同线索按重要性加起来,再做一次判断。
这页最关键的理解是:权重是可学习的。训练神经网络,其实就是让这些权重在数据推动下慢慢变成合适的值。
把神经元想成一个“猫耳探测器”

这一页用“猫耳探测器”把抽象的神经元讲具体。一个神经元未必能直接认出整只猫,它可能只负责一个很小的线索,比如“这里是否像猫耳”。
输入线索可以包括:有没有尖角边缘、左右是否对称、位置是否在头顶附近、周围是否有毛发纹理。神经元把这些线索加权求和,如果证据足够,就输出“这里可能有猫耳”。注意,它不是说“这一定是猫”,而只是对某个局部线索比较敏感。
这页一定要强调:深度网络不是靠一个神经元认猫,而是靠大量小线索逐层组合。一个神经元像一个小探测器;很多探测器一起工作,才能形成对猫脸、猫身、整体对象的判断。
权重决定:AI 更重视哪些线索

这一页解释权重的直觉。权重可以理解为模型对某条线索的“重视程度”。训练的本质,就是在大量样本和错误反馈中不断调这些重视程度。
如果耳朵、胡须、眼睛、脸型等线索经常帮助模型答对,这些线索相关的权重会逐渐变大。如果某些颜色、局部噪声、偶然纹理不能稳定帮助判断,权重会慢慢降低。更需要警惕的是误导线索:如果训练集中很多狗都在雪地里,模型可能把“雪地背景”误当成狗的重要特征。
这就是为什么数据分布非常重要。模型不是天然知道哪些线索“本质上正确”,它只会根据训练数据里的统计关系调权重。如果数据偏了,权重也可能偏。
可以用“调旋钮”来记:每条线索都有一个旋钮,训练就是反复预测、反复纠错,把每个旋钮调到比较合适的位置。
激活函数:证据够了才亮起来

这一页说明激活函数为什么重要。没有激活函数,很多层加权求和叠在一起,数学上仍然等价于一次加权求和。也就是说,再多层也只是一个线性模型,表达能力会很有限。
可以用“尺子”和“弯路”的类比讲。没有激活函数的网络像只会用直尺画线,很难表达复杂边界。猫狗识别中,真实边界往往非常弯曲:猫耳、胡须、眼睛、脸型、姿态、背景遮挡共同影响结果。激活函数让每一层都能做一次“非线性转弯”,从而把简单线索组合成复杂规律。
这页不需要深入讲 Sigmoid、ReLU 等具体公式。学生只要记住:激活函数不是装饰,也不是为了让图好看,而是为了让网络能表达复杂规律。没有它,深度网络的“深”就很难发挥出来。
Softmax:把分数变成一组概率

这一页解释分类任务最后一步。神经网络最后通常先给每个类别一个原始分数,比如猫 4.1、狗 1.2、兔子 0.3。这些分数本身不是概率,不能直接解释成“猫的可能性是 4.1”。
Softmax 的作用是把这一组分数压成一组加起来等于 1 的概率,例如猫 92%、狗 6%、兔子 2%。这样相册就可以排序、筛选和给出置信度。如果“猫”的概率最高,相册就把这张照片归到猫相关结果里。
但这里要埋一个很重要的提醒:概率高不等于绝对正确。92% 只是模型根据当前数据和训练经验给出的置信度,不代表它一定理解了,也不代表结果没有风险。后面讲黑箱和边界时,这句话还要再回来。
- 一个人工神经元 = 加权求和 + 激活:证据够强才「亮」起来。
- 权重决定 AI 更重视哪些线索——训练调的就是这些权重。
- Softmax 把一组分数变成概率,于是模型能输出「猫 92%,狗 8%」。
第 6 节 · 8 分钟层:从像素一步步「看」出一只猫
层,从像素到猫

这一页是第二部分的章节页。它提醒学生:深度学习真正的力量,不在单个神经元,而在很多神经元组成的层,以及层与层之间的逐步组合。
如果只看一个神经元,它很简单,只能做一个小判断;如果把很多神经元排成层,再把很多层堆起来,模型就能从低级线索逐步形成高级概念。猫狗识别的关键不是“某个神经元突然看懂了猫”,而是像素、边缘、纹理、部件、整体类别一步步形成。
这一章的关键词是“逐层抽象”。这是本讲最重要的概念。学生如果只记住一个思想,就记住:深度学习让机器从原始数据中自动学出层级化表示。
多层感知机:最基础的神经网络

这一页介绍 MLP,也就是多层感知机。它是最基础的神经网络形式:输入层接收信息,隐藏层做变换,输出层给出答案。
输入层可以接收像素、词向量或结构化特征。隐藏层是重点:每一层都会把上一层的表示做一次变换,低级线索逐渐组合成更高级的表示。输出层则把最后的表示转成具体任务答案,比如猫/狗概率、搜索相似度或生成条件。
学生不需要记住 MLP 的全部数学,只要明白:多层网络就是把很多“加权求和 + 激活”的单元串起来。每条连线是权重,每个节点是一个小判断器。整个网络通过层层变换,把原始输入变成更有意义的表示。
这也解释了为什么 GPU 对深度学习重要:这些层的底层计算大多是矩阵乘法,GPU 擅长并行处理这些重复计算。
一层层“看”出一只猫

这一页是整讲的灵魂页。看图时请从左到右读:原始图片进入模型后,先变成像素,再形成边缘线条,再形成纹理和轮廓,再提取耳朵、眼睛、胡须等部件,最后形成“猫”的概念。
最震撼的地方是:没有人明确告诉网络“先看边缘,再看猫脸”。网络是在大量图片和正确答案的训练中,自己学出了这个顺序。这就是表示学习。传统方法需要人设计“先看什么”,深度网络则能从样本中学到一套层级结构。
这页可以和人的视觉直觉联系起来。我们看猫时,好像一眼就看懂,但大脑其实也会处理边缘、形状、部件和整体。深度网络把这种逐层处理变成了可训练的数学结构。
学习这页时,学生只要记住一句话:深度学习不是一眼认出猫,而是从低级线索逐层抽象成高级概念。
每一层只做一点点,合起来就很强

这一页把“逐层抽象”拆成六步。第一层是像素,只有 RGB 数字,本身没有语义。第二层是边缘,发现明暗交界和轮廓线。第三层是纹理,看到毛发、斑纹、曲线。第四层是部件,组合出眼睛、耳朵、胡须。第五层是整体,形成猫脸、猫身。第六层是类别,输出猫或狗的概率。
这页的重点不是每个层级的具体名称,而是层级化组合的思想。每一层只做一点点,但后一层可以复用前一层的结果,所以合起来就能表达复杂概念。
可以用学习汉字作比喻:先认笔画,再认偏旁,再认汉字,再认词语。深度学习的“深”,就是这种一层层搭起来的抽象。它不是把所有规则摊在一张大表上,而是把简单结构组合成复杂结构。
为什么“深”比“宽”更适合识别猫?

这一页对比两种思路:宽而浅,深而窄。
宽而浅的网络像把所有规则都摊在一张大表里,一层里堆很多神经元。它可能记住很多样子,但缺少层级组合。一旦出现新姿态、新光线、新遮挡,就容易失效。直觉上,这像让学生直接背所有题型,短期看似会做题,但迁移能力弱。
深而窄的网络每层学一层抽象。低层学边缘,中层学部件,高层学整体。后一层复用前一层结果,组合效率更高。同样的“耳朵”概念可以出现在不同猫、不同角度、不同背景里。直觉上,这像先学笔画,再学偏旁,再学汉字,结构更稳。
所以,深度网络的优势不只是层数多,而是能通过逐层抽象和组合复用,更稳健、更高效地识别复杂对象。
从 7 层到数百层:深度的历史进化

这一页帮助学生建立历史感。1998 年的 LeNet 有 7 层,主要用于手写数字识别。2012 年 AlexNet 有 8 层,在 ImageNet 上引爆深度学习。2014 年 VGG 做到 19 层,推动更深 CNN。2015 年 ResNet 用残差连接让网络可以达到 152 层。2017 年之后,Transformer 时代到来,模型能力不再只看层数,还要看参数规模、训练数据和表示能力。
这页要避免一个误解:层数越多不一定越好。真正重要的是模型能否学出有效表示,训练是否稳定,数据是否足够,能否在新样本上泛化。深度只是能力的一部分。
因此,“深度学习”的“深度”既是历史概念,也是方法特征。早期强调层数,今天更强调大量参数和复杂表示能力。
表示学习:特征不是写出来,而是长出来

这一页解释“表示学习”这个核心术语。传统机器学习里,人先把世界翻译成特征,比如猫耳长度、胡须数量、毛色直方图、眼睛位置。模型只在这些人工特征上学习。深度学习则让模型直接看原始数据,比如像素、音频波形、文字 token、视频帧,中间特征由网络自己学出来。
“长出来”是一个很好的比喻。特征不是程序员逐条写好交给模型的,而是在训练过程中逐渐形成的。低层表示边缘和纹理,高层表示部件和语义,最后形成可用于分类、搜索、生成的内部表示。
表示学习的本质是:把复杂对象变成机器可计算、可比较、可迁移的内部表示。照片、文字、语音、视频都可以变成向量,这些向量让模型能够比较相似度、做分类、做检索,也能迁移到新任务。
相册把照片变成“语义地图”

这一页用向量空间解释相册搜索。搜索“猫”时,相册不是简单翻文件名,而是在比较照片和文字的内部表示。
模型会把每张照片变成一串数字,这串数字可以理解为照片的“坐标”。在这个内部空间里,语义相近的内容会靠得更近:橘猫、猫脸、小猫会聚在一起;金毛、狗照片、奔跑狗会聚在一起;花草和公园也会在另一个区域。这样,当用户输入“猫”,系统也把“猫”变成向量,然后寻找离它最近的一批照片。
这页也可以连接人脸识别。人脸识别常常不是直接给出“是谁”,而是把人脸编码成向量,再和底库中的向量比相似度。相册搜索和人脸识别背后都有“表示 + 相似度”的思想。
需要提醒的是,这里的二维图只是示意。真实向量空间可能有几百到几千维,无法直接画出来,但直觉上可以理解成一张高维语义地图。
- 多层网络逐层抽象:像素 → 边缘 → 纹理 → 部件 → 整只猫。
- 每一层只做一点点,叠起来就能表达很复杂的概念——所以「深」比「宽」更有效。
- 表示学习:特征不是人写出来的,而是在训练中「长」出来的。
第 7 节 · 7 分钟训练:认错之后怎么改
训练,认错之后怎么改

这一页进入第三部分:训练。神经网络一开始并不会认猫狗,它的权重通常是随机或初始状态。它之所以后来变得有用,是因为在大量样本中反复预测、反复犯错、反复调整。
这里最重要的观念是:训练不是把知识直接灌进模型,也不是给模型讲“猫有胡须、狗有尾巴”。训练更像让错误反复回来调旋钮。模型每次给出预测,系统和真实答案比较,得到损失,再把损失反向传回网络,调整权重。
本章会依次讲前向传播、损失函数、反向传播、训练循环、梯度下降、过拟合与数据增强。它们都围绕同一个问题:模型认错之后,怎么变得更好?
前向传播:一张照片走到一个判断

这一页讲前向传播。所谓前向传播,就是数据从输入层进入,经过每一层计算,最后输出预测概率。
在猫狗识别中,输入是一张猫狗照片,最初只是像素矩阵。经过低层,模型提取边缘、颜色、纹理;经过中层,组合成耳朵、眼睛、胡须;经过高层,形成猫脸、狗脸、整体姿态等高级特征;最后输出概率,比如猫 85%、狗 15%。
前向传播只负责算出答案。每一层接收上一层的结果,做一次加权求和和激活,再把结果传给下一层。此时还没有真正的学习发生。如果模型只做前向传播,它只是给出预测,不会变得更好。真正让它进步的是后面根据错误反向调整权重。
记法很简单:前向传播 = 数据往前走;反向传播 = 错误往回走。
损失函数:预测离正确答案有多远

这一页解释损失函数。模型不是只需要知道“对”或“错”,还需要知道“错了多少”。没有这个度量,就不知道应该往哪里调整。
以页面中的例子为例,真实答案是狗,但模型预测猫 72%、狗 21%、兔子 7%。这不是简单错一个字,而是错得比较严重,因为模型把错误类别排到了第一。这样的损失会比较高,说明需要大幅调整。如果真实是狗,模型已经给狗 90%,那即使还不是 100%,方向也接近正确,损失就比较低。
训练目标不是让某一张照片的损失低,而是让大量样本上的平均损失越来越低,并且在新照片上也保持好。这就连接到泛化问题:训练集做得好不够,未见过的照片上也要可靠。
可以把损失函数理解成考试分数的反面:损失越高,说明模型越需要改;损失越低,说明模型越接近目标。
反向传播:把错误往回分配责任

这一页讲反向传播。真正难的不是知道模型错了,而是知道网络中几百万甚至几亿个权重,每个该改多少。
反向传播可以分成五步看:先发现预测错了,例如模型认为猫 72%,真实却是狗;再计算损失,把错误量化;然后从输出层往回传,把错误分配给前面的层;接着得到梯度,告诉每个权重应该往哪个方向调;最后更新权重,让下次少错一点。
不用数学的类比是考试复盘。考试平均分低,不是只责怪最后一个学生,而是从结果往回追:题目是否太难、教学是否有问题、备课是否漏洞、进度是否太快。反向传播也是从结果倒推各层责任,只不过它给每条连接线都算出具体调整方向。
数学上,反向传播靠链式法则。学生不必会推导,但要知道它让训练成为可能:一次从后往前的计算,就能得到所有权重的调整方向。
完整训练循环:错很多次,改很多次

这一页把训练过程整合成循环。训练不是一下子学会,而是一个重复数万次甚至更多次的过程。
第一步是前向:照片经过网络,得到预测概率。第二步是比对:预测结果与真实标签比较,得到损失。第三步是反向:误差从输出层传回去,算出梯度。第四步是更新:权重微调一点。然后换下一个 batch,再来一遍。
这页的关键是“一次只改一点,但重复很多很多次”。单次更新通常很小,看不出模型马上变聪明;但大量样本、大量循环之后,权重会逐渐被推到比较合适的位置。真正的“学习”就发生在这些微调里。
可以提醒学生:深度学习很强,但它并不是突然顿悟,而是大规模试错和优化的结果。模型能力背后是海量数据、海量计算和海量微调。
梯度下降:每次朝少错一点的方向走

这一页讲梯度下降。可以把损失想象成山谷里的高度,模型当前参数在某个位置,目标是走到损失更低的地方。梯度告诉我们“上坡方向”,梯度下降则朝相反方向走,也就是朝损失减少的方向走。
这里最重要的是学习率,也就是每一步走多远。学习率太大,可能一步跨得太远,越过最低点,甚至越学越乱;学习率太小,每次改得太少,虽然稳定,但训练会非常慢;合适的步长既能下降,又不会震荡。
这页不需要深入数学,学生只要抓住:梯度下降不是乱调,而是根据损失变化方向来调。训练技巧中很多方法都围绕“怎么走得更快、更稳、更不容易走偏”。
六个训练术语:听懂就够

这一页是术语认脸,不要求背英文定义,但需要知道它们在训练循环里的位置。
Epoch 是所有训练数据完整看一遍。Batch 是每次喂给模型的一小撮样本,因为一次全部喂入太大,一次只喂一个又太不稳定。Learning Rate 是学习率,也就是每次权重调整的步长。Optimizer 是优化器,决定如何利用梯度更新权重。Overfitting 是过拟合,训练集表现很好,新照片表现很差,像背题。Learning Curve 是学习曲线,用来观察训练损失和验证损失如何随训练变化。
可以提醒学生:这些词在新闻、论文、产品介绍里会反复出现。听到时不必紧张,只要能把它们放回训练循环:数据怎么喂、步子多大、怎么更新、是否背题、曲线怎么看,就够了。
- 训练循环 = 前向传播预测 → 算损失 → 反向传播分配责任 → 梯度下降调权重,循环很多次。
- 损失函数衡量「预测离正确答案有多远」。
- 反向传播 + 梯度下降,就是「认错之后,朝少错一点的方向改」。
第 8 节 · 3 分钟考试、过拟合与数据增强
模型真正考试,不是在训练集上

这一页是理解过拟合前必须补上的桥。很多学生听到“训练误差低”会自然以为模型已经很好,但机器学习和深度学习最关心的不是旧题,而是新题。
可以把所有数据切成三份。第一份是训练集,像平时刷题。模型会反复看这些照片,用它们来更新权重。第二份是验证集,像模拟考试。我们用它来选择学习率、模型大小、训练轮数等方案。第三份是测试集,像从没见过的期末考试。它最好最后才用,用来判断模型对新照片是否可靠。
这里要强调一个判断原则:训练集表现好,只能说明模型会做旧题;验证集和测试集表现好,才说明模型可能真的学到了规律。
如果一个模型在训练集上几乎全对,但在测试集上经常错,它就像学生把练习册答案背下来了,一换题就不会。这就是过拟合。
这页也能连接上一讲机器学习的项目流程:划分数据不是形式主义,而是为了防止我们被漂亮的训练分数骗了。
过拟合:它可能只是背下了训练照片

这一页讲泛化和过拟合。真正的学习,不是训练集上的猫狗都认对,而是新照片上也能认对。
左边的情形像“背旧题”。训练集里的猫狗都认对,但新照片一换角度、换光线、换背景就错。曲线上通常表现为训练误差继续下降,但验证误差后期上升。这说明模型越来越会迎合训练数据,却越来越不适应新数据。
右边的情形像“懂规律”。模型没见过的新猫、新狗、新背景,也能比较稳地判断。训练误差和验证误差一起下降,说明它学到的是更稳定、更可迁移的表示。
这页要让学生记住:模型真正的考试不是训练集,而是未见过的新数据。判断模型好不好,不看它会不会背训练照片,而看它在新样本上是否依然靠谱。
数据增强:让它见过更多同一只猫的变化

这一页讲数据增强。数据增强不是简单收集更多猫,而是把已有猫图做合理变换,让模型知道:这些变化不应该改变“这是一只猫”的判断。
比如,同一只猫可以旋转一点、裁剪只露半张脸、变暗成夜间光线、被沙发遮挡。通过这些变化,模型会少背具体照片,多理解稳定特征。它会知道头歪一点还是猫,只露半张脸仍然可能是猫,光线暗不等于不是猫。
教学类比是一题多变。题目的外观条件变了,但核心知识点没变。学生如果只背原题,一变就错;如果理解了知识点,多种变形都能做。数据增强对模型起到类似作用:让模型更关注本质线索,而不是背景、位置、亮度等偶然条件。
- 模型真正的考试在它没见过的测试集上,不是训练集。
- 过拟合 = 把训练照片「背下来」,换张新图就失灵。
- 数据增强:旋转、平移、缩放,让模型见过同一只猫的更多变化。
第 9 节 · 7 分钟四大架构:相册里的不同岗位
四大架构,相册里的不同岗位

这一页进入第四部分:四大架构。这里的学习方法不是孤立背模型名,而是先看它们在同一个产品里分别做什么。
在手机相册这个系统中,CNN 像“眼睛”,负责看图、识别局部纹理和图像结构;Transformer 像“读关系的人”,负责理解搜索词、做图文对齐和多模态建模;Diffusion 像“生成画师”,从噪声一步步生成图像;RNN/LSTM 是历史角色,帮助我们理解早期序列模型如何处理前后文;MLP 则像基础决策层,很多模型里最后仍有它的影子。
学生看这页时可以先放下年份和论文名,只记岗位:看图、读文字、记顺序、做判断、生成内容。
先看岗位,再记模型名
这一页是架构地图。它把模型名翻译成岗位,这样学生更容易记住。
MLP 是基础决策层,把最后的表示转成分类、分数或概率。CNN 是视觉专家,用小窗口滑动,看局部纹理和图像结构。RNN/LSTM 是早期记忆专家,按顺序读句子或时间序列,记住前文。Transformer 是当今主干,用注意力同时建模远近关系,能处理文字、图像和多模态。Diffusion 是生成引擎,从噪声一步步去噪,生成图片或视频。
这页可以强调:架构不是考试背诵表,而是不同任务里的不同工作方式。看到一个 AI 产品时,先问它要做什么:看图?读文字?比相似度?生成内容?再判断可能用到什么模型。
CNN:手机相册的眼睛

这一页讲 CNN。CNN 最适合从图像中提取局部线索。它的核心直觉是:用一个小窗口在图片上滑动,把局部信息一步步组合成整体判断。
第一个关键词是局部连接。眼睛、耳朵、胡须都出现在局部小区域,没有必要一开始看整张图。第二个关键词是参数共享。同一个“眼睛探测器”可以在整张图上复用,不管眼睛出现在左上还是右下。第三个关键词是逐层抽象。第一层看边缘,后面看纹理、部件、物体,这就是“看出猫”的路径。
这页可以让学生把 CNN 记成“相册的眼睛”:它不是凭空理解猫,而是在图像上反复扫描局部模式,再把局部线索组合成整体判断。
CNN 看图的三件事

这一页把 CNN 的流程拆成三件事。第一是卷积:小窗口从左到右、从上到下滑动,寻找局部模式,比如边缘、曲线、纹理。第二是池化:把相邻区域的信息压缩一下,保留重要信号,同时降低尺寸和计算量。第三是分类:前面学到的图像表示进入输出层,得到猫、狗、风景等概率。
课堂上不需要推卷积公式,抓住两个词就行:局部、复用。局部表示 CNN 不一开始看整张图,而是从小块开始;复用表示同一个探测器可以在图片不同位置使用。
这也解释了为什么 CNN 很适合图像:图像中的模式常常具有位置平移性,比如眼睛在哪里都还是眼睛,毛发纹理在哪里都还是毛发纹理。
RNN / LSTM:早期的记忆专家

这一页讲 RNN 和 LSTM。它们适合处理序列,也就是有先后顺序的数据,例如句子、语音、时间序列。
页面中的句子“我看见一只小狗在跑”可以用来说明。RNN 从左到右读词,每读一个词都会更新一个“记忆状态”。读到“在跑”时,模型需要记住前面出现过“一只小狗”,否则很难理解动作主体。这个记忆状态就是 RNN 的核心。
但 RNN 有两个痛点。第一,句子一长,早期信息容易衰减,前面的内容被慢慢忘掉。第二,它必须顺序处理,不能很好并行,训练很慢。LSTM 用门控机制缓解了遗忘问题,但没有从根本上解决并行效率问题。
因此,Transformer 后来取代了它们在主流自然语言处理中的地位。不过了解 RNN 很有价值,因为它帮助我们理解“序列记忆”这个历史问题。
Transformer:手机相册开始读懂搜索词

这一页讲 Transformer 的直觉。手机相册不只要看图,还要读懂用户输入的搜索词,比如“找一张去年在草地上拍的狗”。这句话里,模型要同时理解时间、地点、对象和动作。
RNN 的读法是从左到右一个词一个词读,直观但长句里前面信息会变淡,也不容易并行。Transformer 的读法是每个词都可以同时“看见”其他词,并计算自己应该更关注哪些词。这就是自注意力。
例如“草地”和“狗”有关,“拍的”和照片任务有关,“去年”提供时间条件。Transformer 不必等词一个个传递记忆,而是直接建立远近词之间的关系。这样既能处理长距离依赖,也能并行训练。
一句话记法:Transformer 让每个词都能看全句,而不是只接着前一个词往下读。
自注意力:每个词都能看见其他词

这一页进一步解释自注意力。注意力不是神秘的“意识”,也不是人类注意力的完整模拟,而是一种计算相关性的机制。
读“找 草地 上 奔跑 的 狗”时,模型会计算哪些词互相关联。草地和狗相关,奔跑和狗相关,找和整体任务相关。注意力矩阵用数字表示这些关联,颜色越深,关联越强。
它强在两个方面。第一,不管两个词隔多远,都能直接建立关系;第二,整句话可以并行计算,训练效率高。更进一步,图片也可以切成图像块 token,文字 token 和图像 token 都进入注意力机制,就有了多模态模型。
学生只需要带走一句话:注意力 = 相关性计算;不是神秘的意识。理解这一点,后面学习大语言模型会轻松很多。
图文搜索:图片和文字进入同一个表示空间

这一页讲图文搜索背后的表示对齐。相册能找“草地上的狗”,靠的是图片表示和文字表示进入同一个空间后进行相似度匹配。
图片编码器把照片变成向量,表达这张图里有什么对象、场景和关系。文字编码器把搜索词也变成向量,表达用户到底想找什么。系统比较图片向量和文字向量,越接近的图片越可能排在搜索结果前面。
这不是简单查关键词,也不是模型“真正像人一样理解生活”。更准确地说,模型在大量图文配对数据中学会了哪些图片和哪些文字经常对应。因此它能把“草地上的狗”这个文字请求,匹配到草地里奔跑的狗照片。
这页可以帮助学生把“表示学习”与实际产品连接起来:只要不同模态能对齐到同一个向量空间,搜索、推荐、问答、多模态理解就都有了基础。
- 不要背定义,先问岗位:它在看图、读关系,还是做最后判断?
- CNN 是相册的眼睛,用小窗口滑动看局部,逐渐组合出物体。
- Transformer 靠自注意力让每个词都能看见其他词,是读懂搜索词、做图文对齐的关键。
第 10 节 · 7 分钟三种任务、Diffusion 与人脸识别
认猫、搜猫、画猫,是三种不同任务

这一页是从图文搜索进入 Diffusion 前的刹车页。前面一直围绕猫狗照片,但 AI 做的事情其实已经变了:有时是识别,有时是搜索,有时是生成。
第一类任务是“认猫”。输入是一张照片,输出是猫、狗、风景等类别概率。这里的核心是视觉理解,常见岗位是 CNN 或视觉模型,最后再用分类层给出判断。
第二类任务是“搜照片”。输入变成一句话和一个相册,例如“草地上的狗”。系统要把文字和图片都变成向量,再比较它们是否说的是同一件事。这里的重点是匹配,不是简单分类。
第三类任务是“画猫”。输入是一句提示词,输出是一张新图片。它不是在相册里找到旧照片,而是从噪声开始一步步生成内容。这里对应的就是 Diffusion 等生成模型。
所以,同样围绕猫狗照片,背后任务完全不同:识别是判断,搜索是匹配,生成是创造。学生只要把这三件事分清,CNN、Transformer、Diffusion 就不会混在一起。
Diffusion:从噪声里画出一只猫

这一页讲 Diffusion,也就是扩散模型。前面讲的是 AI 认猫:从照片中判断类别。现在方向反过来:让 AI 从随机噪声开始,逐步生成一张猫图。
训练时,模型学习“清晰图加噪声”的过程:一张清晰图片被不断加入噪声,直到几乎看不出原图。生成时,模型反过来做:从纯噪声开始,每一步去掉一点噪声,逐渐形成轮廓、纹理、局部细节,最后得到清晰图像。
可以把它想成“从一团雾里慢慢擦出图像”。Diffusion 的关键不是搜索现有图片,而是根据提示和训练中学到的图像分布,逐步创造新图。它是今天图像和视频生成的重要基础。
从猫狗识别到人脸识别:也是深度学习吗?

这一页回答很多人会自然产生的问题:进校人脸识别是不是深度学习?答案是:是,通常属于计算机视觉中的深度表示学习加相似度比对。
猫狗分类的流程是:输入照片,输出类别,比如猫、狗、风景。人脸识别的流程更常见的是:先检测人脸,裁剪对齐,再由视觉模型提取人脸特征,把人脸编码成一个向量,最后与授权底库中的向量做相似度比较。如果相似度高于阈值,就可能判断为同一个人。
这和相册搜索有共同点:都是把复杂对象变成向量,再比较相似度。不同点是,人脸识别关乎真实身份和个人权益,风险比识别猫高得多。因此必须补上边界:授权、最小化采集、保存期限、人工复核、退出机制都很重要。
讲法上先肯定技术归属,再立刻转向伦理边界:识别人不是识别猫,风险等级完全不同。
人脸识别不是记住整张脸,而是提取稳定特征

这一页回应学生非常自然的好奇:为什么一个人换了光线、换了角度、甚至过几年,人脸识别仍然可能认出来?答案不是“系统记住了整张脸”,而是模型把人脸压缩成一种可比较的内部表示。
第一步,同一个人会有很多变化:正脸、侧脸、暗光、笑脸、几年后、胖瘦变化。肉眼看上去差别不小,但仍有一些相对稳定的结构,比如五官位置、脸部比例、局部轮廓和纹理。
第二步,视觉模型提取这些稳定线索。它不会只看一个点,而是综合眼睛、鼻子、嘴、脸型和相对位置等信息。
第三步,把人脸压缩成一串数字,也就是人脸向量。这个向量不是身份证号,也不是姓名,而是模型内部用来比较相似度的特征坐标。
第四步,新拍到的人脸向量会与人脸库中的向量进行相似度比对。如果某个候选人的相似度很高,系统就认为可能是同一个人。
第五步,必须做阈值判断和人工兜底。超过阈值不等于绝对正确;遮挡、口罩、极端光线、年龄变化、照片质量和数据偏差都会造成误识别。因此学校场景中尤其要关注授权、最小化采集、数据安全、误识别申诉和人工复核。
本页最重要的一句话是:人脸识别 = 看图提特征 + 压缩成向量 + 相似度比对 + 阈值判断 + 人工兜底。
四大架构在猫狗 AI 系统里的分工

这一页建议完全用“同一个猫狗 AI 系统”来讲四大架构,而不是把它讲成模型名背诵表。学生要记住的是岗位,不是孤立定义。
先看 MLP。它通常出现在最后几层,负责把前面提取到的特征综合起来,做分类或打分。例如前面模型已经提取到了耳朵、眼睛、毛发和整体轮廓,MLP 或分类头负责把这些信息合成“猫 92%,狗 8%”这样的输出。
再看 CNN。它是视觉专家,像一个小窗口在图片上滑动,一块一块看局部区域。它适合发现边缘、纹理、局部部件,再逐渐组合成猫脸、狗脸、人物和物体。手机相册识别猫狗、人脸、场景时,CNN 或其他视觉模型都在承担类似“看图提特征”的工作。
第三看 Transformer。它是关系理解专家。用户输入“草地上的狗”时,模型不仅要知道“狗”,还要理解“草地”和“狗”的关系,并把文字向量与图片向量对齐。Transformer 的核心优势是自注意力:每个词、每个位置都能看到其他位置,从而建模远距离关系。
第四看 Diffusion。它是生成引擎,不是检索已有图片,而是从噪声里一步步去噪生成新图。输入“戴博士帽的小猫”,系统不是在相册中找一张旧图,而是在生成一张新图。
RNN/LSTM 可以作为历史角色放在旁边。它曾经常用于文本和时间序列,帮助我们理解“按顺序处理”和“记忆状态”的思想;但今天很多语言和多模态任务已经被 Transformer 大量替代。
底部的人脸识别延伸可以这样讲:进校门禁通常也是视觉模型提取人脸特征,压缩成人脸向量,再与数据库比对。但识别人不是识别猫,风险等级完全不同,必须关注隐私、安全、误识别和人工复核。
本页最重要的提醒是:不要背定义,先问岗位。它是在看图、读关系、做最后判断,还是从无到有生成内容?
- 认猫(识别)、搜猫(匹配)、画猫(生成)是三种完全不同的任务。
- Diffusion 从纯噪声一步步去噪,「画」出一张新图。
- 人脸识别 = 提特征 + 压成向量 + 相似度比对 + 阈值 + 人工兜底;识别人不是识别猫,风险等级完全不同。
第 11 节 · 6 分钟为什么 2012 年后爆发,又如何通向大模型
为什么它突然爆发?

这一页进入第五部分:深度学习的爆发。神经网络并不是 2012 年才被发明,它的思想很早就有。真正的问题是:为什么它长期没有成为主流,却在 2012 年后像海啸一样席卷 AI?
答案不是某一个神奇算法,而是算法、数据、算力三者同时成熟。早期有算法思想,但数据不够大、算力不够强;有些时期有数据,但训练方法不稳定;有些时期硬件进步了,但还缺乏足够成熟的工具链。2012 前后,这些条件终于同时到位。
这页要帮助学生从“单点突破”转向“系统条件”的理解。深度学习爆发不是偶然,而是多个技术和产业条件叠加到临界点。
2012 爆发:算法 × 数据 × 算力

这一页解释深度学习爆发的三驾马车。第一是算法:反向传播、ReLU、Dropout、训练框架逐步成熟,让深层网络终于可以稳定训练。没有这些算法,网络再大也训不动。
第二是数据。互联网带来海量图片、文本和视频,ImageNet 这类大规模标注数据集成为视觉爆发的燃料。深度网络参数很多,必须见过足够多样的样本,才能学出稳健表示。
第三是算力。深度学习底层大量是矩阵运算,GPU 擅长并行计算,让训练速度大幅提升。如果没有 GPU,很多网络理论上能训练,实际上要耗费不可接受的时间。
所以,为什么不是 1943、1986 或 1998?因为那些时期三驾马车还没有同时到位。2012 的意义就在于,它们终于在同一个时间窗口汇合。
从识别图片,到多模态助手

这一页用时间线建立技术加速感。2012 年 AlexNet 带来视觉爆发;2015 年 ResNet 让网络可以更深;2017 年 Transformer 带来注意力革命;2020 年前后,大语言模型通过规模化训练展现强生成能力;2022 年之后,对话 AI、绘图 AI 和多模态产品走向大众。
这页的重点不是背年份,而是理解速度:深度学习的发展不是线性推进,而是多个领域快速叠加。图像识别、语言生成、图文理解、视频生成、智能体工具使用,彼此相互促进。
对学生而言,这也解释了为什么今天 AI 产品更新很快。它不是某一个 App 的功能变化,而是背后算法、数据、算力和产品生态一起加速。
模型规模:从小程序,变成一座城市

这一页建立参数规模的数量级感。参数可以理解成模型里可学习的“旋钮”。训练就是把这些旋钮调到合适位置。早期 LeNet 只有几万参数,AlexNet 到了几千万,BERT 到了几亿,GPT-3 到了千亿级,前沿模型则常常达到千亿到万亿级。
需要注意,参数越多不一定越聪明。模型能力还取决于数据质量、训练目标、架构设计、推理方式和对齐方法。但是前沿模型确实依赖巨大的规模,因为更大的参数空间可以容纳更丰富的表示。
这页还可以解释为什么算力重要。参数越多,训练时需要做的矩阵运算越多,消耗的 GPU、时间和成本也越高。因此大模型不仅是算法问题,也是工程和产业问题。
预训练 + 微调:先学通识,再学专长

这一页讲今天 AI 应用的标准范式。很多 AI 产品不是为每个场景从零训练一个模型,而是先在海量数据上预训练一个基础模型,让它具备通用的看、读、生成能力;然后通过微调、提示设计或知识库增强,把它适配到具体任务。
可以用教育类比解释。学生先学通识:阅读、表达、数学思维;再学专业:物理、编程、艺术。通识基础越好,迁移到新任务越快。同样,基础模型先学通用表示,再被训练成某个岗位,比如相册搜索、门禁识别或课堂工具。
产品类比也很重要。厂商通常不会为每个学校从零训练一个大模型,而是在已有模型基础上做适配。这也是为什么今天中小机构也能使用强 AI 能力:它们站在基础模型之上,而不是从零造“大脑”。
从猫狗 AI 到大语言模型,只是输入形态变了

这一页是第三讲和下一讲之间的桥。前面我们用手机相册讲深度学习:输入是像素,模型学图像表示,输出猫狗概率。下一讲我们要讲大语言模型,输入换成文字 token,模型学语言表示,输出下一个词的概率。
左侧可以看“图片 AI”。猫狗识别从像素开始,经过边缘、纹理、部件、整体,最后输出“猫 / 狗”的概率。右侧看“大语言模型”。文字会先被切成 token,token 进入 Transformer,层层形成词义、句法、语境和意图,最后预测下一个 token。
两者看起来应用不同,但底层逻辑相似:都把输入转成数字表示,都经过很多层计算,都通过大量数据训练,都以概率形式输出结果。
这页最重要的是打破神秘感。大语言模型不是另一套魔法,而是深度学习在文字任务上的巨大化版本。今天懂了“认猫”,下一讲理解“写文章”“对话”“推理”就会顺很多。
也可以提醒学生:Transformer 不只读文字。前面图文搜索已经说明,图片也可以切成图像块,文字也可以切成 token,它们都能进入统一的表示空间。这正是多模态模型的基础。
- 深度学习爆发是算法 × 数据 × 算力三者同时成熟,不是某个神奇算法。
- 参数规模从几万到千亿、万亿;但参数越多不一定越聪明。
- 今天的标准范式是预训练 + 微调:先学通识,再学专长。
第 12 节 · 5 分钟强大,但不要盲信:黑箱、偏差与隐私
强大,但不要盲信

这一页进入第六部分:深度学习的边界。前面我们一直在讲它为什么强:能自动学特征、能认图、能搜图、能生成图。现在要补上另一半:它能用,但不一定按我们希望的方式在学习。
这里要建立一个重要区别:准确率高不等于可信。模型可能在测试集上表现很好,但它学到的理由可能是错的;模型可能输出很高置信度,但在某些边界场景上仍然失败;越关乎人,越需要额外的解释、复核和责任机制。
这一章不是为了否定 AI,而是为了让使用者更专业。懂技术的人不是盲目崇拜,也不是一概拒绝,而是知道什么时候能用、怎么用、谁负责、哪里必须留人工兜底。
黑箱:它不是不会错,而是不告诉你为什么错

这一页解释黑箱问题。模型输出看起来很清楚:“这是一只猫,置信度 92%。”但内部过程隐藏在大量层、海量参数和复杂表示中。没有哪个参数写着“因为有胡须所以是猫”。
黑箱不是说模型不能用,而是说我们不能轻易把输出当成不需要解释的真理。做对时也要追问:它真的学会了猫,还是学会了“沙发上毛茸茸的一团”?做错时更要追问:错在数据、光线、角度、训练偏差,还是任务定义本身不清?
这页适合连接前面权重和表示的内容。模型内部是很多数字共同作用,强大但不直观。理解黑箱后,学生会更清楚为什么教育、人脸、医疗等场景不能只看准确率。
它会学最容易的规律,未必是正确的规律

这一页讲学错规律。深度学习不保证自动学到人类想要的因果关系,它常常学到训练数据中最容易利用的统计相关。
比如一个模型看起来会认狗,训练集准确率很高,产品演示也很漂亮。但它实际可能学偏:把雪地、牵引绳、拍摄角度当成狗的关键线索。一旦换成没有这些背景的新照片,它就可能失败。
降低风险的办法包括:数据要多样,评估要分场景,重要决策要有人复核。只看总体准确率不够,要看不同背景、不同光线、不同群体、不同设备下是否稳定。
这页的核心句是:准确率不等于可信度。模型可能答对了,但理由是错的。这个判断在教育 AI、人脸识别和学情预警中尤其重要。
手机相册和人脸识别里的数据非常敏感

这一页讲数据隐私。越贴近生活,越要注意隐私、授权和边界。
照片数据不仅是图片,它可能包含家庭成员、孩子、住址、旅行路线、生活习惯。需要问:是否上传云端?是否用于训练?谁能访问?人脸数据更敏感,因为人脸是生物特征,不像密码泄露后可以修改。需要问:是否必要?是否授权?保存多久?教育数据也很敏感,成绩、行为、家庭情况、课堂表现都可能影响学生权益。需要问:谁解释?谁纠错?谁最终负责?
这页不是说 AI 不能用,而是说底线问题不是“AI 能不能做”,而是“有没有必要、有没有授权、有没有退出和复核”。技术可行不等于教育上、伦理上、管理上都应该使用。
给教师和使用者的三条底线

这一页是边界部分的核心总结。第一条,黑箱不做重大决定。分班、奖惩、升学推荐、风险标签等关乎人的决定,AI 可以提供参考,但不能单独裁决。第二条,数据隐私是红线。学生照片、人脸、成绩、家庭信息都要最小化采集、明确授权、限制用途和保存周期。第三条,永远保留人工兜底。模型低置信、涉及权益、结果异常时,必须能由老师或负责人复核、修改和追溯。
这里要强调,三条底线不是阻止使用 AI,而是让 AI 被负责任地使用。越强大的工具,越需要制度性边界。
评估教育 AI 产品时可以用三句话:透明、可干预、可审计。透明意味着能解释基本依据;可干预意味着老师可以修正或覆盖;可审计意味着事后能追溯谁做了什么、依据是什么。
- 准确率高 ≠ 可信:模型可能答对了,但理由是错的。
- 黑箱:它能给结论,却不告诉你「为什么」。
- 三条底线:黑箱不做重大决定、数据隐私是红线、永远保留人工兜底。
第 13 节 · 2 分钟看懂一个 AI 产品:四问与五问
看到一个 AI 产品,可以这样问四个问题

这一页把技术理解变成可执行的判断清单。第一问:任务是什么?识别猫狗、验证身份、预测风险、生成内容,任务不同,风险不同。第二问:数据从哪来?训练数据是否覆盖真实场景?有没有偏差?有没有敏感信息?第三问:指标怎么看?只看总体准确率不够,还要看误识、漏识、不同人群和不同场景。第四问:谁来负责?模型错了谁解释?用户能否申诉?是否保留人工复核?
这张清单可以直接迁移到校园门禁、人脸考勤、智能批改、学情预警等产品。它让老师不只是“会用工具”,而是能判断工具是否适合进入教育场景。
学生看这页时可以记住:技术问题最终会落到责任问题。一个产品如果说不清任务、数据、指标和责任,就不应该轻易用于重要场景。
看一个 AI 产品,先问这五个问题

这一页把技术理解变成教师和管理者可以直接使用的检查清单。越强大的模型,越需要清晰的边界、解释和责任。
第一问:数据从哪里来?它用了哪些数据?照片、作业、成绩、语音、课堂行为是否被采集?这些数据是否经过授权,是否有最小化采集,是否有删除和退出机制?
第二问:输出依据是什么?AI 为什么这样判断?它能否展示关键证据、置信度或解释线索?如果模型只能给一个结论,却完全说不出依据,就不适合进入高风险决策。
第三问:老师能不能改?教育场景里,AI 输出应该是线索,不是裁决。教师是否能修改、覆盖、补充 AI 的判断,决定了这个系统是不是尊重教育专业性。
第四问:误判后如何追溯?出了问题以后,能不能查到输入数据、模型版本、输出记录和处理流程?没有追溯机制,就很难谈责任。
第五问:隐私怎么保护?学生数据尤其敏感。是否脱敏,是否加密,是否上云,是否用于再训练,是否能被第三方访问,都必须提前说清。
这页的核心不是反对 AI,而是让 AI 进入教育场景时有边界、有解释、有复核、有责任。AI 可以提高效率,但不能替人承担教育责任。
- 看到 AI 产品先问四问:任务是什么、数据从哪来、指标怎么看、谁来负责。
- 教师五问清单:数据来源、输出依据、能否修改、误判追溯、隐私保护。
- 技术问题最终会落到责任问题。
第 14 节 · 3 分钟复盘、课堂活动与参考文献
3 分钟复盘:今天带走三句话

这一页用于复盘。第一句话:深度学习的核心不是“像人脑”,而是多层网络自动学习特征。从像素到边缘、从部件到猫,模型学出层级化表示。第二句话:训练不是灌输知识,而是让错误反复回来调整权重。前向预测、计算损失、反向传播、梯度下降,循环很多次。第三句话:AI 很强,但准确率不等于可信度;越关乎人,越要保留边界。人脸识别、学情预警、教育评价都必须有人复核和隐私保护。
最后再回到最开始的主线:机器不是被写进了“猫的规则”,而是在大量样本中学会了“猫的表示”。这句话把整讲的神经元、层、训练、架构和边界串在一起。
这页也适合学生课后自查:如果能用自己的话解释这三句话,就已经掌握了本讲主体内容。
把“看见猫”变成亲手体验

这一页是课堂互动建议,也适合作为课程网站上的课后实践。
第一步,现场观察。让学员打开手机相册,搜索“猫”“狗”“草地”“人像”等词,看看哪些结果准、哪些不准。第二步,讨论误差。为什么有的照片没有搜到?可能是遮挡、光线、照片数量少、语义太抽象,也可能是相册模型本身能力有限。第三步,迁移到学校。如果换成门禁人脸识别、课堂表情识别,哪些问题会变成隐私、公平和责任问题?
活动目标不是验证某个产品好坏,而是让学员用今天的概念重新看 AI 功能。搜索结果准不准,可以连接到表示学习、图文对齐、泛化和黑箱;涉及人脸时,则要连接到授权、复核和边界。
主要参考文献与资料

这一页是参考资料,不必在课堂逐条讲,但对课程网站很重要。它把本讲背后的经典论文和课程内连接列出来,方便学生课后深入。
经典论文部分可以按历史线索理解:McCulloch & Pitts 1943 是人工神经元思想起点;Rumelhart、Hinton 和 Williams 1986 让反向传播系统化;Krizhevsky、Sutskever 和 Hinton 2012 对应 AlexNet 与 ImageNet;He 等 2015 对应 ResNet 和残差连接;Vaswani 等 2017 对应 Transformer;Ho 等 2020 对应扩散模型。
课程内连接部分提醒学生:第二讲的机器学习概念仍然是基础,特别是数据、特征、模型、损失、优化和泛化。第三讲则把这些概念放进神经网络与深度学习中,重点保留神经元、层、训练、CNN/Transformer/Diffusion 和黑箱边界。后续大语言模型课程会以 Transformer 为核心入口。
- 三句话复盘:自动学特征、训练靠反复纠错、强大但要守边界。
- 课堂活动:用手机相册搜「猫 / 狗 / 草地」,观察哪里准、哪里错,再迁移到校园场景。
- 经典脉络:1943 神经元 → 1986 反向传播 → 2012 AlexNet → 2017 Transformer → 2020 Diffusion。
第 15 节 · 2 分钟尾声:一句话记住整讲

这一页是收尾。整讲最终回到一句话:用很多层神经网络,让机器从原始数据里自动学出层级化特征表示。
可以请学生回想这句话如何在手机相册主线中展开:相册认猫狗,是从像素中学出视觉表示;相册搜照片,是把图片和文字变成可比较的表示;AI 画猫,是从噪声中生成符合提示的图像;谈边界,是提醒我们表示学习很强,但也可能学偏、误判、涉及隐私。
下一讲会进入大语言模型原理,重点看 Transformer 如何一步步长成 GPT、Claude、DeepSeek 这类大模型。今天讲的神经元、层、训练、注意力和表示学习,都是下一讲的基础。
结束时可以强调:理解深度学习,不是为了背公式,而是为了看懂当代 AI 产品背后的共同逻辑,并在教育场景中负责任地使用它。
课后思考题
- 用你自己的话解释「深度学习让机器自动学出层级化特征表示」——用手机相册认猫的例子说明「层级」体现在哪里。
- 为什么说「准确率高不等于可信」?举一个教育或校园场景,说明只看总体准确率可能漏掉什么。
- 认猫、搜猫、画猫分别对应 CNN / Transformer / Diffusion 的哪种「岗位」?它们的输入和输出有什么本质不同?
- 如果学校要引入一款人脸考勤产品,请用本讲的「四问 / 五问」清单,列出你最关心的三个问题。
与下一讲的衔接
下一讲《大语言模型原理》会以 Transformer 为核心入口,看它如何一步步长成 GPT、Claude、DeepSeek 这类大模型。今天讲的神经元、层、训练、注意力与表示学习,都是下一讲的基础——到时你会发现,「写文章」和「认猫」共享同一套底层逻辑。

- 一句话记住整讲:用很多层神经网络,让机器从原始数据里自动学出层级化特征表示。
- 下一讲进入大语言模型,把输入从像素换成文字 token,底层仍是表示、训练与预测。
- 理解深度学习,不是为了背公式,而是为了看懂 AI 产品背后的共同逻辑,并负责任地使用它。