Concept Helper
适合第一次学习
Attention 不是“看一个词”,而是“重写一个词”
每个词都会看全句,并把别的词的信息按权重混进自己的新表示里。热力图的一行,就是某个词在重写自己时借用了谁。
可以怎么观察选中 pronoun 例子里的 it,看语义 head 怎样把权重压到真正指代的名词上。
可以追问什么为什么同一个词在不同 head 里会关注不同对象?这些结果能完全解释模型吗?
Try It
一键课堂任务
建议先按任务 1 到 4 走一遍,再自由换句子和 head。每一步都对应 Transformer 公式里的一个部件。
一行热力图,就是一个词的“信息来源表”
行上的词是 Query,列上的词是 Key;颜色越深,代表这个词在更新表示时越依赖那一列。
Query--当前被重写的词
Top Key--最强信息来源
Top-3 Focus--前三个权重之和
Q/K/V 计算台:从相似度到新表示
同一个 token 会被投影成三种向量:Query 负责提问,Key 负责匹配,Value 负责携带内容。
Q:当前词要找什么--
K:最匹配词的线索--
V:最终混入的内容--
多头不是重复计算,而是并行看不同关系
下面四张小热力图使用同一句话、同一个 Query;切换左侧 head,会同步高亮主视角。
语义 Head
H0位置 Head
H1语法 Head
H2聚合 Head
H3数据是什么同一句 token 序列在不同投影矩阵下产生不同 Q/K/V。
学习目标让不同 head 捕捉互补关系,再拼接成更丰富的表示。
课堂问题如果所有 head 都学成同一种模式,模型会损失什么能力?
自回归生成:当前位置只能看见过去
写下一个 token 时,模型必须遮住右侧未来词;否则训练时就等于把答案提前塞给它。
下一个 token 候选
掩码解释
从词间关系迁移到课堂讲解
Attention 热力图适合做“模型在关联什么”的入口,但课堂上要同时讲清公式、局限和人类解释的边界。
阅读理解指代消解、长距离依赖、关键词回指都能用“当前词看谁”来解释。
代码理解变量名、函数调用和注释之间的依赖关系,会影响模型生成补全。
教学诊断热力图能引导追问:学生是否把概念、公式和例子真正连起来。
公式边界Attention 只是一层的一部分,残差连接、MLP 和后续层也会改变表示。
解释边界颜色深不等于因果证明,它更像一个可视化线索。
课堂活动让学生先预测热力图,再打开可视化对照,效果通常比直接讲公式好。