Experiment · Transformer Chapter

Attention:把一句话里的关系看见

从一个词的“提问”开始,观察它怎样寻找线索、分配权重、混合信息;再切到多头协作和自回归掩码,把 Transformer 里最关键的一步拆开看。

01 TOKENS一句话先变成 token 序列
02 QUERY当前词发出“我要找什么”
03 KEY其他词亮出“我有什么线索”
04 SCOREQ 和 K 点积得到相关性
05 SOFTMAX分数变成一行概率
06 MIX V按权重混合 Value 内容
Concept Helper 适合第一次学习

Attention 不是“看一个词”,而是“重写一个词”

每个词都会看全句,并把别的词的信息按权重混进自己的新表示里。热力图的一行,就是某个词在重写自己时借用了谁。

可以怎么观察选中 pronoun 例子里的 it,看语义 head 怎样把权重压到真正指代的名词上。
可以追问什么为什么同一个词在不同 head 里会关注不同对象?这些结果能完全解释模型吗?
Try It 一键课堂任务
建议先按任务 1 到 4 走一遍,再自由换句子和 head。每一步都对应 Transformer 公式里的一个部件。

一行热力图,就是一个词的“信息来源表”

行上的词是 Query,列上的词是 Key;颜色越深,代表这个词在更新表示时越依赖那一列。

Self-Attention
Query--当前被重写的词
Top Key--最强信息来源
Top-3 Focus--前三个权重之和

Q/K/V 计算台:从相似度到新表示

同一个 token 会被投影成三种向量:Query 负责提问,Key 负责匹配,Value 负责携带内容。

Scaled Dot-Product
Q:当前词要找什么--
K:最匹配词的线索--
V:最终混入的内容--

多头不是重复计算,而是并行看不同关系

下面四张小热力图使用同一句话、同一个 Query;切换左侧 head,会同步高亮主视角。

Multi-Head

语义 Head

H0

位置 Head

H1

语法 Head

H2

聚合 Head

H3
数据是什么同一句 token 序列在不同投影矩阵下产生不同 Q/K/V。
学习目标让不同 head 捕捉互补关系,再拼接成更丰富的表示。
课堂问题如果所有 head 都学成同一种模式,模型会损失什么能力?

自回归生成:当前位置只能看见过去

写下一个 token 时,模型必须遮住右侧未来词;否则训练时就等于把答案提前塞给它。

Causal Mask

下一个 token 候选

掩码解释

从词间关系迁移到课堂讲解

Attention 热力图适合做“模型在关联什么”的入口,但课堂上要同时讲清公式、局限和人类解释的边界。

Explainability
阅读理解指代消解、长距离依赖、关键词回指都能用“当前词看谁”来解释。
代码理解变量名、函数调用和注释之间的依赖关系,会影响模型生成补全。
教学诊断热力图能引导追问:学生是否把概念、公式和例子真正连起来。
公式边界Attention 只是一层的一部分,残差连接、MLP 和后续层也会改变表示。
解释边界颜色深不等于因果证明,它更像一个可视化线索。
课堂活动让学生先预测热力图,再打开可视化对照,效果通常比直接讲公式好。