Experiment 10 · Embeddings

词向量:当“意义”变成可以计算的几何

词向量把词放进一个空间:相近的词靠近,相似的关系变成方向。学生可以在语义地图、相似度、类比运算、共现训练和上下文表示里,看到文字如何进入大模型的计算世界。

01 WORD词不再只是字符串
02 CONTEXT从上下文里学意义
03 VECTOR每个词变成一串数
04 SPACE相似词在空间里靠近
05 ANALOGY关系方向可以相加减
06 LIMITS语料偏差也会被学进去
Concept Helper 适合第一次学习

词向量就是“词的坐标”

计算机原本只看得见编号,看不懂“国王”和“王后”有什么关系。词向量把词变成一串数字,让相似的词靠近,让某些语义关系变成方向。

可以怎么观察先点语义地图里的词,看它的最近邻是不是符合直觉。
可以追问什么为什么“靠近”可以代表语义相似?这个靠近又是谁教给模型的?
Try It 一键课堂任务
建议先按任务 1 到 5 走一遍,再自由选择词和语料。每个任务都对应大语言模型前置知识的一块拼图。

语义地图:相近的词在空间里靠近

这是一个教学用二维投影。真实模型通常有几百到几千维,但核心直觉相同:距离和方向承载语义。

选中:国王
最近邻--
相似度--
所属语义簇--

相似度:看两个向量指向是否接近

余弦相似度比较方向,而不是长度。方向越接近,分数越接近 1。

Cosine
词 A--
词 B--
余弦相似度--
余弦相似度不直接说明“真实世界正确”,只说明模型在语料里学到这两个词的用法方向很接近。

向量运算:关系也可以变成方向

经典例子是“国王 - 男人 + 女人 ≈ 王后”。它不是魔法,而是“王权”和“性别”这些方向在空间里比较稳定。

Top candidates
--

最接近结果

候选词相似度解释

共现训练:意义来自上下文

一个词经常和哪些词一起出现,会改变它在空间里的位置。这里用很小的语料演示“上下文窗口”的直觉。

窗口大小:2

当前语料

中心词的上下文

上下文表示:同一个词会被句子“重新定位”

传统词向量通常给“苹果”一个固定位置;现代 LLM 会先取基础向量,再用上下文把它拉向当前句子的含义。

水果语境
基础词向量苹果
上下文拉向--
表示变化--

句子里的 token

深色 token 是当前词;彩色 token 表示最能帮助模型判断含义的上下文。

上下文权重

边界与偏差:模型学到的是语料统计

如果语料中某些职业、性别、地区经常以固定方式出现,词向量也可能把这种偏差编码进去。

需要人工判断
词向量会压缩语义一个词可能有多个意思,例如“苹果”既是水果也可以是公司。单个静态向量很难同时表达所有语境。
相似不是因果两个词靠近,只说明它们在文本中用法相似,不说明现实世界中存在因果关系。
语料会带来偏差模型从人类文本中学习,也会继承文本里的刻板印象、遗漏和历史偏差。
LLM 使用上下文向量现代大语言模型不只给每个词一个固定向量,而会根据上下文动态更新表示。

课堂讨论

当模型把“程序员”和某一类人群更近地联系起来时,我们要问:这是能力规律,还是语料里的历史偏见?教育和招聘场景尤其需要复核。
观察该追问
某些职业词靠近某类性别词语料来源是否均衡?
某些地区词和评价词靠近是否把刻板印象当成事实?
冷门词向量不稳定训练数据是否足够?