Concept Helper
适合第一次学习
词向量就是“词的坐标”
计算机原本只看得见编号,看不懂“国王”和“王后”有什么关系。词向量把词变成一串数字,让相似的词靠近,让某些语义关系变成方向。
可以怎么观察先点语义地图里的词,看它的最近邻是不是符合直觉。
可以追问什么为什么“靠近”可以代表语义相似?这个靠近又是谁教给模型的?
Try It
一键课堂任务
建议先按任务 1 到 5 走一遍,再自由选择词和语料。每个任务都对应大语言模型前置知识的一块拼图。
语义地图:相近的词在空间里靠近
这是一个教学用二维投影。真实模型通常有几百到几千维,但核心直觉相同:距离和方向承载语义。
最近邻--
相似度--
所属语义簇--
相似度:看两个向量指向是否接近
余弦相似度比较方向,而不是长度。方向越接近,分数越接近 1。
词 A--
词 B--
余弦相似度--
余弦相似度不直接说明“真实世界正确”,只说明模型在语料里学到这两个词的用法方向很接近。
向量运算:关系也可以变成方向
经典例子是“国王 - 男人 + 女人 ≈ 王后”。它不是魔法,而是“王权”和“性别”这些方向在空间里比较稳定。
--
最接近结果
| 候选词 | 相似度 | 解释 |
|---|
共现训练:意义来自上下文
一个词经常和哪些词一起出现,会改变它在空间里的位置。这里用很小的语料演示“上下文窗口”的直觉。
当前语料
中心词的上下文
上下文表示:同一个词会被句子“重新定位”
传统词向量通常给“苹果”一个固定位置;现代 LLM 会先取基础向量,再用上下文把它拉向当前句子的含义。
基础词向量苹果
上下文拉向--
表示变化--
句子里的 token
深色 token 是当前词;彩色 token 表示最能帮助模型判断含义的上下文。
上下文权重
边界与偏差:模型学到的是语料统计
如果语料中某些职业、性别、地区经常以固定方式出现,词向量也可能把这种偏差编码进去。
词向量会压缩语义一个词可能有多个意思,例如“苹果”既是水果也可以是公司。单个静态向量很难同时表达所有语境。
相似不是因果两个词靠近,只说明它们在文本中用法相似,不说明现实世界中存在因果关系。
语料会带来偏差模型从人类文本中学习,也会继承文本里的刻板印象、遗漏和历史偏差。
LLM 使用上下文向量现代大语言模型不只给每个词一个固定向量,而会根据上下文动态更新表示。
课堂讨论
当模型把“程序员”和某一类人群更近地联系起来时,我们要问:这是能力规律,还是语料里的历史偏见?教育和招聘场景尤其需要复核。
| 观察 | 该追问 |
|---|---|
| 某些职业词靠近某类性别词 | 语料来源是否均衡? |
| 某些地区词和评价词靠近 | 是否把刻板印象当成事实? |
| 冷门词向量不稳定 | 训练数据是否足够? |