实验室
12 个实验,全部在你的浏览器里运行
这里的每个实验都是一段真正的算法,不是动画演示:K 近邻真的在算距离,卷积网络真的在你的电脑上做推理,分词器用的是与真实模型相同的词表。没有账号,不装软件,不上传任何数据。
每个实验都对应正文里的一章。建议先读那一章的主线,再来动手;也可以反过来,先玩,玩出疑问再去读。
机器学习入门
实验 01
K 近邻:点一点就懂分类
在画布上放几个点,看最朴素的分类器怎样用「离谁近就算谁」做判断,以及 K 取大取小会发生什么。
约 12 分钟 · 第 4 章 规则不是写出来的,是学出来的 实验 02拟合一条曲线:损失、参数与梯度下降
亲手拖动数据点,看模型怎样一步步降低损失;把多项式次数调高,亲眼看到过拟合是什么样子。
约 15 分钟 · 第 4 章 规则不是写出来的,是学出来的 实验 03网约车计价:一个完整的机器学习项目
从一笔订单到一个模型:拆特征、划分数据、训练、评估、上线后发现世界变了。一条主线走完全流程。
约 25 分钟 · 第 4 章 规则不是写出来的,是学出来的 实验 04数据的陷阱
相关不是因果、抽样有偏、标签泄漏。三个小实验,每个都能让一个准确率很高的模型在现实里翻车。
约 12 分钟 · 第 5 章 真正的考试在训练集之外神经网络
语言模型
实验 07
Tokenizer:不同模型怎么切词
输入任何一句话,对比三代分词器怎样把它切成 token,理解为什么中文更「贵」,以及上下文窗口到底装多少字。
约 12 分钟 · 第 7 章 文字怎样变成数字 实验 08词向量:意义变成几何
在一张二维投影里看词和词的距离,做一次「国王 − 男人 + 女人」的向量算术。
约 12 分钟 · 第 7 章 文字怎样变成数字 实验 09Attention:词和词之间的暗线
把一句话送进一个小型注意力层,看每个词在「看」谁;换一个词,看注意力的连线怎样重新分配。
约 15 分钟 · 第 8 章 每个词都能看见其他词 实验 10下一个词预测:语言模型怎么写字
看一个真正的小模型在每一步给出的概率分布,调温度,试贪心与采样,理解「生成」到底是什么。
约 15 分钟 · 第 8 章 每个词都能看见其他词经典 AI 与决策