为什么 K 太小会敏感
结论:K 小时模型更容易被个别样本影响。
理解:像只听最近一个人的意见,判断会更容易波动。
不需要任何公式,先动手玩:拖动那颗金色的“?”点,看它会被判成哪一类。这背后就是机器学习里最直观的分类思想——物以类聚。
要判断一个新样本属于哪一类,KNN 的办法很朴素:看离它最近的 K 个老样本,谁的票多就归谁。
画布里金色的 “?” 是待分类的新样本;蓝、红、绿点是已经知道类别的样本。
这张表是当前金色点最近的 K 个邻居,按距离从近到远排序——它们就是上方画布里发光、连线的那几个点。
| 排名 | 类别 | 距离 | 权重 |
|---|---|---|---|
| 正在计算最近邻... | |||
结论:K 小时模型更容易被个别样本影响。
理解:像只听最近一个人的意见,判断会更容易波动。
结论:K 大时边界更平滑,但局部结构会被弱化。
理解:像把太多人意见平均掉,少数但重要的线索会被淹没。
结论:“最近”取决于你如何定义距离。
理解:欧氏距离看直线,曼哈顿像走街区,切比雪夫像棋盘移动。