← 返回实验室 Experiment 07 · Data Quality

数据的陷阱

同一个模型,喂给它不同质量的数据,会得到完全不同的决策。这里把干净数据和污染数据并排训练,直接看指标怎样被误导。

左侧:干净训练集。右侧:经过不平衡、噪声、缺失处理后的训练集。评估统一使用干净测试集。
负类 正类 被翻转标注 背景色 = 模型预测概率

类别不平衡

当正类很少时,模型只要一直猜负类也能得到很高准确率,但真正关心的正类会被漏掉。

标注噪声

少量错误标注模型还能抵抗;噪声过高时,模型会把错误规律也当成知识记住。

分布缺口

某个区域缺少训练数据时,模型在那里的预测是外推,不应被当成可靠结论。

1准确率什么时候会骗人?

把类别不平衡调到 1:15。若 Accuracy 仍然好看,但 Recall 明显降低,说明模型把少数类“漏掉了”。

2噪声会怎样污染边界?

把标注噪声逐步升到 25% 以上,观察黑色噪声点附近的决策背景是否开始摇摆。

3没有数据的区域能相信吗?

切换删除区域,看模型在缺口附近的预测。颜色越坚定,不代表证据越充分。