类别不平衡
当正类很少时,模型只要一直猜负类也能得到很高准确率,但真正关心的正类会被漏掉。
同一个模型,喂给它不同质量的数据,会得到完全不同的决策。这里把干净数据和污染数据并排训练,直接看指标怎样被误导。
当正类很少时,模型只要一直猜负类也能得到很高准确率,但真正关心的正类会被漏掉。
少量错误标注模型还能抵抗;噪声过高时,模型会把错误规律也当成知识记住。
某个区域缺少训练数据时,模型在那里的预测是外推,不应被当成可靠结论。
把类别不平衡调到 1:15。若 Accuracy 仍然好看,但 Recall 明显降低,说明模型把少数类“漏掉了”。
把标注噪声逐步升到 25% 以上,观察黑色噪声点附近的决策背景是否开始摇摆。
切换删除区域,看模型在缺口附近的预测。颜色越坚定,不代表证据越充分。