P344 · 测试与评估

根据失败代价选择评测指标

Choose Metrics from Failure Costs

先明确要做的决策和各类错误的代价,再选择指标并优化分数。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

提醒分类样本100条,其中98常规、2紧急。漏紧急代价高,始终判常规也有98%准确率,不能仅凭这个值选择部署。

具体做法

确定提醒决定、误报/漏报/延迟成本及适用群体,在看候选前定义指标、分母和门槛。保留混淆计数、紧急召回及无谓提醒,直接检查昂贵错误。与简单基线比较,再定位信号、标签或阈值问题;不要先扩大模型复杂度。未知政策和样本代表性明确列出。

反例

始终常规得98%准确率,很高就批准,忽略两条紧急漏报。

改进写法

对同一100例同时报告正确98/100、紧急召回0/2和常规无谓提醒0/98。按预定紧急策略判就绪,检查两次漏报与标签依据;把误报取舍说明,不因总体高分隐藏关键失败。

为什么这样改

多数类主导准确率,而决策损害可能集中在少数类。面向失败成本的指标保留这些错误,使分数服务具体选择而不只是显得高。

如何验证

教学恒常规分类器召回0、漏报2,即使总体98%。恒紧急召回2/2但无谓提醒98/98,显示另一代价。检查分母与原始例一致;这些仅是虚拟样本算术。

适用边界

两条紧急不能证明可靠性,仍需代表样本、不确定性与标签复核。成本和阈值是具体产品选择,不是通用数字;分布变化或反馈会改变权衡。本文不提供真实业务或安全部署结论。

原文与版本

如何收录这些方法