P27 · 测试与评估

制定具体的评分标准

Scoring Rubrics

在评分前写清各档分数的依据,以及什么结果需要采取行动。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

评审事故报告的修复项。教学A项只有“改进重试”;B项为“李修复重试,并以断网测试确认仅一次重试”。笼统质量分无法说明A还缺什么。

具体做法

评分前定义任务相关锚点与行动阈值:0无行动;1有行动但缺负责人或完成检查;2三项齐全。逐项引用字段及缺口,低于2须修订。未能读取材料标无法评分,不能当0。先独立评各项再汇总,不通过总分掩盖关键缺失。用共享样例校准评审者分歧。

反例

根据整体质量给报告1到10分,觉得不错就通过,不说明具体修复项。

改进写法

按0/1/2锚点评A、B:行动、负责人、完成检查必须齐全才得2。A缺负责人和检查,引用原文并要求补充;B核对三字段。未知信息保留,不编造负责人或影响数据,不以平均分替代逐项修订。

为什么这样改

明确锚点将判断与可观察字段连接,阈值又将分数与后续行动连接。这样低分说明的是可修复缺口,而不是抽象好坏。

如何验证

教学A=1、B=2,A需补负责人及完成检查。删除B的负责人后也应得1。给两位评审者同一样例,比较理由和分类;若不同,应澄清锚点再用新样例验证一致性。

适用边界

此为内容量表,不是模型准确率或客观测量。三字段齐全也不证明行动有效,另需技术验证。不要为了更高分扩大 scope;量化比较前需检查评审一致性和样本适用性。

原文与版本

如何收录这些方法

相关方法