制定具体的评分标准
Scoring Rubrics
在评分前写清各档分数的依据,以及什么结果需要采取行动。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
评审事故报告的修复项。教学A项只有“改进重试”;B项为“李修复重试,并以断网测试确认仅一次重试”。笼统质量分无法说明A还缺什么。
具体做法
评分前定义任务相关锚点与行动阈值:0无行动;1有行动但缺负责人或完成检查;2三项齐全。逐项引用字段及缺口,低于2须修订。未能读取材料标无法评分,不能当0。先独立评各项再汇总,不通过总分掩盖关键缺失。用共享样例校准评审者分歧。
反例
根据整体质量给报告1到10分,觉得不错就通过,不说明具体修复项。
改进写法
按0/1/2锚点评A、B:行动、负责人、完成检查必须齐全才得2。A缺负责人和检查,引用原文并要求补充;B核对三字段。未知信息保留,不编造负责人或影响数据,不以平均分替代逐项修订。
为什么这样改
明确锚点将判断与可观察字段连接,阈值又将分数与后续行动连接。这样低分说明的是可修复缺口,而不是抽象好坏。
如何验证
教学A=1、B=2,A需补负责人及完成检查。删除B的负责人后也应得1。给两位评审者同一样例,比较理由和分类;若不同,应澄清锚点再用新样例验证一致性。
适用边界
此为内容量表,不是模型准确率或客观测量。三字段齐全也不证明行动有效,另需技术验证。不要为了更高分扩大 scope;量化比较前需检查评审一致性和样本适用性。
原文与版本
- anthropics/skills · Step 3: Generate Evaluation Rubric
查看此版本的文件8a1541c4a3ff - affaan-m/ECC · Evaluation Axes / Evidence / Workflow
查看此版本的文件ef648e01899b