按完整预期结果核对评分
Bind grader results to the full expectation set
确认评分对应正确样本,再按全部预期项重新计算总分。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
修复案例声明五项预期,评分器只返回四条却称五项全通过。完整流畅的summary不能代替规范预期集合与逐项结果的核对。
具体做法
冻结案例身份、预期版本和ID1–5。解析评分对象,要求每个ID恰好一次、范围正确、passed布尔且有证据字段;用规范文字替换评分器改写,保持原ID绑定。拒缺项、重复项和不一致整数摘要;从有效逐项结果重算通过/失败/总数与通过率。再独立检查证据真伪,不能只验证算术。
反例
四条结果看起来很好,summary说5/5就报告100%通过,忽略缺少ID5。
改进写法
对这五项预期先验证ID1–5各一次及布尔结果。缺ID5拒绝完整评分;齐全后从行结果重算摘要,整数计数冲突拒绝,比例以重算值为准。报告绑定原始预期,并核查引用证据,不让评分器省略难项。
为什么这样改
规范集合确定分母,唯一身份确定覆盖,重算确定算术。三者结合阻止模型用漂亮摘要创造不存在的覆盖;语义证据仍是独立门禁。
如何验证
教学ID1–4通过且ID5失败应为passed=4、failed=1、total=5、rate=0.8。缺5、重复4或summary.total=4均拒绝。若只比例误写0.9,可按契约重算0.8,但不能因此修补不存在的行结果。
适用边界
身份和算术检查不证明评分判断正确,也不校准模型。空预期集合或新的状态枚举需另订契约;评估失败不能混为被测模型全部失败。多个案例/重复的聚合还需正确统计单位。