P269 · 测试与评估

说明评测参考答案的来源

Record the origin of evaluation references

标明答案是独立核验的,还是由参与比较的系统生成的。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

比较新旧摘要器时,答案键来自旧系统输出。教学原文只有“原因未知”,旧摘要却写“数据库故障”;精确匹配旧文本会把错误模仿当正确。

具体做法

记录每条参考的来源类别、生成系统/版本、原始输入与独立核验状态。对事实从原文重新核对,不把参与比较的模型输出自动称gold。多个合法表达采用任务量表或盲比,旧输出可保留为有来源的参考产物。用正确/错误对照验证评分器,并保留标注分歧。

反例

新摘要和旧系统措辞不同就判错,旧系统生成的数据库原因无需核验。

改进写法

记录旧摘要为incumbent-generated且尚未独立核验。根据原文原因未知检查两版,不把数据库断言作标准答案;量表允许等效表达。保留旧产物用于比较,并对事实标准独立复核。

为什么这样改

参考来源决定匹配分数的解释。模型自产的参考可能奖励模仿而非正确性;独立事实标准把文风差异与任务错误分开。

如何验证

教学旧摘要新增数据库应在事实标准失败,保留未知的新摘要可通过该项,即使词面匹配低。参考记录能指出来源、版本与核验依据;无依据项标待核,不伪造人审标签。

适用边界

人工核验也可能错,仍需分歧和样本检查。准确参考不证明评分器不过宽或不过严;保存模型输出不等于独立答案。实际生产材料的使用和留存按授权与数据契约处理。

原文与版本

如何收录这些方法