P267 · 测试与评估

多轮比较使用同一组参考产物

Freeze comparison references across rounds

保留固定参考文件;增加更难的对照时也保留旧参考。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

多轮改写报告提示,用逐例盲比评胜率。若每轮重新生成对手,v1与v2比较的对象就不同;教学参考R0应保存一次并固定。

具体做法

保存每个案例R0输出和摘要,版本化案例、量表与评估环境。每轮候选对同一R0盲比,保留标签和逐例证据。对R0饱和时新增较强R1参考与新指标列,旧R0列仍保留;不改写历史分母。环境漂移的无改系统对照可另运行,但不能悄悄替换这项固定参考。

反例

每轮随机生成新基线,却把胜率直接比较;换强参考后覆盖原来的胜率列。

改进写法

将R0参考逐例冻结,v1和v2都对同一文件盲比。需要更难比较时另存R1并新增一列,保留R0身份和原指标。记录评分器/案例版本及平局,不让环境控制运行替换固定对手。

为什么这样改

固定对手让跨轮胜率保持同一比较含义。新增而非覆盖参考保留历史进步,同时给后续差异提供更有区分力的标准。

如何验证

教学v1、v2都对R0三例比较;任何R0摘要改变都需重建比较或判证据失效。新增R1后表含vs-R0与vs-R1两列,不把新列数字冒充旧列增长。逐例映射和原图/文本仍可打开。

适用边界

固定产物可能过时,评估器和环境仍会漂移,不能证明普遍优势。逐例盲比也可能看不到跨例风格趋同,需集合级检查。固定参考与重新评估未改系统不同,应明确各自测量目的。

原文与版本

如何收录这些方法