P108 · 测试与评估

隐藏版本身份做 A/B 对比

Blind A/B Comparison

在相同任务上比较两个版本的输出,不向评估者透露版本身份。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

比较事故摘要提示的两个版本。教学材料固定为同一份“时间12:04、原因未知”的事故输入,两份输出一份保留未知、一份编造原因。评估者不能预先知道哪份是新版。

具体做法

冻结案例、量表、模型运行条件与原始产物。分别生成两版输出,用随机匿名标签及平衡展示顺序交评估者;映射留在评估者不可见处。按事实保留和任务完成评估,允许平局或无法判断;先保存判断再解码。重复多个案例,报告逐例结果、失败运行和波动,不能挑选赢的样本。

反例

告诉评估者A是改进版,问它是否更好;只保留支持A的结果。

改进写法

对同一冻结事故比较两版输出,隐藏版本身份并随机顺序。按时间、原因保留量表引用证据,允许平局,保存逐例判断后才解码标签。记录失败运行和重复差异,不用新版标签作为质量证据。

为什么这样改

匹配输入减少任务差异,盲化标签减少“新版应更好”的暗示。保存后解码防止看到身份再修改理由,重复样本能暴露偶然胜负。

如何验证

教学评估应偏向保留未知的输出,但判断记录不能含新版身份。交换展示顺序后理由仍应引用事实;无法区分时记平局。保存案例、输出、判断与映射,教学预期不能当实测胜率。

适用边界

盲化不能消除风格、位置或评估模型偏差。样本少时不能推普遍收益;收费运行和材料外发仍需授权。来源倾向少平局不应迫使评估者制造差异。

原文与版本

如何收录这些方法

相关方法