隐藏版本身份做 A/B 对比
Blind A/B Comparison
在相同任务上比较两个版本的输出,不向评估者透露版本身份。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
比较事故摘要提示的两个版本。教学材料固定为同一份“时间12:04、原因未知”的事故输入,两份输出一份保留未知、一份编造原因。评估者不能预先知道哪份是新版。
具体做法
冻结案例、量表、模型运行条件与原始产物。分别生成两版输出,用随机匿名标签及平衡展示顺序交评估者;映射留在评估者不可见处。按事实保留和任务完成评估,允许平局或无法判断;先保存判断再解码。重复多个案例,报告逐例结果、失败运行和波动,不能挑选赢的样本。
反例
告诉评估者A是改进版,问它是否更好;只保留支持A的结果。
改进写法
对同一冻结事故比较两版输出,隐藏版本身份并随机顺序。按时间、原因保留量表引用证据,允许平局,保存逐例判断后才解码标签。记录失败运行和重复差异,不用新版标签作为质量证据。
为什么这样改
匹配输入减少任务差异,盲化标签减少“新版应更好”的暗示。保存后解码防止看到身份再修改理由,重复样本能暴露偶然胜负。
如何验证
教学评估应偏向保留未知的输出,但判断记录不能含新版身份。交换展示顺序后理由仍应引用事实;无法区分时记平局。保存案例、输出、判断与映射,教学预期不能当实测胜率。
适用边界
盲化不能消除风格、位置或评估模型偏差。样本少时不能推普遍收益;收费运行和材料外发仍需授权。来源倾向少平局不应迫使评估者制造差异。
原文与版本
- anthropics/skills · Step 3: Generate Evaluation Rubric
查看此版本的文件8a1541c4a3ff - anthropics/skills · Producer-blind artifact comparison
查看此版本的文件8a1541c4a3ff - anthropics/skills · Unblind only for post-hoc diagnosis
查看此版本的文件8a1541c4a3ff