P357 · 测试与评估

用同一组试验比较候选和基线

Compare Candidate and Baseline on the Same Trial Panel

保存每次配对结果,再按预先声明的整体标准判断。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

用试验1、2比较提示:候选0.9/0.5,基线0.8/0.6。挑候选最好与基线最差可制造0.3收益,但同组配对平均差实际为0。

具体做法

预先固定唯一试验ID、版本、输入、环境、评分与聚合门槛。每ID下保存两版结果和证据,保持任务/数据相同,处理缺项错误而不挑样本。以完整配对面板计算均值差、胜出/平局与样本数,检查分数范围及重复ID。按预定门判断,记录不确定性和试点范围。

反例

拿0.9与0.6比较,报告两次试验提升0.3,隐藏另一组结果。

改进写法

保留配对1:0.9对0.8、2:0.5对0.6,均值各0.7、差0,胜出1/2。预设正均值提升门未通过;报告缺失/错误,不用不同试验拼胜。每个分数链接原始证据。

为什么这样改

配对减少任务选择混杂,完整面板防挑有利行。按预定规则计算使结果不因事后选极值而改变含义。

如何验证

教学差为+0.1和−0.1,平均0,胜率0.5。重复ID1或只有候选第二行而无基线则不完整;有限/范围检查也要通过。数字是虚拟示例,不支持统计显著或生产收益。

适用边界

同种子不保证同执行条件,模型可能不支持确定性种子。两例样本小,试点不等于总体统计。失败处理和分母需事先定义,不能删除不利调用改变结果。

原文与版本

如何收录这些方法