P256 · 测试与评估

把评分和记录绑定到同一次尝试

Keep attempts, grades and traces coherent

区分执行失败与可评分结果,确保分数、轨迹和用量属于同一次调用。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

评估case-c1的第1次重复时调用a1超时;恢复后a2得到可评分答案。若把a1当“否定答案”写进结果槽,续跑会跳过;若a2评分配a1轨迹,又会拼错证据。

具体做法

用(case,rep)标结果槽,用attempt_id标每次尝试。可评分结果及时原子落盘并绑定同次答案、评分、轨迹、模型和用量;无可评分输出的基础设施失败写追加尝试台账,结果槽保持缺口。明确重试、拒绝、截断及评分器失败规则,所有尝试用量均对账;续跑仅补缺口,不能重算有效结果为另一调用。处理结果写入后轨迹失败时也不得重复计费记录。

反例

a1超时就写结果false占槽;a2成功后拿a1日志充轨迹,只算成功调用成本。

改进写法

a1超时记attempt失败类别与可得用量,不伪造任务答案。a2若符合重试契约,结果、评分、轨迹和用量全部绑定a2,并保留a1历史。按(case-c1,rep1)幂等恢复,不重复结果;报告尝试失败率和条件评分范围。

为什么这样改

基础设施未产答与模型否定答案不同。尝试身份使重试和成本可追踪,结果槽语义又保证恢复只跳过真正完成的评分对象。

如何验证

教学台账应有a1 timeout和a2有效结果,结果槽只一条且指a2。a2落盘后轨迹保存失败应列产物缺口,不再把同次用量追加成另一失败尝试。重启后不重复a2,未完成其他槽仍续跑。

适用边界

本地超时不证明远端取消,重试可能重复副作用,需隔离或幂等。条件评分要与排除、截断、拒绝和错误率一起报告,不能选择最好重试隐藏失败。原子提交及并发写入需要实际实现验证。

原文与版本

如何收录这些方法