把评分和记录绑定到同一次尝试
Keep attempts, grades and traces coherent
区分执行失败与可评分结果,确保分数、轨迹和用量属于同一次调用。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
评估case-c1的第1次重复时调用a1超时;恢复后a2得到可评分答案。若把a1当“否定答案”写进结果槽,续跑会跳过;若a2评分配a1轨迹,又会拼错证据。
具体做法
用(case,rep)标结果槽,用attempt_id标每次尝试。可评分结果及时原子落盘并绑定同次答案、评分、轨迹、模型和用量;无可评分输出的基础设施失败写追加尝试台账,结果槽保持缺口。明确重试、拒绝、截断及评分器失败规则,所有尝试用量均对账;续跑仅补缺口,不能重算有效结果为另一调用。处理结果写入后轨迹失败时也不得重复计费记录。
反例
a1超时就写结果false占槽;a2成功后拿a1日志充轨迹,只算成功调用成本。
改进写法
a1超时记attempt失败类别与可得用量,不伪造任务答案。a2若符合重试契约,结果、评分、轨迹和用量全部绑定a2,并保留a1历史。按(case-c1,rep1)幂等恢复,不重复结果;报告尝试失败率和条件评分范围。
为什么这样改
基础设施未产答与模型否定答案不同。尝试身份使重试和成本可追踪,结果槽语义又保证恢复只跳过真正完成的评分对象。
如何验证
教学台账应有a1 timeout和a2有效结果,结果槽只一条且指a2。a2落盘后轨迹保存失败应列产物缺口,不再把同次用量追加成另一失败尝试。重启后不重复a2,未完成其他槽仍续跑。
适用边界
本地超时不证明远端取消,重试可能重复副作用,需隔离或幂等。条件评分要与排除、截断、拒绝和错误率一起报告,不能选择最好重试隐藏失败。原子提交及并发写入需要实际实现验证。
原文与版本
- anthropics/skills · Resume and error sidecar
查看此版本的文件8a1541c4a3ff - anthropics/skills · No answer is not negative answer
查看此版本的文件8a1541c4a3ff - anthropics/skills · Resolved run scope, canary and complete result record
查看此版本的文件8a1541c4a3ff - anthropics/skills · Result-before-companion completion flaw
查看此版本的文件8a1541c4a3ff