区分重试后成功与每次都可靠
Retry Success vs Repeated Reliability
一次经过重试的成功,不能证明所有重复试验都能成功。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
同一教学路由夹具跑三次,结果通过、失败、失败。它满足“三次内至少一次成功”,却不满足“三次全部成功”;运营问题不同,名称不能互换。
具体做法
固定重复次数、重试规则、任务与预算,保存每次原始结果和失败类别。分别计算至少一次与全部成功及逐次成功比例,注明是否独立试验、共享状态或顺序重试;总资源包含失败。按预先选择的运营指标判定,不能成功后把其他尝试删掉。
反例
三次只有一次通过,仍称三次可靠;只算成功那次成本。
改进写法
记录[通过,失败,失败]:within-three=true、all-three=false,观察成功数1/3,并列三次资源及失败。说明这是同一夹具的教学序列,不能当总体概率;发布门按预先声明的可靠性规则判断。
为什么这样改
至少一次回答能否靠多次机会成功,全部成功回答重复表现是否稳定。分开指标防止重试偶然胜利被包装成每次可依赖。
如何验证
教学[通过,通过,通过]两项都true;[失败,失败,失败]两项都false;原序列一真一假。按原始数组复算,检查无缺项,基础设施失败按既定规则另列。
适用边界
小样本不能给普遍可靠性,相关尝试与采样方式影响估计。pass@k或pass^k不同评估可能有统计定义,需声明这里仅为观察事件。源中90%目标不是通用门槛。