排除正常波动后再判断改进
Noise-aware intervention comparison
在相同条件下比较单个变化,只有差异超过正常波动才认为有效。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
解析器优化从一次100毫秒变为97毫秒,但平常运行在95–105毫秒之间。教学差异落在波动内,不能据此宣布性能提高。
具体做法
先定义正确性门、指标、输入、缓存、硬件与搜索预算。一次只改一个假设,在相同冷/暖条件与预算下重复两版,保留逐次值;可交错顺序减少环境漂移。按预先方法比较差异和不确定性,正确性失败先拒绝;超出可解释噪声才宣称测得收益。若变化另有维护收益则另立评价依据。
反例
旧版冷缓存跑一次、新版暖缓存跑一次,看到3%差异就称优化成功,省略失败用例。
改进写法
相同输入与缓存条件重复测旧新解析器,保留正确性检查和每次耗时。本教学原始波动95–105毫秒,一次100→97不足以归因。限定尝试预算,差异无法区分时报告未测得收益;明确另有维护收益才另评。
为什么这样改
缓存和环境能产生与代码无关的差异。匹配条件、单变量和重复值限制这些混杂;正确性门防止靠少做必要工作获得更快数字。
如何验证
教学100→97在95–105背景中仅为候选信号;多次旧版约100、新版约80且条件一致可进一步分析,但仍需记录样本和方法。新版跳过验证即使更快也失败。所有数字为说明判据,不是性能实测。
适用边界
有限样本不能完全排除漂移,区间也不自动等于正式置信界限。需要明确统计单位与度量方法;非性能收益不应假称速度收益。冻结来源的保留/撤回策略需结合实际批准目标,不能擅自撤用户改动。
原文与版本
- addyosmani/agent-skills · Noise-aware intervention comparison
查看此版本的文件9d0c60d406b4 - affaan-m/ECC · Required Baseline / Loop / Promotion Gate
查看此版本的文件ef648e01899b