P244 · 测试与评估

排除正常波动后再判断改进

Noise-aware intervention comparison

在相同条件下比较单个变化,只有差异超过正常波动才认为有效。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

解析器优化从一次100毫秒变为97毫秒,但平常运行在95–105毫秒之间。教学差异落在波动内,不能据此宣布性能提高。

具体做法

先定义正确性门、指标、输入、缓存、硬件与搜索预算。一次只改一个假设,在相同冷/暖条件与预算下重复两版,保留逐次值;可交错顺序减少环境漂移。按预先方法比较差异和不确定性,正确性失败先拒绝;超出可解释噪声才宣称测得收益。若变化另有维护收益则另立评价依据。

反例

旧版冷缓存跑一次、新版暖缓存跑一次,看到3%差异就称优化成功,省略失败用例。

改进写法

相同输入与缓存条件重复测旧新解析器,保留正确性检查和每次耗时。本教学原始波动95–105毫秒,一次100→97不足以归因。限定尝试预算,差异无法区分时报告未测得收益;明确另有维护收益才另评。

为什么这样改

缓存和环境能产生与代码无关的差异。匹配条件、单变量和重复值限制这些混杂;正确性门防止靠少做必要工作获得更快数字。

如何验证

教学100→97在95–105背景中仅为候选信号;多次旧版约100、新版约80且条件一致可进一步分析,但仍需记录样本和方法。新版跳过验证即使更快也失败。所有数字为说明判据,不是性能实测。

适用边界

有限样本不能完全排除漂移,区间也不自动等于正式置信界限。需要明确统计单位与度量方法;非性能收益不应假称速度收益。冻结来源的保留/撤回策略需结合实际批准目标,不能擅自撤用户改动。

原文与版本

如何收录这些方法