P262 · 测试与评估

评分规则变化后重新评估所有方案

Regrade all variants after a criterion change

用新指标对所有候选的已保存输出重新评分,再推荐最佳方案。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

报告生成评估原来只评分结构,后来发现缺少事实准确性。教学基线B与候选C都有保存输出;新标准只能比较双方重评分结果,不能将C新分数与B旧分数相减。

具体做法

版本化新量表、评分器与指标公式,冻结每个方案的原始输出和身份。对基线及全部候选使用同一新标准评分,保留旧分数作为历史并标旧版本。重建逐例与汇总表,检查缺证据或评分失败,排名变化则修订建议。需要重新生成任务时单列新实验,不能冒充重评原产物。

反例

只用事实标准评最新C,拿它与结构标准下的B比较,直接宣布胜出。

改进写法

以grader-v2对保存的B、C及其他候选同一批输出重评,记录输出摘要、新旧标准和逐项事实依据。汇总后再推荐;若排名翻转,说明旧搜索优化了不同信号。缺原始输出的方案标不可重评,不编造对应分数。

为什么这样改

保持产物不变而统一测量规则,才能区分评分变化与生成变化。所有推荐依据落在同一标准上,也让历史结论修正可追溯。

如何验证

教学旧结构分B=0.7、C=0.9,新事实分B=0.8、C=0.6,推荐可能反转;两个新值可比较,C旧0.9与B新0.8不可直接比较。表中全部数字是假设,须保留对应标准列。

适用边界

保存产物可能缺少新标准所需证据,模型评分也有波动和费用。重评不能撤销先前对错误信号的选择或调优偏差,可能需新验证集或重新搜索。扩大实验和预算仍受实际授权限制。

原文与版本

如何收录这些方法