P257 · 测试与评估

区分生成波动与评分波动

Separate build variance from scoring variance

分别测量每次生成产物的差异,以及对同一产物重复评分的差异。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

提示先生成检索索引,再用查询评分。同一个索引重复评分结果很稳定,不能因此认定索引生成本身稳定;随机性在构建与评分两个层级。

具体做法

以未变提示独立生成多个基线索引,保存build_id、提示、输入、模型与生成轨迹。对每个索引用同一查询和重复设计评分,区分构建间及同构建内波动。候选也采用相同层级设计,保留分组原始值;不把一个构建上的多次评分当多次独立构建。按实际随机层级分析不确定性及预算。

反例

只生成一次基线索引,重复评分几十次,用很窄区间宣布修改构建提示有收益。

改进写法

以相同提示生成独立B1、B2、B3索引,每个按同一查询设计评分;候选也重复构建。保存构建身份与组内评分,分别报告构建间和评分内变化。少构建证据不足时,不靠增加同一索引评分宣称构建稳定。

为什么这样改

重复评分只能观察固定产物的评分波动。真正独立重建才能暴露中间生成的不稳定,从而判断候选差异是否只是选中了一个幸运构建。

如何验证

教学B1组分数0.79/0.80、B2为0.65/0.66、B3为0.78/0.79:组内小而构建间大,不能只用B1小波动定收益。将这些值标虚拟演示,并检查每组确实来自不同构建而非缓存复用。

适用边界

构建可能共享输入、缓存或随机状态,独立性需要核实。样本数和统计设计取决于层级与成本,来源固定次数不是保证。若构建是确定性的也应验证该前提,而不是一律要求多模型生成。

原文与版本

如何收录这些方法