P274 · 测试与评估

优化无效时先定位失败层

Classify the failing layer when optimization stalls

连续改写没有改善结果时,先判断问题在哪一层,而非继续堆指令。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

连续加强“使用搜索”指令,检索评估仍不变。教学轨迹显示search未注册;再加提示不能修好宿主缺工具,也可能遇到错误评分或普通波动。

具体做法

读取代表失败的完整轨迹、输出与运行配置,按证据暂分类:内容缺失、评分分歧、基础设施、结构不可达、波动。允许多层与未知,记录每类案例数及定位;对最可能解释做控制探测,如只修注册再测同例。修评分需统一重评所有候选;噪声内变化先报告证据不足,而不继续无界堆指令。

反例

每轮持平都再写一段“必须始终搜索”,不看工具是否可用或评分规则。

改进写法

先查失败轨迹:search未注册归宿主接线,注册后用同例验证;若正确引用被评分器拒绝则核对规则并重评。按每项具体证据分类,保留未知;只有内容确实缺失才补内容。

为什么这样改

调优对象不一定是瓶颈。分层诊断把改动指向能解释观察的地方,避免增加模型根本无法执行或访问的指令。

如何验证

教学未注册→修注册后实际调用search支持接线解释,但仍需看任务结果;调用成功却分数不变,进一步核评分。完全相同配置翻转幅度大时列波动。每个类别有案例和探测,不能仅凭低分猜根因。

适用边界

分类是辅助不是证明,单案例可能跨层。环境和评分也会漂移;重评/重复需要许可预算。不可识别失败不应被硬塞到内容缺口,未知项保持可见。

原文与版本

如何收录这些方法