P192 · 测试与评估

检查指令是否改变默认行为

No-Op Test (Behavior-vs-Default Pruning)

与不添加指令的情况比较,删除没有实际作用的规则。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

精简一条“每个事实结论须引用证据”的提示,认为模型默认会做。删前需检查它是否影响当前模型的实际引用行为,而不是让模型评价这句话重要吗。

具体做法

固定模型、运行器、任务集、引用判据与容许退化门槛。比较完整提示、仅删该句、无技能对照,保持其他条件一致并重复。记录规则是否真的触发与回答引用质量两个指标,从逐例行重算缺引用数量。还检查外部解析器是否依赖精确文本;证据不足保留规则,删除后回归则以最小表达恢复。

反例

这条规则听起来显然,直接删除;问模型是否需要它,回答不需要就算实验通过。

改进写法

在同一带证据任务集比较三组提示,记录模型版本、重复运行、规则参与和缺引用数。只有当前样本下满足预设质量门槛才删,并检查外部依赖。结果波动或无法确认时保留;没有模型运行不能宣称无作用。

为什么这样改

消融比较句子的行为贡献,默认对照又区分技能整体和单句作用。观察真实回答而非自报,使删减决定可复核;机制参与与收益分开防止加载标记替代质量。

如何验证

教学结果表可有case、arm、rep、cited、engaged字段;完整组与删句组都3/3引用只说明这三个观察无差异,不能证明无作用。若删句组出现缺引用,应检查归因并恢复最小规则。数字是说明表格的虚拟结果。

适用边界

无作用结论依模型、任务与统计检测能力而定,少样本可能漏掉稀有退化。成本不只由提示长度决定,不能凭删字推省钱。真实付费实验另需授权,模型或运行器变化需复查。

原文与版本

如何收录这些方法

相关方法