P119 · Skill 编写

通过评测迭代 Skill

Eval-Driven Skill Improvement Loop

先用任务样本评测,再针对失败调整 Skill 并重新比较。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

缩短评审Skill时要保留每条发现的触发与位置。教学完整、缺证据和模糊输入三类案例用于比较旧版与候选,不靠一次满意输出判断改善。

具体做法

先保存旧Skill、相关资源、案例与判据,并固定运行器及预算。两版用相同案例设计,检查真实输出与轨迹,按失败模式修最小机制而非堆具体题答案。重测影响项和回归,记录版本、重复、错误及剩余缺口;保留评估材料以便新案例复核泛化。无真实运行时只提供计划。

反例

优雅改写后试一个正常请求,感觉更短便称质量提高,旧版与失败例没留。

改进写法

冻结旧版和三类教学案例,逐发现核触发、位置与依据。相同条件评旧新,读取缺字段失败并修相关指令,再测回归。报告缩短与质量分别变化,保留原始输出;评估模型调用必须在授权预算。

为什么这样改

保留案例使行为变化有共同参照,失败证据指出应调整的机制。过程和产物同时检查能区分技能未触发、工具坏和答案问题。

如何验证

教学候选缺位置而旧版有,应记录回归即使字数少。补规则后同例位置可核,再用新表述案例检查;对缺证据输入不应编造发现。只是验证设计,不是真实模型收益。

适用边界

有限案例可能过拟合,需独立确认与评分校准。框架或模型变动会失效,成本含失败与评估器;单次通过或工具调用不证明通用效果。来源并行执行要求仅作方法依据,不授权本轮派生。

原文与版本

如何收录这些方法

相关方法