通过评测迭代 Skill
Eval-Driven Skill Improvement Loop
先用任务样本评测,再针对失败调整 Skill 并重新比较。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
缩短评审Skill时要保留每条发现的触发与位置。教学完整、缺证据和模糊输入三类案例用于比较旧版与候选,不靠一次满意输出判断改善。
具体做法
先保存旧Skill、相关资源、案例与判据,并固定运行器及预算。两版用相同案例设计,检查真实输出与轨迹,按失败模式修最小机制而非堆具体题答案。重测影响项和回归,记录版本、重复、错误及剩余缺口;保留评估材料以便新案例复核泛化。无真实运行时只提供计划。
反例
优雅改写后试一个正常请求,感觉更短便称质量提高,旧版与失败例没留。
改进写法
冻结旧版和三类教学案例,逐发现核触发、位置与依据。相同条件评旧新,读取缺字段失败并修相关指令,再测回归。报告缩短与质量分别变化,保留原始输出;评估模型调用必须在授权预算。
为什么这样改
保留案例使行为变化有共同参照,失败证据指出应调整的机制。过程和产物同时检查能区分技能未触发、工具坏和答案问题。
如何验证
教学候选缺位置而旧版有,应记录回归即使字数少。补规则后同例位置可核,再用新表述案例检查;对缺证据输入不应编造发现。只是验证设计,不是真实模型收益。
适用边界
有限案例可能过拟合,需独立确认与评分校准。框架或模型变动会失效,成本含失败与评估器;单次通过或工具调用不证明通用效果。来源并行执行要求仅作方法依据,不授权本轮派生。
原文与版本
- anthropics/skills · Step 1: Spawn all runs
查看此版本的文件8a1541c4a3ff - ComposioHQ/awesome-claude-skills · Review report / Low Accuracy
查看此版本的文件be2a406907db - ComposioHQ/awesome-claude-skills · Evaluation prompt
查看此版本的文件be2a406907db - affaan-m/ECC · Philosophy / Eval Types / Grader Types
查看此版本的文件ef648e01899b - anthropics/skills · Same-task baseline and objective assertions
查看此版本的文件8a1541c4a3ff - anthropics/skills · Generalization and repeated-helper evidence
查看此版本的文件8a1541c4a3ff