检查 Agent 操作后的实际环境
Grade the environment left by an agent
任务会改变环境时,应评分最终状态;对话记录用于检查过程要求。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
代码修复Agent称计数器竞争已解决。教学环境允许改counter.ts但不允许改测试期望;最终状态与行为才能证明结果,漂亮总结不能代替工作树。
具体做法
每轮在隔离夹具起步,固定许可范围与隐藏行为判据。运行结束后检查最终文件、完整差异、禁止改动及行为测试;核对真实结果,而非只看轨迹宣称。过程要求如先询问删除才用轨迹核验。空操作检测结合任务判断:确需变更的修复无改变又未通过即失败,诊断或已有正确状态不能机械判。
反例
总结说已修复、测试全绿就评分通过,不看最终代码;允许修改测试把错误期望改成现实值。
改进写法
在最终教学检出测试两个调用方计数为2,检查只改许可实现、未改隐藏期望。核对产物与测试结果;若无修改且错误仍在,修复失败。显式过程约束另从轨迹判断,审美/可读性另评。
为什么这样改
环境是动作任务留下的答案。检查终态和禁止改动,能识别没有执行、越界更改或通过修改标准作弊;过程记录负责不同的协议问题。
如何验证
教学错误仍得1应失败,即使总结称2;实现正确得2但删测试或改禁区仍失败。合法等效实现不必有固定工具序列。保留末态身份和断言结果,此文只给检查设计。
适用边界
终态判据只覆盖已写不变量,隐藏测试也可能不足。副作用是否允许与是否存在需各自核对;网页视觉质量等需渲染/人工判断。隔离环境不证明生产效果,不能单凭未变文件判所有任务失败。
原文与版本
- anthropics/skills · End-state checks
查看此版本的文件8a1541c4a3ff - anthropics/skills · Outcome rather than required path
查看此版本的文件8a1541c4a3ff