P255 · 测试与评估

不让被测 Agent 接触标准答案

Keep answer keys outside agent reach

把答案与被测系统隔离,包括历史记录和前几轮生成的文件。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

评估Agent能否诊断样本仓库故障,症状是“保存后列表仍旧”。评分器知道原因,但gold.json若在工作树或历史里,被测系统可直接取答案。

具体做法

把真实症状和允许仓库暴露给Agent,把标准答案放在独立评分环境并用真实权限限制访问,不仅移出cwd。每次试验建立干净状态,检查文件、Git历史、工具、环境及前轮残留的可达内容。避免在案例名称、示例或提示里泄漏原因。若目标测检索,使用足够陌生或教学合成材料,记录隔离检验范围。

反例

把gold.json放在检出目录,只写“不要看答案”;前一轮修复日志继续留给下一轮。

改进写法

为列表故障诊断只提供用户症状和许可仓库。标准答案及评分提示留在Agent实际不可访问的评分进程;检查历史与旧产物无提示。每轮重建干净环境并记录访问边界,不能声称工作区外自动不可读。

为什么这样改

口头禁止不能制造隐藏信息。结构隔离和清理让分数更接近调查能力,而不是读取答案、记住前轮日志或识别命名暗示。

如何验证

教学访问审计应证明Agent工具无法读取gold与旧修复日志,而能读取许可测试文件。仅能在评分进程看到答案。若移到工作区外仍可由绝对路径读到,隔离失败。不要用真实私密材料作为夹具。

适用边界

沙盒、工具与凭据决定实际边界,公网副本或模型记忆也可能泄漏。隔离检查不证明没有任何训练污染;症状真实性和难度仍需设计。本文没有运行收费模型或读取任何答案库。

原文与版本

如何收录这些方法