从真实应用入口进行评测
Evaluate the real application entry point
走应用实际的上下文组装、工具路由和重试路径,而非只复刻最终请求。
以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。
使用场景
比较客服应用的两个提示版本,应用入口还会拼接客户上下文、检索、重试和调用工具。单独复制提示发给模型只测了绕过这些路径的替代程序。
具体做法
定位真实处理器与实际生产配置,设计隔离测试账户或薄测试包装。只替换未获执行授权的外部副作用,保留上下文、检索、重试和工具接线;明确替身差异。先跑完整试点并检查保存行中的实际模型、用量、轨迹与结果,字段缺失先修运行器。扩量前确认入口、参数和预算均与计划相符。
反例
把系统提示与模型名称复制到新脚本,跳过应用处理器,直接宣称客服系统改善。
改进写法
从客服真实测试入口输入教学咨询,保留检索与工具路由,外发消息用受控适配器。先检查一例的完整保存结果和实际配置,再决定扩量。说明替身和生产差异,不把裸模型输出评分称整应用效果。
为什么这样改
应用质量包含模型前后的代码路径。真正入口让这些因素进入评估,薄替身限制副作用而不悄悄改变测量对象。
如何验证
教学试点应能看到上下文组装、检索、允许工具及重试记录,外发适配器无真实消息。用量或轨迹缺失时不得扩为完整评估。只测裸提示应准确称提示试验。
适用边界
测试账户本身不保证无生产影响,需真实隔离与授权。替身、配置和服务回退可能仍与线上不同;响应模型身份不能揭露全部隐藏替换。本文没有调用模型或发送消息。
原文与版本
- anthropics/skills · Real path and complete pilot record
查看此版本的文件8a1541c4a3ff - anthropics/skills · Served identity and production parity
查看此版本的文件8a1541c4a3ff