P275 · 测试与评估

从真实应用入口进行评测

Evaluate the real application entry point

走应用实际的上下文组装、工具路由和重试路径,而非只复刻最终请求。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

比较客服应用的两个提示版本,应用入口还会拼接客户上下文、检索、重试和调用工具。单独复制提示发给模型只测了绕过这些路径的替代程序。

具体做法

定位真实处理器与实际生产配置,设计隔离测试账户或薄测试包装。只替换未获执行授权的外部副作用,保留上下文、检索、重试和工具接线;明确替身差异。先跑完整试点并检查保存行中的实际模型、用量、轨迹与结果,字段缺失先修运行器。扩量前确认入口、参数和预算均与计划相符。

反例

把系统提示与模型名称复制到新脚本,跳过应用处理器,直接宣称客服系统改善。

改进写法

从客服真实测试入口输入教学咨询,保留检索与工具路由,外发消息用受控适配器。先检查一例的完整保存结果和实际配置,再决定扩量。说明替身和生产差异,不把裸模型输出评分称整应用效果。

为什么这样改

应用质量包含模型前后的代码路径。真正入口让这些因素进入评估,薄替身限制副作用而不悄悄改变测量对象。

如何验证

教学试点应能看到上下文组装、检索、允许工具及重试记录,外发适配器无真实消息。用量或轨迹缺失时不得扩为完整评估。只测裸提示应准确称提示试验。

适用边界

测试账户本身不保证无生产影响,需真实隔离与授权。替身、配置和服务回退可能仍与线上不同;响应模型身份不能揭露全部隐藏替换。本文没有调用模型或发送消息。

原文与版本

如何收录这些方法