P35 · 多 Agent 协作

按任务选择合适成本的模型

Cost-Optimized Model Routing

根据任务难度和风险选择模型,避免所有步骤都使用高成本模型。

编辑审核

以下示例与示意结果由本站编写,用于说明方法,不是模型实测结果。

使用场景

你在预算内安排机械改名和并发评审。教学候选模型 A/B 的真实能力尚未在这两类任务上测量;单 token 便宜不代表完成任务便宜,更强标签也不证明相关质量。先定义可检查结果,再选择路由。

具体做法

遵守宿主与用户的模型选择规则,按任务类建立代表性样例、质量门和评测预算。比较完成任务的总成本与质量,计入失败重跑与评审;只在允许时配置路由或升级。没有评测时方案保持候选,不从自信或价格表直接判合格;模型、提示或工作负载变化后重新核对。

反例

所有任务都用最便宜模型,靠自信回答判断质量;或所有小改名都固定最强模型,并忽略失败重跑成本。

改进写法

给教学改名与并发评审分别定义检查样例。先按已批准预算和当前有效费率/用量记录比较 A/B 的质量与每完成任务成本;把失败重跑和核验算入。只在宿主允许的范围选已满足质量门候选,失败按预定升级规则处理;无实测则报告路由提案未验证,不声称固定节省比或具体模型恒优。

为什么这样改

任务分布和失败尾部会改变成本排序。质量门加完整成本把选择连到本任务证据,而非把“便宜”和“能力强”变成通用角色配方。

如何验证

示意账目记录样例、模型配置、实际结果、用量、适用费率和重跑;未测 A/B 时质量/总成本都未知。检查比较条件一致,没有漏掉失败路径,也没有从一例推断所有任务。

本篇不运行付费模型或改变当前宿主的模型设置。

适用边界

冻结来源的模型名单、倍数、effort 阈值与价格不是当前保证。评测本身有成本,live shadow 增加外部效果;需要明确预算和安全回放条件。更便宜若损失必要质量不算成功优化。

原文与版本

如何收录这些方法

相关方法