Agent 成本优化手册
Agent 系统成本分析
Agent 比普通聊天开销高 3-10 倍——思考链(Chain-of-Thought)消耗大量 Token,工具调用的输入/输出都产生费用,系统 Prompt 通常较长,多步推理放大每轮成本。一个典型的 5 步 Agent 调用可能消耗 5000-15000 Token。
六大优化策略
1. 模型分级
不是所有请求都需要最强模型。建立分级体系:
- 简单查询(问天气、查日历)→ 轻量模型(DeepSeek-V3/Qwen-32B),成本降低 80%
- 中等推理(知识问答、摘要)→ 标准模型(DeepSeek V4 Flash)
- 复杂推理(多步规划、代码生成)→ 强模型(DeepSeek-R1/GPT-4o)
用路由层根据意图复杂度自动分级,可节省 40-60% 成本。
2. 语义缓存
高频重复问题走缓存。日均 10 万请求的场景,缓存命中 30% 可直接节省 30% 的 Token 成本。(详见《语义缓存策略》笔记)
3. Prompt 瘦身
- 系统 Prompt 控制在 500 Token 以内,移除冗余示例
- 使用 Few-shot 压缩技巧:删除无关示例,只保留边界案例
- 工具描述精简:用 1 句话说明用途,详细参数说明放次要位置
- 历史对话窗口截断:保留最近 3-5 轮,或用摘要压缩早期内容
4. 工具调用优化
- 批处理:多个独立工具调用并行发出而非串行
- 减少冗余调用:相似查询合并(例如 "查北京上海深圳的天气" 一次解决)
- 限制最大步数:设 max_turns=10,避免死循环无限消耗
- 审计日志:每次调用记录 Token 数,找到异常高消耗的对话
5. 输出长度控制
- max_tokens:根据场景设定合理上限(问答 500,总结 1000,生成 2000)
- token_budget:整轮对话设 Token 预算,超限触发降级
- 渐进输出:先给简短回答,用户追问再展开详细内容
6. 降级策略
预算超限或 API 限流时自动降级:
- 强模型 → 轻量模型 → 缓存 → 静态回答
- 每步降级记录原因,便于后续分析优化
- 非核心场景(问候、闲聊)全部走最低成本链路
成本监控
每次请求记录:模型名称、输入/输出 Token、耗时、路由层级。按维度聚合:按天/按用户/按场景。设定告警:单次请求成本超过基线 3 倍时告警。周报分析 Top 10 消耗场景,针对性优化。