先算清楚钱花在哪
成本优化前,先按接口维度统计:哪些调用次数最多、哪些 prompt 最长、哪些模型最贵。通常 20% 的接口消耗了 80% 的成本。
没有统计就优化,只是在猜。
四条最有效的杠杆
第一,缓存:相同或相似请求的答案直接复用,尤其是 FAQ、固定模板类问题。第二,缩小上下文:只传必要的知识片段和对话历史。第三,模型分层:简单任务用小模型,复杂任务用大模型。第四,异步批量:低优先级任务用批处理而不是实时生成。
- 结果缓存:命中率通常可以做到 20%-40%
- 上下文裁剪:删掉无关历史,按需检索
- 模型分层:简单任务用小模型,准确率不降
- 批量处理:非实时任务错峰执行
token 是显性成本,隐性成本更贵
重试、人工复核、错误处理也是成本。一个生成失败三次的请求,比一次性成功贵得多。所以质量评测和错误降级,本身就是成本优化。
有时候多花一点 token 换更准的结构化输出,整体成本反而更低。
把成本指标放进监控
每次请求的成本、每用户平均成本、每次任务总成本,都应该进入监控面板。成本异常升高,通常意味着提示词膨胀或缓存失效。
成本优化不是一次性的,而是随用量增长持续进行的工作。
先看账单再优化
打开一周的模型调用账单,按接口、按用户、按任务类型分组,找出最贵的前五名。多数情况下,一个被循环调用的大模型接口会占掉大半成本。
优化从最贵的那一项开始,而不是从顺手能改的地方开始。
预算与账单对账
每月做一次「预算 vs 实际」对账:当初预估的调用量、token 单价、单次任务成本,和实际账单对比,差异通常来自三个地方:上下文越用越长、重试次数超预期、某个接口被高频调用。
对账的价值是校准预估模型:下个月的预算会更接近真实,团队对成本的敏感度也会提高。
成本管理不是省预算,而是让每一分钱都能对应到业务产出。
成本的五个隐藏项
除了模型 token,还有五个容易漏掉的成本:评测集标注的人工时间、提示词调试的试错消耗、日志与向量库存储、灰度测试的双倍调用、以及模型切换时的回归成本。
隐藏成本往往不是单笔很大,而是持续发生。建议每季度把隐藏成本单列出来,看有没有下降空间。
把隐藏成本算进预算,成本报表才接近真实。