用量涨了 50%、账单反而降了:企业 AI 省钱的三个动作

一个反直觉的数据:美国企业的 AI 用量在涨,账单在降。
Ramp 经济学家 Ara Kharazian 发布的最新 Ramp AI Index 显示,美国企业 AI 支出自 7 月见顶后回落,而用量持续上升,到 9 月底创下历史新高,增幅约 50%。
先别急着说「降价了」
最容易得出的结论是「模型在降价」。这不全错——单位 token 价格确实在降——但把 50% 的用量增长和支出下降全部归因于降价,会漏掉企业侧真正发生的事。用量与支出能反向走,通常说明工作负载的构成变了。
从公开的工程实践看,主要是三件事。
动作一:分级路由,而不是全用最好的
最贵的浪费不是用了大模型,而是用大模型干了小模型的活。分类、抽取、格式转换、简单问答,这些任务的正确率在中小模型上与大模型差距很小,但成本差一个量级。做一层路由、按任务类型分派,是投入产出比最高的一步。
动作二:把重复的部分缓存起来
企业场景里请求高度同质化:同一份制度文件、同一个商品目录、同一段代码库,被反复塞进提示词。前缀缓存与结果缓存能直接把这部分成本压到接近零。衡量指标也很直观——缓存命中率。如果这个数字还是个位数,说明优化空间还很大。
动作三:把「长对话」改成「Agent + 工具」
这条最反直觉。长上下文问答的每一轮都要重发历史,成本随轮次线性上涨;而让模型调用工具去取数据,模型只需处理「该调用什么」与「结果是什么」,token 消耗反而更少。多智能体架构在数学证明这类任务上之所以能收敛,靠的就是同一个思路:把已验证的中间结果固化成可复用的外部事实,而不是每轮重新推理一遍。
给读者的落地顺序
- 先量出 token 分布。 不看分布就做优化等于盲猜。先弄清请求量最多的任务是什么、token 花在哪里(输入还是输出、历史还是提示词)。
- 设阈值,而不是凭感觉换模型。 用一批真实请求做对照评测,确定「多大比例的任务小模型能过」,再定路由阈值。
- 把缓存命中率纳入监控。 它比总花费更早暴露问题——因为总花费还受业务量波动影响。
- 警惕省钱的隐性代价。 路由会引入一致性问题:同类问题被两个模型回答,口径可能不一致。对外表达需要统一口径的场景,要强制单模型。
用量涨而账单降,本质上是把「用得多」和「用得好」拆开了。 能拆开,说明这个市场终于开始进入工程化阶段。