3000 万到 1.7 亿个并发智能体:Epoch AI 把 HBM 产能换算成了「劳动力」

Epoch AI 这份研究的结论可以一句话概括:按 2025–2027 年出货的 HBM 算,全部部署后能支撑约 3000 万到 1.7 亿个并发前沿模型智能体,折算成工作量是每周 1.4 亿到 7.2 亿个全职员工的产出。听起来像科幻,但真正有价值的是它的推算方法,以及这个方法暴露出的三个约束。
数字是怎么来的
链条不复杂:HBM 出货量 → 每个 token 的显存占用(权重 + KV Cache)→ 单个智能体的请求节奏 → 并发数。区间之所以跨了 5 倍多,主要卡在三个假设上:单智能体的负载强度、上下文长度、以及「并发」的口径——是峰值并发还是全天候持续并发,两者能差一个数量级。
三个容易被忽略的约束
- 显存不是唯一瓶颈。HBM 只解决容量问题;芯片间互联带宽、电力供应与冷却能力,通常和显存卡在同一数量级上。算力园区里最先撞墙的往往不是芯片,是电。
- 供给能力不等于需求。能撑 1 亿个智能体,不代表有人愿意为 1 亿个智能体付费。报告的对照项正是需求侧收入——这也是它给出「产能过剩风险」判断的依据。
- 成本下降会自我消灭。单位成本一降,用法会从「按次调用」变成「长期常驻」——智能体开始 7×24 挂着做监控、做巡检、做交易。这是典型的杰文斯悖论:便宜不会减少消耗,只会改变消耗的形态。
对读者的实际影响
- 做 Agent 产品的团队:商业模型里必须显式写出「常驻成本」,只算单次调用价格会严重低估支出;
- 看算力与存储标的的人:供给宽松的年份,很可能同时是单价与利润率被压缩的年份,产能不等于利润;
- 做基础设施规划的:把「并发智能体数」当成容量单位来规划电力与散热,比按 GPU 张数规划更贴近真实负载。
一句话判断:制约智能体规模化的,短期内不是模型够不够聪明,而是显存、电力与愿付价格这三条线谁先见底。
参考来源
- Epoch AI:Estimating the agent population(epoch.ai/publications/estimating-the-agent-population)