每天近万亿 token:Prime Inference 把开源前沿模型做成了「按需水电」

开源模型的竞争,正在从前端「权重好不好」转移到后端「能不能被稳定、便宜地调用」。Prime Intellect 发布 Prime Inference,就是这个转变的一个清晰样本。
它提供了什么
- 两种形态:serverless 端点(按需起、按用计费)与预留容量(保底吞吐、成本可预测),跨数据中心部署;
- 已上线 GLM-5.3 端点,属于当前开源前沿梯队;
- 官方自述每天处理近一万亿 token;
- 架构层面明确写到在 GB200 NVL72 上服务 GLM-5.3,并包含内核级优化。
为什么这件事很重要
权重开放只解决了「模型能不能拿到」,没有解决「模型能不能被稳定调用」。中间缺的这一层,长期由云厂商以托管服务的形式补,但托管通常绑定一家云、一份定价、一套限额。独立推理服务商出现,等于给开源模型补上了「中立的水电」。
- 对初创团队:不必自建集群、不必谈云合同,直接按需调用前沿开源模型;
- 对模型方:是否有靠谱的推理伙伴,直接决定权重发布后的实际采用率——模型再好,跑不起来也没人用;
- 对云厂商:推理这一层的毛利会最先被竞争打薄,价值会往「更强的模型」和「更深的行业方案」两端转移。
三个判断
- 开源前沿模型的实际价值 = 权重质量 × 推理服务质量,两者是乘法不是加法;
- 「每天近万亿 token」是这一梯队的入场券,规模不足就没有单位成本优势;
- 真正稀缺的不是吞吐,是稳定性与 P99 尾延迟——serverless 的冷启动、预留容量的排队策略,才是能不能进生产的分水岭。
给开发者的实操建议
- 选型时同时测 serverless 与预留两条路径,重点看尾延迟,而不是平均值;
- 把「模型可替换」写进架构:端点可插拔,换另一家或另一个模型不需要改业务代码;
- 用预留容量兜住基线流量、用 serverless 承接峰值,成本结构会比纯按需合理。
一句话:推理层的竞争刚刚开始,而它的胜负手不在模型,在工程。
参考来源
- Prime Intellect:Prime Inference 发布公告(primeintellect.ai/blog/prime-inference)