8800 万美元押注「光的内存」:推理瓶颈其实不在算力,在搬运

把钱投给「内存带宽」而不是「更多算力」,方向是对的。
光学互连公司 Volantis 完成 8800 万美元 A 轮融资,思路是用光学技术为每颗芯片提供更大容量、更高带宽的内存,目标是在 10T 参数以上的模型上做到每位用户最高 10,000 tokens/秒的推理速度。团队有 CoWoS、HBM 与硅光 CPO 背景,下一代产品已流片。这笔钱押的不是「能不能做出来」,而是「能不能量产」。
为什么瓶颈在内存而不是算力
- 推理分两段,瓶颈不同。 预填充阶段偏算力,解码阶段是典型的内存带宽受限——每生成一个 token,都要把权重与 KV 缓存搬一遍。带宽不够,算力再强也在等数据。
- 光学互连的真实门槛在封装。 把光引擎与计算芯片做进同一封装(CPO),要同时面对硅光良率、耦合精度与热管理三重压力;流片只证明设计跑得通,量产良率才是分水岭。
- 10,000 tokens/秒是目标,不是基线。 这类数字通常在理想配置与特定模型规模下取得,别直接拿来估算自己的成本。
光学之外,还有哪些路
带宽问题不是只有光学一条解法,理解这几条路的取舍,才能判断这笔融资的必要性:
- 先进封装与 HBM 迭代。 把内存堆得更近、层数更多,是当前最主流的做法;路径确定,但瓶颈在产能与成本,天花板清晰。
- 量化与稀疏化。 把权重压到 4 位甚至更低,等于直接减少搬运量,见效最快、门槛最低,代价是精度与工程复杂度。
- 预填充与解码分离部署。 纯软件方案,不改硬件就能让两类负载各用各的资源,是多数团队当下最现实的带宽红利。
- 存算一体。 把计算搬进存储阵列,理论上更彻底,但工艺成熟度最低。
光学方案的价值在于它直指封装内带宽这个最硬的天花板。如果它量产成功,上面几条路的压力都会减轻。
对读者的判断建议
看这类公司,建议只问三个可验证的问题:
- 流片是否真的落在先进封装产线上,还是只有测试片;
- 是否有客户付费试产,而不是只有联合新闻稿;
- 单位 token 成本曲线能不能跨批次复现。
三个都答得出来,说明它离产品近;只答得出第一个,说明中间还隔着一个良率难关。对做推理服务的团队来说,更现实的动作是先在软件侧要带宽红利——把预填充与解码拆开部署,往往不用等硬件就能见效。