560B 参数只激活 25B:蚂蚁 Ling-3.1-flash 把国产模型的竞争锚点挪到了「长任务」

榜单分数的边际价值在下降,「能不能连续干完一件事」正在成为新的分水岭。
蚂蚁百灵发布 Ling-3.1-flash:总参数约 560B,每 Token 激活约 25B,上下文窗口上限 1M;延续混合线性架构并提高线性 Attention 层比例(7 层 KDA 配 1 层 Gated MLA,512 个路由专家选 8 个加 1 个共享专家),定位「真实世界长任务」。
三个技术选择背后的意图
- 稀疏度约 1/22(25B 激活 / 560B 总量):把推理成本压到接近中型模型的量级,同时保留大模型的知识容量。这是「能力按参数买,成本按激活买」的直接体现。
- 线性 Attention 占比提高:标准 Attention 的代价随序列长度平方增长,长上下文下这是最主要的成本项。7:1 的比例说明团队在为「长」付工程代价。
- 1M 上下文:不是为了塞进更多文档,而是为了让 Agent 在多轮工具调用中不必反复摘要——每一轮摘要都是一次信息损耗。
长任务才是真正的分界线
短问答只要模型够聪明就行;长任务考的是三件事:状态不丢、成本可控、出错可恢复。前两点靠架构,第三点靠系统设计(检查点、回滚、重试)。所以模型侧再强,也只解了三分之一。
对读者的实际影响
- 选型:场景若只是「一次问答」,长上下文带来的成本增加不划算;若是跨多轮的工程任务,长窗口省下的摘要损耗往往比单价更重要。
- 成本测算:按激活参数估推理成本,按总参数估部署门槛(显存 / 多卡),两者差别很大,别只看一个数字。
- 工程重点:把精力放在检查点与幂等设计上。模型变强不会自动解决「跑到一半断了」。
结论:Ling-3.1-flash 的价值不在参数表,而在于它把国产模型的竞争锚点从「分数」挪到了「长任务可完成率」。
参考来源
- 蚂蚁百灵公众号《Ling-3.1-flash 发布》
- AIHOT 条目