Mistral Large 4 的 1T 参数和 49B 激活:欧洲拿出的不是「最强」,是「另一种选项」

Mistral AI 以公开预览形式发布 Mistral Large 4(内部代号 Le Chonk),总参数约 1.05 万亿、每个 token 激活约 49 亿?不是——是 49B 激活。这是一款细粒度 MoE 多模态模型,已在自家 3,800 块 NVIDIA Grace Blackwell GPU 集群上完成训练,现在可通过 Mistral API 调用,官方承诺本月底开放权重。
关键数字
- 总参数约 1.05T,每 token 激活约 49B,走的是「大容量 + 稀疏激活」的路线。
- 训练规模 3,800 块 GB200 级别 GPU,属于欧洲企业目前公开的最大单集群之一。
- 官方定位覆盖编码、网络防御,以及制造、金融、电气工程等垂直领域,可驱动通用智能体完成「收集信息 → 产出成品交付物」的长链路任务。
- Mistral 明确表示模型从零训练,而非对现有模型做知识蒸馏——这句话是冲着「开源模型多为蒸馏产物」这一质疑来的。
为什么「开放权重」这四个字比分数更重要
Artificial Analysis 的盘点把重点放在参数与部署上,但我认为这件事真正的分量在于时间点与地区。当前前沿模型的能力差距在收窄,而采购方的核心焦虑已经从「谁的分数高 3 分」转为「我能不能自己掌控这条链路」。一个 1T 级、承诺开放权重、明确可自托管的模型,提供的正是这种掌控感。
对欧洲市场尤其如此。欧盟的合规框架要求数据处理链条可追溯、可审计,闭源 API 的跨境调用始终是合规部门的心病。一个能落到自有数据中心的开放权重模型,即便能力略逊,也常常是唯一能过审的选项。Mistral 卖的其实不是模型,是合规路径。
需要冷静看待的三点
第一,预览版不等于可用版。权重月底才释出,中间还有一周多的窗口,实际量化后的显存占用、推理吞吐、以及社区微调生态都还是未知数。49B 激活虽然比稠密 1T 友好得多,但要让 1T 权重跑起来,硬件门槛依然远高于主流开源模型。
第二,「可自托管」与「自托管得起」是两件事。真正能本地跑起 1T 级 MoE 的组织,数量比「关心开源」的组织少一到两个数量级。开放权重在信创与合规叙事上的价值,可能要大于它在中小团队中的实际部署价值。
第三,垂直领域宣称需要验证。网络防御、电气工程这类领域的评测基准普遍缺乏公开、可复现的口径,厂商自评的领先幅度应当打折看。
对读者的实际影响
如果你在做模型选型:把 Mistral Large 4 记进候选池,但不要急着迁移——等权重释出后先做一次量化推理的显存与吞吐实测,再判断是否进入生产。如果你在做合规评估:这是一个很值得拿去和法务、安全部门讨论的样本,「开放权重」四个字能省掉大量解释成本。如果你只是日常使用者:短期内最实际的变化是 API 价格表上多了一个竞争者,长上下文与多模态任务的价格有可能被压下来。
参考来源
- Mistral AI: Mistral Large 4 官方公告
- Artificial Analysis: Mistral Large 4 发布盘点
- Datawhale:Mistral 发布 1 万亿参数 Le Chonk
延伸阅读:辛顿要 AI 过「FDA 那道门」:监管真正难的不是门槛,是拿什么当证据 · OpenAI 放出 722 篇数学手稿:值钱的不是答案,是「可验证」