3.3 GHz 打赢高主频:NVIDIA Olympus 说明服务器 CPU 的胜负手已经换了

结论
Chips and Cheese 拆解了 NVIDIA 的服务器核心 Olympus:这是一款 10 宽乱序核心,主频只有 3.3 GHz,却靠每周期性能取胜,并采用 SMT 实现,单线程表现接近桌面级。在 SPEC CPU2026 中,它的分支预测略逊于 AMD Zen 5、略优于 Intel Lion Cove,浮点测试则领先两家。这条分析的意义不在于谁多赢了几分,而在于它印证了一个趋势:当主频难以继续上推,服务器 CPU 的胜负手已经转移到"每周期能做多少事"上。
三个要点
- "10 宽 + 3.3 GHz"是一种明确的取舍。 与其硬堆频率、承受功耗与散热代价,不如把资源投在指令级并行上。在数据中心这种按电费和机架密度算账的地方,每周期性能比峰值频率更值钱。
- 分支预测与浮点,分别对应两类真实负载。 分支预测决定通用代码(编译器、数据库、控制逻辑)的效率;浮点领先则直接关系到 AI 与科学计算场景。NVIDIA 在浮点上占优,与它的整体定位是一致的。
- 服务器 CPU 的竞争重回"架构"赛道。 过去几年主频与核数的军备竞赛接近瓶颈,厂商重新开始在解码宽度、乱序窗口、缓存层次这些经典维度上比拼。对采购方而言,这意味着选型不能只看"多少核、多少 GHz"。
对你意味着什么
选服务器 CPU,看"每核性能"和"每瓦性能"。 核多但单核弱,会拖慢数据库、编译、脚本类负载;核少但单核强,可能更适合高并发下的低延迟场景。按你的真实负载曲线来配,而不是按参数表。
把软件优化纳入预算。 宽乱序核心对编译器优化、内存访问模式更敏感。同一套代码,调整数据布局或编译选项,可能比换硬件带来更大收益。
关注散热与功耗的连带成本。 主频低但宽度大的设计,通常在能效上更友好。数据中心的总成本里,电费与散热占比很高,这部分收益往往被低估。
对 AI 基础设施,别把它当纯 GPU 问题。 训练与推理的调度、数据预处理、参数同步都跑在 CPU 上。CPU 这一环变强,整条链路的实际吞吐也会跟着变。
一句话:当主频撞到墙,"每周期做多少事"就成了新的性能货币 —— 这也正是这款核心想证明的事。
参考来源
- Chips and Cheese:NVIDIA's Olympus Core: Pushing Server Single-Thread Performance
延伸阅读:可灵把发布会搬到纽约广告周:AI 视频的胜负手换成了「采购链路」 · 荷兰税务部门放弃微软365迁移计划 将转向自建服务器与欧洲开源方案