中美顶尖模型只差 3%:真正被改变的不是排名,是「追赶」的成本结构

结论
彭博行业研究给出的这组数字值得认真看,但不该被读成「追平」:DeepSeek 9 月发布 V4.1 Flash 之后,中国顶尖模型在基准测试上仅落后美国对手约 3% —— 5 月这个数字还是约 9%,今年更早的时候是 15%。真正的信息不是「只差 3%」,而是收敛的速度与成本不对称。
三个要点
- 收敛比线性外推更快。 从 15% 到 9% 再到 3%,大致用了一个半季度。若只做机械外推,几个月后「差距」这个指标本身就会失去区分度,而这恰恰是它最危险的地方:指标失效后,大家会误以为选择变简单了。
- 基准差距不等于产品能力差距。 LiveBench 这类离线静态评测,衡量的主要是单轮知识与推理表现。它不覆盖工具调用成功率、长程任务稳定性、缓存命中价格、区域可用性与限流策略 —— 而这些才是把模型接入生产时真正会卡住你的东西。
- 「差距」的定义权在评测方手里。 同一批模型换一个榜单、换一套采样参数,排序就会变。所以单一榜单收窄,说明不了差异化竞争结束,只说明通用能力这一维度确实在被拉平。
对你意味着什么
不要再按「国别」做选型。 拿你自己的失败模式做几条回归用例,按三个维度实测:任务形状匹配度、单位成本(含缓存与重试)、可部署性(私有化 / 区域 / 合规)。公开榜单只用来筛掉明显不合适的候选,不用来决定赢家。
把评测变成资产。 外部榜单会变、会失效;你自己那 10 条覆盖真实坑位的用例不会。企业侧尤其如此:与其追每季度的新榜,不如把评测沉淀成内部基准。
对做内容与增长的人: 「差距收窄」这类叙事会反复出现、反复被重新定价。它适合做讨论引子,不适合当作技术判断的依据。
一句话:差距缩到 3% 之后,竞争从「谁的模型更强」换成了「谁更懂自己的任务」。
参考来源
- 彭博行业研究报告(经 IT之家报道):中美顶尖模型 LiveBench 差距缩至 3%