27B 模型压进 6GB:本地部署的账要按「精度取舍」算,不是按参数量

结论先行
阿里巴巴的 Qwen 27B 通常需要约 60GB 内存,而 Prism ML 的团队通过用 1.5 bit 而非 16 bit 存储数值,把它压到 6GB,同时保留约 95% 的性能——在 6GB 占用下已经可以在树莓派这类设备上运行。这条消息常被当成猎奇标题传播,但它真正的意义是:本地部署的门槛,已经可以从「参数量」改写成「你愿意用多少精度换多少内存」。
三个要点
- 1.5 bit 意味着精度被当成了可交易的商品。 95% 是平均分。分类、路由、摘要、意图识别这类任务对长尾精度不敏感,损失很小;而精确计算、结构化抽取、代码生成恰恰相反,掉点往往集中在最难的那部分样本上。
- 别把「能在树莓派上跑」直接等同于「可用」。 跑得起来和跑得快、跑得稳是三件事。低比特推理在端侧的实际吞吐,很大程度取决于内存带宽而不是算力峰值。
- 对「人脑效率」这类比喻保持警惕。 生物大脑的能耗优势来自事件驱动的稀疏计算,而把权重压到低比特是另一条完全不同的路径。两者结果上接近,机理上不可类比。
- 省下来的内存,有一部分会在部署侧还回去。 低比特推理需要在计算时做反量化,额外开销与工程复杂度都会上升。所以「省内存」不等于「省总成本」,做端侧方案时这一项要单独评估。
对读者的建议:先做一张三列对照表
| 任务类型 | 建议精度 | 内存量级 |
| --- | --- | --- |
| 分类 / 路由 / 意图识别 | 1.5–2 bit | 1–6GB,可上边缘设备 |
| 摘要 / 重写 / 结构化抽取 | 4 bit 起 | 8–20GB,普通笔记本可承载 |
| 代码 / 数学 / 精确计算 | 8 bit 以上或走云端 | 别省这一步 |
然后做一件最关键的事:用你自己的小样本跑一遍回归。别人的 95% 是在别人的数据集上测出来的,你的任务未必在这个分布里。花半天验证,比事后返工便宜得多。
一句话:低比特量化的本质不是「魔法压缩」,而是把你的任务容忍度换算成内存预算——先算清容忍度,再选比特数。
参考来源
延伸阅读:1 亿美元、1 万名工程师:Anthropic 花钱补的不是模型,是部署能力 · 用置信度阈值做模型分级路由:降本的正确姿势不是「换便宜模型」 · Mistral Large 4 的 1T 参数和 49B 激活:欧洲拿出的不是「最强」,是「另一种选项」