4GB 显存把决策准确率从 20.7% 提到 74.3%:小模型该不该自己训

结论
Unsloth 公开了一套教程与开源仓库,可以把 Qwen3.5 0.8B 这类小模型微调成"直接输出选项概率"的决策模型,在三个决策基准上的合计准确率从 20.7% 提升到 74.3%,显存占用仅约 4GB;同期 Liquid AI 也开源了 d1-3B 与 d1-omni-600M 两个决策模型。结论比较明确:当任务是一道有界的选择题时,自己训一个小模型的性价比已经高于反复调用通用大模型。
三个要点
- 为什么是"输出概率"而不是"输出答案"。 通用模型被训练成生成自然语言,要它给 A/B/C 打分,是在让它做不擅长的事。把输出层改成选项概率分布,等于把任务从"写作"换回"分类",这也是准确率能翻三倍多的重要原因。
- 成本结构完全不同。 4GB 显存意味着单张消费级显卡就能完成微调与推理,没有按 token 计费的持续支出。相比调用大模型做同样判断,边际成本从"每次付费"变成"一次投入"。
- 难点不在训练而在数据集。 这类微调的效果几乎完全取决于你有没有一批标注一致、覆盖边界情况的历史决策样本。没有数据的话,直接用开源权重(如 d1 系列)是更现实的起点。
- 决策模型是可组合的零件。 它输出概率而非文字,意味着可以嵌进既有系统当"打分器",与大模型形成分工:大模型负责理解与生成,小模型负责在固定维度上稳定投票。这种拆分还会顺带解决一致性问题——同一输入多次调用得到同一个分数,这在质检和风控场景里比"回答得漂亮"更值钱。
对你意味着什么
建议按任务类型分两条路:规则清晰、选项有限、调用量大的判断(工单分类、风险分级、检索重排、质检打标)值得试着自己微调;开放式生成、需要长链条推理的任务仍应交给前沿模型。落地时注意三件事——先用 200 到 500 条样本做可行性验证再谈规模化;评测集必须独立于训练集,否则 74.3% 这类数字毫无意义;把模型升级与维护的人力成本算进去,小模型的"便宜"主要体现在推理侧,而不是维护侧。
参考来源
延伸阅读:检测准确率从 99.5% 掉到 76%:deepfake 攻防已经不对称了 · Claude Haiku 5.5 降价 75%:小模型的竞争已经移到单价表