不写文章、只出概率:d1 这类「决策模型」为什么可能更实用

结论先行
不是所有任务都需要一个「会写文章」的模型。把问题从「生成文本」换成「给出一个概率」,成本与延迟会下降一个数量级——这正是决策模型的价值所在。
它是怎么工作的
Liquid AI 的 d1 接收非结构化输入(文本、图像,或两者)以及一个或多个问题,在一次前向传播中读完,直接返回概率,不生成任何 token。它支持三类问题:
- 是/否:返回 0 到 1 的概率;
- 多选:为每个候选标签给出概率;
- 打分:给出分档加权后的位置。
一次请求可以对同一状态问多个问题,因此节省输入 token。文本决策耗时约 200 到 300 毫秒,足以支撑实时应用。
数据说明了什么
Liquid AI 用六个真实场景对比 GPT-6.1 Sol 与 Claude Opus 5.5,d1 在其中四个持平或更好,成本低 19 到 200 倍,且每个任务都更快。
- 视觉检测场景(电路板、蜡烛、腰果、口香糖)准确率 85% 到 97%,而且模型并未针对该任务训练,仅靠一段简短描述就能理解任务。
- 在智能体的上下文压缩场景里,它逐条读取工具输出,决定保留、裁剪还是丢弃,最终删掉 52% 的 token,同时保留任务必需的全部输出。
计费方式也变了
d1 只按输入 token 计费、没有输出 token。图像按每 32×32 像素块 1.5 token 计入,一张 1024×1024 的图约等于 1536 token,且每个问题单独计费。目前已通过 Vercel 与 OpenRouter 提供(暂仅文本),后续计划开放权重。
对你的实际影响
值得做一次「决策审计」:把系统里那些只需要判断的环节摘出来——工单是否需要升级、文档该归到哪个目录、工具输出该留还是该丢、这一帧图有没有缺陷。这些调用换成决策模型后,成本与延迟同时下降,而且不需要改动整体架构,只需换掉一处调用。分界线也很清楚:如果输出需要是「一个答案」,决策模型更划算;如果需要是「一段话」,仍然得用生成式模型。