OpenAI 把「判断」做成了一个 API:10 美分/百万输入 token,不收输出费

DevDay 预告之后,OpenAI 的 Decisions API 于 10 月 6 日进入公开测试。它做的事很窄:给定输入,输出一个结构化判断——不写文章、不聊天,只回答"是不是""选哪个""打几分"。
它的形态
- 决策模型
gpt-6-luna,支持图像输入,不只是文本。 - 支持三类问题:是/否谓词(predicate)、多选(choices)、打分(scores)。
- 只按输入 token 计费,不按输出计费,价格 10 美分/百万输入 token(同类产品 Jev 为 4.2 美分/百万)。
- 社区转述称其吞吐比 Responses API 快约 10 倍。
典型返回是这样一行 JSON:
{"type": "predicate", "name": "evaluation", "probability": 0.0}Simon Willison 很快发布了 llm-openai-decisions 0.1a0 插件(由 GPT-6 Astra 阅读官方文档后写成,思路沿用他此前的 llm-typesafe):llm install llm-openai-decisions,然后附一张图问"这张图里有哺乳动物吗"。
为什么这个方向值得关注
智能体在生产环境里最不稳定的部分,往往不是"生成",而是分支判断:这条线索是否够资格?这封邮件该不该升级?这个工单属于哪一类?过去这些判断混在对话式推理里,成本不可算、结果不可缓存、延迟不可控。
把它单独抽成一个 API 之后,三件事变得可工程化:
- 成本可算:单价与输入长度直接相乘,不随"模型换个说法"而膨胀。
- 结果可缓存:同一份输入反复出现时,判断可以复用。
- 延迟可控:判定不再是长链条生成,而是短输出甚至零输出。
对开发者的建议
第一,把你管线里"凡是要模型拍板的分支"列出来,逐个评估是否可以换成谓词或打分。第二,保留 prompt 版本与判定样本,把它当成需要回归测试的代码而非提示词。第三,注意它仍然只输出概率——阈值还是你定的,责任不会因为 API 结构变干净而转移。
参考来源
延伸阅读:一天铺开五个入口:Ling-3.1-Flash 把「渠道」做成了发布的一部分 · 78B 只激活 3.46B:欧洲把「可自托管的前沿」做成了开源