68 分要 14.19 美元:Coding Agent 榜单把「能力强」和「用得起」拆成了两个指标

这一轮编码 Agent 的选型,最容易犯的错是只看榜首。
Artificial Analysis 发布的 Coding Agent Index 显示,Claude Sonnet 5.5(max 档)在 Claude Code 上以 68 分居首,但它的每任务成本也最高,达到 14.19 美元。同一批数据的另一面是:同一代模型内部出现了明显的价格优化——GPT-6.1 Sol 的每任务成本比 GPT-6 Sol 低约 30%。
两条信息合起来看才是重点:分数榜的第一名与「用得起的那个」正在分岔。 在聊天场景里,这个分岔无关痛痒;在 Agent 场景里,它直接决定项目能不能跑下去。
为什么 Agent 场景的成本不能用聊天的方式估
- 成本被「步数」乘了一次。 一次任务里模型要经历几十次工具调用与上下文回灌,单次调用的价差会被往返次数放大,而不是线性叠加。
- 失败也要付费。 走错路、重试、回滚,这些在聊天里几乎不存在,在 Agent 里是常态。评估时必须把「无效步数」计入账单。
- 长上下文是另一笔隐性支出。 上下文越堆越长,每一轮都要重新读一遍,成本随进度条爬升。
一套可落地的分层策略
- 把任务按「错了会怎样」分档。 会写坏生产数据、会改错核心逻辑的,用最强档;批量改写、信息抽取、格式转换这类可人工复核的,用中档。
- 给重试设预算上限。 一个任务超过 N 次重试就停下来要人介入,这既是成本控制,也是质量信号——反复失败通常说明任务本身没拆好。
- 建立自己的「每任务成本」台账。 榜单给的是公开基准,你的真实成本取决于任务分布。连续记录两周,你会得到比任何榜单都准的选型依据。
对读者的实际影响
别用「哪个模型最强」来回答「我该用哪个」。 正确的问法是:这个任务链的月频次是多少、单次能容忍多长耗时、失败一次要赔多少。把这三个数写下来,14.19 美元和 30% 的降幅才有意义。
榜单的价值在于给出边界——它告诉你能力的上限在哪、成本的量级在哪;而选择发生在边界之内,那里只有你的任务分布说了算。