9 月 28 日,Anthropic 发布 Claude Sonnet 5.5。时间点很耐人寻味:就在一周前,他们刚把旗舰 Opus 5.5 推上台,主打"更会思考"。现在这台"中杯",官方话术是"更便宜、更快的干活搭子,而不是一次能力飞跃"——一家卖了两年"基准霸主"故事的公司,主动把叙事从"谁更聪明"拧到了"谁更划算"。
话术一换,说明 Anthropic 对这场比赛的胜负手判断变了:从"谁更聪明",转向"谁更划算"。
一、价格没降,但账单要变小
先说最容易被误读的一点:Sonnet 5.5 的 API 名义价格一分没降,还是每百万输入 token 2 美元、输出 10 美元,和上一代入门价一样。
真正变的是"完成任务要花多少"。官方称,生成速度提升 30% 以上,单次任务成本最高降 30%。这 30% 不是靠砍单价,而是靠效率:新模型更常把多次工具调用合并到同一步,减少执行步骤;完成同类任务消耗的 token 更少。
这个区别很关键。过去我们比模型,习惯看"每百万 token 多少钱"。但放到 Agent 场景里,一次任务可能要调几十次工具、跑好几轮、耗几分钟——单价低不等于总账低。对日常 Agent 工作来说,该看的指标是"单次任务成本",不是"token 单价"。单价不变、效率更高,总账照样能少三成。
二、分数逼近旗舰,但分工更清楚了
Sonnet 5.5 在好几项基准上已经贴脸旗舰 Opus 5.5:
基准测试 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
Terminal-Bench 4.0(自主编程) | 70.6% | 10.3% | 66.4%¹ |
CursorBench 4.0(跨文件改代码) | 55.5% | 34.1% | 57.8% |
GDPval-AA v2.1(44 种职业真实工作) | 1844 | 1449 | 1846 |
跨文件改代码的 CursorBench 4.0 里,Sonnet 5.5 拿 55.5%,和 Opus 5.5 的 57.8% 只差 2.3 个百分点;覆盖 44 种职业的 GDPval-AA 上,1844 对 1846,基本平手。
但分数接近不等于该混用。Anthropic 给的分工很明确:Opus 5.5 负责需要持续判断的复杂、开放式任务;Sonnet 5.5 接定义明确、量又大的日常活——改代码、修 Bug、做文档、幻灯片和表格。客户反馈也印证了这点:Slack 在不动提示词的情况下,输出 token 少了约 14%;Zendesk 用数百个真实工单测,处理速度比现用模型快 20%。
说白了,你团队 80% 的常规活,这台"中杯"大概率接得住。
三、一个反直觉的判断:更聪明不一定更好
这里有个很容易被忽略的细节,也是选型的硬标准。
在 FrontierCode 1.1 长时程编程测试里,Sonnet 5.5 在最高推理强度(Max)下反而只拿 46.2%,低于次高档(Xhigh)的 52.1%。Anthropic 的解释是:Max 模式给了模型最大的思考自由度,但它更频繁地触发代码审查、把任务拆给子 Agent,结果在部分场景里超时,或者改出了任务范围之外的代码。
换句话说,对明确的日常 Agent 任务,多想不一定多对,还可能更慢、更贵、更越界。这直接推翻了"推理强度拉满就最好"的直觉。选模型时,别只看能力上限,要看它在你的真实任务上"匹配度"最高那一档。
四、真正值得关注的,是比赛规则变了
把视野拉远一层:Sonnet 5.5 这种"中档高速模型"走红,背后是智力差距在被填平。
第三方评测 Artificial Analysis 的智能指数上,Sonnet 5.5 拿 56 分,只比 Opus 5.5 低 2 分。而开源、开放模型这边,Qwen、MiniMax 等已经在关键基准上逼近闭源梯队——当一家能免费自部署的模型在开发者最在意的基准上和你的付费 API 咬得越来越紧,"纯拼谁更聪明"就不再是稳赢的打法。
所以 Anthropic 这次主动把话术从"基准霸主"换成"便宜可靠的干活搭子"。在智能趋于同质化的区间里,这等于把竞争压到"谁能用更低的单次任务成本,可靠地把活干完"。
对办公提效和知识工作而言,这才是 Sonnet 5.5 类模型真正的意义——它们会加速 Agent 在文档、表格、代码修复这些日常任务里的规模化部署。因为规模化最怕的不是不够聪明,是太贵、太慢、太不稳定。
给你的选型三问
读完这篇,下次有人问"该上哪个模型",别急着比跑分。先问三句:
- 这活是定义明确,还是需要持续判断?明确、量大——交给 Sonnet 5.5 这类中档高速模型;开放式、要深度判断——才上旗舰。
- 你现在的 API 账单里,有多少日常 Agent 任务在用旗舰价在跑?把这部分切出来,可能直接省下相当一块。
- 推理强度是不是默认拉到了 Max?日常任务未必需要,拉满反而可能掉分、超时、超成本。
价格战打到最后,赢家不一定是模型最聪明的那家,而是把"单次任务成本"算得最清楚、用得最稳的那家。Sonnet 5.5 只是一个开始。