拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Anthropic 不卷智商了:Sonnet 5.5 把大模型比拼拽进“谁更划算“

Anthropic 不卷智商了:Sonnet 5.5 把大模型比拼拽进“谁更划算“

9 月 28 日,Anthropic 发布 Claude Sonnet 5.5。时间点很耐人寻味:就在一周前,他们刚把旗舰 Opus 5.5 推上台,主打"更会思考"。现在这台"中杯",官方话术是"更便宜、更快的干活搭子,而不是一次能力飞跃"——一家卖了两年"基准霸主"故事的公司,主动把叙事从"谁更聪明"拧到了"谁更划算"。

话术一换,说明 Anthropic 对这场比赛的胜负手判断变了:从"谁更聪明",转向"谁更划算"。

一、价格没降,但账单要变小

先说最容易被误读的一点:Sonnet 5.5 的 API 名义价格一分没降,还是每百万输入 token 2 美元、输出 10 美元,和上一代入门价一样。

真正变的是"完成任务要花多少"。官方称,生成速度提升 30% 以上,单次任务成本最高降 30%。这 30% 不是靠砍单价,而是靠效率:新模型更常把多次工具调用合并到同一步,减少执行步骤;完成同类任务消耗的 token 更少。

这个区别很关键。过去我们比模型,习惯看"每百万 token 多少钱"。但放到 Agent 场景里,一次任务可能要调几十次工具、跑好几轮、耗几分钟——单价低不等于总账低。对日常 Agent 工作来说,该看的指标是"单次任务成本",不是"token 单价"。单价不变、效率更高,总账照样能少三成。

二、分数逼近旗舰,但分工更清楚了

Sonnet 5.5 在好几项基准上已经贴脸旗舰 Opus 5.5:

基准测试

Sonnet 5.5

Sonnet 5

Opus 5.5

Terminal-Bench 4.0(自主编程)

70.6%

10.3%

66.4%¹

CursorBench 4.0(跨文件改代码)

55.5%

34.1%

57.8%

GDPval-AA v2.1(44 种职业真实工作)

1844

1449

1846

跨文件改代码的 CursorBench 4.0 里,Sonnet 5.5 拿 55.5%,和 Opus 5.5 的 57.8% 只差 2.3 个百分点;覆盖 44 种职业的 GDPval-AA 上,1844 对 1846,基本平手。

但分数接近不等于该混用。Anthropic 给的分工很明确:Opus 5.5 负责需要持续判断的复杂、开放式任务;Sonnet 5.5 接定义明确、量又大的日常活——改代码、修 Bug、做文档、幻灯片和表格。客户反馈也印证了这点:Slack 在不动提示词的情况下,输出 token 少了约 14%;Zendesk 用数百个真实工单测,处理速度比现用模型快 20%。

说白了,你团队 80% 的常规活,这台"中杯"大概率接得住。

三、一个反直觉的判断:更聪明不一定更好

这里有个很容易被忽略的细节,也是选型的硬标准。

在 FrontierCode 1.1 长时程编程测试里,Sonnet 5.5 在最高推理强度(Max)下反而只拿 46.2%,低于次高档(Xhigh)的 52.1%。Anthropic 的解释是:Max 模式给了模型最大的思考自由度,但它更频繁地触发代码审查、把任务拆给子 Agent,结果在部分场景里超时,或者改出了任务范围之外的代码。

换句话说,对明确的日常 Agent 任务,多想不一定多对,还可能更慢、更贵、更越界。这直接推翻了"推理强度拉满就最好"的直觉。选模型时,别只看能力上限,要看它在你的真实任务上"匹配度"最高那一档。

四、真正值得关注的,是比赛规则变了

把视野拉远一层:Sonnet 5.5 这种"中档高速模型"走红,背后是智力差距在被填平。

第三方评测 Artificial Analysis 的智能指数上,Sonnet 5.5 拿 56 分,只比 Opus 5.5 低 2 分。而开源、开放模型这边,Qwen、MiniMax 等已经在关键基准上逼近闭源梯队——当一家能免费自部署的模型在开发者最在意的基准上和你的付费 API 咬得越来越紧,"纯拼谁更聪明"就不再是稳赢的打法。

所以 Anthropic 这次主动把话术从"基准霸主"换成"便宜可靠的干活搭子"。在智能趋于同质化的区间里,这等于把竞争压到"谁能用更低的单次任务成本,可靠地把活干完"。

对办公提效和知识工作而言,这才是 Sonnet 5.5 类模型真正的意义——它们会加速 Agent 在文档、表格、代码修复这些日常任务里的规模化部署。因为规模化最怕的不是不够聪明,是太贵、太慢、太不稳定。

给你的选型三问

读完这篇,下次有人问"该上哪个模型",别急着比跑分。先问三句:

  1. 这活是定义明确,还是需要持续判断?明确、量大——交给 Sonnet 5.5 这类中档高速模型;开放式、要深度判断——才上旗舰。
  2. 你现在的 API 账单里,有多少日常 Agent 任务在用旗舰价在跑?把这部分切出来,可能直接省下相当一块。
  3. 推理强度是不是默认拉到了 Max?日常任务未必需要,拉满反而可能掉分、超时、超成本。

价格战打到最后,赢家不一定是模型最聪明的那家,而是把"单次任务成本"算得最清楚、用得最稳的那家。Sonnet 5.5 只是一个开始。

返回列表