AI Coding
Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna,以及一场新的价格战
前几天是 Grok 4.7 和 MiMo v2.6 Flash/Pro。最近 Anthropic 发布了 Claude Opus 5.5,大约一小时后 OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna。要好好了解所有这些新模型还需要一段时间,但以下是我目前的印象。
GPT-6 Sol 和 Luna 的价格是各自 GPT-5.6 对应版本的一半
GPT-5.6 Luna 已经是我最喜欢的用于构建应用的模型,因为它把出色性能和极低价格结合在了一起。不知怎么,GPT-6 Luna 又在此基础上便宜了一半——而 GPT-6 Sol 相比 GPT-5.6 Sol 也有类似降价。
以下是今天的定价格局:
注意,GPT-5.6 已计划在 11 月涨价 25%,所以 GPT-6 的价格是这些模型促销价的一半。
(GPT-5.6 Terra 与 GPT-6 Sol 定价相同,任何继续使用 Terra 的剩余理由都烟消云散了。)
这种定价的竞争力再怎么强调也不为过。Grok 4.7 定价为 $2/$6,不到 GPT-5.6 Sol 的一半,但现在输入价格与 GPT-6 Sol 相同,输出价格也更接近。
在 $0.10/$0.50 的价格下,GPT-6 Luna 是 OpenAI 有史以来发布的最便宜模型之一,只有弱得多的 GPT-4.1 Nano($0.10/$0.40,2025 年 4 月)和 GPT-5 Nano($0.05/$0.40,2025 年 8 月)比它更便宜。
我为 GPT-6 Luna 和 GPT-6 Sol 渲染了鹈鹕,然后把它们与 GPT-5.6 的鹈鹕全部合并到这个对比网格中。我喜欢你可以立刻看出 5.6 系列选用了更大胆、更明亮的颜色,而 6 系列则柔和得多。我仍然认为 GPT-6 Astra 在 max 下生成了最好的鹈鹕。
Claude Opus 5.5也降价了
Opus 5.5 看起来解决了人们对 Opus 沟通风格的最大抱怨。Thariq Shihipar:
Opus 5.5 是你们反馈的结果。
它沟通清晰,每 token 比 Opus 5.0 更便宜,具备 Fable 5.1 的智能,token 效率很高,并且适用于所有思考力度等级。
它还意在更擅长 Blender。我期待在那里测试它的能力。
Opus 4.5、4.6、4.7、4.8 和 5 价格都相同:输入每百万 token 5 美元,输出每百万 token 25 美元。5.5 降低了 20%——每百万 token 4 美元和 20 美元。
缓存读取价格下降了 60%。这对较长的智能体对话意义重大,因为其中 90% 以上的输入 token 都按缓存 token 价格处理。
Opus 5.5 的新价格与 GPT-5.6 Sol 相同,但那是 OpenAI 将 Sol 价格减半之前。
GPT-6 Astra 和 Claude Fable 5.1 定价均为输入每百万 token 10 美元、输出每百万 token 50 美元。价格战目前影响的是它们下面那一档模型。
Anthropic 表示 Sonnet 5.5 和 Haiku 5.5 即将推出。看看 Haiku 能否在低端重新获得价格竞争力会很有意思,因为当前 Haiku 4.5 是 $1/$5,而最新的 GPT-6 Luna 是 $0.10/$0.50,只有其十分之一
Claude Opus 5.5 的 max 过度思考到崩溃
在我的“生成一只骑自行车的鹈鹕的 SVG”测试中,Claude Opus 5.5 在“max”思考等级下首次未能返回响应!
它一开始称这是“一个经典测试请求”,然后非常非常努力地思考自己在做什么:
这是一个经典的测试请求,所以我想规划一只构图良好的鹈鹕,它有独特的喙和喉囊,骑着一辆带有合适车轮、车架和脚踏板的自行车,背景是简单的天空和地面。[...]
验证小腿长度约为 95.2,足够接近。现在我正在算出近侧腿从髋部到膝盖再到脚踝的路径,然后勾勒踩在脚踏板上的脚部形状——用由直线和曲线构成的路径描出脚跟、脚趾尖和脚底轮廓,使其自然地落在 y=478-494 附近的脚踏板表面上。[...]
我喜欢那条从篮子里显眼地伸出来的鱼,鹈鹕盯着它,这是个值得保留的有趣细节。我还在确认喙基附近的眼部位置符合典型鹈鹕解剖结构,并考虑给它一个稍微更开心的表情。[...]
远侧腿正确地表现为从车架后方穿过,所以我继续检查牙盘齿并确认图层顺序——远侧曲柄臂应大部分被座管和牙盘遮住。我正在确定最终 SVG 的 width 和 height 属性以及 viewBox,以确保正确缩放,并注意到没有文本,所以不需要 font-family。[...]
我本来非常期待看到这只鹈鹕……但它随后停了。Opus 5.5 的最大输出 token 限制为 128,000(其他 Claude 模型也是如此),而它在还在推理这个 SVG 时就撞上了这个限制!
我试了第二次,得到相同结果。这让我怀疑“max”实际上毫无用处——如果它在一个愚蠢的 SVG 提示上都会过度思考到崩溃,我不相信它不会在更有趣的工作上做同样的事。(那两次失败各花了我 2.56 美元,并耗时近 20 分钟。)
Fable 5.1 在“max”下没有过度思考,并且确实给了我见过的任何 Anthropic 模型中最好的鹈鹕。
我还建了这个对比网格,将它们与 Opus 5、Fable 5.1 和 Sonnet 5 的鹈鹕进行比较:
通过画骑自行车鹈鹕的能力来比较不同模型厂商,现在可能没太大意义(如果曾经有的话),但我仍然发现用它们来比较同一模型家族在不同推理等级下的表现有价值。
我现在在 Codex 和 Claude Code 中使用 GPT-6 Sol 和 Claude Opus 5.5 作为默认模型。我已将 agent.datasette.io 上的 Datasette Agent 演示升级为使用 GPT-6 Luna,它似乎在 SQL 查询以及为 Datasette Apps 构建 HTML 和 JavaScript 方面都快速且胜任。
探索智能边界发现无限可能