汽车
morning
Opus 5.5来了,性能赶超Fable,成本低至40%
2026-09-23
1 阅读
约10分钟阅读
字母AI
字号:
文 | 字母AI 5.5!!是Opus 5.5!! 就在三天前,路透社还报道称,随着GPT-6 Astra开始抢回企业市场,Anthropic正在考虑提前推出一款新模型应战。 社区一直猜测新模型会是Opus 5.2还是5.5,现在答案终于揭晓了。 而且这不是一个小更新,Anthropic直接掀开了Claude 5.5这个新系列。 Opus 5.5先打头阵,Sonnet 5.5和Haiku 5.5也已经排在后面,将在几周后推出。 某种意义上,Astra这脚油门踩下去,Anthropic连换代速度都被一起带快了。 和新模型同时到来的还有一个重置,正好方便用户体验。 Fable的定位有点尴尬了 既然被认为是冲着Astra来的,那就把它和Astra放在一起看。 先说价格,Opus 5.5的API输入价格是每百万Token 4美元,输出20美元;Astra则分别是10美元和50美元。 也就是说,Opus 5.5的Token单价只有Astra的40%。 两款模型的上下文没太大差别,Opus 5.5是100万Token,Astra是105万;最大输出也都是128K Token。Astra的知识截止日期是2026年4月30日,Opus 5.5则更新到了2026年6月。两款模型均支持low到max五档推理强度。 而且Opus 5.5相比自家上一代Opus 5也降价了。 Opus 5原本是每百万Token 5美元输入、25美元输出,新模型两边都降了20%;Anthropic称,再加上Token使用效率提升,完成一项典型任务的实际成本能比Opus 5低约40%,输出速度则提高了30%以上。 便宜归便宜,Opus 5.5在跑分上倒是一点没客气。 在官方展示出的可比较的前6项里,Opus 5.5拿下4项,给到夯;Astra拿下2项,给到顶级;Fable 5.1一项都没拿到,已成为过时版本。 尤其是在Anthropic最看重的Coding和Agent能力上,Terminal-Bench 4.0直接从Astra的57.9%冲到了66.4%;FrontierCode也以54.4%压过Astra的53.3%。 不过Astra并没有被全面反超,在跨应用工作流任务AutomationBench里仍然以41.4%对40.0%领先,科学Agent测试Terminal-Bench-Science上则以64.6%对58.7%保持优势。 值得注意的是,在另外两项没有Astra成绩的测试里,Opus 5.5也继续超过了Fable 5.1:Computer Use从80.7%升到81.8%,视觉图表识别则从88.4%升到89.0%。 也就是说,至少在Anthropic公布的这张大表里,Fable 5.1面对Opus 5.5几乎没有守住一块阵地。 把视角从官方文档里移开,第三方评测机构Artificial Analysis已经完成了Opus 5.5的独立测试。 在最新的Intelligence Index里,Opus 5.5最高(max档)拿到58分,Astra和Fable 5.1则都是53分。 但这里有一个很有意思的细节:Opus 5.5开到max档之后,非常能烧Token。 根据Artificial Analysis测出的结果,max effort下Opus 5.5平均每项任务生成约11.9万Token,Astra则约2.7万。 因此,即使Opus 5.5的Token单价只有Astra四成,使用max effort后,单任务成本反而达到了惊人的5.98美元,而Astra仅为3.26美元。 不过,回到默认medium档,情况就好很多:Opus 5.5拿到51分、每任务1.34美元;Astra是50分、1.54美元;Fable 5.1则是49分、2.98美元。 总体来看,Anthropic用四成的价格,把Opus硬生生塞进了Astra和Fable所在的最高能力区间。 目前,Opus 5.5已经全平台上线。 普通用户可以直接在Claude里使用,开发者则可以通过Claude Code和API调用,模型ID为claude-opus-5-5;AWS、Google Cloud和Microsoft Azure也已经同步提供。 Anthropic还顺手提高了Pro、Max、Team和按席位计费Enterprise用户的五小时使用额度,并提供了一次重置。 Fable现在的处境变得多少有点尴尬。尤其是Fable 5.1,9月1日才发布,满打满算只坐了三周最高档。一个谷歌Flash的更新周期过去,下面的Opus突然追了上来,从性能和定价上两头围剿,把自家“大哥”架在火上烤。 这个Fable的档位,真的还有存在的必要么? 少一点AI味, 多一点自主权 跑分只是一张比较直观的成绩单,相比之下,来看点更“实际”的变化。 Anthropic给Opus 5.5生成的文本做了个“去Claude味”的处理。 官方的表述是,Opus 5推出之后,他们收到最多的一类反馈,就是写得太绕、太长,不够容易读。于是Opus 5.5专门改了写作风格:重要信息尽量放在前面,减少行话和一些Claude特有的奇怪措辞,同时更严格地遵守用户给出的写作规则。 效果还挺明显。 Ramp的一名工程师表示,以前最让他受不了的就是前沿模型的输出“又长又难读”,Opus 5.5终于解决了这个问题。 有意思的是,虽然Opus 5.5在说话上“越来越听劝”,但它在底层行为上反而变得不那么听话了。 比如Thinking,现在彻底关不掉了。 Opus 5虽然默认开启Adaptive Thinking(自适应思考),但在high及以下档位,开发者至少还能手动把它关闭;到了Opus 5.5,这个开关直接没了。 模型每一次回答都会进行Adaptive Thinking,用户只能在low、medium、high、xhigh和max之间控制它到底想多少,不能再要求它“别想了直接回答”。Opus 5.5的默认档位也从Opus 5的high降到了medium。 工具调用也出现了类似的变化。 以前开发者可以通过API里的tool_choice,硬性规定Claude“这一轮必须调用某个工具”,或者“必须从这些工具里选一个”。 Opus 5.5取消了这套强制工具调用,只剩下auto和none两个选项:要么把工具交给Claude,由它决定要不要用、用哪个;要么彻底不让它用。想让它必须调用某个工具,就只能通过prompt去告诉它什么时候应该调用,不能再从API层面硬塞过去。 当然,这不意味着开发者彻底失去了约束能力。严格JSON格式仍然可以通过strict tool use保证,也可以使用structured outputs。但至少在工具调用这件事上,Anthropic正在把更多判断权交给模型自己。 这事儿结合Anthropic最近的产品动作看会更有意思。就在6天前, Anthropic刚把Claude的Chat和Cowork合并成了一个入口。 用户只管说自己要什么,Claude会自己判断是简单回答,还是打开工具、处理文件、跑一个长任务。 从Chat还是Cowork的入口,到要不要联网、要不要Thinking、要不要调用工具,越来越多原
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱