智能AI
morning
Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折
摘要
Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折 听雨 2026-09-23 12:59:29 来源: 量子位 梦晨 听雨 发自 凹非寺 量子位 | 公众号QbitAI Claude最新旗舰 Opus 5.5 跑分登顶! 在代码、知识工作、计算机操作等多项基准测试中拿下第一的同时,输出速度也比 Opus 5 快了 30%以上 。 这暂停得好好的前沿,怎么不到两周又被推进了...
Opus
API价格打8折
量子位
20美元
GPT
Fable
5和Fable
Claude
5突袭
68万行代码一天迁完
2026-09-23
1 阅读
约9分钟阅读
听雨
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折 听雨 2026-09-23 12:59:29 来源: 量子位 梦晨 听雨 发自 凹非寺 量子位 | 公众号QbitAI Claude最新旗舰 Opus 5.5 跑分登顶! 在代码、知识工作、计算机操作等多项基准测试中拿下第一的同时,输出速度也比 Opus 5 快了 30%以上 。 这暂停得好好的前沿,怎么不到两周又被推进了。 那CEO Dario Amodei发表的“放缓前沿”公开信算什么? 算他能发。 这届模型开始拿代码当画笔 目前看到比较新颖的测试是用纯代码生成图像,SVG鹈鹕骑自行车已经被刷爆了,这次是更复杂的Python渲染。 类似的能力可以扩展成用纯js代码生成渲染视频。 多项跑分登顶,API价格打8折 他们说任务成本降 4成 ,但API价格并没有直接打 6折 。 Opus 5.5的输入、输出价格分别是每百万Token 4美元 和 20美元 ,相比Opus 5下降 20% 。 再加上完成同一任务需要的步骤和Token更少,Anthropic测算,典型任务的总成本可以下降 40% 。 真正下狠手的是 缓存读取价 。这一项从Opus 5的每百万Token 0.50美元 ,直接降到 0.20美元 ,砍了 60% 。 做Agent编程的都知道,长对话和大型代码任务需要反复读取上下文,缓存读取经常占据成本的大头。相比账面上的API单价,这一刀可能更有实际体感。 另外还有一个Fast mode,输出速度最高可达标准模式的 2.5倍 ,价格也翻倍至每百万输入Token 8美元 、输出Token 40美元 ,适合对延迟特别敏感的场景。 订阅用户也加量了,Pro、Max、Team和按席位收费的企业版,五小时使用限额都会提高;Anthropic还提供了一次可以暂存、由用户自行选择时间使用的rate limit reset。 具体看跑分,目前最新鲜的榜就是 Terminal-Bench 4.0 了,衡量模型处理复杂命令行任务的能力。 Opus 5.5拿下 66.4% ,上一代Opus 5是 52.3% ,OpenAI的 GPT-6 Astra 是 57.9% ,Claude自家的 Fable 5.1 是 55.8% 。 已经明显拉开差距。 在另一项编程基准FrontierCode v1.1上,Opus 5.5以 54.4% 超过GPT-6 Astra的 53.3% ,差距就没那么明显了。 而且推理effort开中档效果反而更好。 Opus 5.5在默认effort,也就是中档设置下,反而跑出了 54.6% ,超过表中其他模型的最高成绩,也略高于自己开到最高档时的 54.4% 。 到了这个能力水平, 0.2个百分点 基本已经落在波动范围里。 Anthropic自己也承认,跑分差距越来越难准确反映真实使用体验,他们内部使用时,Opus 5.5和Fable 5.1的差距就没有榜单看起来这么大。 另一项 CursorBench 4.0 ,测的是来自真实Cursor会话的多文件模糊任务。 最高effort下,Opus 5.5拿到 57.8% ,比Fable 5.1的 51.8% 高 6分 ,比 GPT-5.6 Sol 的 41.7% 高 16.1分 。 如果看性价比,Opus 5.5在默认中档设置下得分 52.5% ,依然领先GPT-5.6 Sol的最高成绩约 11分 ,单项任务成本只有后者的 三分之一 左右。 Opus 5.5特别强调在大规模代码库级别的任务上有明显提升。 早期测试者曾用它迁移 68万行代码 , 不到一天 完成。换成人类工程团队,预计至少需要 数周 。 还有一位测试者用它审计并修复一个 20万行代码库 ,耗时 不到3小时 。同样的任务,Opus 5花了 超过20小时 ,使用的Token数量还是它的 2.5倍 。 在一项内部测试中,Anthropic让Opus 5.5和Fable 5.1分别将HAProxy从C语言重写成Rust。HAProxy是一款被广泛使用的Web流量负载均衡软件。 两个版本都通过了HAProxy自身几乎全部回归测试,但Opus 5.5只用了 9.5小时 ,Fable 5.1用了 12小时 ,前者的成本低了 51% 。 Anthropic还让模型优化一个Web应用所有页面的加载速度。Opus 5.5在 40次 测试中成功了 39次 ;Opus 5虽然也缩短了加载时间,但改进幅度更小,还改变了应用原本的行为。 知识工作方面同样值得关注。 在覆盖 44个职业 的真实工作能力评估GDPval-AA v2.1中,Opus 5.5得分 1846 Elo ,Fable 5.1是 1735 ,Opus 5是 1708 。 在默认effort设置下,Opus 5.5的得分就超过了GPT-6 Astra在最高effort下的表现,单项任务成本大约只有后者的 五分之一 。 投资公司Walleye Capital反馈,Opus 5.5在最低设置下,就基本完成了他们的量化研究评测任务。 把effort调高后,它还发现评测指令里的分钟索引存在一个off-by-one错误,并主动修正。 模型甚至特意备注:这样处理是正确的,但可能会导致自己被评分器扣分。 Walleye称,此前测试过的所有模型,都没有发现并处理这个问题。 还有个明显变化在于: Opus 5.5说话的方式变了 。 以前Opus 5虽然也能找到答案,但很快就会钻进代码块、时间线和区间定义里,用户需要自己从大量技术细节中提炼结论。 Opus 5.5会先把最重要的信息摆出来,再解释原因。 官网展示了一个billing系统Bug的对比。Opus 5找到问题后,马上开始解释代码改动和时间区间;Opus 5.5开头就把账算清楚了: 额外减少的 9.92美元 来自一个Bug,免费层调整只占 1.50美元 。 随后它才说明,究竟是哪次代码重构把每个月最后一天的大部分用量漏掉了。 一位早期测试者的评价是: It writes the way I do(它写东西的方式跟我一样)。 Anthropic还特意强调,表达清楚不只是文风升级。模型把关键信息放在前面、减少术语和特异性表达,人类检查其结论和操作过程也会更加容易,这本身就是一项安全收益。 和Fable一个级别的笼子 能力往前冲,安全笼子也跟着加厚了。 Opus 5.5是首款同时搭载Fable 5.1同级网络安全、生物安全和反蒸馏护栏的Opus模型 。触发相关限制后,系统会透明地回退到其他模型处理。 发布之前,它还接受了METR和Frontier Design两家外部机构的评估。 这也是Anthropic对“放缓前沿”的解释:模型照常研发和发布,但要给安全对齐和外部审查留出时间。 在Anthropic内部覆盖近2000个模拟场景的自动化行为审计中,Opus 5.5在几乎所有失调行为指标上,都拿到了近期Cla
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱