游戏
morning
Claude 5.5 发布,性能直逼 Fable,还要卷价格
2026-09-23
1 阅读
约10分钟阅读
莫崇宇
字号:
Claude 5.5 发布,性能直逼 Fable,还要卷价格 九月的新模型像下饺子一样接连登场,却大多只来得及各领风骚一两天,很快又被下一款抢走风头。 就在刚刚,Anthropic 正式发布了 Claude Opus 5.5。这是 Claude 5.5 家族的首款模型,未来几周内还会有 Sonnet 5.5 和 Haiku 5.5 陆续登场。 Opus 5.5 并非一次常规的半代升级。官方称,它在多数任务上的表现已经达到 Claude Fable 5.1 水平,相比 Opus 5 的典型任务成本降低 40%,输出速度提高超过 30%。 半代升级,Opus 性能直逼 Fable Anthropic 将 Opus 5.5 定位为面向长时间编程 Agent 和知识工作的主力模型。从官方公布的成绩看,它在 Agent 编程、电脑操作和专业工作上都取得了明显提升。 在 Terminal-Bench 4.0 中,Opus 5.5 得分为 66.4%,高于 GPT-6 Astra 的 57.9% 和 Opus 5 的 52.3%;FrontierCode v1.1 得分为 54.4%,略高于 GPT-6 Astra 的 53.3%;CursorBench 4.0 则从 Opus 5 的 46.6% 提高到 57.8%。 面向知识工作的 GDPval-AA v2.1 中,Opus 5.5 得到 1846 Elo,超过 Fable 5.1 的 1735 和 Opus 5 的 1708。在 OSWorld 2.0 电脑操作评测中,它也从 Opus 5 的 74.0% 提高到 81.8%。 优势并没有覆盖所有项目。 Opus 5.5 在 AutomationBench 中得到 40.0%,略低于 GPT-6 Astra 的 41.4%;在 Terminal-Bench-Science 0.1 中得到 58.7%,与 Astra 的 64.6% 仍有差距。 Anthropic 自己也提醒,当前前沿模型之间的榜单差距,已经无法完整反映真实工作中的体验。在公司内部使用中,Opus 5.5 与 Fable 5.1 的差距比部分评测结果看起来更小。 真正能体现此次升级的,是持续数小时甚至十几个小时的长任务。 早期测试者曾用 Opus 5.5 在一天内完成一项涉及 68 万行代码的迁移工作;另一项 20 万行代码库审计只用了不到三小时,而 Opus 5 完成同类任务超过 20 小时,token 消耗约为前者的 2.5 倍。 Anthropic 还让 Opus 5.5 和 Fable 5.1 把 HAProxy 从 C 语言重写为 Rust,两者都通过了绝大多数回归测试,Opus 5.5 用时 9.5 小时,Fable 5.1 用时 12 小时,前者成本低了 51%。 知识工作方面,在一项季度业绩报告测试中,模型只能从一份较难检索的网页副本中寻找资料,任何虚构数字或引语都会导致失败。Opus 5.5 在不同思考强度下提交的 18 份报告中有 16 份过关,Fable 5.1 和 Opus 5 没有一次达到同一标准。 另一项虚构并购分析要求模型先在 Excel 中建立财务模型,再制作面向管理层的演示文稿。Opus 5.5 与 Opus 5 得出了相同结论,但前者的模型更完整,演示文稿也更清楚,完成时间从 93 分钟缩短到 63 分钟,成本降低一半。 降价之后,Opus 开始成为日常主力 比榜单更容易被用户感知的变化来自价格和速度。 Opus 5.5 的 API 输入和输出价格分别为每百万 token 4 美元和 20 美元,比 Opus 5 低 20%;缓存读取价格从 0.50 美元降至 0.20 美元,降幅达到 60%。 除了输入、输出及缓存价格下调,Opus 5.5 还提供最高 2.5 倍速度的 Fast mode,价格为每百万输入 token 8 美元、输出 token 40 美元。 模型支持 100 万 token 上下文和 12.8 万 token 最大输出,思考模式始终开启,默认 effort 为 medium,用户可以根据任务调整思考强度。 长时间运行的 Agent 还能通过上下文压缩整理较早的对话,同时保留最近回合,降低长任务被上下文拖慢的概率。 Opus 5.5 已经上线 Claude、Claude Code 和 Claude Platform,同时登陆 AWS、Google Cloud 与 Microsoft Azure,API 模型名称为 claude-opus-5-5。它也成为 Claude 付费计划的默认模型。 Anthropic 同时提高了 Pro、Max 和 Team 计划的五小时使用限额。 ClaudeDevs 表示,此次限额直接增加 20%,更低的模型价格还会让同一额度下的可用时长进一步增加约 25%。订阅用户还会获得一次可自行选择时间使用的额度重置,有效期截至 10 月 22 日。 价格下降并不等于所有设置下的 token 消耗都会同步下降。 有开发者根据 Artificial Analysis 的测试指出,Opus 5.5 在 max 档运行 Intelligence Index 时,输出 token 消耗位居已测模型最高水平。 不过,官方所称的单任务成本降低,主要建立在默认设置和典型工作负载上,且多数用户不会长期使用 max 强度,真实成本仍会受到任务类型、推理档位、上下文长度和缓存命中率影响。 社区最早出现的一批实测,大多集中在创意编程、3D 建模和可交互模拟。 Wes Bos 在连续一周使用并消耗大量 token 后认为,Opus 5.5 已经达到 Fable 级别;他让模型渲染了 500 种常见健身器材,并据此做出一套完整的健身房搭建器。 BridgeMind 则用一次提示生成了可玩的 Mario Kart 游戏。据其展示,Opus 5.5 生成的场景和玩法细节明显多于 Fable 5.1 的版本,Mario、Luigi 等角色也被做进了游戏。 更特别的案例来自 Jake Eaton。 他没有使用图像模型或现成绘图软件,而是让 Opus 5.5 编写约 7500 行 Python 代码,通过标准库模拟不同笔刷,再逐像素绘制出多种艺术风格。Ben Poole 展示的 sketch-to-simulation,则让模型把草图和概念示意直接转化为可以运行的交互模拟。 不过,Opus 5.5 的创意能力并非在所有方向都占优。 Auggie 用 Bach Benchmark 测试其音乐创作能力,生成的四声部众赞歌出现了声部间距、重复音和平行八度等问题,他认为前一天由 Grok 4.7 生成的版本可能更好。 沃顿商学院教授 Ethan Mollick 在早期测试后给出了相近的判断。他认为 Opus 5.5 是首个让自己感到接近 Fable 水平、同时又不属于 Fable 或 Astra 系列的模型,不过 Claude 近期常见的文字过密问题仍未完全消失。 Anthropic 显然意识到了这个问题。官方将表达能力列为此次更新重点,称 Opus 5.5 会优先给出重要信息,减少术语和特殊表达,也
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱