智能AI
morning
突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「计时之王」
摘要
机器之心编辑部 就在刚刚,OpenAI 与 Anthropic 几乎同时推出新模型: OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna;Anthropic 则发布性能直逼 Fable 5.1 的 Claude Opus 5.5。 OpenAI 表示,GPT-6 Sol 与 GPT-6 Luna 脱胎于此前顶级的 GPT-6 Astra 底座,重点是将 Astra 的核心推理与多模态...
GPT
Sol
Luna
OpenAI
Astra
Opus
Claude
Anthropic
token
美元降低到
2026-09-23
1 阅读
约10分钟阅读
机器之心
字号:
机器之心编辑部 就在刚刚,OpenAI 与 Anthropic 几乎同时推出新模型: OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna;Anthropic 则发布性能直逼 Fable 5.1 的 Claude Opus 5.5。 OpenAI 表示,GPT-6 Sol 与 GPT-6 Luna 脱胎于此前顶级的 GPT-6 Astra 底座,重点是将 Astra 的核心推理与多模态优势下放,重构出更轻量、吞吐量更高的运行版本。也就是说,GPT-6 Astra 承担的是能力探索角色,而 Sol 和 Luna 则承担能力规模化应用的任务。 价格方面则直接「腰斩」,与 GPT-5.6 的促销价相比,Sol 与 Luna 的价格直接降低了 50%。 随后,Sam Altman 在社交平台发文,强调这是 OpenAI 推动「智能普及化」的必经之路 —— 让开发者不再受制于昂贵的算力账单。 「尤其是按照单任务成本(per-task pricing)来比较 —— 而这才是我们认为真正应该关注的指标 —— 我认为目前市场上没有任何产品具备真正的竞争力。 我们希望人们能够大量使用 AI,因为这对于探索眼前这场新的「文艺复兴」非常重要。只有让更多人能够广泛使用 AI,才能真正释放这一轮技术变革带来的可能性。」 而 Anthropic 拿出的则是 Claude Opus 5.5。 作为 Claude 系列中的高性能模型,Opus 5.5 延续了 Anthropic 在复杂任务、代码生成和企业工作流领域的重点布局。 Anthropic 表示, 相比 Opus 5,Opus 5.5 在典型任务中的成本降低约 40%,输出速度提升超过 30%。 下面具体来看一下。 OpenAI 发布 GPT-6 Sol、Luna: 将 Astra 能力推向规模化应用、价格「腰斩」 OpenAI 表示,本月早些时候推出了 GPT-6 Astra,这是全球最智能、对齐程度最高的模型,但考虑现实中的工作存在不同规模、不同节奏以及不同预算需求。因此推出 GPT-6 Sol 和 GPT-6 Luna。 如果说, GPT-6 Astra 开启了新一代智能模型,而这两个模型则通过提升成本效率,让更多人能够获得这种智能能力。 OpenAI 认为,模型能力提升固然重要,但单位任务成本同样成为企业部署 AI 时的重要考量。因此此次重点优化了缓存机制和推理效率,并将节省的成本反馈给用户。 博客链接:https://openai.com/index/introducing-gpt-6-sol-and-luna/ 相较于 GPT-5.6,GPT-6 Sol 和 Luna 的 API 价格降低了 50%。 GPT-6 Sol: 输入价格从每百万 token 4 美元降低到 2 美元;输出价格从每百万 token 20 美元降低到 10 美元。 GPT-6 Luna: 输入价格从每百万 token 0.20 美元降低到 0.10 美元;输出价格从每百万 token 1.20 美元降低到 0.50 美元。 价格下来了,但性能依旧能打。 在 AutomationBench 测试中(该测试评估跨应用的企业工作流),GPT-6 Sol 在最高推理强度(xhigh effort)下超过了 Claude Opus 5 的最高强度表现,而每个任务成本仅为 Opus 5 的 9%。 而在高推理强度下, GPT-6 Luna 相比上一代模型提升了 5.4 个百分点,同时每个任务成本降低 58%。 同时,GPT-6 Sol 也以更低成本超过 Claude Fable 5.1,同时甚至超过了低推理强度下的 GPT-6 Astra。 而在内部事实准确性测试中,该测试基于经过匿名处理的真实用户对话(用户曾标记模型错误),GPT-6 Sol 的错误数量约为上一代模型的一半,接近 Astra 级别的可靠性,同时成本更低。 GPT-6 Luna 也取得明显提升: 在更高推理强度下,它能够以约百分之一的成本达到 GPT-5.6 Sol 的水平。 另一个重要变化则出现在软件开发领域,随着 Coding Agent 开始承担越来越复杂的任务,持续运行成本成为开发团队的重要考量。 编程能力上,OpenAI 表示 GPT-6 Sol 和 Luna 在保持强大代码能力的同时,通过更低 API 价格,让开发者拥有更多试验空间,也让团队能够更加大胆地使用 Codex 执行复杂任务。 在 FrontierCode 测试中,GPT-6 Sol 相比 GPT-5.6 Sol 有明显提升,并以更低成本达到 Claude Fable 5.1 xhigh 的水平。 在 DeepSWE v1.1 测试中:GPT-6 Sol 在最高推理强度下获得 68.8% 分数,仅比 Claude Fable 5 的最高成绩 69.9% 低 1.1 个百分点。但 GPT-6 Sol 每个任务成本降低约 80%。GPT-6 Luna 在最高推理强度下获得 66.6%,接近 Claude Opus 5 和 Fable 5 的中等推理强度表现。 在这些比较中: Luna 相比 Opus 5,每任务成本降低 93%;相比 Fable 5,每任务成本降低 96%。 这或许是在说明 OpenAI 的目标并不是简单制造一个更强模型,而是在寻找 单位智能成本最低的模型。 计算机操作能力上,GPT-6 Sol 和 Luna 相比上一代模型提供了更高成本效率。 在 OSWorld 2.0 offline 测试中,GPT-6 Sol 在最高推理强度下达到与 Claude Opus 5 中等推理强度相近的成绩: GPT-6 Sol:60.5% Claude Opus 5:60.3% 但 GPT-6 Sol 每任务成本降低约 80%,GPT-6 Luna(max)则能够超过 GPT-5.6 Sol(medium),同时成本仅为其十分之一。 而除了模型价格下降,OpenAI 还针对 Agent 长任务场景优化了缓存机制,改进了 GPT-6 的 Prompt Caching,使默认缓存命中率更高,从而帮助 Agent 复用更多上下文、更快响应、对缓存输入 token 读取享受 90% 折扣。 这意味着,未来模型竞争不仅是模型本身的能力竞争,也包括整个推理基础设施效率竞争。 Anthropic:Opus 5.5 来了,Fable 级能力 OpenAI 发布的另一边, Anthropic 这次同样非常强调「效率」。 Claude Opus 5.5 是 Claude 5.5 系列的第一款模型。Anthropic 给它的定位非常直接:大多数任务达到 Claude Fable 5.1 的水平,但相比 Opus 5,典型任务运行成本降低约 40%,输出速度则提高超过 30%。 博客链接:https://www.anthropic.com/claude-opus-5-5/ 先看能力。 在 Anthropic 公布的 headline comparison table 中,Opus 5.5 在列出的项目上全部高于 Fable 5.1。 Terminal-Bench
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱