首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GPT-6猛砍价,Opus 5.5忙“变好用”:模型价格战,已经不能只看API定价

摘要

北京时间9月23日,OpenAI和Anthropic前后相隔大约一个小时发布了新一轮模型更新。 OpenAI推出GPT-6 Sol和GPT-6 Luna,将本月早些时候GPT-6 Astra上的部分能力继续下放:Sol面向专业工作、Coding和复杂Agent任务,Luna则进一步压低成本,瞄准高频、大规模调用。 Anthropic几乎同时推出的Claude Opus 5.5,继续强化Coding...

Opus GPT Luna Claude Fable 北京时间9月23日 OpenAI和Anthropic前后相隔大约一个小时发布了新一轮模型更新 OpenAI推出GPT Sol和GPT 将本月早些时候GPT
2026-09-24 1 阅读 约10分钟阅读 褚杏娟
分享:
字号:
北京时间9月23日,OpenAI和Anthropic前后相隔大约一个小时发布了新一轮模型更新。 OpenAI推出GPT-6 Sol和GPT-6 Luna,将本月早些时候GPT-6 Astra上的部分能力继续下放:Sol面向专业工作、Coding和复杂Agent任务,Luna则进一步压低成本,瞄准高频、大规模调用。 Anthropic几乎同时推出的Claude Opus 5.5,继续强化Coding和Agent能力之外,还把“Communication”单独列为重点升级方向,并进一步降低模型运行成本。 技术能力上,两家公司依然在比较模型能力、Coding、Agent和计算机操作;但从开发者的早期反馈来看,大家对两者的关注焦点并不同。 对于GPT-6 Sol和Luna,大家反复讨论的是“价格怎么还能继续降”;对于Opus 5.5则更受关注“上一代那些难用的问题到底修好了没有”。 模型价格战,脱离API 价格表 GPT-6这一轮最激进的变化首先发生在价格上。 GPT-6 Sol的API输入价格从GPT-5.6 Sol促销价的每百万Token 4美元降至2美元,输出从20美元降至10美元;GPT-6 Luna则从每百万Token 0.20美元和1.20美元进一步降至0.10美元和0.50美元。相比上一代,Sol和Luna的价格大致又下降了一半。 OpenAI并没有只强调Token单价,而是反复用“完成一次任务多少钱”证明这一代产品的方向已经从刷新能力上限,转向整体压低Agent的使用成本。 在AutomationBench中,Agent需要调用47种工具完成销售、营销、运营、客服、财务和人力资源等业务流程。GPT-6 Sol在xhigh推理强度下得分33.2%,平均单任务成本0.27美元;Claude Opus 5得分26.9%,OpenAI计算其任务成本约为Sol的11.1倍。Claude Fable 5.1配合Opus 5回退时取得31.4%,OpenAI称其成本至少是Sol的8.9倍,而且这一数字还没有完整计入约40%任务回退到Opus 5产生的额外费用。在覆盖55个细分行业的Agents’ Last Exam中,OpenAI同样把重点放在“接近或超过高端模型能力,但显著降低任务成本”上。 Coding场景更能体现这种策略。 在DeepSWE 1.1中,GPT-6 Sol最高推理强度得到68.8%,与Claude Fable 5 xhigh的69.9%只差1.1个百分点,但OpenAI称其单任务成本低约80%;GPT-6 Luna则达到66.6%,接近Claude Opus 5和Fable 5中等推理强度的水平,而按照OpenAI的测算,完成同类任务的成本分别比Opus 5低约93%、比Fable 5低约96%。 Luna得到的正面评价尤其集中在性价比上,有用户惊讶于这样一个已经相当便宜的模型还能再次降价,也有人表示已经开始把部分生产分类任务迁移到GPT-6 Luna。 不过,这种反馈同时暴露了GPT-6的另一面:一些开发者并没有感受到很强的“6代跃迁”,原本期待Sol明显接近Astra,实际体验却更像一个更成熟、更便宜的GPT-5.6 Sol。有人干脆把这次发布概括为“主要是一次成本胜利”。 Anthropic面对的问题则完全不同。上一代Opus 5并非能力不强,相反,它在不少Benchmark上已经处于很高位置,但真实使用口碑明显分化。 一些开发者认为它Coding正确性不错,却容易出现表达冗长、术语奇怪、注释过多、过度设计,以及擅自扩大任务范围等问题。甚至有用户指出,Opus 5在不少Benchmark上已经与Fable接近,但自己在实际Coding中仍几乎全部使用Fable。 因此,Opus 5.5这次把Communication单独列出来并不奇怪。Anthropic强调,新模型会减少不必要的术语和特殊措辞,把重要信息放在前面,并改善长时间协作中的可读性。 同时,Opus 5.5典型工作负载成本相比Opus 5下降40%,输出速度提升30%以上,Cache Read价格下降60%。这次降价,Anthropic也在试图解决“最强模型能不能重新变成开发者愿意连续使用几个小时的工具”的成本问题。 Coding还是主战场,但开发者越来越不相信几分Benchmark差距 在OpenAI公布的部分Coding评测中,GPT-6 Sol已经逼近Claude此前的高端模型。但过去几轮发布已经让很多人意识到,软件工程Benchmark里的几分差距,很难稳定映射到真实使用体验。 Opus 5就是一个典型例子:它发布时拥有漂亮的成绩,但仍有不少开发者认为它在真实项目里难用;与此同时,也有另一批用户认为高推理强度下的Opus 5已经是非常强的程序员,甚至能够根据刚发表的论文完成算法实现。 “到底好不好用”,除了模型,也越来越依赖任务类型、代码库结构、工作流以及开发者自己的Agent Harness,而不是一张统一榜单。这也是为什么Opus 5.5虽然获得了明显更积极的早期评价,社区态度仍然带有很强的“先用几周再说”。 一些长期在Fable、Opus和OpenAI模型之间切换的开发者已经考虑把5.5重新作为主力,也有人认为其表达风格确实改善,但“Benchmark很好看”已经不足以直接建立信任。 Anthropic自己也承认,当模型能力达到目前水平之后,评测之间几个百分点的差距越来越难直接映射成现实体验。 原因在于,真实软件工程从来不只是“写出一段能通过测试的代码”。历史代码、技术债、架构约束、模糊需求、团队规范、长期维护性,以及“哪些地方不能碰”,都很难被单一Benchmark完整覆盖。一个模型即使第一次写出的代码完全正确,如果它修改了大量无关文件、进行了不必要的重构,或者需要开发者花大量时间理解和返工,实际生产力仍可能低于一个跑分稍低、但行为更稳定的模型。 因此,Coding模型的评价对象不再是“能不能生成正确代码”,而是Agent完成一次软件工程任务的全过程质量:它用了多少步骤、改了多少无关内容、有没有理解边界、是否容易复核,以及最终需要多少人工介入。 当Agent连续工作数小时,模型价格战开始拼“缓存阶段” 这次发布,OpenAI开始明显把Prompt Caching当成Agent降本的核心能力,而不再只是把它当作底层推理优化。 OpenAI披露,其内部研究人员过去一年对Coding Agent的使用量快速增加,如果按照API价格折算,一名研究人员每天使用Coding Agent产生的Token成本中位数已经超过600美元,前10%的研究人员甚至超过7000美元。 当Agent开始持续运行,大量成本并不是来自新的问题,而是来自同一批代码、工具定义、历史对话和任务状态被反复重新处理。 GPT-6因此进一步调整了Prompt Caching机制。已经命中的缓存输入Token可以获得90%的价格折扣,同时减少重复Prefill带来的计算开销和延迟。 OpenAI还新增Prompt Caching Dashboard和诊断工具,让开发者看到哪些Prompt成功命中缓存、哪些没有;过去调整Reasoning
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱