首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

只降价20%,账单却少八成!GPT-5.6杀入Claude地盘重算编程账

摘要

新智元报道 同一个模型,官方价格只降了20%,你的账单却少了八成。 8月24日,OpenAI公布了一项与AWS一起做的测试结果: 在Terminal-Bench 2.1上,GPT-5.6 Terra在Kiro里完成一个成功任务的成本,降低了约82%。 Kiro是AWS的软件开发智能体平台,覆盖IDE、CLI和Web。 GPT-5.6家族的Sol、Terra、Luna三兄弟,已在里面跑了一个多月。 ...

Bench Terra GPT Terminal Codex配GPT 同一个模型 CLI和Web Sol OpenAI Pro
2026-08-28 1 阅读 约8分钟阅读 新智元
分享:
字号:
新智元报道 同一个模型,官方价格只降了20%,你的账单却少了八成。 8月24日,OpenAI公布了一项与AWS一起做的测试结果: 在Terminal-Bench 2.1上,GPT-5.6 Terra在Kiro里完成一个成功任务的成本,降低了约82%。 Kiro是AWS的软件开发智能体平台,覆盖IDE、CLI和Web。 GPT-5.6家族的Sol、Terra、Luna三兄弟,已在里面跑了一个多月。 这82%,并非官方降价。 Terra最近一次调价是在7月30日,幅度20%。 7月30日OpenAI调价公告,Terra降20%。 单价只降20%,账单却能砍掉八成。 中间差的那六十个百分点是从哪儿省出来的,才是真正值得我们关注的。 GPT-5.6登陆Kiro是今年7月的事儿。 先是13日,AWS宣布GPT-5.6 Sol、Terra、Luna在Amazon Bedrock正式可用。 紧接第二天,Kiro发博客宣布三款模型上线IDE、CLI和Web。 这是OpenAI模型第一次进Kiro,刚好赶上Kiro公开预览一周年。 先把模型摆上 货架,再拉去干活,一个多月后, OpenAI 回来交作业: 两家联手把Kiro环境和OpenAI模型一起调了一遍,Terra完成一个成功任务的成本,降了约82%。 省下的 是走弯路的钱 7月30日那次调价,Terra降了20%,可到了Kiro的测试里,单任务成本降了82%。 那多省下的六成,是从哪儿来的? 方向就这么几个: 模型吐的token更少了,工具来回调的次数更少了,失败之后的重试和绕远路更少了。 所以省下的这一大块,并非每次调用的钱,而是那些原本会白花的调用的钱。 道理很简单:一个AI智能体把任务做砸一次,账单照记。它中途选错路径、跑偏三轮再回头,这些token也照收。 真实开发里,钱往往就是这么漏掉的。 OpenAI在官方博客中也点过同一套逻辑,效率来自三层: 发起请求、组织上下文的智能体框架,中间调度请求的编排系统,最后才是GPU上跑的模型本身。 OpenAI拆解GPT-5.6的效率来源:请求从智能体框架出发,经编排系统调度,最后到GPU跑模型,每一层都在省。 省钱还能省到模型分工上。 OpenAI 还举过一个用法:编码工作流可以先用Sol把问题想清楚、把计划定下来,再换Luna去实施那些已经定义清楚的改动、写测试、跑评估。 同一条流水线,不同环节配不同档位的智能。 模型只占账单一半 换个框架就换个价 Terminal-Bench 2.1这套题,不是让模型单独答卷。 它把模型丢进一个终端环境,给一个模糊目标,让它自己规划路径、调工具、写脚本、处理报错、反复迭代。 所以跑出来的成绩,是「智能体+模型」这个组合的成绩。 Terminal-Bench 2.1公开榜单,准确率右边多了一项成本。(图源:Terminal-Bench) 榜单里的四行数字最能说明问题: Claude Code配Fable 5,83.8%,552.67美元; Codex配GPT-5.5,83.1%,2059.19美元; Codex配GPT-5.6 Terra,78.4%,421.15美元; Codex配GPT-5.6 Luna,75.7%,241.45美元。 前两行分数只差0.7个百分点,账单却差了将近4倍。 同一个模型,装进不同的框架,配不同的上下文组织和工具策略,跑出来也根本不是一个价。 按Kiro官方给的数据,Terra在Coding Agent Index上拿77.4分,只比Claude Fable 5的77.2高一点。 它的卖点不在分数,在于这个分数所对应的价钱。 Kiro那套spec-driven的发力点也在这里,核心玩法就一句:不许上来就写代码。 它先把用户那句含糊的目标,拆成正经的需求文档、技术设计和可执行任务清单,再交给模型。 这样,模型到手的不再是一句含糊不清的话,而是一份理清楚的活儿。 熟悉Agent的人会立刻反应过来,这一步省的正是最昂贵的那部分开销。 模型跑偏、返工、推倒重来,烧掉的token往往比正经干活还多。 Kiro还在流程里留了两道闸栏:代码真正修改前,先停下来让人过一眼;活干完之后,再自动跑一轮测试验证对不对。 这两道闸拦下的每一次返工,都能省下真金白银。 Claude在亚马逊的地盘 GPT分走了一半 一年前,Kiro还只是个spec-driven的IDE,模型选择器是Anthropic的主场。 一年后,AWS在自家开发智能体平台上,一口气摆进三档OpenAI模型。 Sol、Terra、Luna跟Claude并排列进同一个下拉菜单,这画面搁一年前很难想象。 虽然GPT-5.6这次是「全家入驻」,但并未「全面开放」。 三款模型是渐进式、实验性开放,面向Pro、Pro+、Pro Max和Power用户,区域只有两个,美国的弗吉尼亚北部和欧洲的法兰克福,支持跨区域推理。 还有一条挺多人不适应的:这批模型在Kiro里走的是隐藏思维链,你看不到它的推理步骤,只看得到最终结果。 习惯了盯着Agent一步步推理的人,会觉得像把活扔进了一个不透明的盒子。 官方的说法是,这是预期行为,不影响输出质量。 三档模型在Kiro里明码标价。 7月14日刚上线那会儿,同样的任务,Sol扣2.4倍,Terra扣1.2倍,Luna扣0.6倍。 7月30日OpenAI那轮降价落地,第二天Kiro跟进:Luna从0.6倍一路砍到0.1倍,Terra从1.2倍降到1.0倍,只有Sol未动。 AWS的态度摆在了明面上:一个开发平台,不能只绑一家模型。 同一个选择器里,两家前沿模型开始互相压价。 模型的评价标准也跟着变了:分数高不再默认能赢,花钱少同样能赢。 对开发者来说,选模型以前问的是「这个模型多少钱一百万token」,现在得问「让它把这件事做完,我到底要花多少」。 参考资料: https://x.com/OpenAIDevs/status/2091966982015103068 https://openai.com/index/gpt-5-6-in-kiro/ 编辑:元宇 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱