首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GPT-6 Astra 正式发布:性能 AGI,贵到要负债

2026-09-04 1 阅读 约10分钟阅读 彭海星
分享:
字号:
「欢迎来到 AGI 时代。」 OpenAI 总裁 Greg Brockman 用这句话结束了 GPT-6 Astra 的媒体吹风会。 几个小时前,ChatGPT、Claude 和 Grok 才经历了一次罕见的同时宕机,但短暂故障没有打乱 OpenAI 的发布节奏—— 就在刚刚,GPT-6 Astra 正式亮相。 Brockman 对这款模型的评价,甚至超过了 OpenAI 以往任何一次新品发布: 如果几年以后回头追问,AGI 究竟在什么时候诞生,我想答案大概就在这段时间,甚至可能就是这个模型……就我个人而言,我认为我们已经达到了(AGI 水平)。 对于听惯了 AI 公司豪言壮语的人来说,问题也随之而来:Astra 到底做到了什么,足以让 OpenAI 定调说「这是全球最智能、最符合人类意图的模型」? 跑分没有横扫一切,价格倒是登上了顶峰 按照 OpenAI 的说法,Astra 是一次「代际跃迁」,能力提升覆盖电脑操作、软件工程、专业工作、科学和网络安全。 根据官方公布的数据,Astra 在代表「脑力」的研究级数学测试 FrontierMath Tier 4 和科学知识测试 GPQA Diamond 中成绩是 97.6% 和 96%。 而在代表「动手能力」的长程软件工程测试 DeepSWE、CAD 绘制测试 BenchCAD 和漏洞利用能力测试 ExploitBench 中,Astra 也分别做到了 74.1%、95.9% 和 100%。 也就是说,GPT-6 Astra 已经把很多既有测试「刷爆」了。要想完整理解它的能力上限,我们可能需要设计一些新的测试。 但 OpenAI 更倾向于介绍 ARC-AGI-3 的成绩:99.9%。 这是一项高度抽象化的测试,模型要进入一个完全陌生的小游戏世界,不提供任何规则说明和目标,模型必须自己通过互动观察环境的变化,推断出这个世界的「游戏规则」然后规划行动。 在今年 3 月刚公布时,最强的 AI 成绩只有 0.51%,即使是 GPT-5.6 Sol 在默认框架下也只有 7.8%,而现在 Astra 在特设的保留推理+压缩上下文框架下,就做到了和人类完全等同的环境推理满分成绩——这一点会和我们稍后说到的「环境操作」能力紧密相关。 作为最新的超旗舰级模型,Astra 的基本规格自然不会落后:105 万 token 上下文窗口,最高输出 12.8 万 token,知识截止时间为 2026 年 4 月 30 日,支持 low、medium、high、xhigh 和 max 五档推理强度。 但与此同时,模型的价格也来到了新高度。 标准模式下,每百万输入 token 收费 10 美元、输出 50 美元 ;输入超过 27.2 万 token 后,整次请求的输入和缓存价格翻倍,输出价格升至 75 美元。模型依然支持更快给出结果的快速模式,相应地要支付两倍价格。 对比起来,Astra 的输入与输出单价是 5.6 Sol 当前促销价的 2.5 倍,也和 Anthropic 刚发布的 Fable 5.1 相同。 想体验的话,我们可能还得稍微再等几天: Astra 目前率先向小部分可信合作企业开放,ChatGPT 各级会员用户和 API 则会在未来几天里陆续推送使用权限。 另外还有一个涉及最高级网络攻击能力的版本,只会提供给网络防御机构使用。 当然,我们都知道官方口径向来是「报喜不报忧」的,第三方独立机构的测试稍微能给官方叙事降一下温—— 在 Artificial Analysis 最常用的通用智能独立测试 Intelligence Index v4.1.1 中,Astra max 的成绩「只有」61 分,和 GPT-5.6 Sol max 持平,低于 Fable 5.1 的 66 分、Opus 5 的 63 分以及 Muse Spark 1.3 的 62 分。 这也和 X 上一些提前获得内测资格的开发者体感相仿:Astra 不是那种在智能上遥遥领先的模型,但它堪称恐怖的环境理解和操作能力弥补了这一点,最终交出的输出结果相当漂亮。 虽然在通用智能测试上不算吃香,可一旦转到 Coding 测试就是另一回事了: 在 Artificial Analysis Coding Agent Index 中,Astra 得到 67 分,距离榜首 Fable 5.1 只差 3 分。与此同时,Astra 体现出了极佳的 token 效率,使用的 token 仅相当于 5.6 Sol max 的三分之一、Opus 5 high 的五分之一。 凭借效率优势,Astra max 完成单项 Coding 任务的成本和 Sol 大致相当。于是,在散点图中我们能看到 Astra 在左上角几乎划出了一个专属「斩杀区」——在相同的价格区间,Astra 目前可以说是「无敌」的。 另外,Astra 的幻觉也明显减少。Artificial Analysis 测得 Astra max 的幻觉率为 51%,远低于 Sol 的 92%,拒答率数据也显示它没有依靠频繁拒绝回答来压低幻觉。 单看综合跑分,很难说 Astra 是什么「独一档」的模型。但 它的关键进步,其实藏在「模型如何使用电脑」这件事上。 为人类设计的界面,Astra 用得比人更好 Astra 的发布宣传片开头,引用了一个 80 年代的早期 AI 演示。当时,人对电脑说「画一个黄色圆圈」,电脑就能照做。 同样的梦想延续到了今天。如今,几个人只是站在投影大屏前,或拿起筷子吃饭,或甩动手里的网球拍, 同时嘴上说出想要做一个完整可玩的 3D 游戏、把商品上架到 eBay,或是编辑照片后放入特定文件夹。 等待片刻,工作就完成了。 复杂的提示词和来回操作修改的过程全部消失,只需要像吃饭时看剧聊天一样,随口说几句话,Astra 就能把工作全部搞定。 这可能是理解 Astra 最好的方式。 OpenAI 还展示了一批更贴近日常工作的案例: 寻找猫咪寄养服务,人类平均需要半小时,Astra 用时 5 分 27 秒;寻找工作从约 5 小时缩短到 2 分 51 秒。它还能预约车管所服务、寻找公寓、填写表格、整理日历、更新 CRM,在 Excel 和 Power BI 中处理数据,在 Blender 中制作模型并进一步转换成 UE5 中的交互场景。 在这些现象的背后,是一种更具冲击力的技术路线—— 以前我们希望 AI 使用一套软件或一种服务,通常要先为它开发 API,用 MCP 协议规定可用的外部工具和数据。每多接入一个系统,都要重新处理权限、数据格式和调用逻辑。大量老旧的政务、医疗、保险和企业软件,甚至根本没有合适的 API。 但我们还有另一种已经为人类这种通用智能服务了几十年的接口:GUI。 屏幕、键盘和鼠标是一套覆盖数十亿台电脑、兼容无数新旧软件的接口。模型只要能看懂屏幕、理解当前状态并准确操作,今天仍在使用的软件就可以直接成为它的工具。 Greg Brockman 在吹风会上也谈到了这一点。他认为,AI 行业长期受困于为不同工具逐一编写连接器;当电脑操作能力足够成熟,Agent 就能直接穿梭于表格、表单和网页。 模型开始主动适应人类的软件世界,企业就不必等待整个软件世界先完成
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱