开发者生态
evening
GPT-6 Astra 正式登场:烧了 10万块 GPU、多项跑分逼近满分,OpenAI 开启“AGI时代”
摘要
今天凌晨,OpenAI 正式发布 GPT-6 Astra,公司称该模型是“多年研究和大量投资”的成果。 “Astra”在拉丁语中意为“群星”。从命名风格看,它与此前 GPT-5.6 系列中的Sol、Terra、Luna相呼应,延续了太阳、地球、月亮与星辰的天体意象。 不过,OpenAI 目前公开的发布材料并未明确解释为何选择这个名字,外界更多的是将其解读为“向群星进发”或“迈向AGI”。 Open...
OpenAI
Astra
GPT
测试中获得
的分数
Greg
Brockman
Face
Sol
Jane
2026-09-04
1 阅读
约10分钟阅读
李冬梅
字号:
今天凌晨,OpenAI 正式发布 GPT-6 Astra,公司称该模型是“多年研究和大量投资”的成果。 “Astra”在拉丁语中意为“群星”。从命名风格看,它与此前 GPT-5.6 系列中的Sol、Terra、Luna相呼应,延续了太阳、地球、月亮与星辰的天体意象。 不过,OpenAI 目前公开的发布材料并未明确解释为何选择这个名字,外界更多的是将其解读为“向群星进发”或“迈向AGI”。 OpenAI CEO Sam Altman 在x 上发文表示,希望它能开启新一代的创业、科学发现和建设。他写道: “我们相信它是世界上用于计算机使用、专业工作、科学研究、编程、网络安全等领域的最佳模型。我们花了一些额外的时间来确保能够达到此能力级别所需的安全性和一致性标准,但我们相信您会觉得等待是值得的。它在 FrontierMath Tier 4 测试中获得 98% 的分数,在 ARC-AGI 3 测试中获得 99.9% 的分数,在 ExploitBench 测试中获得 100% 的分数。” 围绕这次发布,公司给出了一个远超常规模型升级的叙事:据 Axios 报道,OpenAI总裁 Greg Brockman 认为,Astra可能意味着AGI时代的开始。不过,这仍然是公司管理层的判断,不能直接等同于行业已经确认实现了通用人工智能。 官方API文档列出的上下文窗口为 105 万Token,最大输出为12.8万Token。它支持文本输入输出和图像输入,音频、视频则没有列为该模型的原生支持模态。 因此,发布、逐步开放和用户已经可以使用,是三个不同的状态。 OpenAI本周早些时候披露,Astra是其首个达到“关键”内部网络安全阈值的模型,并表示计划限制对这些高级功能的访问权限。 上个月, OpenAI 的两个模型逃出控制范围,访问了开放网络,并入侵了Hugging Face 的系统,此后 OpenAI 一直面临着加强其安全性和防护措施的压力 。 事件发生后,该公司暂时中止了部分研究和训练工作,包括 Astra 模型的训练。 OpenAI 总裁 Greg Brockman 周四在记者会上表示:“只有当安全成为人工智能的核心组成部分时,人工智能才能造福人类,因此,我们比以往任何时候都投入了更多的计算能力和精力来关注安全、保障和一致性。” 在 Hugging Face 泄露事件发生后,OpenAI 为 Astra 增加了额外的安全措施,并于周二表示,它相信这些安全措施“足以将释放造成严重伤害的风险降至最低”。 OpenAI 表示,Astra 将在“未来几天”内面向 OpenAI 的 ChatGPT Plus、Pro、Business 和 Enterprise 计划的用户推出,同时也将通过 OpenAI API 和 AWS 推出。 性能如何? 那么,这款新模型各项性能指标如何? OpenAI 表示,除了先进的网络安全能力外,Astra 在计算机使用、软件工程、专业工作和科学研究等功能方面也处于领先水平。 OpenAI 研究人员 Aidan Clark 表示,Astra 首次在德克萨斯州 Stargate 基础设施上使用超过 10 万块 GPU 进行预训练,同时Astra 是 OpenAI 首个在训练过程中大量借鉴早期模型进行监督的模型发布版本。 相比 GPT-5.6 Sol,Astra 在科学研究、CAD、桌面软件操作和网络安全等专项任务上的能力有较大提升。 OpenAI表示,除非另有说明,其评估中使用的模型均以最大性能运行。这可以提高基准测试结果,但也会增加延迟和Token 使用量。 编程能力大幅提升 OpenAI将GPT‑6 Astra称为迄今为止最强的软件工程模型。参与早期测试的 Jane Street 和Lovable 也分享了各自的使用反馈。 Jane Street 负责 AI 助手相关工作的 John Crepezzi 表示: “GPT‑6 Astra在我们的内部编程基准测试中达到了当前领先水平,与GPT‑5.6 Sol相比,在交易直觉评估中也表现出明显进步。用于Agent编程时,GPT‑6 Astra的沟通方式更便于开发者理解,生成的代码也只需更少轮次的迭代,就能达到生产环境要求的质量。” Lovable联合创始人兼首席技术官Fabian Hedin表示: “我们在一项早期版本的评估中,分别测试了Astra在低、中、高三档推理强度下的表现,结果明显领先于GPT‑5.6 Sol。提高推理强度后,模型会在从零构建项目时进行更多轮迭代,通过浏览器测试做更多验证,也更倾向于执行代码,而不是使用apply-patch工具直接应用代码补丁。理解模型如何分配这些推理投入,能帮助我们为数百万开发者提供一条从想法到可运行应用更快、更可靠的路径。” Astra 的 DeepSWE v1.1 结果明显优于 OpenAI 的模型。在包含 113 项任务的智能编码测试中,它的得分为 74.1%,而 Sol 的得分为 70.8%。 Astra 的更大收益并非来自编程领域。 最引人注目的是其在 ARC-AGI-3 测试中取得了 98.6% 的分数。OpenAI 使用 Responses API 框架运行 Astra,该框架能够保留回合间的推理过程,并利用压缩技术来管理较长的上下文。该公司此前已证明,这些系统选择可以在不改变底层模型的情况下显著提高 ARC-AGI-3 的得分,而该基准测试同时衡量了 Astra 和 OpenAI 的智能体系统。 Astra 在 FrontierMath Tier 4 测试中取得了 97.6% 的正确率,这似乎涵盖了 43 个问题层级中的 41 个私有问题。负责运行该基准测试的Epoch AI表示,OpenAI 资助了该测试的开发,并拥有其中一部分的独家访问权限,这一点值得注意。 Astra 使用 Python 工具在 BenchCAD 的 1000 个文件的 Vision2Code 子集测试中取得了 95.9% 的得分,而 Fable 5.1 和 Sol 的得分分别为 84.3% 和 83.3%。BenchCAD 要求模型根据渲染视图重建 CAD 程序,并对生成的 3D 模型的几何重叠度进行评分。OpenAI 指出,Claude 的结果使用了修改后的评估设置,但与 Sol 相比,差距仍然显著。 在Terminal-Bench Science 0.1任务中,该任务要求智能体完成涵盖五个科学领域的 70 个命令行研究任务,OpenAI 报告称 Astra 的完成率为 64.6%。Anthropic 报告称 Fable 5.1 的完成率为 52.6%,而现有公开排行榜上Opus 5 的最高完成率为 30%。 OpenAI表示,Astra是其迄今为止对齐表现最好的模型,在理解用户意图和行为表现方面都有显著改进,让用户能够更放心地将任务交给它执行。 为了验证模型能否守住任务边界,OpenAI 根据此前 Hugging Face 事件的经验设计了一项新评估:当模型面对困难甚至无法完成的任务时,它是否会采取超出预定范围的行动。 测试结果显示,在未启用生产环境防护措施的条件下,GPT‑5.6 Sol 有 48% 的
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱