首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 morning

刚刚,GPT-6 震撼发布!人类进入 AGI 大分工时代

2026-09-04 1 阅读 约10分钟阅读 莫崇宇
分享:
字号:
GPT-6 Astra,猝不及防地降临。 就在刚刚,OpenAI 官方定调称,这是「全球最智能、最符合人类意图的模型」。 OpenAI 表示,Astra 集合了多年在预训练、强化学习和模型对齐领域的研究成果,在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业工作等多个方向达到新的能力水平。 相比以聊天、写作和问答为主的前代模型,Astra 更像一个能直接干活的 AI Agent:它可以调用工具、操作软件、浏览网页,独立完成复杂任务。 这一次发布,也成为 OpenAI 近年来规模最大的一次模型升级。 据 OpenAI 研究负责人 Aidan Clark 介绍,Astra 是 OpenAI 迄今规模最大的训练项目之一,也是首次在训练过程中大量使用此前模型参与监督的新一代模型。该模型首次在美国 Stargate 德州基地使用超过 10 万张 GPU 进行预训练。 OpenAI 总裁 Greg Brockman 更是直接开麦:几年后回头看,今天就是 AGI 时代的起点。 GPT-6 Astra 登场,要让 AI 接管软件 GPT-6 Astra 最大的变化,是 Computer Use 能力。 过去的大模型虽然可以生成代码、总结资料、回答问题,但真正进入现实软件环境执行任务时,仍然存在明显限制。浏览网页、填写表格、操作办公软件、处理复杂流程,这些任务需要大量人工介入。 Astra 试图改变这一点。 OpenAI 称,Astra 是目前最强的计算机操作模型,可以完成填写在线表单、更新 CRM 数据、整理日程、进行网络研究,并在邮件和文档编辑器中生成内容。它还可以分析科学数据、生成图表、创建网站,并自动运行前端质量测试。 在官方演示中,Astra 展示了多个接近真实工作的创意场景。 它可以使用 KiCad 完成 PCB 设计,将电子原理图转换成可以制造的电路板布局;可以操作 Excel、Power BI 等办公工具;可以使用 Blender 创建三维模型,并进一步转换为 Unreal Engine 5 中可交互浏览的空间。 除此之外,我们还能让 Astra 从设计图开始搭建完整房屋模型,模型先在 Blender 中完成 3D 建模,再自动导入 Unreal Engine 5,生成可以自由探索的交互场景。 甚至另一位用户还能通过 MCP 连接 Ableton,让 Astra 从零制作完整音乐,包括音色设计、乐器编排和混音流程。 基准测试结果也显示,Astra 的 Computer Use 能力明显提升。 在 OSWorld 2.0 测试中,GPT-6 Astra 得分达到 72.6%,高于 GPT-5.6 Sol 的 65.7%。而在 Agents’ Last Exam 测试中,Astra 得分达到 59.3%,高于 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。 此外,OpenAI 还同步升级了 Codex harness。 过去,AI 编程 Agent 最大的问题之一,是长时间任务容易丢失上下文。一个持续数小时的大型开发任务中,模型可能忘记此前为什么修改某段代码,或者遗漏用户早期提出的限制条件。 Astra 引入了新的上下文管理方式。 OpenAI 表示,Codex 不再单纯依靠压缩总结保存历史,而是可以跨上下文窗口保存笔记,并搜索此前消息和工具输出,从而找到之前的需求、测试结果以及修改记录。 同时,Astra 可以在等待用户回复时继续推进不依赖该信息的任务。如果问题会影响最终结果,模型会等待用户确认;如果影响较小,则会根据合理假设继续执行。 简言之,过去,人们更关注模型能否给出准确回答;接下来,真正拉开差距的,将是它能否独立完成一项完整工作。 代码、数学和科学,成为 GPT-6 Astra 的新战场 OpenAI 希望 Astra 不只是一个效率工具,而是进入企业核心工作流程。 其中,软件工程是竞争最激烈的领域之一。 OpenAI 将 Astra 称为目前最强的软件工程模型。 在考察终端环境测试的 Terminal-Bench 4.0 中,Astra 得分达到 57.7%,明显高于 GPT-5.6 Sol 的 37.3%,同时每个任务的预计 API 成本低于 Sol 和 Claude Fable 5.1。在 DeepSWE v1.1 测试中,Astra 得分达到 74.1%。 OpenAI 更强调的是,Astra 在复杂真实开发环境中的表现。 合作伙伴 Jane Street 表示,Astra 在 Agent 编程场景下,更容易被开发者理解,同时生成代码需要更少迭代才能达到生产质量。 AI 创作者 Pietro Schirano 则展示了 Astra 根据图片生成 3D 模型和动画,并通过一句目标指令创建完整水下探索游戏的过程,其中包含 3D 元素、声音以及可交互玩法。 另一位用户 Chris 表示,Astra 在 Unity 环境中的表现相比此前版本提升明显,能够直接利用现有资源组装城市场景,生成更接近真实游戏开发流程的内容。 科学研究则是 Astra 展示能力的另一个重点。 OpenAI 表示,Astra 在 FrontierMath Tier 4 测试中取得 97.6% 成绩,在 GPQA Diamond 科学推理测试中达到 96.0%。 这款新模型还参与了数学研究。OpenAI 表示,Astra 帮助推进了素数间隔问题研究,其中一项结果将无限多个素数对之间的已知距离上限进一步缩小。 在实际科研流程中,Astra 不只是回答科学问题,而是可以直接进入专业软件环境分析数据。例如,它可以检查基因测序质量、分析遗传变化,并帮助研究人员判断下一步研究方向。 不过,Astra 最受关注的能力,也带来了最大的安全争议。 OpenAI 表示,Astra 已达到其 Preparedness Framework 中的「关键网络安全能力阈值」。 在 ExploitBench 测试中,Astra 获得 100% 成绩,高于 GPT-5.6 Sol 的 78.5%;在 ExploitGym 测试中,Astra 成功率达到 42.4%,高于 Sol 的 30.3%。 进一步测试显示,Astra 在近期漏洞测试中发现并利用了两个此前未知的 zero-day 漏洞,OpenAI 表示已经向相关维护方披露。 同一个模型,既可以帮助企业发现漏洞、修复代码,也可能被用于攻击系统。因此 OpenAI 对 Astra 的开放采取了更严格的分级策略。 普通用户版本会拒绝部分高级网络安全请求,而经过审核的安全团队可以通过 Daybreak 项目获得更开放的访问权限。 人类与 AI 的大分工时代 GPT-6 Astra 发布后,AGI 再次成为行业讨论中心。 OpenAI 并没有正式宣布已经实现 AGI,但 Greg Brockman 的表态明显更加积极。 他认为,未来的人们可能会把 Astra 看作 AGI 时代的重要起点,同时表示 AGI 更像一个「使命概念」,而不是一个可以被简单定义的技术指标。 「如果几年后回头看,什么时候真正创造了 AGI,我认为可能就是现在,可能就是这个模
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱