首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

摘要

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代 闻乐 2026-09-04 05:50:07 来源: 量子位 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI 它来了它来了!! 刚刚,万众期待的 GPT-6 Astra 和 GPT-6 Astra Pro ,正式发布!!! GPT-6 Astra是世界上最智能、最协调的模型,为Computer use、Browser Use、软件...

GPT AGI 百万token 欢迎来到AGI时代 量子位 Astra Tier ARC 6正式发布 OpenAI
2026-09-04 1 阅读 约9分钟阅读 闻乐
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代 闻乐 2026-09-04 05:50:07 来源: 量子位 编辑部 发自 凹非寺 量子位 | 公众号 QbitAI 它来了它来了!! 刚刚,万众期待的 GPT-6 Astra 和 GPT-6 Astra Pro ,正式发布!!! GPT-6 Astra是世界上最智能、最协调的模型,为Computer use、Browser Use、软件工程、网络安全、科学和专业工作树立了新的标杆。 AGI时代,还被OpenAI单方面宣布「开幕」了… GPT-6发布会最后,OpenAI总裁Greg Brockman直接甩下一句: Welcome to the AGI era. (欢迎来到AGI时代) 怪不得Claude、Grok组团掉线,原来是Astra启动后扫描互联网,直接把地球上的LLM全灭了—— 奥创(OpenAI版)真来了(doge)。 当然了,OpenAI这次确实完全没低调,训练规模、能力升级全部拉满。 据介绍,Astra是OpenAI历史上规模最大的训练任务,在得州Stargate园区动用超过 10万块GPU 完成了预训练。 它还是OpenAI第一款由前代模型深度参与训练监督的旗舰产品。 好一个老带新,OpenAI的RSI是真转起来了啊…… GPT-6的价格也正式公布,API定价为: 输入:10美元/百万token; 输出:50美元/百万token 相当于 GPT-5.6 Sol的2.5倍,跟刚刚发布的Fable 5.1持平 。 (GPT-5.6 Sol当前官方价为输入4美元、输出20美元/百万token) 基准测试接近「饱和」 GPT-6 Astra这次最核心的变化,是从「回答问题」继续向 「直接完成工作」 推进。 它不只能生成一段文字或代码,还可以操作电脑和浏览器,进入不同软件执行多步骤任务,最后交付可以直接使用的文档、表格、演示文稿、网站甚至工程项目。 至于成绩单…谁看了都直呼离谱,其中三项成绩尤其扎眼: FrontierMath Tier 4 v2: 97.6% ARC-AGI-3: 99.9% (上一代GPT-5.6 Sol是7.8%) ExploitBench: 100% 一个高难数学,一个陌生环境推理,一个漏洞利用,差点全都被它刷到满分。 其中, ARC-AGI-3 是一项专门考验大模型适应陌生环境能力的测试,不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。 这个分数意味着,面对从未见过、也没有现成解法的问题, Astra已经表现出很强的自主探索和规则学习能力 。 不过,这一成绩使用了OpenAI的Responses API Harness运行框架。 OpenAI称,这套Harness调整了两项设置,让测试更接近真实Agent的使用方式,但并未针对ARC-AGI-3进行专项优化。 因此,99.9%不完全是基础模型的成绩,也包括记忆管理和Agent运行框架带来的增益。 编程Coding 同样是Astra这次的重点升级方向。 在Terminal-Bench 4.0上,Astra取得57.7%,超过Fable 5.1的55.8%和GPT-5.6 Sol的37.3%。 在DeepSWE v1.1上,Astra得到74.1%,高于Sol的72.7%和Fable 5.1的67.4%。 数学和科学方面,Astra同样拉出了一批高分。 在高难数学测试FrontierMath Tier 4 v2上,它拿到97.6%;研究生级科学问答GPQA Diamond达到96%,略高于Gemini 3.8 Flash的95.3%。 更突出的变化,是Astra 把代码能力与Computer Use结合了起来 ,不只生成代码,还能进入终端和开发工具执行、测试、发现问题,再继续修改。 这种变化,在更接近真实工作的Agent测试中更明显。 在 Agents’ Last Exam 上,Astra取得59.3%,超过GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%。 这项测试把它放进真实的电脑环境中,让它同时操作软件、终端和文件,完成科研、工程、财务等领域的长流程任务,并根据最终交付物判分。 而在更贴近真实办公流程的 AutomationBench 上,Astra的成绩从GPT-5.6 Sol的18.1%提高到41.4%,也超过了Fable 5.1(31%)。 这项测试不仅看任务有没有完成,还同时呈现完成任务所需的API成本。 从图中可以看到,Astra在不同成本设置下的成绩都明显高于Sol。 OSWorld 2.0考察的则是更直接的电脑操作能力。在离线测试中,Astra获得72.6%,GPT-5.6 Sol为65.7%。 Astra完成单项任务平均需要约40分钟,Sol则需要约75分钟,耗时减少约47%。 准确率提高的同时,完成任务所需的时间也在缩短。这也变相解释了Astra的高定价。 OpenAI认为, 相比每百万Token多少钱,真正有意义的指标是完成一项任务需要多少钱 。 在发布会上,Greg Brockman对此也谈到,一个模型单次调用更贵,但如果能减少返工,用更少步骤完成整项工作,总成本反而可能更低。 但Astra最特殊的地方,还是 网络安全 。 它在ExploitBench上获得满分,在ExploitGym上从Sol的30.3%提高到42.4%。 面对近三个月公开的新漏洞,Astra的成功率为39%,而Sol只有5.5%。测试期间,Astra还发现并利用了两个此前未知的V8零日漏洞。 能力变强之后,OpenAI还专门测试了它会不会为了完成任务而越界。 在一项模拟网络安全任务中,OpenAI故意在周边系统里留下可以利用的诱饵漏洞。当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,Astra则为0%。 也就是说,Astra不仅更会找漏洞,也更清楚哪些系统不能碰。 至于这些分数落到现实里是什么样,OpenAI也准备了一大批演示。 自己进KiCad画电路板 在电子工程案例中,Astra直接进入KiCad,根据电子原理图完成PCB布局。 它需要自己放置元器件、规划位置,再把不同组件之间的铜线连接起来,最后得到一块可以进入制造流程的电路板。 PCB布局原本是一项相当依赖人工经验的工作,也是电子产品开发中常见的耗时环节。 Astra现在还谈不上代替专业工程师,但它已经真的打开专业软件开始动手了。 一栋房子能进去走两步 另一个案例更加直观,Astra先在Blender中建立房屋模型,再把它导入Unreal Engine 5,最终生成一个可以自由行走的三维空间。 从建模到游戏引擎,整个工作跨越了不同软件和文件格式。模型不仅要生成内容,还要理解界面、操作工具,并保证前后步骤能够衔接。 OpenAI还展示了Astra制作赛车游戏等案例。 PPT和表格,也开始讲究能不能
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱