首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

GPT-6来了,立摘ASI坐标系今日金牌!

摘要

新智元报道 终于,Astra 来了! 今天,OpenAI 正式发布 GPT-6 Astra。ARC-AGI-3 打到 99.9%,FrontierMath Tier 4 拿下 97.6%。 数字在这里开始有些苍白。 OpenAI 总裁 Greg Brockman 在发布会上喊出:「Welcome to the AGI era.」 Fable 5.1 的 SOTA 只有可怜的两天。 9 月 1 日,...

ASI GPT Astra OpenAI Agent AGI Altman ARC Fable Claude
2026-09-04 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 终于,Astra 来了! 今天,OpenAI 正式发布 GPT-6 Astra。ARC-AGI-3 打到 99.9%,FrontierMath Tier 4 拿下 97.6%。 数字在这里开始有些苍白。 OpenAI 总裁 Greg Brockman 在发布会上喊出:「Welcome to the AGI era.」 Fable 5.1 的 SOTA 只有可怜的两天。 9 月 1 日,Anthropic 刚把 Claude Fable 5.1 推上王座:Ramp 让它连续跑了 38 小时,中途发现训练数据标签有错,自己改掉,自己开六组实验,自己写结论。 9 月 2 日,谷歌发了 Gemini 3.8 Flash,外部实测在多项编码基准上够到 Claude Opus 5 那一档。 DeepMind 核心研究员姚顺宇评价:「对模型是一小步,对递归自我改进是一次巨大的飞跃。」 9 月 3 日,GPT-6 Astra 落地。 三天,三颗炸弹。放在两年前,随便哪一颗都够行业消化一个月。 而这还不是最让人紧张的部分。 GPT-6 Astra 的发布背后,藏着一段略显坎坷的故事。 8 月 7 日,OpenAI 发了一篇措辞罕见的声明—— 它能独立发现此前无人知晓的系统漏洞,独立编写攻击代码,独立完成从入侵到深层渗透的全过程。 为此,OpenAI 甚至暂停了两周的强化学习训练。 Altman 发表长文:「我们暂停了一些前沿 RL 训练,以确保达到新能力水平所需的对齐、安全和监控标准。」 刹车本身就是信号。 就在 GPT-6 发布的前两天,马斯克和 Altman 在 G20 峰会上的发言,几乎可以当作这一周的注脚。 马斯克视频连线,原话是: 「AI will just crush all humans at software.」 (人工智能将会在软件领域彻底碾压) 他给了一个明确的时间表——未来 12 到 18 个月,AI 在软件上将达到「Stockfish 级别」,像国际象棋引擎碾压顶尖棋手一样碾压人类程序员,并且「在所有形式的工程和一切数字事务上都会极其出色」。 AI不仅会击败人类,还将训练人类。 Altman 把 AI 比作电力:「说一个国家不要 AI,其糟糕程度大约相当于一百多年前说我们不要电。」 但紧接着他也说了另一句话:「担忧是有道理的。担忧是我们预判问题的方式。除非人们非常紧急地行动,否则网络安全方面会出很大问题。」 然后 GPT-6 落地了。ExploitBench 满分。 奇点已过,进入 ASI 冲刺期 去年是新智元十周年,我们说 2027 年 AI 抵达 ASI 临界点。 一年过去了。METR 那条「AI 独立完成任务的时长每七个月翻一番」的曲线不但没有放缓,最新数据显示翻倍速度可能已经加快到每三到五个月。 38 小时的连续自主运行已经是事实。ARC-AGI-3 满分已经是事实。ExploitBench 满分已经是事实。 我们未必已经抵达 ASI。但我们已经进入通往 ASI 的超高加速段。 奇点已至。现在是 ASI 冲刺期。 新智元的 logo 像一个黑洞的视界。十一年,我们站在视界边缘,记下所看见的。 今天再往前看,像走到了地图失效的地方。再往前,旧的刻度、旧的榜单、旧的更新周期,都不够用了。 十一年前我们点燃第一束烛光时,ASI 还是遥远的词。那时候,把看见的记下来就够了。 这个时代,媒体得先有一套观测工具,才谈得上记录。 模型的坐标散在几十个地方。跑分在 LMArena、Vals.ai、MathArena、SWE-bench 这些榜上,价格在各家定价页和 OpenRouter 上,社区在全球各处吵。 同一张榜,单 Agent 和多 Agent 并行的分能差好几个点,厂商发布稿只挑高的那个写。 结果就是两种:每天焦虑地刷消息,越刷越乱;一种干脆不跟了,等别人告诉他结论。 不过,两种都不该是 2026 年的读法。 所以我们干脆让 Agent 来干这件事。让它持续追踪、整理、校准来自不同数据源的变化,不睡觉,不漏拍。落点只有一条—— 你不用自己刷遍全网,也不会错过 ASI 重要的坐标变化。 我们决定做一个 ASI 坐标系 所以我们决定做一套新的 ASI 观测系统。 不是半年更新一次的榜单。不是发布后就静止的文章。是一张每天重新变化的坐标图。 它叫 新智元 ASI 坐标系 。 十几家独立数据源、29 个二级指标,归到 7 个维度——智能、推理、知识、编码、Agent、经济、效率,合成一个 0 到 100 的总分。 十几张榜换算到同一把尺上,才有得比。多源交叉验证,任何单一数据源在全体系里不超过 15%,没有哪张榜说了算。 其中,核心模块叫 ASI 今日看板 。回答的是:今天全球模型坐标发生了什么变化? 谁上升,谁下降。能力、价格、速度有什么新动静。每天一张,看完就知道今天该重新认识谁。 重点在「今日」,它一直在更新中。 为什么GPT-6 Astra 能拿89.1分? GPT-6 Astra 是今天刚官宣的,OpenAI 的开发者文档才挂上去,它就已经进了我们的看板,分算完了,排在第一。 昨天这一轮里它还只是「GPT-6 灰测」的传闻,今天一官宣,几路证据一凑齐,立即直接进官网。 它只盯最近 7 天新上线的文本大模型。 数据来源一共五路。第一路,是OpenRouter 模型目录,看上架时间、价格、上下文长度。第二路,LMArena 周榜快照,看模型第一次出现在哪周。第三路,我们自己的模型库,有发布日期的以它为准。第四路,新智元公众号当天和前一天的文章,按厂商名和「发布、上线、版本号」这类关键词筛标题,拉正文,再从里面提取模型能力信息。 能力图七个维度就是坐标系那七维:智能、推理、知识、编码、Agent、生态、经济。 今天的排名: GPT-6 Astra 89.1 分第一; Claude Fable 5.1 84.9 第二; Gemini 3.8 Flash 81.5 第三; Muse Spark 1.3 78.9 第四。 GPT-6 Astra的89.1分怎么算出来的? 这里一共关注四项: 能力、 关注度、可用度、新鲜度。 其中,能力占大头,贡献 47.5 分。 关注度贡献 22.6 分, 公众号的发文数和阅读量全部拉满。可用度只贡献 9 分,是四项里最低的,因为GPT-6 Astra刚刚官宣,普通用户还用不到。新鲜度 10 分, 今天上线,所以满分。 过去是模型发布、编辑看新闻、等第三方评测,评测出来热点已经过了。 现在是它一官宣,早上机器自己把证据凑齐、图画好、分算好推到官网上。GPT-6 上线第一个早上,我们已经在分析它了。 其他栏目,包括 秒追 ASI ,回答的是:刚刚发生了什么? 新模型发布,版本上线,跑分更新,价格变化,实验室关键动向。机器人逐秒抓取,人类编辑一分钟内裁定。抓到即成条,最近三天滚动。 ASI 爆点 ,回答的是:今天全球 AI 社区在争论什么?不看谁声量大,看什么最热,每小时同步一次。 三个模块,三个时间尺度。秒追管秒,爆点管小时,看板管天。 ASI 启示录放每日深度和 Top 10 热文,视频和直播也在。上线之后,慢慢逛。 9 月 7 日,见 9 月
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱