首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

GPT-5.6一夜刷新AI智能天花板!最小模型成本暴降25倍

摘要

新智元报道 GPT-5.6再次刷新AI智能天花板! 今天,OpenAI重磅发布《GPT-5.6构建者指南》,交出了一份亮眼的成绩单。 在ARC-AGI-3上,GPT-5.6 Sol的性能从13.3%飙到38.3%,输出Token暴降6倍。 另一边,「超小杯」Luna表现同样惊艳: 在BrowseComp测试中,它以84.04%性能直逼GPT-5.5(84.36%),更将成本从33.27 美元打到1...

GPT AGI 飙到38 超小杯 33美元 三个月前 拿下84 Sol 新智元报道 6再次刷新AI智能天花板
2026-08-14 1 阅读 约6分钟阅读 新智元
分享:
字号:
新智元报道 GPT-5.6再次刷新AI智能天花板! 今天,OpenAI重磅发布《GPT-5.6构建者指南》,交出了一份亮眼的成绩单。 在ARC-AGI-3上,GPT-5.6 Sol的性能从13.3%飙到38.3%,输出Token暴降6倍。 另一边,「超小杯」Luna表现同样惊艳: 在BrowseComp测试中,它以84.04%性能直逼GPT-5.5(84.36%),更将成本从33.27 美元打到1.33美元。 此外,官方还附上了「保姆级」教程,教初创团队如何以更低成本跑GPT-5.6。 GPT-5.6实力大涨 输出Token砍6倍 仅一个月的时间,GPT-5.6 Sol内部悄悄完成进化。 一直以来,ARC-AGI-3是顶尖AI还未拿下50%的最难测试,测试规则非常简单—— 把AI丢进一堆没见过的2D小游戏里,不给说明书,让它自己摸索规则怎么玩。 结果,GPT-5.6 Sol在官方榜上只拿了7.8%,而GPT-5.5仅有0.4%。 就拿上一代对比来看,同一个Sol在ARC-AGI-2上考了92.5%分,还通关了《宝可梦·火红》。 为此,OpenAI两位研究员Ilan Bigio和Ted Sanders去查了原因,问题出现在harness上。 ARC官方的「通用harness」干了两件事:每走一步,就把模型的私有推理过程丢掉;上下文一满,就从最老的开始截断。 也就是说,模型每走一步,记忆就会被清空,然后再重来一遍。 于是,团队把harness换成Responses API,打开两个开关「推理保留」和「压缩」,重新跑了一遍公开题集。 没想到,GPT-5.6 Sol从13.3%飙到38.3%,且输出Token减少6倍。 「超小杯」Luna 成本更低了 这份《建造者指南》里,最抓眼球的一组对比,来自BrowseComp。 这是OpenAI自己打造的,一个专考「能不能在全网输出冷门事实」的榜单。 三个月前,GPT-5.5开到Extra High档,拿下84.36%,总花费33.27美元。 现在,GPT-5.6家族里最小最便宜的Luna,同样Extra High,拿下84.04%,花了1.33美元。 虽然成绩仅差0.32%,但成本砍了足足25倍。 当然了,OpenAI想要说的是—— 三个月前,只有旗舰GPT才能干的活儿,现在最低档的小模型Luna,也能做到八九不离十。 让GPT-5.6自写代码、调工具 指南中,OpenAI还给出了另外三种方式,都是让GPT-5.6实现更低成本部署。 第一个,是程序化工具调用(Programmatic Tool Calling)。 以前的Agent像个事必躬亲的老板:每收到一份材料,都需亲自过目一遍,才能说下一步干什么—— 调100次工具,就得来回100趟。 现在模型可以直接写一段JavaScript,在沙箱里把工具批量调完、筛完、汇总完,只把最后那张表拿回自己眼前。 金融研究公司Rogo的实测结果,质量打平的前提下,输入Token少用了21%。 第二个,是「原生多智能体」。 主模型当工头,把活拆给一群子模型并行去干,最后收回来汇总。 ChatGPT里那个ultra档位,本来就是这么跑的,默认四个agent同时开工。 产品公司Obvious的联创Jon Bell说,他们一口气扔了六份需求进去,边写边搭边讨论,全程没散架。 第三个,是「提示词缓存」。 缓存有效期拉长到至少30分钟,断点还能自己指定位置。 AI公司Ploy的工程师给一段29000 token的共享提示词加了断点和工作区专属键,未命中缓存的输入直接少了28%。 每秒750个token 加速14倍 同一天,OpenAI放出了Ultrafast模式预览版。 GPT-5.6 Sol,最高14倍速,每秒吐出750个token,先在OpenAI API上线。 这件事的分量在于,它撕掉了一条用了两年的潜规则——想要实时响应,就得退而求其次换个小模型。 现在不用了,Ultrafast跑的还是那个Sol,智能水平一点没减。 Cerebras自己做了一组对照,选的题是Humanity's Last Exam——2500道通常只有博士才答得上来的题。 Sol Ultrafast跑完全部2500题,用时11小时11分。 Claude Fable 5跑同一批题,用了78小时27分,三天多。 准确率相当,速度差了近7倍。 提分、降本、提速,短短一个月的时间,GPT-5.6完成了一次真正意义上的全方位进化。 参考资料: https://openai.com/index/builders-guide-to-gpt-5-6 编辑:桃子 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱