智能AI
morning
刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable
摘要
新智元报道 真是深藏不漏! 这一次,谷歌终于把底牌扔出来了。 就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。 上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气—— 这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro! 一张疯传全网的基准图,简直堪称「恐怖」。 Gemini 4 Pro完全杀疯,编码、智能体、...
Gemini
Pro
25美元
新智元报道
真是深藏不漏
这一次
谷歌终于把底牌扔出来了
就在这两天
大模型竞技场Arena悄然杀入一款新模型
名字竟挂着
2026-09-18
1 阅读
约8分钟阅读
新智元
字号:
新智元报道 真是深藏不漏! 这一次,谷歌终于把底牌扔出来了。 就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。 上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气—— 这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro! 一张疯传全网的基准图,简直堪称「恐怖」。 Gemini 4 Pro完全杀疯,编码、智能体、推理等领域实力,全面碾压GPT-6 Astra、Claude Fable 5.1。 开发者Vidhi体验过后,被Gemini 4 Pro完全震惊到了。 一张猫咪的SVG图,就证明了一切。GPT-6 Astra直接扔出了一只「大猫咪」(似猫非猫,更像laofu)。 正如传言所说,谷歌内部实现了RSI,Gemini 4 Pro才能和Astra/Fable正面对打。 沉寂许久的巨兽,真的强势回归了! Gemini 4 Pro匿名偷跑,击败Astra和Fable AI圈许久未有这么兴奋了。 要知道,谷歌上一个大版本更新Gemini 3.1 Pro,已经是7个月前(2月19日)的事儿了。 谷歌I/O大会上,劈柴曾预告:Gemini 3.5 Pro将在6月上线。 未曾想,这一重大发布鸽了又鸽,最终「胎死腹中」! 就在这个月初,WSJ独家爆料,Gemini 3.5 Pro取消了,原因很简单—— 3.5 Pro的进化程度,连Flash都比不上。 好在,Gemini 4在预训练中评估优秀,后训练还在顺利进行中。 如今,Gemini 4 Pro竟穿上了gemini-3.8-flash的「马甲」,在Arena上首个检查点现身了。 毕竟Gemini 3.8 Flash这款模型,早在9月初发布,同名再出现极不寻常。 一大波上手体验后的开发者们,对4 Pro印象深刻,甚至体感超越了Astra和Fable。 从泄露的基准测试图中,可以发现,4 Pro实现了全面压制,成绩单非常亮眼—— DeepSWE v1.1:AI智能体编码任务上,4 Pro拿下了最高88.%分,比Astra还要多近2%; GDPval-AA v2:在真实知识工作任务中,4 Pro唯一获得了2064 Elo; Terminal-bench 2.1:4 Pro终端编码能力也是最强的95.3%; OSWorld-2.0:计算机使用能力方面,4 Pro斩获86.8%,击败了Astra和Fable。 若这张表分数属实,Gemini 4 Pro真是「地表最强」的AI了。 在价格方面,相较于Astra和Fable,也是「御三家」中最具性价比的那个。每百万Token输入价格2.25美元,每百万Token输出价格11.25美元。 AI研究员Qwinah进入Gemini 4 Pro后端后发现,它有1000万输入上限,25.6万输出上限,永久跨会话记忆,不用API即可连网。 全网首测4 Pro,登上热搜 真正比跑分更有看点的,是全网一大的波惊艳实测。 UI网页设计,品味大提升 这不,开发者Bee测完之后,直呼「Gemini 4 Pro太不真实了......」 短短14分钟,4 Pro打造了一个以素描、铅笔与石墨质感为主题的「创意展示网页」。 它竟可以将网页的「滚动即笔触」概念化,向下滑动线条逐渐加深,交互感非常丝滑。 下面这个是一个兼具赛博朋克和复古未来主义的工作网站。 4 Pro在设计过程中,首屏结合了3D网格、数据仪表盘,还有可交互的3D模型。 3D+SVG,夯爆了 全网疯传的一个经典「鹈鹕骑自行车」的测试,Gemini 4 Pro输出的效果非常震撼。 配色、日夜切换、车灯、解剖标注、踏频控制,整个完成度完全不输顶尖大模型。 Pankaj Kumar在体验后,直接总结了几个变化: 速度很快,SVG和3D生成明显进步;一次提示就能把复杂要求吃得比较准。 甚至,它已经能直接生成带完整交互逻辑、视觉效果不错的小游戏。 再来看一个像素风3D宝塔测试,有种身临其境的味道了。 下面这个是4 Pro用时10分钟,制作出的空客H145直升机3D模型。 另外,在一个3D飞行模拟的测试中,4 Pro的画面效果大幅超越了Gemini 3.8 Flash。 从这一点,就可以证明,Gemini 3.8 Flash和竞技场上的gemini-3.8-flash不是同一款。 一键直出可玩的游戏 在游戏生成方面,Gemini 4 Pro也没有落下。 「我的世界」从页面搭建,大游戏中每个模块的设计,完全不输此前放出的Astra的测试。 还有下面这个3D卡丁车竞速游戏,看起来比跑跑卡丁车这些曾风靡一时赛车游戏更现代;而这,是Gemini 4 Pro花了很短时间做出来的。 谷歌真正押注的,叫 RSI 一旦RSI这个循环真能持续转起来,模型升级的节奏可能彻底变掉。 上个月,Google DeepMind首席战略官Jasjeet Sekhon在伯克利的活动上,直接把话挑明了—— RSI(递归自我改进),已成为AI巨额投资逻辑里的关键一环。 整个行业押注的,是能力曲线继续向上。 而如果真正撞上递归自我改进,这条曲线甚至可能从「指数增长」进一步加速。 就在最近,全网流传着更激进的说法: Gemini 4之所以提前完成预训练,正是因为谷歌DeepMind在训练中实现「RSI闭环了」。 有意思的是,就在14日,谷歌一项名为Dream-RSI的研究也公开了。 它研究的正是,如何让Agent在探索过程中不断改进自己的搜索策略,从经验中继续升级下一轮探索。 可以确认的是,谷歌DeepMind已经公开把RSI摆到了非常重要的位置。 而且,AI参与改进AI的迹象越来越多。 「御三家」要回来了? 所以,Gemini 4 Pro面对的是一个已经彻底变样的牌桌。 OpenAI有Astra;Anthropic有Fable 5.1。 两大巨头已经把竞争从单纯聊天,卷到长任务、Agent、代码、推理乃至自主科研。 谷歌如果只是做出一个「比Gemini 3.8更强」的模型,已经不够了。 Gemini 4 Pro必须重新证明一件事:Gemini还在最前沿! 谷歌要想撑住目前4.23万亿美元的市值,保持AI实力在第一梯队至关重要。 参考资料: https://x.com/HarshithLucky3/status/2100524699780600136 编辑:桃子 马可 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱