游戏
morning
Gemini 4 Pro疑似泄露,“AI减排”又成空话
2026-09-19
1 阅读
约10分钟阅读
字母AI
字号:
文 | 字母AI 前几个月,OpenAI和Anthropic轮番把旗舰模型往前推,谷歌却显得异常安静。 Flash几乎3周一更,3.6、3.7、3.8连续往前,但代表最高能力上限的Pro迟迟没有动静。 直到这两天,大模型盲测竞技场Arena里,突然冒出一个挂着gemini-3.8-flash名字的模型。 开发者一上手就发现了不对劲,真正的Gemini 3.8 Flash已经发布了,它该是什么水平,大家心里有数。可这个“3.8 Flash”,写代码、做SVG、跑Agent,表现明显又往上跳了一截。 几轮实测之后,一个猜测迅速扩散开来: 这个模型很有可能是谷歌藏在标签后面的下一代旗舰——Gemini 4 Pro。 紧接着,一张更夸张的benchmark对比图开始疯传。编码、Agent、推理,多项成绩都把GPT-6 Astra和Claude Fable压在下面。 就在几天前,几家最重要的AI公司还在公开讨论,是不是该慢一点。现在,减速的声音还没落地,新一轮竞赛已经开始狂飙。 而这个疑似Gemini 4 Pro的“神级模型”背后,还有一个更危险的关键词: RSI。 Gemini 4 Pro疑似泄露 9月2日,Google刚刚正式发布Gemini 3.8 Flash。官方称,这是Gemini 3系列最新一代Flash,在软件工程、Agent任务和复杂多步推理上都有明显提升;从3.7 Flash到3.8 Flash,中间只隔了三周。 所以,当Arena里又出现一个同样挂着gemini-3.8-flash名字的模型时,开发者很快就察觉到了异常。 真正的3.8 Flash已经摆在那里,大家有现成的参照物。而这个模型看起来明显更强,分明是Pro模型才会有的实力。 最早引发传播的一批实测,集中在SVG、网页和3D场景上。 开发者Harshith让它用SVG画一只侧面的家猫,并把结果与GPT-6 Astra Max和正式版Gemini 3.8 Flash放在一起。Arena里的这个版本,无论轮廓、比例还是细节完整度,都和正式3.8 Flash拉开了肉眼可见的差距。 从左到右依次为“4 Pro”、Astra、3.8 Flash X网友@thtbee_从多个角度连续测试了这个疑似Gemini 4 Pro的模型。 一个Voxel风格宝塔,模型跑了8分钟,直接生成了一整套可交互3D场景。 一架空客H145直升机,它只花大约10分钟就搭出了完整的3D展示页面,细节非常丰富。不过,这位网友表示,页面底部的UI元素“看起来有点糟”。 在网页设计上,模型花了大约14分钟就做出了一套单色主题网站,整体非常干净、完整。过去Gemini经常被吐槽的设计品味问题,这次似乎终于被补上了。 另一位网友@Mr_Salio直接拿这个疑似Gemini 4 Pro的模型去做游戏。成品画面足够流畅,世界生成和游戏设计的完成度也很高。 更关键的一条线索来自开发者Qwinah。 他声称自己成功“幽灵路由”到了Gemini 4 Pro的后端,并贴出了一张疑似内部终端信息的截图。 根据他的说法,这个模型的内部标识里直接出现了G4P-ARGON和VIA_3.8_FLASH,最大输出达到256K,上下文窗口超过1000万token,还带有跨会话永久记忆、无需API即可联网、后端自动编译运行脚本,甚至物理机器人控制等能力。 如果这些信息属实,那它显然已经不是一次普通的Flash升级。 与此同时,一张Gemini 4 Pro的benchmark对比表也开始在社区疯传。 按照图里的数据,Gemini 4 Pro在软件工程测试DeepSWE v1.1拿到88.7%,在终端Agent测试Terminal-Bench 2.1达到95.3%,在专家级知识推理测试HLE-Verified冲到72.1%,在电脑操作Agent测试OSWorld 2.0达到86.8%。 更夸张的是,在衡量真实知识工作的GDPval-AA v2上,它被写成2064 Elo,直接突破2000大关。 如果这些数据属实,Gemini 4 Pro简直能“拳打Fable,脚踢Astra”,一举站上前沿模型之巅。 但越是夸张,越需要小心。 值得注意的是,这张benchmark表,和Qwinah“挖”出来的那张疑似后端截图,并不完全对得上;benchmark表里作为对照项的Astra,得分也不符合官方数据;两份材料都没有Google、Arena或相关benchmark官方背书,目前仍然只是社区流传的信息。 唯一能被确认的只有那个名叫gemini-3.8-flash名字的模型,和完全不符合Gemini 3.8 Flash的表现。 但大家之所以会迅速把答案指向Gemini 4 Pro,还有一个非常重要的原因:Google的Pro模型,已经空窗太久了。 Gemini 3.5 Pro迟迟没有正式落地,Gemini 4早已确认进入训练,过去几个月,Flash一代代往前推,真正代表能力上限的Pro线始终没有新型号出现。 现在,一个能力明显异常的“3.8 Flash”突然从Arena里钻了出来。 于是,猜测自然越来越像样——Google可能根本没打算把真正的大升级留给3.5 Pro,直接憋到了Gemini 4 Pro。 Gemini 4 Pro背后,更大的关键词是RSI 如果说Gemini 4 Pro目前还只是社区传言,那么更值得注意的是, 谷歌正在明显加快AI参与模型研发的速度。 在这一次的Gemini 4 Pro传闻里,RSI这个关键词被反复提及。 RSI全称为Recursive Self-Improvement,递归自我改进,简单来说,就是AI开始参与制造更强的AI,而更强的AI又进一步加快下一代模型的研发。 一旦这个循环跑起来,被加速的就不只是模型能力本身。 就连模型进化的速度,也会开始被模型自己加速。 路透社今年8月披露,谷歌联合创始人Sergey Brin近几个月一直在推动Gemini提速,并把递归自我改进列为重点关注方向之一。 虽然谷歌目前还没有公开宣布自己已经实现了这个闭环,但它正在把越来越多原本属于研究员的工作交给Agent,包括评测模型、寻找改进方向、跑实验,再把结果反馈回模型研发流程。 9月2日发布Gemini 3.8 Flash时,谷歌也在官方说明里提到,一套长期运行的Agent循环正在“递归地评估和改进底层模型”。 Google DeepMind研究员姚顺宇(不是腾讯的姚顺雨)则在3.8 Flash发布后,化用了阿姆斯特朗登月时的话来形容这次更新: “这是模型的一小步,RSI的一大步。” 就在最近, 谷歌还把“RSI”写进了一篇新论文的标题里 。 9月14日,谷歌、GDM等团队发布Dream-RSI,专门研究如何让Agent通过不断改进探索策略,实现递归自我改进。在算法工程、数学优化和GPU kernel任务上,这套方法都显示出更高的探索效率和更低的搜索成本。 也正因如此,这次Gemini 4 Pro的传闻才会迅速和RSI绑在一起。 社区里的猜测并没有停留在“Gemini 4 Pro很强”上,也在追问,谷歌内部到底把RSI做到了什么程度。 RSI这条路显然不只谷歌在走。 美国时间9月17日,Anth
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱