首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Gemini 3.8,明日登场!

摘要

新智元报道 Claude 5.1刚问世,另一边OpenAI Astra马上杀到。 现在,就连谷歌也有了新动作。最新爆料, Gemini 3.8 Flash将在明日登场 。 看来,AI圈又要「过年了」。 Gemini 3.5 Pro取消 下一个大版本4.0 比起Gemini 3.8 Flash的发布,许多人还是更加好奇:Gemini 3.5 Pro到底什么时候来啊?! 对不起,不用等了, 谷歌已放弃...

Gemini Flash 新智元报道 Claude 1刚问世 另一边OpenAI Astra马上杀到 就连谷歌也有了新动作 最新爆料 Flash将在明日登场
2026-09-03 1 阅读 约9分钟阅读 新智元
分享:
字号:
新智元报道 Claude 5.1刚问世,另一边OpenAI Astra马上杀到。 现在,就连谷歌也有了新动作。最新爆料, Gemini 3.8 Flash将在明日登场 。 看来,AI圈又要「过年了」。 Gemini 3.5 Pro取消 下一个大版本4.0 比起Gemini 3.8 Flash的发布,许多人还是更加好奇:Gemini 3.5 Pro到底什么时候来啊?! 对不起,不用等了, 谷歌已放弃...... 今年5月I/O大会预告至今,已过去近4个月,Gemini 3.5 Pro进化程度连Flash都比不上。 谷歌也是迫不得已,直接「弃子」。 好在, Gemini 4.0在预训练中评估优秀,后训练还在顺利进行中 。 这篇来自WSJ的独家爆料,还重磅预告了Gemini 3.8 Flash(代号「Skimaki」)强悍的编程实力。 据称,在谷歌内部编码工具Jetski的对比测试中, 3.8 Flash直接碾压Opus模型 。 而且,这款模型已研发数月,早在谷歌领导层「大地震」之前就开始了。 Hassabis让位,首席科学家Jeff Dean离职,让许多人对Gemini的未来都捏了把汗。 不过,目前看来,一切都在内部有条不紊地进行中。 目前,谷歌计划先推出Gemini 3.8 Flash,是因为这款模型参数小,所需计算少,更容易出成果。 听内部人士说,从今年初开始,谷歌就投入了更多的人力和算力,专门用来提升Gemini的写代码能力。 特别是,加大了对「强化学习」的投入,让AI通过不断试错来真正学会新本领。 而且谷歌DeepMind和其他实验室,同时推进多个项目,这样一来即便是这个不行,另一个还能顶上。 Gemini 3.5 Pro不及预期,但Gemini 4.0还未「出炉」。 如今,硅谷「御两家」OpenAI和Anthropic,已在前沿模型和编程Agent上,非常能打。 Information称, OpenAI下一代 Astra还采用了一种 「 循环深度」( recurrent depth)新型推理方法 ,让思考token减少的同时,还大幅提升了性能。 这张王牌,即将在本周揭晓。 而此时此刻, 谷歌 总得交出点东西才行。 毕竟劈柴承诺之后几个月,除了发布了一款3.7 Flash,再没有扔出能让AI圈兴奋的模型了。 或许就在今晚,Gemini 3.8 Flash要登场了。 Gemini第一次,会自己看视频了 在此发布之前,谷歌今天先来了一波预热,为Gemini植入了一项新能力—— 智能体视频理解(Agentic Vedio Understanding) 这项功能,简直上大分。 上传一段I/O大会视频,同一款模型Gemini 3.7 Flash,Token消耗直接暴降88%。 谷歌在官博中表示,Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite三个模型都能用agentic视频理解能力,入口在Google AI Studio和Gemini Enterprise Agent Platform。 在标准视频分析基准上打开这个开关,token消耗最多降88%,分析成本最多降66%,准确率反过来还涨了最多7%。 而且 不额外收一分钱 ,走的仍是标准API的token定价。省钱和变准通常要打架。这次没打起来。 因为,Gemini学会了 「 拖进度条 」 。 过去的处理方式叫「静态」处理,模型被动接收固定帧率的画面流,帧率由API参数定死,模型没有话语权。 现在换成模型自己拿主意,看哪一段、以多快的速度看、是看画面、听音频还是直接读转录文字,都可以自己决定。 这不是谷歌第一次这么干。 此前的agentic vision把代码执行和Gemini原生的图像理解拼在一起,模型对着一张图能自己写代码去放大、裁剪、比对。 这回轮到视频,思路照搬,只不过把工具换成了原生视频工具。 四件以前很难干的活 官方博客中还列出了几种高难度的应用场景。 亚秒级片段检索。 以前模型「看」视频,一秒只截一张图。问题是,很多东西不到一秒就闪过去了。 现在能精确到不到一秒去定位这些瞬间了。 这意味着「自动剪辑」这件事第一次真正可行了:以前剪辑师得自己趴在时间轴上,一帧一帧地找该在哪里下刀,现在可以先让模型扫一遍,把候选的切点标出来,人再去挑。 长视频里捞针。 几小时的素材里问一个复杂问题,不用把几百万 token 全烧一遍。 异常检测。 模型盯上某个时间窗口之后,可以专门对这一段提高帧率重新采样,看清快速运动和细微的画面瑕疵。产线质检和安防监控最吃这一口,因为异常本来就只发生在那几秒里。 数数。 一个动作重复了多少次,画面里有几个不同的物体,这类问题模型过去错得很稳定,原因也很朴素,漏采的那几帧里正好有东西。 Agent终于看得起视频了 视频,一直是所有模态里最贵的那个。 文字便宜,图片还行,视频又大又长,一分钟就能顶掉一本书的token。 所以这两年所有人聊Agent,更多还是在聊它会读、会写、会调用工具。 问题是,一个主要靠文字理解世界的Agent,看到的其实只是一个被人「转述」过的世界。 摄像头拍到的、会议录下的、生产线上跑过去的,那些没人愿意花时间转成文字的东西,它一概不知道。 现在,这条成本曲线被砍掉一大截。 一个Agent如果能自己翻完几小时的监控、几十小时的课程、上百条素材,还不至于把预算烧穿,那它接触世界的方式就变了。 它不用再等着人把画面转述成文字喂给它,也不用再在「看得起」和「看得准」之间选一个。 谷歌,就先做了这个破局者。 AI大战,下一回合 这几天,四家的发布节奏,几乎撞到了一起。 Claude 5.1刚来,OpenAI Astra已经在门口,谷歌憋了几个月也终于拿出Gemini 3.8 Flash迎战。 这一波更新后,如今的Claude主攻两大领域:编程+科研。 下一代Astra将变成一个「持续智能体」,用奥特曼的话来说,其计算机使用能力已达人类水平。 Gemini 3.8 Flash也将在编程方面,有更大的跃升。 现在,OpenAI、Anthropic、谷歌,以及SpaceXAI已经同时开足马力。 马斯克预告Grok 4.7十天后发布 这场混战,才刚刚进入最凶的一段。 参考资料: https://x.com/Google/status/2094840983913402704 https://deepmind.google/blog/introducing-agentic-video-in-gemini/ 编辑:所罗门 桃子 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱