智能AI
morning
刚刚,Gemini 3.8上线!
摘要
新智元报道 谷歌又杀回来了。 今夜,Google DeepMind 一口气放出两个模型——Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。 官方称它们是谷歌迄今最先进的实时对话模型。 在 Artificial Analysis 的语音质量榜上,Extended Thinking 拿下总榜第一,82.6 分。 在 ServiceNow 的语音 ...
Live
Extended
Thinking
RSI
Gemini
Agent
Voice
DeepMind
Token
Gremlin
2026-09-16
1 阅读
约7分钟阅读
新智元
字号:
新智元报道 谷歌又杀回来了。 今夜,Google DeepMind 一口气放出两个模型——Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。 官方称它们是谷歌迄今最先进的实时对话模型。 在 Artificial Analysis 的语音质量榜上,Extended Thinking 拿下总榜第一,82.6 分。 在 ServiceNow 的语音 Agent 测试里,以前的模型要么答得准但聊起来像机器人,要么聊得顺但老办错事。 这两个模型第一次把准和顺同时往前拱了一步。 刚吵完 RSI,谷歌交了份语音作业 就在上周,AI 圈知名泄密账号 Lyra 发了一条推——「huge congRatulationS Indeed! @GoogleDeepMind」。 大写字母挑出来一拼:R-S-I。递归自我改进(Recursive Self-Improvement)。 这条推直接炸了锅。几小时内上千条转发,有人扒出疑似谷歌内部模型配置截图,代号赫然写着「RSI Model LiveRL LE」。 再加上 Sergey Brin 被爆一直在内部猛推 RSI,DeepMind 高管 8 月份刚在伯克利公开说「RSI 正在成为 AI 投资论文的核心」——整个 AI 圈沸腾了一周,都在等谷歌放大招。 然后呢? 然后谷歌放了一个……语音模型。 Token Gremlin 转了官方发布帖,甩下一句:「There's the RSI I've been hearing about. 👀😂」 我听说的那个 RSI 就是这? 笑归笑。谷歌虽然没宣布模型能改写自己的权重,但它做了一件过去语音 AI 从没做到的事—— 说话、思考、后台干活三件事互不打断 。头一回,电话那头的 AI 听起来像个正在忙的人。 两条线,分工不同 Gemini 3.8 Live 主打规模化和成本效率,对话智能、流畅度和视觉理解捏在一起,适合大批量铺开。Extended Thinking 主打高复杂度任务,智能更高,能做多步推理。 谷歌给这两个模型的定位很实在—— 它们是可以上生产的语音 Agent 基础组件 。 以前问语音助手一个复杂问题,它会先沉默。等得稍微久一点,人就会下意识地再问一遍,然后把它彻底打断。 3.8 Live Extended Thinking 把这段沉默拆了。碰上要多想几步的任务,它先用一句「Let me check that…」接住你,然后一边推理一边把进度讲出来。 第二个大改动,模型可以先应下你的请求、继续聊天,工具调用和 API 请求放到后台跑。 对开发者来说,这一条比任何跑分都实在。 以前要做一个能查库存、能下单、能改地址的语音客服,工程量大半花在拼接那些空白上——用音乐填、用提示音填、用「请稍等」硬填。现在模型自己把这段接住了。 97种语言,聊到一半自己切 对话中途换语种,它自己检测自己切,不用提前设置。同声传译那种无缝换语言,成了默认能力。 摄像头对着什么,它也几乎同步知道。近实时的视觉输入直接进对话,你不用先截图、再上传、再等它描述一遍。 谷歌自己的演示是让 Extended Thinking 当编程家教——站在你旁边看着屏幕上的代码讲。你指着一行问「这儿为什么报错」,它看得见你指的是哪行。 这种场景过去要靠截图加上传,来回三步,现在是一句话的事。 两张成绩单分开看 82.6 分说的是语音质量,也就是会不会聊天。 另一组分数说的是会不会办事。 Extended Thinking 在 τ-Voice 上拿到 68.6%,小幅领先 GPT-Live-1 Astra 的 67.9%;在 Sierra 的 τ-Voice-banking 上拿到 35.1%,对手是 GPT-Live-1 Astra 的 32.0%;Big Bench Audio 97.7%。 τ-Voice-banking 银行场景就现实多了——核身份、查流水、改额度,一步错就得从头来,Extended Thinking 只办成了三成多。 标准版 3.8 Live 不卷难度卷成本,让真人盲听投票排了第二,谷歌说价格也压得住。 AI 学会了说「我查一下」 过去二十年我们练的是盯屏幕、敲键盘、等结果。 现在它开始变成 Agent 的实时界面。人和机器的配合从「下指令、等结果」,变成 边聊边并行干活 。 整个 AI 圈吵了一周的 RSI,谷歌今天的回答是一个语音模型。Token Gremlin 笑了,但方向已经定了。 看完《Her》好多年了,大家一直在等那个能一边聊天一边把事办了的 AI。 今天谷歌把它拆成了四块零件装上了:延迟压下来、后台能跑工具、边想边汇报、语言自动切。 屏幕第一次不再是你和 AI 之间的必经之路。 参考资料: https://x.com/GoogleDeepMind/status/2099907440422830269 https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking 编辑:所罗门 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱