智能AI
morning
谷歌推出Gemini 3.8 Live和3.8 Live Extended Thinking实时对话模型,支持97种语言切换
2026-09-16
1 阅读
约4分钟阅读
IT之家
字号:
IT之家 9 月 16 日消息,当地时间 9 月 15 日,谷歌宣布推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。谷歌称这是其最先进的实时对话模型,在智能和零件推理方面有重大升级,让 AI 对话更加思维智能。外表新品分别是面向规模部署与成本优化的 Gemini 3.8 Live,以及面向高复杂度任务、强化多步推理能力的 Gemini 3.8 Live Extended Thinking 。 Gemini 3.8 Live 兼顾对话智能、流畅交流和视觉理解,面向规模化与成本效率。Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备更强的智能和多步推理能力。 Gemini 3.8 Live Extended Thinking 在参考基准测试中取得领先成绩,拿下 Artificial Analysis 语音对语音质量指数总排名第一( 82.6% ),在 τ-Voice智能体任务完成率达到 68.6% ,在 Sierra 的 τ-Voice-banking 基准测试达到 35.1% ;推理能力方面,在 Big Bench Audio 得分 97.7% ,同时仍保持有定价的定价。Gemini 3.8 Live 则获得用户高认可度,在 Speech Agent Arena 排名第二,且具备成本,适合大规模部署。在 ServiceNow EVA-Bench 的模型语音智能体基准测试中,成功平衡准确性与对话质量,推高了复杂工作流的帕累托前沿。Gemini 3.8 Live可近实时处理窗口输入,在对话中自动检测并切换97种支持的语言,还能在后台执行工具与API调用,同时保持对话流畅不中断。针对需要深度推理的任务,Gemini 3.8 Live Extended Thinking可实现推理与语音同步进行,在不中断对话流畅度的前提下提升复杂工作流智能水平,通过“让我确认一下……”此类早期语言提示自然响应提示,导师实时讲解多步后台任务处理进度。开发者可通过 Gemini Live API ,在声网、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等平台轻松部署构建高性能语音驱动界面;歌谷还与 Salesforce、Genspark、Lumeris等企业积极合作,共同推进生态建设。谷歌所有AI生成音频都添加了SynthID隐形水印,直接嵌入音频输出,可检测AI生成内容,帮助防止偏差信息传播。目前Gemini 3.8 Live已开始潜水:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise抢先体验,登陆Gemini Enterprise客户体验;全用户即将在Search Live体验。Gemini 3.8 Live延伸思维也已大众开启:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise抢先体验,登陆Gemini Enterprise for Customer Experience以及Google Workspace企业客户;普通用户即将在Gemini Live体验,Google AI Pro和Ultra订阅者可在Google Workspace的Docs使用,所有Google AI订阅者可在Gmail和Keep体验。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱