首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

谷歌落后一个时代?CEO 亲自官宣“语音转文字”模型,网友:你们看不清形势啊

2026-08-28 1 阅读 约10分钟阅读 李冬梅
分享:
字号:
谷歌发布号称“迄今最强”语音转文本模型 8月26日,谷歌发布新一代语音转文本模型 Gemini 3.5 Transcribe,可以在转录过程中自动处理“嗯”“啊”等语气词、口误和重复表达,并补充标点、大小写及文本格式。 谷歌将其称为“迄今最精确的语音转文本模型”,谷歌 CEO Pichai 在x上宣布了该模型。 与只追求逐字记录的传统语音识别模型不同,Gemini 3.5 Transcribe 希望直接将原始语音转换为更接近成稿的文本,减少用户后续整理会议记录、采访速记和通话内容的工作量。 例如,当用户说“我们周二开会——不,改成周三”时,模型能够理解后半句是对前面内容的修正,并在最终文本中保留正确结果,而不是机械记录整段口误。 Gemini 3.5 Transcribe支持85种以上语言和地区变体,并能够自动判断当前使用的语言。用户不需要提前设置语种,即使在一句话或者同一段对话中切换语言,模型也可以继续转录。 这项能力主要面向跨国会议、多语言访谈、客服通话以及同时夹杂中英文专业术语的场景。 在真实录音中,影响转录准确率的往往不只是口音,还包括背景噪声、多人同时发言和专业词汇。谷歌称,Gemini 3.5 Transcribe针对嘈杂环境、不同口音和多语言对话进行了优化,并增强了对电话号码、邮政编码、订单号等字母与数字混合信息的识别能力。 Gemini 3.5 Transcribe 可处理实时语言切换和无缝流式转录 模型还支持自定义词表。开发者最多可以提供1000个专业词汇、缩写、人名或产品名称,引导模型优先识别这些内容。谷歌表示,在实际使用中,自定义词表控制在100个词以内通常效果更好。 这对于技术采访可能更实用。例如,用户可以提前加入Kubernetes、BigQuery以及公司和产品名称,减少模型将专业名词识别成发音相近词语的情况。 Gemini 3.5 Transcribe 还提供“说话人分离”能力,可以识别最多8名说话人,并把不同语音片段分配给相应的说话人标签。不过,谷歌同时提醒,三名以上说话人的识别目前仍属于实验性能力。 对于预先录制的音频,模型还能输出逐词时间戳,标明每个词在录音中的起止时间,方便用户制作字幕、检索原始录音或者定位采访原话。启用说话人分离或逐词时间戳后,单次录音长度上限为30分钟;普通音频转录则支持单次最长1小时。 3.5 转录功能提供多说话人归属和单词级时间戳的转录。 流式转录词错误率4.0% 根据谷歌引用的Artificial Analysis测评数据,Gemini 3.5 Transcribe在实时流式场景中的平均词错误率为4.0%,非流式录音处理的平均词错误率为2.6%。 词错误率通常用于衡量语音识别结果中替换、删除和新增词语所占的比例,数值越低,意味着转录结果越接近原始语音。不过,不同测试集的语言、噪声和口音分布会影响最终成绩,这组数据不能直接代表模型在所有录音条件下的准确率。 与谷歌上一代语音转录模型 Chirp 3 相比,Gemini 3.5 Transcribe 的最终转录延迟缩短了70%。实时版本可以通过WebSocket持续接收语音,并以低于一秒的延迟返回阶段性转录结果。 谷歌此次提供两个版本:`gemini-3.5-transcribe-live`面向实时字幕、语音输入和Voice Agent;`gemini-3.5-transcribe`则用于处理采访录音、会议、通话记录等预录制音频,支持说话人分离和逐词时间戳。 开发者目前可以通过Google AI Studio中的Gemini API,以及Gemini Enterprise Agent Platform调用该模型。实时转录的综合价格约为每分钟0.009美元,非实时转录约为每分钟0.005美元,同时提供免费测试额度。 语音转录开始从“听写”走向“整理” Gemini 3.5 Transcribe 最值得关注的地方,并不只是词错误率进一步下降,而是语音转录工具正在改变输出目标。 过去的自动语音识别主要追求忠实记录:说话人讲了什么,系统就尽量逐字写下什么。但真实口语中充满语气词、重复、停顿、临时改口和不完整句子,即使识别完全准确,输出结果往往仍然无法直接阅读。 Gemini 3.5 Transcribe加入的Smart Transcription,会主动清理语气词和重复内容,根据上下文处理自我修正,并把口语转成带有标点和结构的文本。它还支持“逆文本规范化”,例如将英文口述的“twenty six million dollars”直接转换为“$26M”。 这意味着,模型给出的不再只是原始速记,而是一份经过初步整理的文本。 不过,这种“智能整理”也带来了新的风险。对会议纪要和日常语音输入而言,删除语气词通常不会影响信息;但在新闻采访、法律取证和需要逐字核对的场景中,自动删除重复表达或改写数字,可能改变说话人的原始措辞。 为此,Gemini 3.5 Transcribe 同时提供 Verbatim 模式,允许开发者获得更接近逐字记录的文本。实际使用时,是否启用语气词清理和智能格式化,应当根据场景决定,而不能简单地把“更整洁”视为“更准确”。 目前,这项技术也开始进入谷歌自己的产品。Android 版 Gboard 的 Rambler 功能可以将口述内容转换为格式化文本,并允许用户通过语音继续修改措辞和风格;在macOS版Gemini应用中,模型还可以结合屏幕上下文识别文件名和当前文档,并通过语音指令调用其他Gemini模型完成文件总结、文本改写和图片生成。 从这个角度看,Gemini 3.5 Transcribe并不只是一款新的听写模型。谷歌正在把语音转录变成AI操作系统的入口:用户不必先把语言整理成标准指令,而是可以直接带着停顿、口误和临时修改说出需求,再由模型理解真正意图并继续执行任务。 谷歌看不清形势? 在行业狂卷多模态、Coding Agent 的大环境中,表面上看,谷歌此时单独发布一款语音转文本模型,很容易给人一种“还在解决上一代问题”的感觉,所以在x 上,有也用户评价谷歌“看不透形势”。 可以说,网络上不看好的声音巨多。 更尖锐的批评来自一名Gemini Ultra用户。 他表示,自己已经后悔升级,因为所谓的额外功能,只有在模型能力和产品迭代真正跟上行业进度时才有意义。他曾经希望谷歌能够赢下这场竞争,这份信心很大程度上来自 Demis Hassabis及其领导下的DeepMind。但随着 Demis 不再负责 DeepMind 的日常运营,他感觉“DeepMind的灵魂已经离开了”。在他看来,失去鲜明的研究方向和领导者之后,谷歌面对的就只剩下一场赤裸的模型能力较量,而它目前正在这场竞争中落后。 Gemini 3.5 Transcribe的发布进一步强化了这种失望:当同行都在强调更强的Agent、端到端语音交互和复杂任务执行时,谷歌却把一款语音转文本模型推到台前,容易让付费用户产生一种产品节奏与行业焦点错位的感觉。需要指出的是,这更多反映了用户对谷歌整体AI进展和产品体验的不满,并不能单凭一款转录模型判断其技术路线已经落后。 那么,谷歌真如上述网友所言,已经到了很糟糕的境况了吗? 事
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱