开发者生态
morning
Gemini-3.5-转录
2026-08-28
1 阅读
约3分钟阅读
k9294
字号:
今天,我们推出 Gemini 3.5 Transcribe,这是我们迄今为止最精确的语音转文本模型,专为智能语音交互而设计。与受背景噪音、复杂行话和不流畅清理困扰的传统语音识别模型不同,Gemini 3.5 Transcribe 可将原始音频直接转换为准确、优美的格式化文本。在我们的 Gemini 应用程序和 Android 等产品中,我们看到消费者已经从这种转录模型中受益,并通过新的语音功能(例如 Android 上的 Rambler 和 macOS 上的 Gemini 应用程序)受益。现在,开发人员可以在 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 中使用 Gemini 3.5 Transcribe 构建类似的功能。我们构建了 3.5 Transcribe,可以无缝插入您的开发人员工作流程,无论您是构建语音代理、实时字幕工具还是通话后分析管道。该模型可通过两个独立的 API 使用: 实时流:使用 Gemini-3.5-transcribe-live 通过 Live API 为交互式语音应用程序提供亚秒级延迟的连续双向流。预录制的音频处理:使用gemini-3.5-transcribe 通过交互API 转录录制的音频、会议、通话记录等,并包含发言者归属和单词级时间戳。获得更精确、更智能的转录 Gemini 3.5 Transcribe 旨在捕捉您的自然说话风格,以更好地理解您的意图并识别自定义词汇,以便您可以用语音执行任务。智能转录:无缝处理自我更正(例如“让我们星期二见面——不,星期三”),删除填充词(“ums”和“ahs”),自动设置文本格式。函数调用:模型可以通过函数调用将复杂的任务(例如图像生成和文件分析)委托给其他Gemini模型。目前可在 Gemini macOS 应用程序中使用。更精确的转录:根据人工分析的测量,流媒体用例的平均字错误率 (WER) 为 4.0%,非流媒体用例的平均字错误率 (WER) 为 2.6%。它在嘈杂的现实环境中表现出强大的性能,能够准确捕获邮政编码和订单 ID 等字母数字实体。自定义词汇:通过无缝地调整转录以适应您提供的自定义词汇,识别专业术语和独特的拼写。全球语言支持:自动检测和转录超过 85 种语言,无缝处理地区口音和多种方言。多说话人识别:准确归属预先录制的音频中的语音,并带有最多三个说话人的时间戳(对 3 个以上说话人的支持尚处于实验阶段)。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱