数码硬件
morning
派早报:智谱开源 GLM-5.3-Flash 原生多模态模型等
2026-08-28
1 阅读
约3分钟阅读
少数派编辑部
字号:
8 月 26 日,Google 推出语音转文字(ASR)模型 Gemini 3.5 Transcribe。该模型支持实时流式转录和预录音频转录,可自动删除「嗯」「呃」等语气词、重复内容和口误,并根据用户随后的自我修正调整转录结果,生成更适合阅读的文本。 Google 表示,Gemini 3.5 Transcribe 的端到端转录延迟较上一代 Chirp 3 缩短约 70%。在 FLEURS 多语言基准测试中,其流式和非流式语音识别词错误率(WER)分别为 5.50% 和 5.04%;Artificial Analysis 的测试结果显示,该模型在流式和非流式场景下的平均 WER 分别为 4.0% 和 2.6%。此外,模型还改进了噪声环境下的转录表现,以及对订单号、邮政编码等字母数字组合的识别能力。 Gemini 3.5 Transcribe 支持 85 种以上语言,可自动识别语言并处理多语种切换。用户还可以提供自定义词汇表,以提高行业术语、品牌名和专有名词的识别准确率。对于预录音频,模型支持说话人区分和字词级时间戳。 开发者可通过 Google AI Studio、Google Antigravity 和 Gemini API 使用公开预览版。普通用户可在 macOS 版 Gemini App 以及部分地区 Android Gboard 的「Rambler」功能中体验相关能力,Chrome 浏览器的集成支持将在后续推出。 来源 Google 同步推出了 Gemini Omni 1.1 Flash 多模态视频生成与编辑模型,面向视频创作和编辑场景。该模型新增场景扩展、首尾帧插值、视频参考和高分辨率输出等功能。 在扩展已有视频时,模型可以分析最长 10 秒的前序内容,并以每次 10 秒的长度继续生成,累计时长最长可达 40 秒。用户还可以指定视频的起始帧和结束帧,由模型生成两者之间的动态过渡。此外,模型支持输入最长 3 秒的参考视频,用于保持角色、动作和场景的一致性。 模型还提供 360p 草稿模式。与标准 720p 模式相比,该模式的系统吞吐速度最高可提升约 60%,生成成本约为后者的三分之一。完成内容确认后,用户可以生成 1080p 或最高 4K 分辨率的视频。 Gemini Omni 1.1 Flash 按视频时长计费,360p、720p、1080p 和 4K 视频的 API 价格分别为每秒 0.03、0.10、0.15 和 0.30 美元。目前,该模型已通过 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 向开发者开放,并在 Google Flow 中提供给 Google AI Plus、Pro 和 Ultra 订阅用户。 来源
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱