Folia
← 返回头版

Google 发布 Gemini 3.5 Transcribe 语音转文字模型

Google 发布了 Gemini 3.5 Transcribe 语音转文字模型,官方称其为最精确的语音识别模型,可将原始音频直接转换为准确且格式化的文本 1。开发者可通过 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent Platform 使用该模型 1。该模型提供两种接口:用于实时流式处理的 gemini-3.5-transcribe-live,以及用于预录音频处理的 gemini-3.5-transcribe 1。

在性能方面,据 Artificial Analysis 测量,该模型在流式场景的平均词错误率(WER)为 4.0%,非流式场景为 2.6% 1。在 FLEURS 基准测试中,其流式与非流式 WER 分别为 5.50% 和 5.04% 1。相比前代 Chirp 3,其最终转录时间缩短了 70% 1。该模型支持超过 85 种语言的自动检测与转录,且预录音频支持最多 3 位说话人的多说话人识别与时间戳 1。目前,该模型已集成至 Gboard(Android Rambler 功能)、Gemini macOS 应用和 Google Antigravity,并即将登陆 Chrome 1。


来源

  1. Hacker NewsGemini-3.5-Transcribe

评论