谷歌发布了 Gemini 3.5 Transcribe,一款建立在 Gemini 音频理解能力之上的语音转文字模型,目前处于公开预览阶段。它能自动识别85种以上语言,跟得上句子中途切换语言的说话人,可区分最多三位说话者,并输出词级时间戳。与普通听写的真正区别在于谷歌所称的"智能转写":它会剔除口头禅、修正说话人的自我更正,并即时排版,因此输出读起来像干净的散文,而不是音频的逐字记录。它还可以针对专业术语偏向自定义词表,并能在转写过程中调用函数以移交任务。谷歌给出的词错误率为:录音2.6%,流式4.0%;在多语言 FLEURS 基准上分别为5.04%和5.50%,延迟比前代 Chirp 3 降低约70%。该模型可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 使用,也已进入 Android 上 Gboard 的 Rambler 和 macOS 版 Gemini 应用,Chrome 支持据称即将到来。