aiminute. ← 全部AI新闻
新模型 AI Minute Newsroom 2026-08-28

谷歌的新转写模型写下的不是你说出的话,而是你想说的话——支持85种语言

谷歌的新转写模型写下的不是你说出的话,而是你想说的话——支持85种语言

谷歌发布了 Gemini 3.5 Transcribe,一款建立在 Gemini 音频理解能力之上的语音转文字模型,目前处于公开预览阶段。它能自动识别85种以上语言,跟得上句子中途切换语言的说话人,可区分最多三位说话者,并输出词级时间戳。与普通听写的真正区别在于谷歌所称的"智能转写":它会剔除口头禅、修正说话人的自我更正,并即时排版,因此输出读起来像干净的散文,而不是音频的逐字记录。它还可以针对专业术语偏向自定义词表,并能在转写过程中调用函数以移交任务。谷歌给出的词错误率为:录音2.6%,流式4.0%;在多语言 FLEURS 基准上分别为5.04%和5.50%,延迟比前代 Chirp 3 降低约70%。该模型可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 使用,也已进入 Android 上 Gboard 的 Rambler 和 macOS 版 Gemini 应用,Chrome 支持据称即将到来。

为什么重要?转写是许多日常工作底下的管道:课堂笔记、医疗口述、字幕、会议纪要,以及记者不得不敲出来的采访录音。支持85种语言并能处理语码转换,才是英语之外真正要紧的一行:多数人不会在一次谈话里干干净净只说一种语言,而此前模型对此处理得很差。不过"清理"是一笔实打实的交换。一份悄悄修好你句子的记录更好读,却不再是所言内容的忠实记载——而这恰恰是证词笔录或纪律听证会最不该有的性质。
#音频与音乐

✓ 已核实 · 4个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

谷歌的视频模型现在可以被告知一个镜头从哪里开始、到哪里结束——草稿的成本只有三分之一
2026-08-28
澳大利亚榜单新规:歌必须由人写、主唱必须由人唱——周五生效
2026-08-27
开发者摸了几周的匿名模型现在以MIT许可开放下载——智谱称整个预览全程跑在国产芯片上
2026-08-27
IBM 的新开源模型不是靠读教程学会用终端的,而是靠真的去用
2026-08-27
唱片巨头入股了那家 AI 图像公司:环球、索尼、华纳和 EA 全都出现在 Stability 的 7600 万美元融资里
2026-08-26