微软 10 月 1 日发布了首个实时语音转文字模型 MAI-Transcribe-2-Streaming。它在收到声音约 100 毫秒后给出初稿,你停下后 0.13 秒完成。Artificial Analysis 把它的实时准确度排在第一,错误率 2.5%,支持 60 种语言。
✓ 已核实 · 3个来源