マイクロソフトは10月1日、初の実時間音声文字起こしモデルを公開しました。音声を受けて約100ミリ秒で下書きを返し、話し終えて0.13秒で確定します。Artificial Analysisは実時間精度で一位とし、誤り率は2.5%で60言語に対応します。
✓ 検証済み · 3ソース