Metaは9月1日、初のリアルタイム音声モデルMuse Voice Transcribeを出した。一回の処理で文字を書き、話者を分け、話し終えて0.16秒後に確定稿を返す。重みは配らず、音声千分あたり三ドルのAPIとしてだけ売る。
✓ 検証済み · 4ソース