Новая модель Meta различает 20 голосов, говорящих разом.
Meta выпустила Muse Voice Transcribe первого сентября, свою первую модель звука в реальном времени. За один проход она пишет слова, различает говорящих и ловит паузы. Итоговый текст приходит через 0,16 секунды после речи, а веса Meta не отдаёт.
Почему это важноЖивым субтитрам и протоколам встреч до сих пор нужны были три сшитые модели. Одна модель вместо трёх делает постоянную расшифровку по-настоящему дешёвой.