Открытая модель Xiaomi выделяет один голос из трёх говорящих.
Xiaomi выпустила в пятницу бесплатную речевую модель CocktailASR-1. Вы даёте ей короткий образец нужного голоса, а остальных она пропускает мимо. В тесте с тремя голосами она ошиблась в 12,29% слов, а с двумя только в 4,11%.
Почему это важноПротоколы встреч и субтитры рассыпаются, как только двое заговорили разом. Веса открыты, поэтому всё это работает на вашей машине, а не на чужом сервере.