Le modèle ouvert de Xiaomi isole une voix parmi trois qui parlent.
Xiaomi a publié vendredi CocktailASR-1, un modèle vocal gratuit. Vous lui donnez un court extrait de la voix visée, et il ignore les autres. Sur un test à trois voix, il s'est trompé sur 12,29% des mots, contre 4,11% à deux.
Pourquoi c'est importantLes comptes rendus et les sous-titres s'effondrent dès que deux personnes parlent ensemble. Les poids sont ouverts, donc tout cela tourne sur votre machine et non sur un serveur.