El modelo abierto de Xiaomi aísla una voz entre tres que hablan.
Xiaomi publicó el viernes CocktailASR-1, un modelo de voz gratuito. Le das una muestra corta de la voz elegida y el modelo ignora a los demás. En una prueba con tres voces falló el 12,29% de las palabras, y el 4,11% con dos.
Por qué importaLas actas y los subtítulos se rompen en cuanto dos personas hablan a la vez. Los pesos son abiertos, así que esto corre en tu propio equipo y no en un servidor ajeno.