aiminute. ← Todas las noticias de IA
Herramientas 2026-08-22

Un modelo de voz que empieza a hablar en menos de 50 milisegundos, y el código de servicio es abierto

Un modelo de voz que empieza a hablar en menos de 50 milisegundos, y el código de servicio es abierto

Nari Labs publicó el 19 de agosto una explicación del sistema de servicio que ha construido para Qwen3-TTS 1.7B CustomVoice, y liberó tanto la implementación como el banco de pruebas. En una sola H100 SXM mantiene el percentil 95 del tiempo hasta el primer audio por debajo de 50 milisegundos con 10 peticiones por segundo, y sigue por debajo de 100 milisegundos incluso con 20. A plena carga el coste sale en torno a 2 dólares por millón de caracteres de habla. La mejora viene de la planificación y no de un modelo nuevo: los tres componentes del sistema, el Talker, el Code Predictor y el códec, se planifican como una sola unidad en lugar de tres colas separadas, las peticiones se priorizan por fecha límite para que el trabajo en streaming no quede atascado detrás del trabajo por lotes, y la decodificación es incremental con estado en caché.

Por qué importaLa latencia es lo que decide si una interfaz hablada se siente como una conversación o como un menú telefónico. Por debajo de unos 200 milisegundos una persona interpreta la réplica como una respuesta; pasado medio segundo empieza a hablar por encima. Bajar de 50 ha significado casi siempre recurrir al sistema propietario de una empresa de API de voz, con el precio correspondiente. El truco que lleva dos años transformando la inferencia de texto, que la mayor parte de la velocidad estaba en la capa de servicio y no en los pesos, llega ahora al audio, en público y con el código adjunto. Si estás construyendo algo que habla, el suelo de lo aceptable acaba de subir.
#Audio y Música

✓ Verificado · 2 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

Anthropic dejará que su modelo más potente cace fallos en tu código, pero no te dejará hablar con él
2026-08-22
Apple Music dirá cuándo una canción la hizo una máquina — pero quien la sube decide si lo declara
2026-08-21
Stripe acaba de pagar 7.500 millones por un enrutador de modelos. Días después Ramp construyó uno y lo regala hasta enero.
2026-08-21
El asistente de Meta es ya una app de Mac que lee tu pantalla y escribe en cualquier ventana — y lo que ve puede entrenar el modelo
2026-08-21
Un clic en un medio le dice ahora a Google que te enseñe más de él — y tú no te mueves de la página que estabas leyendo
2026-08-21