aiminute. ← Todas las noticias de IA
Herramientas AI Minute Newsroom 2026-08-22

Un modelo de voz que empieza a hablar en menos de 50 milisegundos, y el código de servicio es abierto

Un modelo de voz que empieza a hablar en menos de 50 milisegundos, y el código de servicio es abierto

Nari Labs publicó el 19 de agosto una explicación del sistema de servicio que ha construido para Qwen3-TTS 1.7B CustomVoice, y liberó tanto la implementación como el banco de pruebas. En una sola H100 SXM mantiene el percentil 95 del tiempo hasta el primer audio por debajo de 50 milisegundos con 10 peticiones por segundo, y sigue por debajo de 100 milisegundos incluso con 20. A plena carga el coste sale en torno a 2 dólares por millón de caracteres de habla. La mejora viene de la planificación y no de un modelo nuevo: los tres componentes del sistema, el Talker, el Code Predictor y el códec, se planifican como una sola unidad en lugar de tres colas separadas, las peticiones se priorizan por fecha límite para que el trabajo en streaming no quede atascado detrás del trabajo por lotes, y la decodificación es incremental con estado en caché.

Por qué importaLa latencia es lo que decide si una interfaz hablada se siente como una conversación o como un menú telefónico. Por debajo de unos 200 milisegundos una persona interpreta la réplica como una respuesta; pasado medio segundo empieza a hablar por encima. Bajar de 50 ha significado casi siempre recurrir al sistema propietario de una empresa de API de voz, con el precio correspondiente. El truco que lleva dos años transformando la inferencia de texto, que la mayor parte de la velocidad estaba en la capa de servicio y no en los pesos, llega ahora al audio, en público y con el código adjunto. Si estás construyendo algo que habla, el suelo de lo aceptable acaba de subir.
#Audio y Música

✓ Verificado · 2 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

TikTok metió un chatbot de compras dentro del vídeo que ves.
2026-10-06
El nuevo modelo de Microsoft empieza a escribir antes de que calles.
2026-10-05
ElevenLabs regala a los estudiantes un año de su voz lectora.
2026-10-05
El asistente de Meta guarda una ficha horaria de tus conocidos.
2026-10-05
Un comando devuelve el interruptor de IA que Apple borró.
2026-10-05