aiminute. ← Toute l’actu IA
Outils AI Minute Newsroom 2026-08-22

Un modèle vocal qui commence à parler en moins de 50 millisecondes, et le code de service est ouvert

Un modèle vocal qui commence à parler en moins de 50 millisecondes, et le code de service est ouvert

Nari Labs a publié le 19 août un exposé du système de service qu'il a bâti pour Qwen3-TTS 1.7B CustomVoice, et a ouvert le code de l'implémentation comme du banc d'essai. Sur une seule H100 SXM, il maintient le 95e centile du délai avant le premier son sous 50 millisecondes à 10 requêtes par seconde, et reste sous 100 millisecondes même à 20. À pleine charge, le coût revient à environ 2 dollars par million de caractères de parole. Le gain vient de l'ordonnancement et non d'un nouveau modèle : les trois composants du système, le Talker, le Code Predictor et le codec, sont ordonnancés comme une seule unité au lieu de trois files distinctes, les requêtes sont priorisées par échéance pour que le flux ne reste pas coincé derrière le traitement par lots, et le décodage est incrémental avec état en cache.

Pourquoi c'est importantC'est la latence qui décide si une interface vocale ressemble à une conversation ou à un serveur téléphonique. En dessous d'environ 200 millisecondes, une personne perçoit la réplique comme une réponse ; passé une demi-seconde, elle commence à parler par-dessus. Descendre sous 50 supposait jusqu'ici la pile propriétaire d'une entreprise d'API vocale, au prix correspondant. L'astuce qui remodèle l'inférence textuelle depuis deux ans, à savoir que l'essentiel de la vitesse se trouvait dans la couche de service et non dans les poids, arrive dans l'audio, en public, code à l'appui. Si vous construisez quelque chose qui parle, le seuil de l'acceptable vient de monter.
#Audio & Musique

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

TikTok a glissé un chatbot d'achat dans la vidéo que vous regardez.
2026-10-06
Le nouveau modèle de Microsoft écrit avant que vous ayez fini.
2026-10-05
ElevenLabs offre aux étudiants un an de sa voix de lecture.
2026-10-05
L'assistant de Meta tient une fiche horaire sur vos proches.
2026-10-05
Une commande rend l'interrupteur d'IA qu'Apple avait supprimé.
2026-10-05