aiminute. ← Toute l’actu IA
Outils 2026-08-22

Un modèle vocal qui commence à parler en moins de 50 millisecondes, et le code de service est ouvert

Un modèle vocal qui commence à parler en moins de 50 millisecondes, et le code de service est ouvert

Nari Labs a publié le 19 août un exposé du système de service qu'il a bâti pour Qwen3-TTS 1.7B CustomVoice, et a ouvert le code de l'implémentation comme du banc d'essai. Sur une seule H100 SXM, il maintient le 95e centile du délai avant le premier son sous 50 millisecondes à 10 requêtes par seconde, et reste sous 100 millisecondes même à 20. À pleine charge, le coût revient à environ 2 dollars par million de caractères de parole. Le gain vient de l'ordonnancement et non d'un nouveau modèle : les trois composants du système, le Talker, le Code Predictor et le codec, sont ordonnancés comme une seule unité au lieu de trois files distinctes, les requêtes sont priorisées par échéance pour que le flux ne reste pas coincé derrière le traitement par lots, et le décodage est incrémental avec état en cache.

Pourquoi c'est importantC'est la latence qui décide si une interface vocale ressemble à une conversation ou à un serveur téléphonique. En dessous d'environ 200 millisecondes, une personne perçoit la réplique comme une réponse ; passé une demi-seconde, elle commence à parler par-dessus. Descendre sous 50 supposait jusqu'ici la pile propriétaire d'une entreprise d'API vocale, au prix correspondant. L'astuce qui remodèle l'inférence textuelle depuis deux ans, à savoir que l'essentiel de la vitesse se trouvait dans la couche de service et non dans les poids, arrive dans l'audio, en public, code à l'appui. Si vous construisez quelque chose qui parle, le seuil de l'acceptable vient de monter.
#Audio & Musique

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Anthropic laisse son modèle le plus puissant traquer les failles de votre code, mais vous interdit de lui parler
2026-08-22
Apple Music indiquera quand un morceau a été fait par une machine — mais c'est celui qui le publie qui décide de le dire
2026-08-21
Stripe vient de payer 7,5 milliards pour un routeur de modèles. Quelques jours plus tard, Ramp en construit un et l'offre jusqu'en janvier.
2026-08-21
L'assistant de Meta est désormais une app Mac qui lit votre écran et écrit dans n'importe quelle fenêtre — et ce qu'il voit peut entraîner le modèle
2026-08-21
Un clic sur un site d'information dit désormais à Google de vous en montrer davantage — et vous restez sur la page que vous lisiez
2026-08-21