Werkzeuge
2026-08-22
Ein Sprachmodell, das in unter 50 Millisekunden zu sprechen beginnt, und der Serving-Code ist offen
Nari Labs veröffentlichte am 19. August eine Darstellung des Serving-Stacks, den es für Qwen3-TTS 1.7B CustomVoice gebaut hat, und stellte sowohl Implementierung als auch Benchmark unter eine offene Lizenz. Auf einer einzelnen H100 SXM hält das System das 95. Perzentil der Zeit bis zum ersten Audio bei 10 Anfragen pro Sekunde unter 50 Millisekunden und bleibt selbst bei 20 unter 100 Millisekunden. Bei voller Auslastung liegen die Kosten bei rund 2 Dollar pro Million Zeichen Sprache. Der Gewinn kommt aus der Ablaufplanung, nicht aus einem neuen Modell: Die drei Komponenten des Systems, Talker, Code Predictor und Codec, werden als eine Einheit statt als drei getrennte Warteschlangen geplant, Anfragen werden nach Frist priorisiert, damit Streaming-Arbeit nicht hinter Batch-Arbeit hängen bleibt, und die Dekodierung läuft inkrementell mit zwischengespeichertem Zustand.
Warum es wichtig istDie Latenz entscheidet, ob sich eine gesprochene Schnittstelle wie ein Gespräch oder wie ein Telefonmenü anfühlt. Unter etwa 200 Millisekunden liest ein Mensch die Erwiderung als Antwort; jenseits einer halben Sekunde beginnt er darüberzureden. Unter 50 zu kommen bedeutete bislang meist den proprietären Stack eines Sprach-API-Anbieters, mit entsprechendem Preis. Der Kniff, der die Textinferenz seit zwei Jahren umbaut, nämlich dass der größte Teil der Geschwindigkeit in der Serving-Schicht steckt und nicht in den Gewichten, kommt nun im Audio an, öffentlich und mit beiliegendem Code. Wer irgendetwas baut, das spricht, sieht die Untergrenze des Akzeptablen gerade nach oben rücken.
✓ Verifiziert · 2 Quellen
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
Anthropic lässt sein stärkstes Modell Fehler in Ihrem Code jagen, aber nicht mit Ihnen sprechen
2026-08-22Apple Music zeigt künftig an, wenn ein Song von einer Maschine stammt — ob das jemand angibt, entscheidet der Uploader
2026-08-21Stripe hat gerade 7,5 Milliarden Dollar für einen Modell-Router gezahlt. Tage später baut Ramp einen und verschenkt ihn bis Januar.
2026-08-21Metas Assistent ist jetzt eine Mac-App, die Ihren Bildschirm liest und in jedes Fenster tippt — und was sie sieht, kann das Modell trainieren
2026-08-21Ein Klick auf einer Nachrichtenseite sagt Google jetzt, dass Sie mehr davon sehen wollen — und Sie bleiben auf der Seite, die Sie gerade lesen
2026-08-21