aiminute. ← Alle KI-News
Werkzeuge 2026-08-22

Ein Sprachmodell, das in unter 50 Millisekunden zu sprechen beginnt, und der Serving-Code ist offen

Ein Sprachmodell, das in unter 50 Millisekunden zu sprechen beginnt, und der Serving-Code ist offen

Nari Labs veröffentlichte am 19. August eine Darstellung des Serving-Stacks, den es für Qwen3-TTS 1.7B CustomVoice gebaut hat, und stellte sowohl Implementierung als auch Benchmark unter eine offene Lizenz. Auf einer einzelnen H100 SXM hält das System das 95. Perzentil der Zeit bis zum ersten Audio bei 10 Anfragen pro Sekunde unter 50 Millisekunden und bleibt selbst bei 20 unter 100 Millisekunden. Bei voller Auslastung liegen die Kosten bei rund 2 Dollar pro Million Zeichen Sprache. Der Gewinn kommt aus der Ablaufplanung, nicht aus einem neuen Modell: Die drei Komponenten des Systems, Talker, Code Predictor und Codec, werden als eine Einheit statt als drei getrennte Warteschlangen geplant, Anfragen werden nach Frist priorisiert, damit Streaming-Arbeit nicht hinter Batch-Arbeit hängen bleibt, und die Dekodierung läuft inkrementell mit zwischengespeichertem Zustand.

Warum es wichtig istDie Latenz entscheidet, ob sich eine gesprochene Schnittstelle wie ein Gespräch oder wie ein Telefonmenü anfühlt. Unter etwa 200 Millisekunden liest ein Mensch die Erwiderung als Antwort; jenseits einer halben Sekunde beginnt er darüberzureden. Unter 50 zu kommen bedeutete bislang meist den proprietären Stack eines Sprach-API-Anbieters, mit entsprechendem Preis. Der Kniff, der die Textinferenz seit zwei Jahren umbaut, nämlich dass der größte Teil der Geschwindigkeit in der Serving-Schicht steckt und nicht in den Gewichten, kommt nun im Audio an, öffentlich und mit beiliegendem Code. Wer irgendetwas baut, das spricht, sieht die Untergrenze des Akzeptablen gerade nach oben rücken.
#Audio & Musik

✓ Verifiziert · 2 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Anthropic lässt sein stärkstes Modell Fehler in Ihrem Code jagen, aber nicht mit Ihnen sprechen
2026-08-22
Apple Music zeigt künftig an, wenn ein Song von einer Maschine stammt — ob das jemand angibt, entscheidet der Uploader
2026-08-21
Stripe hat gerade 7,5 Milliarden Dollar für einen Modell-Router gezahlt. Tage später baut Ramp einen und verschenkt ihn bis Januar.
2026-08-21
Metas Assistent ist jetzt eine Mac-App, die Ihren Bildschirm liest und in jedes Fenster tippt — und was sie sieht, kann das Modell trainieren
2026-08-21
Ein Klick auf einer Nachrichtenseite sagt Google jetzt, dass Sie mehr davon sehen wollen — und Sie bleiben auf der Seite, die Sie gerade lesen
2026-08-21