aiminute. ← Alle KI-News
Neue Modelle AI Minute Newsroom 2026-08-28

Googles neues Transkriptionsmodell schreibt nicht auf, was Sie gesagt haben, sondern was Sie meinten — in 85 Sprachen

Googles neues Transkriptionsmodell schreibt nicht auf, was Sie gesagt haben, sondern was Sie meinten — in 85 Sprachen

Google hat Gemini 3.5 Transcribe veröffentlicht, ein Sprache-zu-Text-Modell auf Basis von Geminis Audioverständnis, derzeit als öffentliche Vorschau. Es erkennt automatisch mehr als 85 Sprachen, folgt Sprechenden, die mitten im Satz die Sprache wechseln, trennt bis zu drei Stimmen und liefert Zeitstempel auf Wortebene. Was es von gewöhnlichem Diktat unterscheidet, nennt Google Smart Transcription: Es entfernt Füllwörter, repariert Selbstkorrekturen und formatiert den Text im Lauf, sodass das Ergebnis wie sauberer Fließtext liest statt wie ein wörtliches Protokoll der Aufnahme. Es lässt sich zudem auf ein eigenes Vokabular für Fachbegriffe hin gewichten und kann mitten in der Transkription Funktionen aufrufen, um Aufgaben zu übergeben. Google nennt eine Wortfehlerrate von 2,6 Prozent bei aufgezeichnetem Audio und 4,0 Prozent im Streaming, im mehrsprachigen FLEURS-Benchmark 5,04 beziehungsweise 5,50 Prozent, bei rund 70 Prozent geringerer Latenz als beim Vorgänger Chirp 3. Verfügbar ist es über die Gemini-API in Google AI Studio und der Gemini Enterprise Agent Platform, in Gboards Rambler unter Android und in der Gemini-App für macOS; Chrome-Unterstützung soll folgen.

Warum es wichtig istTranskription ist die Installation unter viel gewöhnlicher Arbeit: Vorlesungsnotizen, medizinisches Diktat, Untertitel, Sitzungsprotokolle, das Interview, das eine Journalistin abtippen muss. Die Unterstützung von 85 Sprachen samt Code-Switching ist außerhalb des Englischen die entscheidende Zeile: Die wenigsten sprechen in einer Sitzung sauber nur eine Sprache, und bislang kamen Modelle damit schlecht zurecht. Die Bereinigung ist allerdings ein echter Tausch. Ein Protokoll, das Ihre Sätze stillschweigend repariert, liest sich besser und ist kein getreues Abbild des Gesagten mehr — genau die falsche Eigenschaft für eine Zeugenaussage oder eine Disziplinaranhörung.
#Audio & Musik

✓ Verifiziert · 4 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Googles Videomodell lässt sich jetzt sagen, wo eine Einstellung beginnt und wo sie endet — und Entwürfe kosten ein Drittel
2026-08-28
Australiens Charts verlangen jetzt, dass ein Mensch den Song geschrieben und die Hauptstimme gesungen hat — die Regel gilt ab Freitag
2026-08-27
Das anonyme Modell, an dem Entwickler wochenlang herumgetestet haben, ist jetzt MIT-lizenziert herunterladbar — und Z.ai sagt, die gesamte Vorschau lief auf chinesischen Chips
2026-08-27
IBMs neuen offenen Modellen wurde nicht beigebracht, ein Terminal zu beschreiben — sie wurden trainiert, indem sie eines benutzten
2026-08-27
Die Plattenkonzerne sind beim KI-Bildunternehmen eingestiegen: Universal, Sony, Warner und EA stecken in Stabilitys 76-Millionen-Runde
2026-08-26