Was ist das?
KI-Audio umfasst drei Revolutionen auf einmal. Sie erzeugt Musik aus einem Textbefehl, Stimmen ununterscheidbar von menschlichen und Gespräche in Echtzeit. Daraus entstanden Chart-Hits von KI sowie eine Explosion von Hörbüchern und Sprachagenten. Sie brachte auch die ersten großen Urheberrechtsurteile.
Wichtige Werkzeuge und Akteure
- Suno, Udio — komplette Songs (Gesang, Text, Produktion) aus einem Prompt
- ElevenLabs — führend bei lebensechter Sprache und Stimmklonen
- Sprachmodi von OpenAI / Google — Konversation in Echtzeit
- Open Source: YuE2 für ganze Songs, MusicGen (Meta), Whisper für Transkription
Meilensteine
- 2022-2024 — Whisper machte Transkription kostenlos, dann lieferten Suno und Udio Songs in Radioqualität und die Labels klagten
- 2025 — Echtzeit-Sprachagenten ersetzen Callcenter-Warteschlangen; Betrug mit Stimmklonen nimmt zu
- 2026 — Münchner Gericht urteilt gegen Suno im ersten großen europäischen KI-Musik-Urheberrechtsfall (in unserer Berichterstattung)
- Jul 2026 — OpenAI bettet Google DeepMinds unsichtbares SynthID-Wasserzeichen in ChatGPT-Sprachaudio ein und öffnet eine Prüf-API (unsere Berichterstattung)
- Aug 2026 — ByteDances SeedRealtime schaut, hört und spricht gleichzeitig, live in der Doubao-App
- Aug 2026 — Spotify nimmt gekennzeichnete KI-Acts aus den Empfehlungen und Australiens ARIA schließt rein KI-gemachte Titel aus den Charts aus (unsere Berichterstattung)
- Sep 2026 — Sunos v6 wechselt auf lizenzierte Kataloge, und das offene YuE2 zieht im Blindtest gleich (unsere Meldung)
- Sep 2026 — ElevenLabs' Music v2.5 erlaubt auch Gratiskonten den Verkauf ihrer Stücke, sofern sie das Werkzeug nennen (unsere Meldung)
- Sep 2026 — Gemini 3.8 Live führt bei Sprache zu Sprache, und Qwen senkt die Tonkosten um 98% (unsere Meldung)
- Sep 2026 — ElevenLabs' Eleven v4 klont eine Stimme aus zehn Sekunden und spricht über 90 Sprachen (unsere Meldung)
Mini-Glossar
- TTS: Text-to-Speech — Geschriebenes in natürliche Sprache verwandeln
- Stimmklonen: die Stimme einer Person aus kurzen Proben nachbilden
- Stem: eine isolierte Spur (Gesang, Schlagzeug) innerhalb eines Songs