Was ist das?
KI-Audio umfasst drei Revolutionen zugleich: Musikerzeugung aus einem Text-Prompt, von Menschen nicht zu unterscheidende Stimmen und Echtzeit-Konversation. Es brachte Chart-Erfolge von KI-Songs, einen Boom bei Hörbüchern und Sprachagenten — und die ersten großen Urheberrechtsurteile.
Wichtige Werkzeuge und Akteure
- Suno, Udio — komplette Songs (Gesang, Text, Produktion) aus einem Prompt
- ElevenLabs — führend bei lebensechter Sprache und Stimmklonen
- Sprachmodi von OpenAI / Google — Konversation in Echtzeit
- Open Source: MusicGen (Meta), Bark, Whisper für Transkription
Meilensteine
- 2022 — Whisper macht nahezu perfekte Transkription kostenlos
- 2023 — MusicGen; der virale „Fake-Drake“-Song zwingt die Branche zur Reaktion
- 2024 — Suno und Udio liefern Songs in Radioqualität; große Labels verklagen beide
- 2025 — Echtzeit-Sprachagenten ersetzen Callcenter-Warteschlangen; Betrug mit Stimmklonen nimmt zu
- 2026 — Münchner Gericht urteilt gegen Suno im ersten großen europäischen KI-Musik-Urheberrechtsfall (in unserer Berichterstattung)
- Jul 2026 — OpenAI bettet Google DeepMinds unsichtbares SynthID-Wasserzeichen in ChatGPT-Sprachaudio ein und öffnet eine Prüf-API — die Konkurrenz konvergiert auf einen Herkunftsstandard (in unserer Berichterstattung)
- Aug 2026 — ByteDances SeedRealtime macht Full-Duplex audiovisuell: es schaut, hört und spricht gleichzeitig — live in der Doubao-App
- Aug 2026 — Spotify kennzeichnet "AI Persona"-Acts und nimmt sie standardmäßig aus den Empfehlungen: die erste große Plattform, bei der es etwas kostet, ein KI-Künstler zu sein (unsere Berichterstattung)
Mini-Glossar
- TTS: Text-to-Speech — Geschriebenes in natürliche Sprache verwandeln
- Stimmklonen: die Stimme einer Person aus kurzen Proben nachbilden
- Stem: eine isolierte Spur (Gesang, Schlagzeug) innerhalb eines Songs