Qu'est-ce que c'est ?
L'audio par IA recouvre trois révolutions à la fois : la génération de musique à partir d'un prompt, des voix indiscernables des humaines et la conversation en temps réel. Il a produit des chansons IA en tête des classements, une explosion de livres audio et d'agents vocaux — et les premiers grands verdicts en droit d'auteur.
Outils et acteurs clés
- Suno, Udio — chansons complètes (voix, paroles, production) à partir d'un prompt
- ElevenLabs — leader de la voix réaliste et du clonage vocal
- Modes vocaux d'OpenAI / Google — voix conversationnelle en temps réel
- Open source : MusicGen (Meta), Bark, Whisper pour la transcription
Jalons
- 2022 — Whisper rend la transcription quasi parfaite gratuite
- 2023 — MusicGen ; la chanson virale du « faux Drake » force l'industrie à réagir
- 2024 — Suno et Udio livrent des chansons de qualité radio ; les grands labels les poursuivent
- 2025 — Les agents vocaux en temps réel remplacent les files des centres d'appels ; les arnaques au clonage vocal augmentent
- 2026 — Le tribunal de Munich condamne Suno dans la première grande affaire européenne de droit d'auteur musical lié à l'IA (dans nos articles)
- Juil 2026 — OpenAI intègre le filigrane invisible SynthID de Google DeepMind dans la voix de ChatGPT et ouvre une API de vérification — les rivaux convergent vers un standard unique de provenance (dans nos articles)
- Août 2026 — SeedRealtime de ByteDance rend le full-duplex audiovisuel : il regarde, écoute et parle en même temps, déjà actif dans l'app Doubao
- Août 2026 — Spotify badge les projets « AI Persona » et les retire par défaut des recommandations : la première grande plateforme à faire payer le fait d'être un artiste IA (notre couverture)
Mini-glossaire
- TTS : synthèse vocale — transformer l'écrit en voix naturelle
- Clonage vocal : reproduire la voix d'une personne à partir de courts échantillons
- Stem : piste isolée (voix, batterie) au sein d'une chanson