Qu'est-ce que c'est ?
L'audio IA rassemble trois révolutions à la fois. Il génère de la musique à partir d'un texte, des voix indiscernables des humaines et de la conversation en temps réel. Il a produit des chansons IA en tête des classements et une explosion de livres audio et d'agents vocaux. Il a aussi apporté les premiers grands jugements sur le droit d'auteur.
Outils et acteurs clés
- Suno, Udio — chansons complètes (voix, paroles, production) à partir d'un prompt
- ElevenLabs — leader de la voix réaliste et du clonage vocal
- Modes vocaux d'OpenAI / Google — voix conversationnelle en temps réel
- Open source : YuE2 pour les chansons, MusicGen (Meta), Whisper pour la transcription
Jalons
- 2022-2024 — Whisper rend la transcription gratuite, puis Suno et Udio livrent des chansons de qualité radio et les labels les poursuivent
- 2025 — Les agents vocaux en temps réel remplacent les files des centres d'appels ; les arnaques au clonage vocal augmentent
- 2026 — Le tribunal de Munich condamne Suno dans la première grande affaire européenne de droit d'auteur musical lié à l'IA (dans nos articles)
- Juil 2026 — OpenAI intègre le filigrane invisible SynthID de Google DeepMind dans la voix de ChatGPT (nos articles)
- Août 2026 — SeedRealtime de ByteDance regarde, écoute et parle en même temps, déjà actif dans l'app Doubao
- Août 2026 — Spotify retire des recommandations les projets badgés IA et l'ARIA australienne exclut des classements les titres entièrement IA (notre couverture)
- Sep 2026 — Le v6 de Suno passe aux catalogues sous licence et YuE2, ouvert, l'égale à l'aveugle (notre couverture)
- Sep 2026 — Music v2.5 d'ElevenLabs autorise la vente des morceaux même en offre gratuite, à condition de citer l'outil (notre couverture)
- Sep 2026 — Gemini 3.8 Live prend la tête en voix à voix et Qwen baisse de 98% le coût de l'audio (notre couverture)
- Sep 2026 — Eleven v4 d'ElevenLabs clone une voix en dix secondes et parle plus de 90 langues (notre couverture)
Mini-glossaire
- TTS : synthèse vocale — transformer l'écrit en voix naturelle
- Clonage vocal : reproduire la voix d'une personne à partir de courts échantillons
- Stem : piste isolée (voix, batterie) au sein d'une chanson