¿Qué es esto?
El audio con IA abarca tres revoluciones a la vez: generación de música desde un prompt de texto, voces indistinguibles de las humanas y conversación en tiempo real. Ha producido canciones de IA en lo alto de las listas, una explosión de audiolibros y agentes de voz — y los primeros grandes veredictos de derechos de autor.
Herramientas y actores clave
- Suno, Udio — canciones completas (voces, letra, producción) desde un prompt
- ElevenLabs — líder en voz realista y clonación de voz
- Modos de voz de OpenAI / Google — voz conversacional en tiempo real
- Código abierto: MusicGen (Meta), Bark, Whisper para transcripción
Hitos
- 2022 — Whisper hace gratuita la transcripción casi perfecta
- 2023 — MusicGen; la canción viral del "falso Drake" obliga a la industria a reaccionar
- 2024 — Suno y Udio lanzan canciones con calidad de radio; las grandes discográficas demandan a ambas
- 2025 — Los agentes de voz en tiempo real sustituyen las colas de los call centers; crecen las estafas de clonación de voz
- 2026 — Un tribunal de Múnich falla contra Suno en el primer gran caso europeo de derechos de autor de música con IA (en nuestra cobertura)
- Jul 2026 — OpenAI integra la marca de agua invisible SynthID de Google DeepMind en la voz de ChatGPT y abre una API de verificación — los rivales convergen en un único estándar de procedencia (en nuestra cobertura)
- Ago 2026 — SeedRealtime de ByteDance lleva el full-duplex a lo audiovisual: mira, escucha y habla a la vez, ya activo en la app Doubao
- Ago 2026 — Spotify marca a los proyectos "AI Persona" y los excluye por defecto de las recomendaciones: la primera gran plataforma que pone un coste a ser un artista de IA (nuestra cobertura)
Mini glosario
- TTS: texto a voz — convertir lo escrito en voz natural
- Clonación de voz: reproducir la voz de una persona a partir de muestras breves
- Stem: pista aislada (voces, batería) dentro de una canción