¿Qué es esto?
El audio con IA abarca tres revoluciones a la vez. Genera música desde un texto, voces indistinguibles de las humanas y conversación en tiempo real. Ha producido canciones de IA en lo alto de las listas y una explosión de audiolibros y agentes de voz. También trajo los primeros grandes fallos judiciales sobre derechos de autor.
Herramientas y actores clave
- Suno, Udio — canciones completas (voces, letra, producción) desde un prompt
- ElevenLabs — líder en voz realista y clonación de voz
- Modos de voz de OpenAI / Google — voz conversacional en tiempo real
- Código abierto: YuE2 para canciones, MusicGen (Meta), Whisper para transcripción
Hitos
- 2022-2024 — Whisper hizo gratuita la transcripción y luego Suno y Udio lanzaron canciones de calidad radio, con demandas de las discográficas
- 2025 — Los agentes de voz en tiempo real sustituyen las colas de los call centers; crecen las estafas de clonación de voz
- 2026 — Un tribunal de Múnich falla contra Suno en el primer gran caso europeo de derechos de autor musical (nuestra cobertura)
- Jul 2026 — OpenAI integra la marca de agua invisible SynthID de Google DeepMind en la voz de ChatGPT (nuestra cobertura)
- Ago 2026 — SeedRealtime de ByteDance mira, escucha y habla a la vez, ya activo en la app Doubao
- Ago 2026 — Spotify saca de las recomendaciones los proyectos marcados como IA y la ARIA australiana los excluye de las listas (nuestra cobertura)
- Sep 2026 — El v6 de Suno pasa a catálogos con licencia y el abierto YuE2 lo iguala (nuestra cobertura)
- Sep 2026 — El Music v2.5 de ElevenLabs deja vender los temas hasta en el plan gratuito, citando la herramienta (nuestra cobertura)
- Sep 2026 — Gemini 3.8 Live queda primero en voz a voz y Qwen abarata un 98% la entrada de audio (nuestra cobertura)
- Sep 2026 — Eleven v4 de ElevenLabs clona una voz con diez segundos y habla 90 idiomas (nuestra cobertura)
Mini glosario
- TTS: texto a voz — convertir lo escrito en voz natural
- Clonación de voz: reproducir la voz de una persona a partir de muestras breves
- Stem: pista aislada (voces, batería) dentro de una canción