Что это?
ИИ-аудио — это сразу три революции: генерация музыки по текстовому запросу, голоса, неотличимые от человеческих, и разговор в реальном времени. Оно породило ИИ-песни во главе чартов, взрыв аудиокниг и голосовых агентов — и первые крупные вердикты по авторским правам.
Ключевые инструменты и игроки
- Suno, Udio — целые песни (вокал, текст, продакшн) по запросу
- ElevenLabs — лидер в реалистичной речи и клонировании голоса
- Голосовые режимы OpenAI / Google — разговорный голос в реальном времени
- Открытый код: MusicGen (Meta), Bark, Whisper для транскрипции
Вехи
- 2022 — Whisper делает почти идеальную транскрипцию бесплатной
- 2023 — MusicGen; вирусная песня «фальшивого Дрейка» заставляет индустрию реагировать
- 2024 — Suno и Udio выпускают песни радио-качества; мейджор-лейблы подают в суд на обе
- 2025 — голосовые агенты в реальном времени заменяют очереди колл-центров; растут аферы с клонированием голоса
- 2026 — суд Мюнхена выносит решение против Suno в первом крупном европейском деле об авторских правах на ИИ-музыку (в наших материалах)
- Июл 2026 — OpenAI встраивает невидимый водяной знак SynthID от Google DeepMind в голос ChatGPT и открывает API проверки — конкуренты сходятся на едином стандарте происхождения (в наших материалах)
- Авг 2026 — SeedRealtime от ByteDance делает полный дуплекс аудиовизуальным: смотрит, слушает и говорит одновременно; уже работает в приложении Doubao
- Авг 2026 — Spotify помечает аккаунты «AI Persona» и по умолчанию убирает их из рекомендаций: первая крупная платформа, назначившая цену за то, чтобы быть ИИ-исполнителем (наш материал)
Мини-словарь
- TTS: синтез речи — превращение текста в естественный голос
- Клонирование голоса: воспроизведение голоса человека по коротким образцам
- Стем: изолированная дорожка (вокал, барабаны) внутри песни