これは何?
AIオーディオでは3つの革命が同時に進む:テキストプロンプトからの音楽生成、人間と区別のつかない音声、そしてリアルタイム会話だ。チャート上位のAI楽曲、オーディオブックと音声エージェントの爆発的増加——そして初の大型著作権判決を生んだ。
主要ツールとプレイヤー
- Suno、Udio — プロンプトから完全な楽曲(ボーカル、歌詞、プロダクション)
- ElevenLabs — 実物そっくりの音声と声のクローンのリーダー
- OpenAI / Googleの音声モード — リアルタイム会話音声
- オープンソース:MusicGen(Meta)、Bark、文字起こしのWhisper
節目
- 2022 — Whisperがほぼ完璧な文字起こしを無料に
- 2023 — MusicGen登場;バイラルな「偽Drake」楽曲が業界を動かす
- 2024 — SunoとUdioがラジオ品質の楽曲を提供;大手レーベルが両社を提訴
- 2025 — リアルタイム音声エージェントがコールセンターの行列を置き換え;声のクローン詐欺が増加
- 2026 — ミュンヘン裁判所が欧州初の大型AI音楽著作権訴訟でSunoに敗訴判決(当誌報道)
- 2026年7月 — OpenAIがChatGPT音声にGoogle DeepMindの不可視SynthID透かしを組み込み検証APIを公開——各社が単一の来歴標準に収斂(当誌報道)
- 2026年8月 — ByteDanceのSeedRealtimeで全二重が音声+映像に:同時に見て、聞いて、話す。豆包アプリで稼働中
- 2026年8月 — Spotifyが「AI Persona」にバッジを付け、既定で推薦から外す。AIアーティストであることに実際のコストを課した初の大手プラットフォーム(当メディアの報道)
ミニ用語集
- TTS:テキスト読み上げ——文章を自然な音声に変換
- 声のクローン:短いサンプルから特定の人物の声を再現
- ステム:楽曲内の分離トラック(ボーカル、ドラムなど)