これは何?
AI音声には三つの革命が同時に入っている。文章から音楽を作り、人と区別できない声を出し、リアルタイムで会話する。チャート上位のAI楽曲や、オーディオブックと音声エージェントの急増を生んだ。最初の大きな著作権判決もここから出た。
主要ツールとプレイヤー
- Suno、Udio — プロンプトから完全な楽曲(ボーカル、歌詞、プロダクション)
- ElevenLabs — 実物そっくりの音声と声のクローンのリーダー
- OpenAI / Googleの音声モード — リアルタイム会話音声
- オープンソース:楽曲のYuE2、MusicGen(Meta)、文字起こしのWhisper
節目
- 2022-2024 — Whisperが文字起こしを無料にし、続いてSunoとUdioがラジオ品質の楽曲を出し、大手レーベルが提訴した
- 2025 — リアルタイム音声エージェントがコールセンターの行列を置き換え;声のクローン詐欺が増加
- 2026 — ミュンヘン裁判所が欧州初の大型AI音楽著作権訴訟でSunoに敗訴判決(当誌報道)
- 2026年7月 — OpenAIがChatGPT音声にGoogle DeepMindの不可視SynthID透かしを組み込み、検証APIを公開(当誌報道)
- 2026年8月 — ByteDanceのSeedRealtimeで全二重が音声+映像に:同時に見て、聞いて、話す。豆包アプリで稼働中
- 2026年8月 — Spotifyがバッジ付きのAI名義を推薦から外し、オーストラリアのARIAは全面AI制作の楽曲を国内チャートから排除(当誌報道)
- 2026年9月 — Sunoのv6が許諾済みカタログに切り替え、公開モデルYuE2が目隠し試聴で並んだ(当誌報道)
- 2026年9月 — ElevenLabsのMusic v2.5は、ツール名を明記すれば無料アカウントでも楽曲を販売できるようにした(当誌報道)
- 2026年9月 — Gemini 3.8 Liveが音声対音声で首位に立ち、通義千問は音声入力の費用を98%下げた(当誌報道)
- 2026年9月 — ElevenLabsのEleven v4は十秒の録音から声を複製し、九十以上の言語を話す(当誌報道)
ミニ用語集
- TTS:テキスト読み上げ——文章を自然な音声に変換
- 声のクローン:短いサンプルから特定の人物の声を再現
- ステム:楽曲内の分離トラック(ボーカル、ドラムなど)