यह क्या है?
एआई ऑडियो में एक साथ तीन क्रांतियाँ हैं। यह लिखे हुए से संगीत बनाता है, इंसान जैसी आवाज़ें देता है और रीयल-टाइम में बात करता है। इससे चार्ट पर छाए एआई गाने और ऑडियोबुक तथा वॉइस एजेंट की बाढ़ आई। पहले बड़े कॉपीराइट फ़ैसले भी यहीं से आए।
प्रमुख उपकरण और खिलाड़ी
- Suno, Udio — प्रॉम्प्ट से पूरे गाने (गायन, बोल, प्रोडक्शन)
- ElevenLabs — सजीव आवाज़ और वॉइस क्लोनिंग में अग्रणी
- OpenAI / Google वॉइस मोड — रीयल-टाइम संवादी आवाज़
- ओपन सोर्स: गानों के लिए YuE2, MusicGen (Meta), ट्रांसक्रिप्शन के लिए Whisper
मील के पत्थर
- 2022-2024 — Whisper ने ट्रांसक्रिप्शन मुफ़्त किया, फिर Suno और Udio ने रेडियो-गुणवत्ता के गाने दिए और लेबलों ने मुकदमा किया
- 2025 — रीयल-टाइम वॉइस एजेंटों ने कॉल-सेंटर कतारें बदलीं; वॉइस क्लोनिंग घोटाले बढ़े
- 2026 — म्यूनिख अदालत ने यूरोप के पहले बड़े AI संगीत कॉपीराइट मामले में Suno के खिलाफ फ़ैसला दिया (हमारी कवरेज में)
- जुल॰ 2026 — OpenAI ने ChatGPT की आवाज़ में Google DeepMind का अदृश्य SynthID वॉटरमार्क जोड़ा और सत्यापन API खोला (हमारी कवरेज में)
- अग॰ 2026 — ByteDance का SeedRealtime फुल-डुप्लेक्स को ऑडियो-विज़ुअल बनाता है: एक साथ देखता, सुनता और बोलता है; Doubao ऐप में लाइव
- अग 2026 — Spotify ने बैज वाले एआई खाते सिफ़ारिशों से हटाए और ARIA ने एआई-निर्मित ट्रैक ऑस्ट्रेलियाई चार्ट से बाहर किए (हमारी कवरेज)
- सित 2026 — Suno का v6 लाइसेंसी कैटलॉग पर आया, खुला YuE2 सुनवाई में बराबर आया (हमारी कवरेज)
- सित 2026 — ElevenLabs के Music v2.5 ने मुफ़्त खातों को भी अपने ट्रैक बेचने दिए, बशर्ते औज़ार का नाम दें (हमारी कवरेज)
- सित 2026 — Gemini 3.8 Live आवाज़-से-आवाज़ सूची में पहला आया, और क्वेन ने ऑडियो लागत 98% घटाई (हमारी कवरेज)
- सित 2026 — ElevenLabs का Eleven v4 दस सेकंड से आवाज़ क्लोन कर नब्बे भाषाएँ बोलता है (हमारी कवरेज)
मिनी शब्दकोश
- TTS: टेक्स्ट-टू-स्पीच — लिखे हुए को स्वाभाविक आवाज़ में बदलना
- वॉइस क्लोनिंग: छोटे नमूनों से किसी व्यक्ति की आवाज़ की नकल
- स्टेम: गाने के भीतर अलग किया गया ट्रैक (गायन, ड्रम)