aiminute. ← सभी AI समाचार
टूल्स AI Minute Newsroom 2026-08-22

एक आवाज़ मॉडल जो 50 मिलीसेकंड से भी कम में बोलना शुरू कर देता है, और सर्विंग कोड खुला है

एक आवाज़ मॉडल जो 50 मिलीसेकंड से भी कम में बोलना शुरू कर देता है, और सर्विंग कोड खुला है

Nari Labs ने 19 अगस्त को Qwen3-TTS 1.7B CustomVoice के लिए बनाए गए सर्विंग स्टैक पर एक लेख प्रकाशित किया और कार्यान्वयन तथा बेंचमार्क दोनों को ओपन सोर्स कर दिया। एक ही H100 SXM पर, प्रति सेकंड 10 अनुरोधों पर पहली ध्वनि तक के समय का 95वाँ पर्सेंटाइल 50 मिलीसेकंड से नीचे रहता है, और प्रति सेकंड 20 अनुरोधों पर भी 100 मिलीसेकंड से कम रहता है। पूरी क्षमता पर लागत लगभग 2 डॉलर प्रति दस लाख अक्षर वाणी बैठती है। सुधार नए मॉडल से नहीं, शेड्यूलिंग से आया है: सिस्टम के तीन हिस्से — Talker, Code Predictor और कोडेक — तीन अलग कतारों के बजाय एक इकाई के रूप में शेड्यूल होते हैं, अनुरोधों को समय-सीमा के अनुसार प्राथमिकता दी जाती है ताकि स्ट्रीमिंग काम बैच काम के पीछे अटके नहीं, और डिकोडिंग कैश्ड स्थिति के साथ क्रमिक होती है।

यह क्यों मायने रखता हैविलंबता ही तय करती है कि कोई बोलने वाला इंटरफ़ेस बातचीत जैसा लगता है या फ़ोन मेन्यू जैसा। लगभग 200 मिलीसेकंड से कम में व्यक्ति उत्तर को उत्तर की तरह ग्रहण करता है; आधे सेकंड के बाद वह ऊपर से बोलने लगता है। 50 से नीचे जाने का मतलब आम तौर पर किसी वॉइस एपीआई कंपनी का मालिकाना स्टैक और उसी हिसाब की कीमत रहा है। जो तरकीब पिछले दो साल से टेक्स्ट इन्फ़रेंस को बदल रही थी — कि अधिकांश गति वेट में नहीं, सर्विंग परत में छिपी थी — वह अब ऑडियो में, सार्वजनिक रूप से और कोड सहित पहुँच गई है। अगर आप कुछ भी बोलने वाला बना रहे हैं, तो स्वीकार्य का न्यूनतम स्तर अभी-अभी ऊपर खिसक गया।
#ऑडियो और संगीत

✓ सत्यापित · 2 स्रोत

WhatsApp X Telegram
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ

संबंधित खबरें

TikTok ने देखे जा रहे वीडियो के अंदर शॉपिंग बॉट रख दिया।
2026-10-06
Microsoft का नया मॉडल आपकी बात खत्म होने से पहले लिखने लगता है।
2026-10-05
ElevenLabs छात्रों को एक साल मुफ़्त पढ़ने वाली आवाज़ दे रहा है।
2026-10-05
मेटा का सहायक आपके हर परिचित की घंटेवार फ़ाइल रखता है।
2026-10-05
एक कमांड से Apple का हटाया AI बंद करने वाला स्विच वापस
2026-10-05