टूल्स
AI Minute Newsroom
2026-08-22
एक आवाज़ मॉडल जो 50 मिलीसेकंड से भी कम में बोलना शुरू कर देता है, और सर्विंग कोड खुला है
Nari Labs ने 19 अगस्त को Qwen3-TTS 1.7B CustomVoice के लिए बनाए गए सर्विंग स्टैक पर एक लेख प्रकाशित किया और कार्यान्वयन तथा बेंचमार्क दोनों को ओपन सोर्स कर दिया। एक ही H100 SXM पर, प्रति सेकंड 10 अनुरोधों पर पहली ध्वनि तक के समय का 95वाँ पर्सेंटाइल 50 मिलीसेकंड से नीचे रहता है, और प्रति सेकंड 20 अनुरोधों पर भी 100 मिलीसेकंड से कम रहता है। पूरी क्षमता पर लागत लगभग 2 डॉलर प्रति दस लाख अक्षर वाणी बैठती है। सुधार नए मॉडल से नहीं, शेड्यूलिंग से आया है: सिस्टम के तीन हिस्से — Talker, Code Predictor और कोडेक — तीन अलग कतारों के बजाय एक इकाई के रूप में शेड्यूल होते हैं, अनुरोधों को समय-सीमा के अनुसार प्राथमिकता दी जाती है ताकि स्ट्रीमिंग काम बैच काम के पीछे अटके नहीं, और डिकोडिंग कैश्ड स्थिति के साथ क्रमिक होती है।
यह क्यों मायने रखता हैविलंबता ही तय करती है कि कोई बोलने वाला इंटरफ़ेस बातचीत जैसा लगता है या फ़ोन मेन्यू जैसा। लगभग 200 मिलीसेकंड से कम में व्यक्ति उत्तर को उत्तर की तरह ग्रहण करता है; आधे सेकंड के बाद वह ऊपर से बोलने लगता है। 50 से नीचे जाने का मतलब आम तौर पर किसी वॉइस एपीआई कंपनी का मालिकाना स्टैक और उसी हिसाब की कीमत रहा है। जो तरकीब पिछले दो साल से टेक्स्ट इन्फ़रेंस को बदल रही थी — कि अधिकांश गति वेट में नहीं, सर्विंग परत में छिपी थी — वह अब ऑडियो में, सार्वजनिक रूप से और कोड सहित पहुँच गई है। अगर आप कुछ भी बोलने वाला बना रहे हैं, तो स्वीकार्य का न्यूनतम स्तर अभी-अभी ऊपर खिसक गया।
✓ सत्यापित · 2 स्रोत
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
TikTok ने देखे जा रहे वीडियो के अंदर शॉपिंग बॉट रख दिया।
2026-10-06Microsoft का नया मॉडल आपकी बात खत्म होने से पहले लिखने लगता है।
2026-10-05ElevenLabs छात्रों को एक साल मुफ़्त पढ़ने वाली आवाज़ दे रहा है।
2026-10-05मेटा का सहायक आपके हर परिचित की घंटेवार फ़ाइल रखता है।
2026-10-05एक कमांड से Apple का हटाया AI बंद करने वाला स्विच वापस
2026-10-05