नए मॉडल
AI Minute Newsroom
2026-08-28
गूगल का नया ट्रांसक्रिप्शन मॉडल वह नहीं लिखता जो आपने कहा — वह लिखता है जो आपका मतलब था, 85 भाषाओं में
गूगल ने Gemini 3.5 Transcribe जारी किया है — Gemini की ऑडियो समझ पर बना एक स्पीच-टू-टेक्स्ट मॉडल, जो अभी सार्वजनिक पूर्वावलोकन में है। यह 85 से अधिक भाषाओं को अपने आप पहचानता है, वाक्य के बीच में भाषा बदलने वाले वक्ता के साथ चलता है, तीन तक आवाज़ें अलग करता है, और शब्द-स्तर के टाइमस्टैम्प देता है। साधारण डिक्टेशन से इसे अलग करने वाली बात वह है जिसे गूगल 'स्मार्ट ट्रांसक्रिप्शन' कहता है: यह भरावन शब्द हटाता है, वक्ता की आत्म-सुधार को ठीक करता है और चलते-चलते पाठ को स्वरूप देता है, ताकि नतीजा ऑडियो के शब्दशः रिकॉर्ड की जगह साफ़ गद्य जैसा पढ़ा जाए। इसे विशेष शब्दावली की ओर झुकाया जा सकता है और ट्रांसक्रिप्शन के बीच कार्य सौंपने के लिए यह फ़ंक्शन कॉल भी कर सकता है। गूगल के अनुसार शब्द त्रुटि दर रिकॉर्डेड ऑडियो पर 2.6 प्रतिशत और स्ट्रीमिंग में 4.0 प्रतिशत है; बहुभाषी FLEURS बेंचमार्क पर क्रमशः 5.04 और 5.50 प्रतिशत, और विलंबता पूर्ववर्ती Chirp 3 से लगभग 70 प्रतिशत कम। यह Google AI Studio तथा Gemini Enterprise Agent Platform में Gemini API के ज़रिये, Android पर Gboard के Rambler में और macOS के Gemini ऐप में उपलब्ध है; Chrome समर्थन आने की बात कही गई है।
यह क्यों मायने रखता हैट्रांसक्रिप्शन बहुत सारे रोज़मर्रा के काम के नीचे बिछी पाइपलाइन है — व्याख्यान नोट्स, चिकित्सकीय डिक्टेशन, सबटाइटल, बैठक की कार्यवाही, वह इंटरव्यू जिसे पत्रकार को टाइप करना पड़ता है। भाषा-बदलाव सहित 85 भाषाओं का समर्थन अंग्रेज़ी के बाहर सबसे मायने रखने वाली पंक्ति है: ज़्यादातर लोग एक ही बैठक में एक ही भाषा साफ़-साफ़ नहीं बोलते, और अब तक मॉडल इसे ठीक से नहीं सँभालते थे। पर सफ़ाई एक असली सौदा है। जो प्रतिलेख चुपचाप आपके वाक्य सुधार देता है, वह पढ़ने में आसान तो है, पर जो कहा गया उसका ईमानदार रिकॉर्ड नहीं रह जाता — और गवाही या अनुशासनात्मक सुनवाई के लिए यही सबसे ग़लत गुण है।
✓ सत्यापित · 4 स्रोत
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
गूगल के वीडियो मॉडल को अब बताया जा सकता है कि शॉट कहाँ से शुरू और कहाँ ख़त्म हो — और ड्राफ़्ट की लागत एक-तिहाई
2026-08-28ऑस्ट्रेलिया के चार्ट में अब शर्त है कि गीत किसी इंसान ने लिखा हो और मुख्य आवाज़ इंसान की हो — नियम शुक्रवार से
2026-08-27जिस गुमनाम मॉडल को डेवलपर हफ़्तों से टटोल रहे थे वह अब MIT लाइसेंस पर डाउनलोड के लिए खुला है — और Z.ai कहती है पूरा प्रीव्यू चीनी चिप पर चला
2026-08-27आईबीएम के नए ओपन मॉडलों को टर्मिनल का वर्णन करना नहीं सिखाया गया — उन्हें टर्मिनल चलाकर प्रशिक्षित किया गया
2026-08-27रिकॉर्ड लेबलों ने AI इमेज कंपनी में हिस्सेदारी खरीद ली: Stability के 7.6 करोड़ डॉलर के दौर में यूनिवर्सल, सोनी, वॉर्नर और EA सब शामिल
2026-08-26