aiminute. ← सभी AI समाचार
नए मॉडल AI Minute Newsroom 2026-08-28

गूगल का नया ट्रांसक्रिप्शन मॉडल वह नहीं लिखता जो आपने कहा — वह लिखता है जो आपका मतलब था, 85 भाषाओं में

गूगल का नया ट्रांसक्रिप्शन मॉडल वह नहीं लिखता जो आपने कहा — वह लिखता है जो आपका मतलब था, 85 भाषाओं में

गूगल ने Gemini 3.5 Transcribe जारी किया है — Gemini की ऑडियो समझ पर बना एक स्पीच-टू-टेक्स्ट मॉडल, जो अभी सार्वजनिक पूर्वावलोकन में है। यह 85 से अधिक भाषाओं को अपने आप पहचानता है, वाक्य के बीच में भाषा बदलने वाले वक्ता के साथ चलता है, तीन तक आवाज़ें अलग करता है, और शब्द-स्तर के टाइमस्टैम्प देता है। साधारण डिक्टेशन से इसे अलग करने वाली बात वह है जिसे गूगल 'स्मार्ट ट्रांसक्रिप्शन' कहता है: यह भरावन शब्द हटाता है, वक्ता की आत्म-सुधार को ठीक करता है और चलते-चलते पाठ को स्वरूप देता है, ताकि नतीजा ऑडियो के शब्दशः रिकॉर्ड की जगह साफ़ गद्य जैसा पढ़ा जाए। इसे विशेष शब्दावली की ओर झुकाया जा सकता है और ट्रांसक्रिप्शन के बीच कार्य सौंपने के लिए यह फ़ंक्शन कॉल भी कर सकता है। गूगल के अनुसार शब्द त्रुटि दर रिकॉर्डेड ऑडियो पर 2.6 प्रतिशत और स्ट्रीमिंग में 4.0 प्रतिशत है; बहुभाषी FLEURS बेंचमार्क पर क्रमशः 5.04 और 5.50 प्रतिशत, और विलंबता पूर्ववर्ती Chirp 3 से लगभग 70 प्रतिशत कम। यह Google AI Studio तथा Gemini Enterprise Agent Platform में Gemini API के ज़रिये, Android पर Gboard के Rambler में और macOS के Gemini ऐप में उपलब्ध है; Chrome समर्थन आने की बात कही गई है।

यह क्यों मायने रखता हैट्रांसक्रिप्शन बहुत सारे रोज़मर्रा के काम के नीचे बिछी पाइपलाइन है — व्याख्यान नोट्स, चिकित्सकीय डिक्टेशन, सबटाइटल, बैठक की कार्यवाही, वह इंटरव्यू जिसे पत्रकार को टाइप करना पड़ता है। भाषा-बदलाव सहित 85 भाषाओं का समर्थन अंग्रेज़ी के बाहर सबसे मायने रखने वाली पंक्ति है: ज़्यादातर लोग एक ही बैठक में एक ही भाषा साफ़-साफ़ नहीं बोलते, और अब तक मॉडल इसे ठीक से नहीं सँभालते थे। पर सफ़ाई एक असली सौदा है। जो प्रतिलेख चुपचाप आपके वाक्य सुधार देता है, वह पढ़ने में आसान तो है, पर जो कहा गया उसका ईमानदार रिकॉर्ड नहीं रह जाता — और गवाही या अनुशासनात्मक सुनवाई के लिए यही सबसे ग़लत गुण है।
#ऑडियो और संगीत

✓ सत्यापित · 4 स्रोत

WhatsApp X Telegram
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ

संबंधित खबरें

गूगल के वीडियो मॉडल को अब बताया जा सकता है कि शॉट कहाँ से शुरू और कहाँ ख़त्म हो — और ड्राफ़्ट की लागत एक-तिहाई
2026-08-28
ऑस्ट्रेलिया के चार्ट में अब शर्त है कि गीत किसी इंसान ने लिखा हो और मुख्य आवाज़ इंसान की हो — नियम शुक्रवार से
2026-08-27
जिस गुमनाम मॉडल को डेवलपर हफ़्तों से टटोल रहे थे वह अब MIT लाइसेंस पर डाउनलोड के लिए खुला है — और Z.ai कहती है पूरा प्रीव्यू चीनी चिप पर चला
2026-08-27
आईबीएम के नए ओपन मॉडलों को टर्मिनल का वर्णन करना नहीं सिखाया गया — उन्हें टर्मिनल चलाकर प्रशिक्षित किया गया
2026-08-27
रिकॉर्ड लेबलों ने AI इमेज कंपनी में हिस्सेदारी खरीद ली: Stability के 7.6 करोड़ डॉलर के दौर में यूनिवर्सल, सोनी, वॉर्नर और EA सब शामिल
2026-08-26