aiminute. ← सभी AI समाचार
अनुसंधान AI Minute Newsroom 2026-08-29

एंथ्रोपिक ने क्लॉड को अपनी ही दस अलाइनमेंट खामियों पर लगा दिया। धोखे वाले काम में उसने 85 अंक पाए, जहाँ 28 मानव सुरक्षा शोधकर्ताओं ने 20 पाए थे।

एंथ्रोपिक ने क्लॉड को अपनी ही दस अलाइनमेंट खामियों पर लगा दिया। धोखे वाले काम में उसने 85 अंक पाए, जहाँ 28 मानव सुरक्षा शोधकर्ताओं ने 20 पाए थे।

28 अगस्त को प्रकाशित एक पेपर में एंथ्रोपिक उस चीज़ का वर्णन करती है जिसे वह 'स्वचालित अलाइनमेंट शोधकर्ता' कहती है: क्लॉड किसी एक विशेष खामी पर मौजूद शोध पढ़ता है, एक प्रशिक्षण विधि सुझाता है, उसे करीब तीस मिनट चलाता है, बेंचमार्क स्कोर पढ़ता है, और फिर से कोशिश करता है। अलाइनमेंट खामियों की दस श्रेणियों में — हर एक को तीन से पाँच बेंचमार्क से नापा गया — उसने मॉडल की सामान्य क्षमताओं को नुकसान पहुँचाए बिना सुरक्षा अंतर का 26 से 96 प्रतिशत तक पाट दिया। धोखे वाले काम में उसने कई बार चलाने पर 85 प्रतिशत तक पहुँचकर दिखाया; 28 मानव सुरक्षा शोधकर्ता, जिनमें से हरेक को आठ घंटे तक मिले थे, 20 प्रतिशत पर रहे। उसने जो विधियाँ खोजीं वे उन मॉडलों से 4.7 गुना तक बड़े मॉडलों पर भी काम कर गईं जिन पर वे बनी थीं। इकलौते उत्पादन-स्तर के परीक्षण में क्लॉड सॉनेट 5 ने क्लॉड ओपस 4.8 के एक शुरुआती चेकपॉइंट में बचे सुरक्षा अंतर का 65 प्रतिशत 60 घंटे में पाट दिया, और जारी हो चुके मॉडलों के स्कोर के करीब पहुँच गया। इस काम का नेतृत्व एंथ्रोपिक फेलो चेन यूह-हान ने किया; परीक्षण ओपस चेकपॉइंट के साथ-साथ Gemma-2-2B पर भी हुए।

यह क्यों मायने रखता हैएंथ्रोपिक सावधानी से कहती है कि इंसानों से यह तुलना बराबरी की लड़ाई नहीं है: शोधकर्ताओं ने एक-एक विचार भेजा और उस पर दोहरा काम नहीं कर सके, जबकि मशीन ने वही चक्र सैकड़ों बार चलाया — इसलिए पेपर इसे प्रतिस्थापन नहीं, सहयोग के पक्ष में तर्क बताता है। इसे जस का तस मान भी लें, तब भी नतीजा मायने रखता है, क्योंकि जिस असंतुलन की ओर वह इशारा करता है वह असली है। अगर मॉडल मॉडल बनाने में बेहतर होते जाएँगे, तो अलाइनमेंट का काम भी उसी रफ़्तार से तेज़ होना होगा, वरना वह पीछे छूट जाएगा — और यह पहली प्रकाशित कोशिश है जो दिखाती है कि इस दौड़ का सुरक्षा वाला आधा हिस्सा भी स्वचालित हो सकता है। लेखकों की अपनी चेतावनियाँ याद रखने लायक हैं: जिन खामियों की जाँच हुई वे उत्पादन प्रणालियों के मुक़ाबले संकरी हैं, जो खामियाँ अभी किसी ने देखी ही नहीं उनके लिए बेंचमार्क हैं ही नहीं, और उन्होंने यह नहीं जाँचा कि ये सुधार बाद में होने वाले भारी रीइन्फ़ोर्समेंट लर्निंग को झेल पाते हैं या नहीं।
#AI एजेंट#विज्ञान और अनुसंधान

✓ सत्यापित · 2 स्रोत

WhatsApp X Telegram
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ

संबंधित खबरें

Z.ai ने वादे वाले दिन ही GLM-5.3 के वेट्स खोल दिए — पर पिछले तीन मॉडलों में इस्तेमाल किया गया MIT लाइसेंस चुपचाप छोड़ दिया
2026-08-29
रैनसमवेयर गिरोह की तरकीब एक वाक्य थी — कोडिंग एजेंट से कहो कि यह एक टेस्ट है। इसके बाद वह छह हफ़्ते असली कंपनियों के नेटवर्क के भीतर रहा।
2026-08-28
गूगल सर्च अब आपके लिए हवाई किराए पर नज़र रखेगा और होटल भी बुक करेगा — बातचीत लिंक की सूची पर नहीं, बुकिंग पर ख़त्म होती है
2026-08-28
जिस प्रोटोकॉल ने AI को आपकी फ़ाइलों तक पहुँचाया, उसका अब प्रयोगशाला उपकरणों के लिए एक भाई है — Anthropic चाहता है कि मॉडल माइक्रोस्कोप को वैसे ही चलाए जैसे कोई ऐप चलाता है
2026-08-28
जिन लैब्स के मॉडल पिंजरे से निकलकर असली कंपनियों पर हमला कर चुके हैं, उन्होंने अब एक पत्र पर साथ हस्ताक्षर किए हैं: दुनिया जल्दी करे और अपना बचाव करे
2026-08-28