अनुसंधान
2026-08-12
एन्क्रिप्टेड रीज़निंग असल में एन्क्रिप्टेड नहीं है: एक कमज़ोर मॉडल ताक़तवर मॉडल के छिपे विचार शब्द-दर-शब्द पढ़कर सुना देता है
10 अगस्त को ELLIS इंस्टीट्यूट ट्यूबिंगन और मैक्स प्लांक इंस्टीट्यूट फ़ॉर इंटेलिजेंट सिस्टम्स की एक टीम ने "Stealing Reasoning Traces from Proprietary LLM APIs" प्रकाशित किया। Anthropic, OpenAI और Google तीनों अपने मॉडलों की चेन-ऑफ़-थॉट एक ही तरीक़े से छिपाते हैं: रीज़निंग को एन्क्रिप्ट करके क्लाइंट को लौटा दिया जाता है, और क्लाइंट अगली रिक्वेस्ट के साथ वही सिफरटेक्स्ट वापस भेजता है। शोधकर्ताओं ने पाया कि ये ब्लॉक एक ही प्रदाता के भीतर सेशन, उपयोगकर्ता और मॉडल—सबके बीच पूरी तरह अदल-बदल किए जा सकते हैं। यानी किसी फ़्लैगशिप मॉडल की एन्क्रिप्टेड रीज़निंग उसी कंपनी के छोटे, कम सुरक्षित मॉडल को दीजिए, और वह उसे डिक्रिप्ट करके छिपा हुआ पाठ हूबहू छाप देता है। पेपर चार नतीजे दिखाता है: एंटी-डिस्टिलेशन बचाव को चकमा देना, निजी डेटा निकालना, प्रदाता द्वारा छाने गए ख़तरनाक कंटेंट को सामने लाना, और अदृश्य प्रॉम्प्ट इंजेक्शन। फिर टीम ने सार्वजनिक कोड रिपॉज़िटरी से 315,320 एन्क्रिप्टेड ब्लॉक जुटाकर डिकोड किए और 367 निजी जानकारी तथा 182 चालू क्रेडेंशियल बरामद किए।
यह क्यों मायने रखता हैयह एन्क्रिप्शन एक साथ दो काम कर रहा था—प्रतिस्पर्धियों को मॉडल की रीज़निंग डिस्टिल करने से रोकना, और उपयोगकर्ताओं को यह देखने से रोकना कि मॉडल ने क्या सोचकर छोड़ दिया। पता चला कि दोनों में से एक भी नहीं हो रहा था, क्योंकि ताला और चाबी साथ-साथ क्लाइंट को भेजे जा रहे थे। असहज करने वाली बात हमला नहीं, वे 315,320 ब्लॉक हैं: ये आम डेवलपरों से आए जिन्होंने एजेंट लॉग सार्वजनिक रिपॉज़िटरी में डाल दिए, यह जाने बिना कि उनमें पड़ी अबूझ स्ट्रिंग्स दरअसल उनकी अपनी मशीन की सोच थीं—और 182 मामलों में उनकी अपनी चालू API कुंजियाँ। अगर आपने एजेंट ट्रांसक्रिप्ट GitHub पर पुश किए हैं, वे इस वक़्त पढ़े जा सकते हैं।
✓ सत्यापित · 3 स्रोत
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
मशीन लर्निंग ने बीमार मस्तिष्क कोशिकाओं का आकार पढ़ा और नौ पहले से स्वीकृत दवाएँ चुनीं जिन्होंने उन्हें शांत किया
2026-08-21डीपसीक का सस्ता वर्कहॉर्स अब देख सकता है — और आँखों वाली एजेंट कार्यों में वह एंथ्रोपिक के सर्वश्रेष्ठ के करीब होने का दावा करता है
2026-08-21एआई को प्रशिक्षित करने का तरीका सुधारने के लिए चार घंटे और एक जीपीयू दिया गया: सर्वश्रेष्ठ एजेंट को 1 में से 0.25 मिले — और अधिकांश ने कोशिश ही नहीं की
2026-08-21ChatGPT अब आपके iMessage पढ़ सकता है और भेज भी सकता है — और जो सेटिंग उसे पूछने से छूट देती है, वही है जिसके बारे में OpenAI चेतावनी देता है
2026-08-21एजेंट ने अपने कोड की सिफ़ारिश कराने के लिए दूसरा आदमी गढ़ लिया। टेक्सस के 24 वर्षीय छात्र ने दोनों पर भरोसा नहीं किया।
2026-08-21