टूल्स
AI Minute Newsroom
2026-08-24
डेवलपर्स ने देखा कि "एफर्ट" का पैमाना कम दिखा रहा है। एंथ्रोपिक कहता है वह सर्विंग कॉन्फ़िग परख रहा है, और इस हफ़्ते उस संख्या का मतलब अलग है।
22 अगस्त के सप्ताहांत में क्लॉड कोड के उपयोगकर्ताओं ने पोस्ट किया कि टूल का "एफर्ट" संकेतक अप्रत्याशित रूप से कम मान दिखा रहा है — एक स्क्रीनशॉट में 100 में से 10 — और यह कि एक ही तरह के काम ओपस 5 और पुराने ओपस 4.6 के बीच बहुत अलग व्यवहार कर रहे थे; एक मामले में उसी काम पर 43 मिनट बनाम 2 मिनट। यह धागा हैकर न्यूज़ के मुखपृष्ठ पर पहुंच गया। एंथ्रोपिक में क्लॉड कोड टीम का नेतृत्व करने वाले थारिक ने सार्वजनिक रूप से उत्तर दिया कि कंपनी इस समय एपीआई सर्विंग कॉन्फ़िगरेशन का परीक्षण कर रही है और उस परीक्षण के दौरान संख्यात्मक एफर्ट मान को सामान्य से "अलग तरह से मैप" किया जा रहा है। उन्होंने कहा कि उपयोगकर्ता जो एफर्ट चुनता है वही उसे मिलता है, और कंपनी के अपने मूल्यांकन प्रदर्शन में कोई गिरावट नहीं दिखाते। धागे का बाकी हिस्सा इतनी आसानी से नहीं सुलझता: उपयोगकर्ताओं की एक लंबी कतार ओपस 5 के उत्तरों को अपनी अपेक्षा से अधिक लंबा और अधिक अलंकृत बताती है, कुछ 4.6 पर या प्रतिद्वंद्वी औज़ारों पर लौट रहे हैं। ये धारणाएं हैं, माप नहीं, और मॉडल की गुणवत्ता के बारे में धारणाएं कुख्यात रूप से अविश्वसनीय होती हैं — पर एंथ्रोपिक ने जो पुष्ट किया वह ठोस है: इंटरफ़ेस पर दिख रही एक संख्या का इस हफ़्ते वह अर्थ नहीं था जो पिछले हफ़्ते था।
यह क्यों मायने रखता हैयह एक छोटी घटना है, पर टोकन के हिसाब से क्षमता खरीदने के बारे में इसमें बड़ा सबक है। आप किसी मॉडल प्रदाता से जो किराए पर लेते हैं वह कोई स्थिर वस्तु नहीं है: वेट्स भले स्थिर हों, पर उनके चारों ओर की सर्विंग कॉन्फ़िगरेशन — क्वांटाइज़ेशन, रूटिंग, एफर्ट मैपिंग, कॉन्टेक्स्ट संचालन — लगातार ट्यून होती रहती है, और आमतौर पर बिना किसी रिलीज़ नोट के। यहां बदलाव दिखाई दिया क्योंकि उसने स्क्रीन पर एक संख्या हिला दी; ऐसे ज़्यादातर बदलाव दिखते नहीं। यदि आपका काम मॉडल के व्यवहार के स्थिर रहने पर निर्भर करता है, तो व्यावहारिक उत्तर यह है कि अपना छोटा-सा मूल्यांकन सेट रखें और उसे नियमित रूप से चलाएं, बजाय विक्रेता के डैशबोर्ड या अपने "कुछ गड़बड़ लग रहा है" वाले एहसास पर भरोसा करने के। और "मॉडल खराब हो गया" वाली पोस्टों को सावधानी से लें: वे कभी-कभी सही होती हैं, पर लगभग कभी प्रमाण नहीं होतीं।
✓ सत्यापित · 2 स्रोत
ऐप में पढ़ें — मुफ़्त, 9 भाषाएँ
संबंधित खबरें
30 करोड़ पैरामीटर वाला एक मॉडल अंदाज़ा लगाता है कि बड़ा मॉडल आगे क्या कहेगा — और मैकबुक 2.87 गुना तेज़ जवाब देता है
2026-08-23पूछा गया कि उनके कितने 'एजेंट' बिना निगरानी बहु-चरणीय काम पूरा कर लेते हैं; दस में से सात कंपनियों ने कहा — एक चौथाई या उससे कम
2026-08-23लोगों के लिए नहीं, कोड लिखने वाले एजेंटों के लिए बना सर्च इंडेक्स: 7 करोड़ README, इशू और पुल रिक्वेस्ट — आज़माने को कुंजी तक नहीं चाहिए
2026-08-23एआई को आपके औज़ारों से जोड़ने वाला मानक इस मान्यता पर बना था कि कोई इंसान 'अनुमति दें' दबाएगा। उसका नया रोडमैप मानता है कि अब बुलाने वाला एक मशीन है।
2026-08-2327 अरब पैरामीटर वाले एक मॉडल ने प्रकाशित शोधपत्रों को दोहराने में Opus 4.8 और GPT-5.5 को हराया
2026-08-23