चित्रण: tuput
हिन्दी
MMLU को दोबारा जाँचने वाले शोधकर्ताओं का अनुमान है कि उसके 6.49% सवालों में गलतियाँ हैं। Scale AI के ज़रिये रखे गए एनोटेटरों ने स्कूली गणित के 1,205 नए सवाल लिखे, और कुछ ओपन मॉडलों ने उन पर सार्वजनिक GSM8K परीक्षण से 8 अंक तक कम अंक पाए। LMArena ने कहा कि Meta को ज़्यादा साफ़ बताना चाहिए था कि उसकी Llama 4 एंट्री इंसानी पसंद के लिए अनुकूलित थी।
MMLU, भाषा मॉडलों को अंक देने वाली 57 विषयों की बहुविकल्पीय परीक्षा, में 16 शोधकर्ताओं की जून 2024 की दोबारा जाँच के अनुसार अनुमानित 6.49% सवालों में गलतियाँ हैं। वायरोलॉजी खंड में उनके जाँचे 100 में से 57 सवालों में कोई न कोई समस्या थी। आगे वे दर्ज मामले हैं जिनमें बेंचमार्क घिस गए, प्रशिक्षण डेटा में रिस गए या उनके साथ खेल हुआ, हर आँकड़ा किसने मापा, और बेंचमार्कों के अपने लेखक उनकी सीमाओं के बारे में क्या कहते हैं।
जब परीक्षा में जगह नहीं बचती
3 जून 2024 तक MMLU-Pro के लेखकों ने, जो MMLU का कहीं कठिन उत्तराधिकारी है, लिखा कि ऐसे बेंचमार्कों पर प्रदर्शन “समतल होने लगा है।” MMLU-Pro में 12,032 सवाल हैं और हर सवाल के दस उत्तर-विकल्प, यानी MMLU से तीन गुना ग़लत विकल्प। उसके बनाने वालों ने MMLU के उन 5,886 सवालों को हटा दिया जिनका सही जवाब आठ ओपन मॉडलों में से चार से ज़्यादा ने दिया, इसलिए उसके सिर्फ़ 6,810 सवाल MMLU से आते हैं और बाक़ी दूसरे स्रोतों से। लेखक बताते हैं कि जिन मॉडलों को उन्होंने परखा उनकी सटीकता MMLU के मुक़ाबले 16% से 33% गिरी, और प्रॉम्प्ट की शब्दावली के प्रति संवेदनशीलता 4 से 5% से घटकर 2% रह गई। GPT-4o के बारे में वे बताते हैं कि क़दम-दर-क़दम तर्क ने MMLU-Pro को 53.5% से 72.6% तक उठाया, जबकि MMLU को सिर्फ़ 87.2% से 88.7% तक।
स्टैनफ़ोर्ड का 2026 का AI इंडेक्स कहता है, “जिन मूल्यांकनों को सालों तक कठिन रहना था, वे महीनों में संतृप्त हो जाते हैं।” वह जोड़ता है कि Humanity’s Last Exam पर, जो AI के लिए कठिन बनाई गई परीक्षा है, अग्रणी मॉडलों ने एक साल में 30 प्रतिशत अंकों की बढ़त ली।
उत्तर-कुंजी की गलतियाँ
ग़लत उत्तर-कुंजी सबसे अच्छे संभव अंक को 100% से नीचे बाँध देती है। MMLU-Redux की टीम ने, जिसके पहले लेखक आर्यो प्रदीप्ता गेमा हैं, 57 विषयों में से हर एक के 100 यादृच्छिक सवाल जाँचे, कुल 14,042 में से 5,700। उन्होंने समस्याओं को अस्पष्ट सवाल, अस्पष्ट विकल्प, कोई सही उत्तर नहीं, कई सही उत्तर और ग़लत कुंजी में छाँटा। वायरोलॉजी का रिकॉर्ड सबसे ख़राब था, 57%, जिसमें 33 ग़लत कुंजियाँ थीं। तार्किक भ्रांतियों में 26%, कॉलेज रसायन में 25% और पेशेवर क़ानून में 18% थे। 6.49% का आँकड़ा पूरी परीक्षा के लिए उनका अनुमान है, जो नमूने से निकाला गया है। लेखक दर्ज करते हैं कि 8,342 सवाल बिना जाँचे रहे और उनकी प्रक्रिया “एनोटेटरों के निजी पूर्वाग्रहों से अब भी प्रभावित हो सकती है।”
गणित के सवालों का एक नया सेट
GSM8K स्कूल-स्तर के गणित के शब्द-सवालों का सेट है। 1 मई 2024 को ह्यू झांग और उनके साथियों ने GSM1k पर आधारित एक पेपर जारी किया, जिसमें Scale AI के ज़रिये रखे गए इंसानी एनोटेटरों के लिखे 1,205 नए सवाल थे, और उन्हें लिखने में किसी भाषा मॉडल का इस्तेमाल नहीं हुआ। GSM1k पर कुछ मॉडलों की सटीकता 8 अंक तक गिरी। सबसे बड़ा अंतर Yi-6B-Chat में था, 43.7% से 35.7%। Phi और Mistral परिवारों ने लगभग हर रिलीज़ में GSM1k पर कम अंक पाए, जबकि Gemini, GPT और Claude मॉडलों में ओवरफ़िटिंग के कम संकेत दिखे। लेखकों को इस बात के बीच भी सहसंबंध मिला कि कोई मॉडल GSM8K के उदाहरण ज्यों के त्यों कितनी आसानी से पैदा करता है और उसका अंक-अंतर कितना है (0.36 का स्पीयरमैन r-वर्ग)। वे आगाह करते हैं कि दोनों सेट “केवल बहुत मिलते-जुलते हैं, एकदम एक जैसे वितरित नहीं।” लेखकों ने GSM1k को शुरू में रोके रखा ताकि वह प्रशिक्षण डेटा में न रिस जाए।
संदूषण कैसे मापा जाता है
संदूषण का मतलब है कि परीक्षा की सामग्री किसी मॉडल के प्रशिक्षण डेटा में रिस गई। तीन पेपर इस पर अलग-अलग कोणों से हमला करते हैं।
चुन्युआन देंग और उनके साथियों ने मॉडलों से कहा कि बहुविकल्पीय सवाल से छिपाया गया एक ग़लत उत्तर-विकल्प अनुमान से बताएँ। MMLU पर ChatGPT और GPT-4 ने उसे हूबहू 52% और 57% बार मिलाया। लेखक इसे सामग्री देखे होने का संकेत पढ़ते हैं, पर इस तरीक़े को सीधे पुनर्प्राप्ति से कम भरोसेमंद कहते हैं। योनातन ओरेन और उनके साथियों ने जाँचा कि क्या कोई मॉडल किसी बेंचमार्क के मूल सवाल-क्रम को फेंटे हुए क्रमों से ज़्यादा पसंद करता है। पाँच सार्वजनिक मॉडलों पर लगाने पर इस परीक्षण को व्यापक संदूषण के बहुत कम प्रमाण मिले। रुइजी शू और उनके साथियों ने परप्लेक्सिटी और n-ग्राम स्कोर से गणित परीक्षणों पर 31 मॉडल जाँचे और टेस्ट-सेट के दुरुपयोग के पर्याप्त मामले बताए। जिस मामले में मॉडल बनाने वाले ने लगभग हर परीक्षण ख़ुद चलाया, उसके लिए ऑन-डिवाइस मॉडलों पर हमारी पड़ताल देखें।
HumanEval से तारीख़ वाले सवालों तक
LiveCodeBench, जो 12 मार्च 2024 को HumanEval जैसे पुराने कोडिंग परीक्षणों की जगह लेने के लिए पोस्ट हुआ, LeetCode, AtCoder और Codeforces से सवाल लेता है और दर्ज करता है कि हर सवाल कब प्रकाशित हुआ, ताकि किसी मॉडल को सिर्फ़ उसके प्रशिक्षण-कटऑफ़ के बाद जारी सवालों पर परखा जा सके। उसके लेखक बताते हैं कि अगस्त 2023 के बाद जारी LeetCode सवालों पर DeepSeek के कोड मॉडल तेज़ी से गिर गए। वे लिखते हैं कि HumanEval “एक आसान बेंचमार्क है जिसमें छोटे और अलग-थलग प्रोग्रामिंग सवाल हैं, इसलिए उस पर ओवरफ़िट करना आसान है।” वे जोड़ते हैं कि बेंचमार्क में सिर्फ़ Python है और सवालों का नमूना चुनने भर से अंक 1 से 1.5% हिल जाते हैं, इसलिए मॉडलों के बीच छोटे अंतरों का ज़्यादा मतलब नहीं।
SWE-bench Verified, सॉफ़्टवेयर कामों का इंसान-छना हुआ सेट, पर भी वैसी ही जाँच पड़ी। Epoch AI ने 3 सितंबर 2026 को उसे “Flawed” (त्रुटिपूर्ण) दर्जा दिया। वह OpenAI के 23 फ़रवरी 2026 के ऑडिट का हवाला देता है, जिसने 27.6% कामों को कवर किया और उनमें से 59.4% में ऐसे परीक्षण पाए जो सही सुधारों को ठुकरा देते थे, यानी सभी कामों का कम से कम 16.4%। Epoch कहता है कि उसे यथोचित भरोसा है कि 20% से ज़्यादा सवालों में अंक देने की समस्याएँ हैं, और अब सभी काम और समाधान सार्वजनिक हैं। हमारी कोडिंग एजेंटों पर रिपोर्ट पास होने वाले पैचों की मेंटेनर समीक्षा और Scale AI के SWE-Bench Pro बोर्ड को कवर करती है।
LMArena पर Llama 4 की एंट्री
Meta की 5 अप्रैल 2025 की Llama 4 घोषणा ने कहा कि Llama 4 Maverick के साथ “एक प्रायोगिक चैट संस्करण” आया जिसने LMArena पर, जो इंसानी पसंद के वोटों से बना रैंकिंग है, 1417 का Elo स्कोर पाया। TechCrunch के अनुसार 7 अप्रैल को Meta के अधिकारी अहमद अल-दहले ने इस दावे को कि Meta ने टेस्ट सेट पर प्रशिक्षण दिया, “सीधे-सीधे सच नहीं” कहा।
LMArena ने 8 अप्रैल को अपना बयान पोस्ट किया। उसने कहा कि उसकी नीति की Meta की व्याख्या “उससे मेल नहीं खाती जो हम मॉडल प्रदाताओं से अपेक्षा करते हैं,” और यह कि Meta को ज़्यादा साफ़ बताना चाहिए था कि Llama-4-Maverick-03-26-Experimental एक अनुकूलित मॉडल था जो इंसानी पसंद के लिए बनाया गया था। उसने समीक्षा के लिए 2,000 या ज़्यादा मुक़ाबलों के नतीजे जारी किए और कहा कि वह अपनी नीतियाँ अद्यतन कर रहा है।
29 अप्रैल 2025 को शिवालिका सिंह और उनके साथियों ने “The Leaderboard Illusion” प्रकाशित किया। वह Llama 4 की रिलीज़ से पहले एरीना पर Meta के 27 तक निजी संस्करण गिनता है, और अनुमान लगाता है कि Google और OpenAI को टेस्ट प्रॉम्प्टों का 19.2% और 20.4% मिला, जबकि 83 ओपन-वेट मॉडलों को मिलाकर 29.7%। एक फ़ाइन-ट्यूनिंग परीक्षण में, 70% एरीना डेटा वाले मिश्रण पर प्रशिक्षित 7-अरब-पैरामीटर वाले मॉडल ने Arena-Hard प्रॉम्प्ट सेट पर अपनी जीत दर 23.5% से बढ़ाकर 49.9% कर ली, यानी 112.3% की सापेक्ष बढ़त, जबकि उसका MMLU अंक 66.5% से फिसलकर 65.9% रह गया। लेखक Meta की अपनी गिनती को सतर्क अनुमान कहते हैं, कहते हैं कि वे निजी संस्करणों के अंक नहीं देख सकते, और बताते हैं कि कई लेखक Cohere में काम करते हैं। वे अंक वापस लेने पर रोक और प्रति प्रदाता निजी संस्करणों की घोषित सीमा तय करने की सिफ़ारिश करते हैं।
Arena ने 9 मई 2025 को जवाब दिया। वह पेपर के ओपन-मॉडल हिस्से पर आपत्ति करता है, और अपने 27 अप्रैल के आँकड़ों में ओपन मॉडलों को 40.9% पर रखता है। उसका कहना है कि पेपर में रिलीज़ से पहले के परीक्षण के फ़ायदों का चार्ट एक सिमुलेशन था जिसका एरीना डेटा से कोई लेना-देना नहीं, और फ़ाइन-ट्यूनिंग परीक्षण में 500 प्रॉम्प्टों का स्थिर बेंचमार्क था जिसे एक मॉडल ने जाँचा। उसने यह भी कहा कि उसकी रिलीज़-पूर्व परीक्षण नीति 1 मार्च 2024 से सार्वजनिक है, और वादा किया कि वह कई रिलीज़-पूर्व संस्करणों की इजाज़त देगा और शुरुआती अंकों पर “अनंतिम” का लेबल लगाएगा।
टिकने के लिए बनी परीक्षाएँ, और उनके अपने ऑडिट
Humanity’s Last Exam (HLE) 24 जनवरी 2025 को 2,500 सवालों के साथ पोस्ट हुई। हर सवाल को अग्रणी मॉडलों पर परखा गया और अगर वे सही जवाब दे देते तो वह ठुकरा दिया गया। पेपर की तालिका में केवल-पाठ वाले सवालों पर आठ मॉडलों में सबसे अच्छा o3-mini (high) 13.4% पर दर्ज है, और एक निजी रोके हुए सेट से ओवरफ़िटिंग की जाँच होती है। 23 जुलाई 2025 को FutureHouse ने साहित्य-खोज एजेंट के साथ रसायन और जीव विज्ञान के 321 केवल-पाठ सवाल जाँचे, उसके 150 आउटपुट विशेषज्ञों से समीक्षित करवाए, और अनुमान लगाया कि 29% (प्लस-माइनस 3.7 अंक) के उत्तर सहकर्मी-समीक्षित साहित्य से सीधे टकराते थे। FutureHouse का अद्यतन कहता है कि HLE टीम की अपनी अनुवर्ती जाँच में एक मिलते-जुलते उपसमूह का क़रीब 18% समस्याग्रस्त निकला, और तीन विशेषज्ञ समीक्षकों में से कम से कम एक 25% पर असहमत था। टीम एक सतत संशोधन की योजना बना रही है।
ARC-AGI, जिसे फ़्रांसुआ शोले ने 2019 में पेश किया, पहेलियों का एक सेट है जो इंसानों के लिए सुलभ और AI के लिए कठिन होने के लिए बना है। 17 मई 2025 का ARC-AGI-2 पेपर 407 प्रतिभागियों के साथ इंसानी परीक्षण बताता है। उसकी तालिका, 14 मई 2025 तक, अर्ध-निजी सेट पर सबसे अच्छा अंक 3.0% दर्ज करती है। लेखक कहते हैं कि 5% से नीचे की सटीकता को आम तौर पर सार्थक नहीं माना जाता। NIST के परीक्षण केंद्र CAISI ने, जो उस सेट को “रोका हुआ और असंदूषित” कहता है, 1 मई 2026 की एक रिपोर्ट में उस पर GPT-5.5 के लिए 79% और Anthropic के Opus 4.6 के लिए 63% मापा। उस रिपोर्ट के बाक़ी हिस्से के लिए चीनी मॉडलों पर हमारा लेख देखें। CAISI कहता है कि उसके आँकड़े सभी कामों का माध्य हैं, जो बेंचमार्क की आधिकारिक अंकन-पद्धति से अलग है।
स्रोत और आगे पढ़ने के लिए
- Wang and others, MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark (arXiv:2406.01574, 3 June 2024)
- Gema and others, Are We Done with MMLU? (arXiv:2406.04127, 6 June 2024)
- Zhang and others, A Careful Examination of Large Language Model Performance on Grade School Arithmetic (arXiv:2405.00332, 1 May 2024)
- Deng and others, Investigating Data Contamination in Modern Benchmarks for Large Language Models (arXiv:2311.09783, NAACL 2024)
- Oren and others, Proving Test Set Contamination in Black Box Language Models (arXiv:2310.17623, 26 October 2023)
- Xu and others, Benchmarking Benchmark Leakage in Large Language Models (arXiv:2404.18824, 29 April 2024)
- Jain and others, LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code (arXiv:2403.07974, 12 March 2024)
- Epoch AI: Benchmark review, SWE-bench Verified (3 September 2026)
- Meta AI: The Llama 4 herd (5 April 2025)
- TechCrunch: Meta exec denies the company artificially boosted Llama 4's benchmark scores (7 April 2025)
- LMArena statement on Llama 4, posted on X and reproduced by Simon Willison (8 April 2025)
- Singh and others, The Leaderboard Illusion (arXiv:2504.20879, 29 April 2025)
- Arena (formerly LMArena): Our Response to 'The Leaderboard Illusion' Writeup (9 May 2025, updated 13 June 2025)
- Stanford HAI: 2026 AI Index Report, Technical Performance
- Phan and others, Humanity's Last Exam (arXiv:2501.14249, 24 January 2025; version 11, 28 July 2026)
- FutureHouse: About 30% of Humanity's Last Exam chemistry/biology answers are likely wrong (23 July 2025)
- Chollet and others, ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems (arXiv:2505.11831, 17 May 2025)
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
यह लेख AI उपकरणों की सहायता से शोधित और लिखा गया है, और सटीकता के लिए संपादित किया गया है। यह केवल सामान्य जानकारी और चर्चा के लिए है, पेशेवर सलाह नहीं। हमारे संपादकीय मानक और अस्वीकरण देखें। कोई त्रुटि मिली? हमें बताएँ।
अच्छा लगा? अगला लेख पाएँ।
एक बार में एक अच्छा लेख, सीधे आपके इनबॉक्स में। कोई स्पैम नहीं, जब चाहें अनसब्सक्राइब करें।