Skip to content
MMLU च्या अंदाजे ६.४९ टक्के प्रश्नांत चुका आहेत, एका नव्या गणित चाचणीमुळे काही मॉडेलचे गुण ८ पर्यंत कमी झाले, आणि मेटाने LMArena वर उतरवलेले Llama 4 मॉडेल त्यांनी प्रसिद्ध केलेले मॉडेल नव्हते
कृत्रिम बुद्धिमत्ता

MMLU च्या अंदाजे ६.४९ टक्के प्रश्नांत चुका आहेत, एका नव्या गणित चाचणीमुळे काही मॉडेलचे गुण ८ पर्यंत कमी झाले, आणि मेटाने LMArena वर उतरवलेले Llama 4 मॉडेल त्यांनी प्रसिद्ध केलेले मॉडेल नव्हते

चित्रण: tuput

मराठी

MMLU पुन्हा तपासणाऱ्या संशोधकांच्या अंदाजानुसार त्याच्या ६.४९ टक्के प्रश्नांत चुका आहेत. स्केल एआयमार्फत नेमलेल्या टिप्पणीकारांनी शाळेतील गणिताच्या १,२०५ नव्या समस्या लिहिल्या, आणि काही ओपन मॉडेलना सार्वजनिक GSM8K चाचणीपेक्षा त्यावर ८ गुणांपर्यंत कमी मिळाले. मेटाची Llama 4 ची प्रवेशिका मानवी पसंतीसाठी खास बदललेली होती हे त्यांनी अधिक स्पष्टपणे सांगायला हवे होते, असे LMArena ने म्हटले.

· · 7 मिनिटांचे वाचन

MMLU ही भाषा मॉडेलना गुण देण्यासाठी वापरली जाणारी ५७ विषयांची बहुपर्यायी परीक्षा आहे. जून २०२४ मध्ये १६ संशोधकांनी केलेल्या पुनर्तपासणीनुसार तिच्या अंदाजे ६.४९ टक्के प्रश्नांत चुका आहेत. व्हायरॉलॉजी विभागात त्यांनी तपासलेल्या १०० प्रश्नांपैकी ५७ मध्ये काही ना काही दोष होता. बेंचमार्क कसे जीर्ण होतात, प्रशिक्षण डेटामध्ये कसे झिरपतात किंवा त्यांच्यावर कशी चलाखी केली जाते याची नोंदलेली प्रकरणे, प्रत्येक आकडा कोणी मोजला, आणि बेंचमार्कचे स्वतःचे लेखक त्यांच्या मर्यादांबद्दल काय म्हणतात, हे पुढे आहे.

जेव्हा चाचणीला जागा उरत नाही

३ जून २०२४ पर्यंत MMLU चा अधिक कठीण उत्तराधिकारी असलेल्या MMLU-Pro च्या लेखकांनी लिहिले की अशा बेंचमार्कवरील कामगिरी “स्थिर होऊ लागली आहे.” MMLU-Pro मध्ये १२,०३२ प्रश्न आहेत आणि प्रत्येकाला दहा उत्तर पर्याय आहेत, म्हणजे MMLU पेक्षा तीन पट जास्त चुकीचे पर्याय. आठपैकी चारपेक्षा जास्त ओपन मॉडेलनी बरोबर सोडवलेले ५,८८६ MMLU प्रश्न त्याच्या निर्मात्यांनी वगळले, त्यामुळे त्यातील फक्त ६,८१० प्रश्न MMLU मधून आलेले आहेत आणि बाकीचे इतर स्रोतांतून. त्यांनी तपासलेल्या मॉडेलची अचूकता MMLU च्या तुलनेत १६ ते ३३ टक्क्यांनी घसरते आणि प्रश्नाच्या शब्दरचनेला असलेली संवेदनशीलता ४ ते ५ टक्क्यांवरून २ टक्क्यांवर येते, असे लेखक नोंदवतात. GPT-4o साठी ते नोंदवतात की टप्प्याटप्प्याने तर्क करण्यामुळे MMLU-Pro ५३.५ टक्क्यांवरून ७२.६ टक्क्यांवर गेले, पण MMLU फक्त ८७.२ टक्क्यांवरून ८८.७ टक्क्यांवर.

स्टॅनफोर्डचा २०२६ चा एआय इंडेक्स म्हणतो, “अनेक वर्षे आव्हानात्मक राहतील असे मानलेले मूल्यमापन काही महिन्यांत संतृप्त झाले आहे.” तो पुढे सांगतो की एआयसाठी कठीण असावी म्हणून रचलेल्या Humanity’s Last Exam चाचणीवर आघाडीच्या मॉडेलनी एका वर्षात ३० टक्के गुणांची वाढ मिळवली.

उत्तरपत्रिकेतील चुका

चुकीची उत्तरपत्रिका सर्वोत्तम संभाव्य गुणांना १०० टक्क्यांच्या खाली अडवून ठेवते. आर्यो प्रदीप्ता गेमा पहिले लेखक असलेल्या MMLU-Redux चमूने ५७ विषयांपैकी प्रत्येकातील १०० यादृच्छिक प्रश्न तपासले, म्हणजे १४,०४२ पैकी एकूण ५,७०० प्रश्न. त्यांनी समस्यांची वर्गवारी केली: अस्पष्ट प्रश्न, अस्पष्ट पर्याय, एकही बरोबर उत्तर नाही, अनेक बरोबर उत्तरे आणि चुकीची उत्तरकुंजी. व्हायरॉलॉजीचा रेकॉर्ड सर्वात वाईट होता, ५७ टक्के, ज्यात ३३ चुकीच्या उत्तरकुंज्या होत्या. तर्कदोष (लॉजिकल फॅलसीज) विषयात २६ टक्के, महाविद्यालयीन रसायनशास्त्रात २५ टक्के आणि व्यावसायिक कायद्यात १८ टक्के. ६.४९ टक्क्यांचा आकडा हा संपूर्ण चाचणीसाठीचा त्यांचा अंदाज आहे, नमुन्यावरून विस्तारलेला. ८,३४२ प्रश्न तपासले गेले नाहीत आणि त्यांचा प्रोटोकॉल “टिप्पणीकारांच्या वैयक्तिक पूर्वग्रहांना अजूनही बळी पडू शकतो” असे लेखक नमूद करतात.

गणिताच्या समस्यांचा नवा संच

GSM8K हा शाळास्तरावरील गणिताच्या शब्दसमस्यांचा संच आहे. १ मे २०२४ रोजी ह्यू झांग आणि सहकाऱ्यांनी GSM1k वर आधारित एक शोधनिबंध प्रसिद्ध केला; त्यात मानवी टिप्पणीकारांनी लिहिलेल्या १,२०५ नव्या समस्या आहेत, त्या लिहिण्यासाठी कोणतेही भाषा मॉडेल वापरलेले नाही, आणि टिप्पणीकार स्केल एआयमार्फत नेमले गेले होते. GSM1k वर काही मॉडेलची अचूकता ८ गुणांपर्यंत घसरली. सर्वात मोठी तफावत Yi-6B-Chat मध्ये होती, ४३.७ टक्क्यांवरून ३५.७ टक्के. Phi आणि Mistral कुटुंबांनी जवळजवळ प्रत्येक आवृत्तीत GSM1k वर कमी गुण मिळवले, तर Gemini, GPT आणि Claude मॉडेलमध्ये ओव्हरफिटिंगची फारशी चिन्हे दिसली नाहीत. मॉडेल GSM8K ची उदाहरणे शब्दशः तयार करण्याची शक्यता किती आणि त्याच्या गुणांतील तफावत यांच्यात सहसंबंध असल्याचेही लेखकांना आढळले (स्पिअरमन आर-स्क्वेअर ०.३६). दोन्ही संच “फक्त अत्यंत सारखे आहेत, पण त्यांचे वितरण एकसारखे नाही” असा इशारा ते देतात. GSM1k प्रशिक्षण डेटामध्ये झिरपू नये म्हणून लेखकांनी सुरुवातीला तो रोखून धरला.

दूषण कसे मोजले जाते

दूषण (कंटामिनेशन) म्हणजे चाचणीचे साहित्य मॉडेलच्या प्रशिक्षण डेटामध्ये झिरपणे. तीन शोधनिबंध वेगवेगळ्या दिशांनी त्यावर हल्ला करतात.

चुन्युआन डेंग आणि सहकाऱ्यांनी मॉडेलना बहुपर्यायी प्रश्नातून लपवलेला चुकीचा उत्तर पर्याय ओळखायला सांगितले. MMLU वर ChatGPT आणि GPT-4 ने तो अचूक जुळवला ५२ टक्के आणि ५७ टक्के वेळा. लेखक याला प्रश्न आधी पाहिल्याचे चिन्ह मानतात, पण पद्धत थेट पुनर्प्राप्तीपेक्षा कमी विश्वासार्ह असल्याचे सांगतात. योनातान ओरेन आणि सहकाऱ्यांनी तपासले की मॉडेल बेंचमार्कचा मूळ प्रश्नक्रम फेरबदल केलेल्या क्रमांपेक्षा पसंत करते का. पाच सार्वजनिक मॉडेलवर ही चाचणी केली असता व्यापक दूषणाचे फारसे पुरावे आढळले नाहीत. रुईजी शू आणि सहकाऱ्यांनी परप्लेक्सिटी आणि n-ग्रॅम गुणांचा वापर करून गणित चाचण्यांवर ३१ मॉडेल तपासली आणि चाचणी संचाच्या गैरवापराची लक्षणीय उदाहरणे नोंदवली. मॉडेल बनवणाऱ्यानेच जवळजवळ प्रत्येक चाचणी चालवली अशा प्रकरणासाठी ऑन-डिव्हाइस मॉडेलवरील आमचा लेख पहा.

HumanEval पासून तारखा असलेल्या समस्यांपर्यंत

LiveCodeBench १२ मार्च २०२४ रोजी HumanEval सारख्या जुन्या कोडिंग चाचण्यांना पर्याय म्हणून प्रसिद्ध झाले; ते LeetCode, AtCoder आणि Codeforces मधील समस्या घेते आणि प्रत्येक कधी प्रसिद्ध झाली ते नोंदवते, त्यामुळे मॉडेलची चाचणी फक्त त्याच्या प्रशिक्षण मर्यादेनंतर प्रसिद्ध झालेल्या समस्यांवर करता येते. ऑगस्ट २०२३ नंतर प्रसिद्ध झालेल्या LeetCode समस्यांवर DeepSeek च्या कोड मॉडेलची कामगिरी तीव्रतेने घसरल्याचे त्याचे लेखक नोंदवतात. ते लिहितात की HumanEval हा “लहान आणि स्वतंत्र प्रोग्रामिंग समस्यांचा सोपा बेंचमार्क आहे, आणि म्हणून त्यावर ओव्हरफिट करणे सोपे आहे.” ते आणखी सांगतात की हा बेंचमार्क फक्त पायथॉन व्यापतो आणि फक्त समस्या निवडण्याच्या पद्धतीमुळे गुण १ ते १.५ टक्क्यांनी हलतात, म्हणून मॉडेलमधील लहान फरकांना फारसा अर्थ नाही.

मानवाने गाळलेला सॉफ्टवेअर कामांचा संच, SWE-bench Verified वरही तीच छाननी झाली. Epoch AI ने ३ सप्टेंबर २०२६ रोजी त्याला “सदोष” दर्जा दिला. ते ओपनएआयच्या २३ फेब्रुवारी २०२६ च्या ऑडिटचा संदर्भ देते, ज्याने २७.६ टक्के कामे तपासली आणि त्यापैकी ५९.४ टक्क्यांमध्ये योग्य दुरुस्ती नाकारणाऱ्या चाचण्या आढळल्या, म्हणजे सर्व कामांच्या किमान १६.४ टक्के. Epoch म्हणते की २० टक्क्यांपेक्षा जास्त प्रश्नांत गुण देण्याच्या समस्या असल्याबद्दल त्यांना वाजवी खात्री आहे, आणि सर्व कामे व उपाय आता सार्वजनिक आहेत. आमचा कोडिंग एजंटवरील वृत्तान्त उत्तीर्ण पॅचेसचा देखभालकर्त्यांनी केलेला आढावा आणि स्केल एआयचे SWE-Bench Pro बोर्ड यांबद्दल आहे.

LMArena वरील Llama 4 ची प्रवेशिका

मेटाच्या ५ एप्रिल २०२५ च्या Llama 4 घोषणेत म्हटले होते की Llama 4 Maverick सोबत “एक प्रायोगिक चॅट आवृत्ती” आली, जिने LMArena, मानवी पसंतीच्या मतांवर आधारित क्रमवारी, येथे १४१७ चा एलो मिळवला. ७ एप्रिल रोजी मेटाचे अधिकारी अहमद अल-दहले यांनी मेटाने चाचणी संचांवर प्रशिक्षण दिल्याचा दावा “अगदीच खरा नाही” असे म्हटले, असे टेकक्रंचने नोंदवले.

LMArena ने ८ एप्रिल रोजी स्वतःचे निवेदन प्रसिद्ध केले. त्यात म्हटले होते की मेटाने धोरणाचा लावलेला अर्थ “मॉडेल पुरवठादारांकडून आमच्या अपेक्षेशी जुळत नव्हता,” आणि Llama-4-Maverick-03-26-Experimental हे मानवी पसंतीसाठी ऑप्टिमाइझ करण्यासाठी बनवलेले खास तयार केलेले मॉडेल होते हे मेटाने अधिक स्पष्टपणे सांगायला हवे होते. त्याने पुनरावलोकनासाठी २,००० किंवा त्याहून अधिक सामन्यांचे निकाल प्रसिद्ध केले आणि धोरणे अद्ययावत करत असल्याचे सांगितले.

२९ एप्रिल २०२५ रोजी शिवालिका सिंग आणि सहकाऱ्यांनी “द लीडरबोर्ड इल्युजन” प्रसिद्ध केले. Llama 4 च्या प्रकाशनाआधी Arena वर मेटाचे तब्बल २७ खासगी प्रकार होते असे ते मोजते, आणि गुगल आणि ओपनएआयला चाचणी प्रॉम्प्टपैकी अनुक्रमे १९.२ टक्के आणि २०.४ टक्के मिळाले, तर ८३ ओपन-वेट मॉडेलना मिळून २९.७ टक्के, असा अंदाज मांडते. एका फाइन-ट्यूनिंग चाचणीत, ७० टक्के Arena डेटा असलेल्या मिश्रणावर प्रशिक्षित ७ अब्ज पॅरामीटरच्या मॉडेलने Arena-Hard प्रॉम्प्ट संचावरील आपले विजयाचे प्रमाण २३.५ टक्क्यांवरून ४९.९ टक्क्यांवर नेले, म्हणजे ११२.३ टक्क्यांची सापेक्ष वाढ, तर त्याचा MMLU गुण ६६.५ टक्क्यांवरून ६५.९ टक्क्यांवर घसरला. लेखक म्हणतात की मेटाबद्दलची त्यांची गणना सावध आहे, खासगी प्रकारांचे गुण त्यांना दिसत नाहीत, आणि अनेक लेखक Cohere मध्ये काम करतात हे ते जाहीर करतात. गुण मागे घेण्यावर बंदी आणि प्रत्येक पुरवठादारामागे खासगी प्रकारांवर जाहीर मर्यादा घालण्याची ते शिफारस करतात.

Arena ने ९ मे २०२५ रोजी उत्तर दिले. ते शोधनिबंधातील ओपन मॉडेलच्या वाट्याला आक्षेप घेते आणि २७ एप्रिलच्या आपल्या आकडेवारीत ओपन मॉडेल ४०.९ टक्के असल्याचे सांगते. प्रकाशनपूर्व चाचणीतील फायद्यांचा शोधनिबंधातील आलेख हे Arena डेटाशी संबंध नसलेले सिम्युलेशन होते, आणि फाइन-ट्यूनिंग चाचणीत मॉडेलने गुण दिलेला ५०० प्रॉम्प्टचा स्थिर बेंचमार्क वापरला होता, असेही ते म्हणते. आपले प्रकाशनपूर्व चाचणी धोरण १ मार्च २०२४ पासून सार्वजनिक आहे असेही ते म्हणाले, आणि अनेक प्रकाशनपूर्व प्रकारांना परवानगी देण्याचे आणि सुरुवातीच्या गुणांवर तात्पुरते असे लेबल लावण्याचे आश्वासन दिले.

प्रतिकार करण्यासाठी बनवलेल्या परीक्षा, आणि त्यांचे स्वतःचे ऑडिट

Humanity’s Last Exam (HLE) २४ जानेवारी २०२५ रोजी २,५०० प्रश्नांसह प्रसिद्ध झाली. प्रत्येक प्रश्न आघाडीच्या मॉडेलवर तपासला गेला आणि त्यांनी तो बरोबर सोडवला तर नाकारला गेला. शोधनिबंधाच्या तक्त्यानुसार फक्त मजकूर असलेल्या प्रश्नांवर आठ मॉडेलमध्ये सर्वोत्तम o3-mini (high) १३.४ टक्क्यांवर आहे, आणि ओव्हरफिटिंग तपासण्यासाठी एक खासगी राखीव संच आहे. २३ जुलै २०२५ रोजी FutureHouse ने साहित्य-शोध एजंटच्या मदतीने रसायनशास्त्र आणि जीवशास्त्रातील ३२१ फक्त मजकूर प्रश्न तपासले, त्याच्या १५० निष्कर्षांचे तज्ज्ञांकडून पुनरावलोकन करून घेतले, आणि २९ टक्के (अधिक किंवा उणे ३.७ गुण) प्रश्नांची उत्तरे समवयस्क-पुनरावलोकित साहित्याशी थेट विसंगत असल्याचा अंदाज मांडला. FutureHouse च्या अद्ययावतीनुसार HLE चमूच्या स्वतःच्या पाठपुराव्यात तशाच उपसंचातील सुमारे १८ टक्के प्रश्न समस्याग्रस्त आढळले, आणि तीन तज्ज्ञ पुनरावलोकनकर्त्यांपैकी किमान एकाची २५ टक्के प्रश्नांवर असहमती होती. चमू क्रमाक्रमाने सुधारणा करण्याची योजना आखत आहे.

ARC-AGI २०१९ मध्ये फ्रान्स्वा शोले यांनी मांडले; ते माणसांना सुलभ आणि एआयला कठीण असावेत अशा कोड्यांचा संच आहे. १७ मे २०२५ च्या ARC-AGI-2 शोधनिबंधात ४०७ सहभागींसह मानवी चाचणीची नोंद आहे. १४ मे २०२५ पर्यंतचा त्याचा तक्ता अर्ध-खासगी संचावरील सर्वोत्तम गुण ३.०% देतो. ५% पेक्षा कमी अचूकता सामान्यतः अर्थपूर्ण मानली जात नाही, असे लेखक म्हणतात. १ मे २०२६ च्या अहवालात NIST च्या चाचणी केंद्र CAISI ने, जे त्या संचाला “राखीव आणि दूषणमुक्त” म्हणते, त्यावर GPT-5.5 साठी ७९ टक्के आणि अँथ्रोपिकच्या Opus 4.6 साठी ६३ टक्के मोजले. त्या अहवालातील बाकीचा भाग चिनी मॉडेलवरील आमच्या लेखात आहे. CAISI म्हणते की त्याचे आकडे कामांमधील सरासरी आहेत, जी बेंचमार्कच्या अधिकृत गुणदान पद्धतीपेक्षा वेगळी आहे.

Share
Copied!

स्रोत आणि पुढील वाचन

  1. Wang and others, MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark (arXiv:2406.01574, 3 June 2024)
  2. Gema and others, Are We Done with MMLU? (arXiv:2406.04127, 6 June 2024)
  3. Zhang and others, A Careful Examination of Large Language Model Performance on Grade School Arithmetic (arXiv:2405.00332, 1 May 2024)
  4. Deng and others, Investigating Data Contamination in Modern Benchmarks for Large Language Models (arXiv:2311.09783, NAACL 2024)
  5. Oren and others, Proving Test Set Contamination in Black Box Language Models (arXiv:2310.17623, 26 October 2023)
  6. Xu and others, Benchmarking Benchmark Leakage in Large Language Models (arXiv:2404.18824, 29 April 2024)
  7. Jain and others, LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code (arXiv:2403.07974, 12 March 2024)
  8. Epoch AI: Benchmark review, SWE-bench Verified (3 September 2026)
  9. Meta AI: The Llama 4 herd (5 April 2025)
  10. TechCrunch: Meta exec denies the company artificially boosted Llama 4's benchmark scores (7 April 2025)
  11. LMArena statement on Llama 4, posted on X and reproduced by Simon Willison (8 April 2025)
  12. Singh and others, The Leaderboard Illusion (arXiv:2504.20879, 29 April 2025)
  13. Arena (formerly LMArena): Our Response to 'The Leaderboard Illusion' Writeup (9 May 2025, updated 13 June 2025)
  14. Stanford HAI: 2026 AI Index Report, Technical Performance
  15. Phan and others, Humanity's Last Exam (arXiv:2501.14249, 24 January 2025; version 11, 28 July 2026)
  16. FutureHouse: About 30% of Humanity's Last Exam chemistry/biology answers are likely wrong (23 July 2025)
  17. Chollet and others, ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems (arXiv:2505.11831, 17 May 2025)
  18. NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)

हा लेख AI साधनांच्या मदतीने संशोधित आणि लिहिला गेला असून अचूकतेसाठी संपादित केला आहे. हा केवळ सर्वसाधारण माहिती आणि चर्चेसाठी आहे, व्यावसायिक सल्ला नाही. आमचे संपादकीय मानक आणि अस्वीकरण पाहा. चूक आढळली? आम्हाला कळवा.

#ai benchmarks#benchmark contamination#mmlu#gsm8k#swe-bench#lmarena#humanity's last exam#arc-agi

आवडलं? पुढचा लेख मिळवा.

एका वेळी एक चांगला लेख, थेट तुमच्या इनबॉक्समध्ये. स्पॅम नाही, हवं तेव्हा थांबवा.

याच विभागात आणखी: कृत्रिम बुद्धिमत्ता
Scale च्या SWE-Bench Pro फलकावर सर्वोत्तम कोडिंग एजंट ६१.५% वर आहे, चाचण्या पास होणाऱ्या अनेक दुरुस्त्या देखभालकर्ते नाकारतात, आणि METR म्हणते की तिची ताजी चाचणी एजंट किती वेळ वाचवतात हे दाखवू शकत नाही
बेंचमार्क म्हणतात की एजंट प्रबळ आहेत. देखभालकर्ते, एक यादृच्छिक चाचणी आणि घटना अहवालांचा ढीग म्हणतात की चित्र त्यापेक्षा संकुचित आहे. प्रत्येक आकडा प्रत्यक्षात काय मोजतो ते येथे आहे.
मिस्ट्रलच्या १ ट्रिलियन पॅरामीटरच्या ले चोंकने स्वतंत्र एआय निर्देशांकावर ३८ गुण मिळवले, ओपन मॉडेलमध्ये आठवा क्रमांक, आणि त्याचे वेट्स अजून प्रसिद्धही झालेले नाहीत
फ्रान्सच्या मिस्ट्रलने ट्रिलियन पॅरामीटरचे मॉडेल ऑनलाइन आणले आहे आणि डाउनलोड करता येणारे वेट्स याच महिन्यात येतील असे सांगितले आहे. बाहेरचे परीक्षक त्याला चीनबाहेरचे सर्वोत्तम ओपन मॉडेल आणि ओपन मॉडेलमध्ये आठवे ठरवतात, आणि त्याच्या आकाराबद्दल मिस्ट्रलचे स्वतःचे आकडेही सगळे जुळत नाहीत.
२०२६ मध्ये सर्वोच्च न्यायालयाच्या दोन निकालांनी बनावट एआय उद्धरणांवर उभे असलेले आदेश रद्द केले, तर भारतीय न्यायालये भाषांतर आणि शब्दांकनासाठी एआय वापरतात आणि न्यायालयाचे एआय नियमांचे मसुदे अजून अंतिम झालेले नाहीत
संसदेतील उत्तरे आणि न्यायालयीन नोंदी दाखवतात की कोणती एआय साधने प्रत्यक्ष चालू आहेत, कोणती अजून चाचणी टप्प्यात आहेत, आणि न्यायाधीशांना त्यांच्यासोबत काय करण्यास मनाई आहे. काल्पनिक निवाडे आदेशात शिरले तर काय होते हे सर्वोच्च न्यायालयाचे तीन आदेश दाखवतात.
← सर्व लेख