చిత్రణ: tuput
తెలుగు
MMLUను మళ్లీ తనిఖీ చేసిన పరిశోధకులు దాని ప్రశ్నల్లో 6.49%లో లోపాలు ఉన్నాయని అంచనా వేశారు. Scale AI ద్వారా నియమించిన అన్నోటేటర్లు 1,205 కొత్త పాఠశాల స్థాయి గణిత సమస్యలు రాశారు, వాటిపై కొన్ని ఓపెన్ మోడళ్లు పబ్లిక్ GSM8K పరీక్షలో కంటే 8 పాయింట్ల వరకు తక్కువ స్కోర్ చేశాయి. తన Llama 4 ఎంట్రీని మానవ ప్రాధాన్యత కోసం అనుకూలీకరించారని Meta మరింత స్పష్టంగా చెప్పి ఉండాల్సిందని LMArena అంది.
భాషా మోడళ్లకు స్కోర్ ఇవ్వడానికి వాడే 57 అంశాల బహుళ ఎంపిక పరీక్ష MMLUలో, 16 మంది పరిశోధకులు 2024 జూన్లో చేసిన మళ్లీ తనిఖీ ప్రకారం, ప్రశ్నల్లో అంచనా 6.49%లో లోపాలు ఉన్నాయి. వైరాలజీ విభాగంలో వారు పరిశీలించిన 100 ప్రశ్నల్లో 57లో ఏదో ఒక సమస్య ఉంది. బెంచ్మార్క్లు అరిగిపోవడం, శిక్షణ డేటాలోకి లీక్ కావడం లేదా తమకు అనుకూలంగా తారుమారు చేయబడటం వంటి నమోదైన కేసులను, ప్రతి సంఖ్యను ఎవరు కొలిచారో, బెంచ్మార్క్ల సొంత రచయితలు వాటి పరిమితుల గురించి ఏం చెబుతున్నారో ఇక్కడ చూస్తాం.
పరీక్షకు చోటు చాలనప్పుడు
MMLUకు కఠినమైన వారసుడైన MMLU-Pro రచయితలు 2024 జూన్ 3 నాటికి, అలాంటి బెంచ్మార్క్లపై పనితీరు “స్థిరపడటం మొదలైంది” అని రాశారు. MMLU-Proలో 12,032 ప్రశ్నలు ఉన్నాయి, ఒక్కొక్కదానికి పది జవాబు ఎంపికలు, అంటే MMLUలో కంటే మూడు రెట్లు ఎక్కువ తప్పు ఎంపికలు. ఎనిమిది ఓపెన్ మోడళ్లలో నాలుగుకు పైగా సరిగ్గా జవాబిచ్చిన 5,886 MMLU ప్రశ్నలను దాని నిర్మాతలు తొలగించారు, కాబట్టి దాని ప్రశ్నల్లో 6,810 మాత్రమే MMLU నుండి వచ్చాయి, మిగిలినవి ఇతర మూలాల నుండి వచ్చాయి. తాము పరీక్షించిన మోడళ్లపై MMLUతో పోలిస్తే కచ్చితత్వం 16% నుండి 33% తగ్గిందని, ప్రాంప్ట్ పదాలకు సున్నితత్వం 4 నుండి 5% నుండి 2%కి తగ్గిందని రచయితలు నివేదించారు. GPT-4oకు దశలవారీ తార్కికం MMLU-Proను 53.5% నుండి 72.6%కి పెంచగా MMLUను 87.2% నుండి 88.7%కి మాత్రమే పెంచిందని వారు నివేదించారు.
“సంవత్సరాల పాటు సవాలుగా ఉండేలా ఉద్దేశించిన మూల్యాంకనాలు నెలల్లోనే సంతృప్తమవుతున్నాయి” అని స్టాన్ఫర్డ్ 2026 AI ఇండెక్స్ చెబుతోంది. AIకి కష్టంగా ఉండేలా రూపొందించిన Humanity’s Last Examలో ఫ్రాంటియర్ మోడళ్లు ఒక్క ఏడాదిలో 30 శాతం పాయింట్లు మెరుగుపడ్డాయని కూడా అది జతచేస్తోంది.
జవాబు కీలో లోపాలు
తప్పు జవాబు కీ ఉత్తమ సాధ్యమైన స్కోర్ను 100% కంటే కిందే పరిమితం చేస్తుంది. MMLU-Redux బృందం, ఆర్యో ప్రదీప్త గెమా మొదటి రచయితగా, 57 అంశాల్లో ప్రతిదాని నుండి 100 యాదృచ్ఛిక ప్రశ్నలను, మొత్తం 14,042లో 5,700 ప్రశ్నలను తనిఖీ చేసింది. సమస్యలను అస్పష్టమైన ప్రశ్నలు, అస్పష్టమైన ఎంపికలు, సరైన జవాబు లేనివి, అనేక సరైన జవాబులు ఉన్నవి, తప్పు కీలు అని వర్గీకరించారు. వైరాలజీ రికార్డు అత్యంత దారుణంగా 57%, 33 తప్పు కీలతో. తార్కిక దోషాల్లో 26%, కాలేజీ రసాయనశాస్త్రంలో 25%, ప్రొఫెషనల్ లాలో 18%. 6.49% అనేది నమూనా నుండి విస్తరించి మొత్తం పరీక్షకు వారు వేసిన అంచనా. 8,342 ప్రశ్నలు తనిఖీ కాకుండా మిగిలాయని, తమ ప్రోటోకాల్ “అన్నోటేటర్ల వ్యక్తిగత పక్షపాతాలకు ఇంకా గురయ్యే అవకాశం ఉందని” రచయితలు గమనించారు.
కొత్త గణిత సమస్యల సెట్
GSM8K అనేది పాఠశాల స్థాయి గణిత పద సమస్యల సెట్. 2024 మే 1న హ్యూ జాంగ్ మరియు సహచరులు GSM1k చుట్టూ నిర్మించిన పత్రాన్ని విడుదల చేశారు, అది Scale AI ద్వారా నియమించిన మానవ అన్నోటేటర్లు రాసిన 1,205 కొత్త సమస్యలు, వాటిని రాయడానికి ఏ భాషా మోడల్ను వాడలేదు. GSM1kలో కొన్ని మోడళ్లకు కచ్చితత్వం 8 పాయింట్ల వరకు పడిపోయింది. అతిపెద్ద తేడా Yi-6B-Chat, 43.7% నుండి 35.7%. Phi, Mistral కుటుంబాలు దాదాపు ప్రతి విడుదలలోనూ GSM1kలో తక్కువ స్కోర్ చేశాయి, Gemini, GPT, Claude మోడళ్లు ఓవర్ఫిట్టింగ్ సూచనలు తక్కువగా చూపాయి. ఒక మోడల్ GSM8K ఉదాహరణలను అక్షరం పొల్లు పోకుండా ఉత్పత్తి చేసే సంభావ్యతకు, దాని స్కోర్ అంతరానికి మధ్య పరస్పర సంబంధాన్ని (స్పియర్మన్ r-స్క్వేర్డ్ 0.36) కూడా రచయితలు కనుగొన్నారు. ఆ రెండు సెట్లు “అత్యంత సారూప్యమైనవి మాత్రమే, ఒకేలా పంపిణీ అయినవి కావు” అని వారు హెచ్చరిస్తున్నారు. GSM1k శిక్షణ డేటాలోకి లీక్ కాకుండా ఉండేందుకు రచయితలు మొదట దాన్ని నిలిపి ఉంచారు.
కలుషితాన్ని ఎలా కొలుస్తారు
కలుషితం అంటే పరీక్ష పదార్థం మోడల్ శిక్షణ డేటాలోకి లీక్ కావడం. మూడు పత్రాలు దాన్ని వేర్వేరు కోణాల్లో ఎదుర్కొంటాయి.
చున్యువాన్ డెంగ్ మరియు సహచరులు, బహుళ ఎంపిక ప్రశ్న నుండి దాచిన ఒక తప్పు జవాబు ఎంపికను ఊహించమని మోడళ్లను అడిగారు. MMLUలో ChatGPT, GPT-4 దాన్ని 52%, 57% సార్లు ఖచ్చితంగా సరిపోల్చాయి. ఇది మోడల్ ఆ డేటాకు గురైందనడానికి సంకేతమని రచయితలు భావిస్తారు, కానీ ప్రత్యక్షంగా రాబట్టడం కంటే ఈ పద్ధతి తక్కువ నమ్మదగినదంటారు. ఒక మోడల్ బెంచ్మార్క్ అసలు ప్రశ్నల క్రమాన్ని కలగలిపిన వెర్షన్ల కంటే ఇష్టపడుతుందో లేదో యోనాతాన్ ఓరెన్ మరియు సహచరులు పరీక్షించారు. ఐదు పబ్లిక్ మోడళ్లపై వర్తింపజేసినప్పుడు, విస్తృత కలుషితానికి ఆధారం పెద్దగా దొరకలేదు. పెర్ప్లెక్సిటీ, n-గ్రామ్ స్కోర్లను వాడి గణిత పరీక్షలపై 31 మోడళ్లను రుయ్జీ షు మరియు సహచరులు తనిఖీ చేసి, పరీక్ష సెట్ దుర్వినియోగం గణనీయమైన ఉదాహరణలను నివేదించారు. మోడల్ తయారీదారే దాదాపు ప్రతి పరీక్షను నడిపిన ఒక కేసు కోసం, పరికరంలోనే నడిచే మోడళ్లపై మా పరిశీలన చూడండి.
HumanEval నుండి తేదీలున్న సమస్యల వరకు
HumanEval వంటి పాత కోడింగ్ పరీక్షలకు బదులుగా 2024 మార్చి 12న పోస్ట్ చేసిన LiveCodeBench, LeetCode, AtCoder, Codeforces నుండి సమస్యలను తీసుకుని ప్రతిదీ ఎప్పుడు ప్రచురితమైందో నమోదు చేస్తుంది, దీనివల్ల మోడల్ శిక్షణ కటాఫ్ తర్వాత విడుదలైన సమస్యలపై మాత్రమే పరీక్షించవచ్చు. 2023 ఆగస్టు తర్వాత విడుదలైన LeetCode సమస్యలపై DeepSeek కోడ్ మోడళ్లు తీవ్రంగా పడిపోయాయని దాని రచయితలు నివేదించారు. HumanEval “చిన్న, ఏకాకి ప్రోగ్రామింగ్ సమస్యలున్న సులభమైన బెంచ్మార్క్, కాబట్టి ఓవర్ఫిట్ కావడం సులభం” అని వారు రాశారు. ఆ బెంచ్మార్క్ పైథాన్ను మాత్రమే కవర్ చేస్తుందని, సమస్యల నమూనా మాత్రమే స్కోర్లను 1 నుండి 1.5% కదిలిస్తుందని, కాబట్టి మోడళ్ల మధ్య చిన్న అంతరాలకు అర్థం తక్కువని వారు జతచేస్తున్నారు.
మనుషులు ఫిల్టర్ చేసిన సాఫ్ట్వేర్ టాస్క్ల సెట్ SWE-bench Verified కూడా అదే పరిశీలనకు గురైంది. Epoch AI దాన్ని 2026 సెప్టెంబర్ 3న “లోపభూయిష్టం” అని రేట్ చేసింది. ఇది 2026 ఫిబ్రవరి 23న OpenAI చేసిన ఆడిట్ను ఉటంకిస్తోంది; అది 27.6% టాస్క్లను కవర్ చేసి, వాటిలో 59.4%లో సరైన పరిష్కారాలను తిరస్కరించిన పరీక్షలను కనుగొంది, అంటే అన్ని టాస్క్లలో కనీసం 16.4%. 20%కి పైగా ప్రశ్నలకు స్కోరింగ్ సమస్యలు ఉన్నాయని తనకు సహేతుక విశ్వాసం ఉందని, ఇప్పుడు అన్ని టాస్క్లు, పరిష్కారాలు పబ్లిక్ అని Epoch చెబుతోంది. పాస్ అయ్యే ప్యాచ్లపై మెయింటెయినర్ల సమీక్షను, Scale AI SWE-Bench Pro బోర్డును కోడింగ్ ఏజెంట్లపై మా నివేదిక కవర్ చేస్తుంది.
LMArenaలో Llama 4 ఎంట్రీ
2025 ఏప్రిల్ 5 నాటి Meta Llama 4 ప్రకటన, Llama 4 Maverickతో పాటు “ఒక ప్రయోగాత్మక చాట్ వెర్షన్” వచ్చిందని, అది మానవ ప్రాధాన్యత ఓట్లపై నిర్మించిన ర్యాంకింగ్ అయిన LMArenaలో 1417 Elo స్కోర్ చేసిందని చెప్పింది. టెస్ట్ సెట్లపై Meta శిక్షణ ఇచ్చిందన్న వాదన “అస్సలు నిజం కాదు” అని Meta కార్యనిర్వాహకుడు అహ్మద్ అల్-దహ్లే ఏప్రిల్ 7న అన్నారని TechCrunch చెబుతోంది.
LMArena ఏప్రిల్ 8న తన సొంత ప్రకటన పోస్ట్ చేసింది. తన విధానానికి Meta చేసిన అన్వయం “మోడల్ ప్రొవైడర్ల నుండి మేము ఆశించేదానికి సరిపోలేదు” అని, Llama-4-Maverick-03-26-Experimental అనేది మానవ ప్రాధాన్యత కోసం ఆప్టిమైజ్ చేయడానికి నిర్మించిన అనుకూలీకరించిన మోడల్ అని Meta మరింత స్పష్టంగా చెప్పి ఉండాల్సిందని అది చెప్పింది. సమీక్ష కోసం 2,000 లేదా అంతకంటే ఎక్కువ బ్యాటిల్ ఫలితాలను విడుదల చేసి, తన విధానాలను నవీకరిస్తున్నట్టు చెప్పింది.
2025 ఏప్రిల్ 29న శివాలిక సింగ్ మరియు సహచరులు “The Leaderboard Illusion” ప్రచురించారు. Llama 4 విడుదలకు ముందు Arenaలో Meta ప్రైవేట్ వేరియంట్లు 27 వరకు ఉన్నాయని అది లెక్కిస్తోంది, పరీక్ష ప్రాంప్ట్లలో Google, OpenAIలకు 19.2%, 20.4% దక్కగా 83 ఓపెన్-వెయిట్ మోడళ్లకు కలిపి 29.7% దక్కిందని అంచనా వేస్తోంది. ఫైన్-ట్యూనింగ్ పరీక్షలో, 70% Arena డేటా ఉన్న మిశ్రమంతో శిక్షణ పొందిన 7 బిలియన్ పారామీటర్ల మోడల్ Arena-Hard ప్రాంప్ట్ సెట్లో తన విజయ రేటును 23.5% నుండి 49.9%కి పెంచుకుంది, అంటే 112.3% సాపేక్ష లాభం, అదే సమయంలో దాని MMLU స్కోర్ 66.5% నుండి 65.9%కి జారింది. తమ Meta లెక్క సంప్రదాయకమైనదని, ప్రైవేట్ వేరియంట్ల స్కోర్లు తమకు కనిపించవని రచయితలు చెబుతున్నారు, అనేకమంది రచయితలు Cohereలో పనిచేస్తున్నారని వెల్లడిస్తున్నారు. స్కోర్ ఉపసంహరణపై నిషేధం, ప్రొవైడర్కు ప్రైవేట్ వేరియంట్లపై స్పష్టమైన పరిమితి విధించాలని వారు సిఫార్సు చేస్తున్నారు.
Arena 2025 మే 9న స్పందించింది. పత్రంలోని ఓపెన్ మోడళ్ల వాటాను అది వివాదం చేస్తూ, తన 27 ఏప్రిల్ గణాంకాల్లో ఓపెన్ మోడళ్లను 40.9%గా చూపింది. విడుదలకు ముందు పరీక్షల లాభాల పత్రం చార్ట్ Arena డేటాతో సంబంధం లేని ఒక సిమ్యులేషన్ అని, ఫైన్-ట్యూనింగ్ పరీక్ష ఒక మోడల్ తీర్పు చెప్పిన స్థిరమైన 500 ప్రాంప్ట్ల బెంచ్మార్క్ను ఉపయోగించిందని అది చెబుతోంది. విడుదలకు ముందు పరీక్షల విధానం 2024 మార్చి 1 నుండి పబ్లిక్గా ఉందని కూడా చెప్పి, అనేక విడుదల-పూర్వ వేరియంట్లను అనుమతిస్తామని, ప్రారంభ స్కోర్లను తాత్కాలికంగా లేబుల్ చేస్తామని హామీ ఇచ్చింది.
నిరోధించేలా నిర్మించిన పరీక్షలు, వాటి సొంత ఆడిట్లు
Humanity’s Last Exam (HLE) 2025 జనవరి 24న 2,500 ప్రశ్నలతో పోస్ట్ అయింది. ప్రతి ప్రశ్నను ఫ్రాంటియర్ మోడళ్లపై పరీక్షించి, అవి సరిగ్గా జవాబిస్తే తిరస్కరించారు. పత్రం పట్టిక టెక్స్ట్-మాత్రమే ప్రశ్నలపై ఎనిమిది మోడళ్లలో ఉత్తమంగా o3-mini (high)ను 13.4% వద్ద జాబితా చేస్తోంది, ఓవర్ఫిట్టింగ్ను ఒక ప్రైవేట్ హెల్డ్-అవుట్ సెట్ తనిఖీ చేస్తుంది. 2025 జూలై 23న, FutureHouse 321 టెక్స్ట్-మాత్రమే రసాయన, జీవశాస్త్ర ప్రశ్నలను సాహిత్య-శోధన ఏజెంట్తో తనిఖీ చేసింది, దాని 150 అవుట్పుట్లను నిపుణులతో సమీక్షింపజేసింది, 29% (ప్లస్ లేదా మైనస్ 3.7 పాయింట్లు) జవాబులు పీర్-రివ్యూ చేసిన సాహిత్యంతో ప్రత్యక్షంగా విభేదిస్తున్నాయని అంచనా వేసింది. అలాంటి ఉప సెట్లో దాదాపు 18% సమస్యాత్మకమని HLE బృందం సొంత ఫాలో-అప్ కనుగొన్నదని, ముగ్గురు నిపుణ సమీక్షకుల్లో కనీసం ఒకరు 25%తో విభేదించారని FutureHouse నవీకరణ చెబుతోంది. ఆ బృందం రోలింగ్ సవరణను ప్లాన్ చేస్తోంది.
2019లో ఫ్రాంకోయిస్ చోలెట్ ప్రవేశపెట్టిన ARC-AGI, మనుషులకు అందుబాటులో ఉండి AIకి కష్టంగా ఉండేలా ఉద్దేశించిన పజిల్స్ సెట్. 2025 మే 17 నాటి ARC-AGI-2 పత్రం 407 మంది పాల్గొన్న మానవ పరీక్షను నివేదిస్తోంది. 2025 మే 14 నాటికి దాని పట్టిక సెమీ-ప్రైవేట్ సెట్పై ఉత్తమ స్కోర్ను 3.0%గా జాబితా చేస్తోంది. 5% కంటే తక్కువ కచ్చితత్వాలను సాధారణంగా అర్థవంతంగా పరిగణించరని రచయితలు చెబుతున్నారు. ఆ సెట్ను “హెల్డ్-అవుట్, కలుషితం కానిది” అని పిలిచే NIST పరీక్షా కేంద్రం CAISI 2026 మే 1 నివేదికలో, దానిపై GPT-5.5కు 79%, Anthropic Opus 4.6కు 63% కొలిచింది. ఆ నివేదికలోని మిగిలిన భాగాన్ని చైనా మోడళ్లపై మా వ్యాసం కవర్ చేస్తుంది. తన గణాంకాలు టాస్క్లపై సగటు అని, అది బెంచ్మార్క్ అధికారిక స్కోరింగ్కు భిన్నమని CAISI చెబుతోంది.
మూలాలు మరియు మరింత చదవడానికి
- Wang and others, MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark (arXiv:2406.01574, 3 June 2024)
- Gema and others, Are We Done with MMLU? (arXiv:2406.04127, 6 June 2024)
- Zhang and others, A Careful Examination of Large Language Model Performance on Grade School Arithmetic (arXiv:2405.00332, 1 May 2024)
- Deng and others, Investigating Data Contamination in Modern Benchmarks for Large Language Models (arXiv:2311.09783, NAACL 2024)
- Oren and others, Proving Test Set Contamination in Black Box Language Models (arXiv:2310.17623, 26 October 2023)
- Xu and others, Benchmarking Benchmark Leakage in Large Language Models (arXiv:2404.18824, 29 April 2024)
- Jain and others, LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code (arXiv:2403.07974, 12 March 2024)
- Epoch AI: Benchmark review, SWE-bench Verified (3 September 2026)
- Meta AI: The Llama 4 herd (5 April 2025)
- TechCrunch: Meta exec denies the company artificially boosted Llama 4's benchmark scores (7 April 2025)
- LMArena statement on Llama 4, posted on X and reproduced by Simon Willison (8 April 2025)
- Singh and others, The Leaderboard Illusion (arXiv:2504.20879, 29 April 2025)
- Arena (formerly LMArena): Our Response to 'The Leaderboard Illusion' Writeup (9 May 2025, updated 13 June 2025)
- Stanford HAI: 2026 AI Index Report, Technical Performance
- Phan and others, Humanity's Last Exam (arXiv:2501.14249, 24 January 2025; version 11, 28 July 2026)
- FutureHouse: About 30% of Humanity's Last Exam chemistry/biology answers are likely wrong (23 July 2025)
- Chollet and others, ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems (arXiv:2505.11831, 17 May 2025)
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
ఈ వ్యాసం AI సాధనాల సహాయంతో పరిశోధించి రాయబడింది మరియు కచ్చితత్వం కోసం సవరించబడింది. ఇది సాధారణ సమాచారం మరియు చర్చ కోసం మాత్రమే, వృత్తిపరమైన సలహా కాదు. మా సంపాదకీయ ప్రమాణాలు మరియు నిరాకరణ చూడండి. తప్పు కనిపించిందా? మాకు తెలియజేయండి.
నచ్చిందా? తదుపరిది పొందండి.
ఒకసారి ఒక మంచి వ్యాసం, నేరుగా మీ ఇన్బాక్స్కు. స్పామ్ లేదు, ఎప్పుడైనా ఆపవచ్చు.