অলঙ্করণ: tuput
বাংলা
MMLU আবার যাচাই করা গবেষকরা অনুমান করেছেন এর ৬.৪৯% প্রশ্নে ভুল আছে। স্কেল এআই-এর মাধ্যমে নিয়োগ করা অ্যানোটেটররা স্কুলস্তরের ১,২০৫টি নতুন অঙ্ক লিখেছিলেন, আর কিছু ওপেন মডেল সেগুলোয় প্রকাশ্য GSM8K পরীক্ষার চেয়ে ৮ পয়েন্ট পর্যন্ত কম স্কোর করেছে। LMArena বলেছে, মেটার Llama 4 এন্ট্রি যে মানুষের পছন্দের জন্য কাস্টমাইজ করা ছিল তা মেটার আরও স্পষ্ট করা উচিত ছিল।
MMLU, ভাষা মডেলের স্কোর করতে ব্যবহৃত ৫৭ বিষয়ের একটি বহুনির্বাচনী পরীক্ষা, ১৬ জন গবেষকের ২০২৪ সালের জুনের পুনর্যাচাই অনুযায়ী তার আনুমানিক ৬.৪৯% প্রশ্নে ভুল আছে। ভাইরোলজি অংশে তাঁরা যে ১০০টি প্রশ্ন দেখেছিলেন, তার ৫৭টিতে সমস্যা ছিল। এই লেখায় আছে বেঞ্চমার্ক ক্ষয়ে যাওয়া, প্রশিক্ষণের তথ্যে ফাঁস হয়ে যাওয়া বা কৌশলে ব্যবহৃত হওয়ার নথিভুক্ত ঘটনাগুলো, কে কোন সংখ্যা মেপেছেন, আর বেঞ্চমার্কগুলোর নিজেদের নির্মাতারা তাদের সীমা নিয়ে কী বলেন।
যখন পরীক্ষায় আর জায়গা থাকে না
২০২৪ সালের ৩ জুনের মধ্যে MMLU-র আরও কঠিন উত্তরসূরি MMLU-Pro-র লেখকরা লিখেছিলেন যে এ ধরনের বেঞ্চমার্কে পারফরম্যান্স ‘সমতল হতে শুরু করেছে’। MMLU-Pro-তে ১২,০৩২টি প্রশ্ন, প্রতিটিতে দশটি উত্তর বিকল্প, অর্থাৎ MMLU-র চেয়ে তিন গুণ ভুল বিকল্প। এর নির্মাতারা MMLU-র ৫,৮৮৬টি প্রশ্ন বাদ দিয়েছেন, যেগুলোর উত্তর আটটি ওপেন মডেলের মধ্যে চারটির বেশি ঠিক দিয়েছিল, ফলে এর মাত্র ৬,৮১০টি প্রশ্ন MMLU থেকে এসেছে আর বাকিগুলো এসেছে অন্য সূত্র থেকে। লেখকরা জানান, তাঁদের পরীক্ষা করা মডেলগুলোয় MMLU-র তুলনায় নির্ভুলতা ১৬% থেকে ৩৩% কমেছে, আর প্রম্পটের শব্দচয়নের প্রতি সংবেদনশীলতা ৪ থেকে ৫% থেকে নেমে ২%-এ এসেছে। GPT-4o-র জন্য তাঁরা জানান ধাপে ধাপে যুক্তি MMLU-Pro-কে ৫৩.৫% থেকে ৭২.৬%-এ তুলেছে, কিন্তু MMLU-কে তুলেছে কেবল ৮৭.২% থেকে ৮৮.৭%-এ।
স্ট্যানফোর্ডের ২০২৬ সালের এআই ইনডেক্স বলছে, ‘বছরের পর বছর ধরে কঠিন থাকার কথা ভেবে বানানো মূল্যায়ন মাসের মধ্যে স্যাচুরেটেড হয়ে যাচ্ছে।’ এতে আরও আছে, এআইয়ের জন্য কঠিন করে বানানো পরীক্ষা Humanity’s Last Exam-এ সীমান্তের মডেলগুলো এক বছরে ৩০ শতাংশ পয়েন্ট এগিয়েছে।
উত্তরপত্রের ভুল
ভুল উত্তরপত্র সর্বোচ্চ সম্ভাব্য স্কোরকে ১০০%-এর নিচে বেঁধে দেয়। আরিও প্রদীপ্ত গেমাকে প্রথম লেখক করে MMLU-Redux দল ৫৭টি বিষয়ের প্রতিটি থেকে ১০০টি করে এলোমেলো প্রশ্ন যাচাই করেছে, ১৪,০৪২টির মধ্যে মোট ৫,৭০০টি। তাঁরা সমস্যাগুলো ভাগ করেছেন অস্পষ্ট প্রশ্ন, অস্পষ্ট বিকল্প, সঠিক উত্তর নেই, একাধিক সঠিক উত্তর আর ভুল উত্তরপত্রে। ভাইরোলজির রেকর্ড ছিল সবচেয়ে খারাপ, ৫৭%, ৩৩টি ভুল উত্তরপত্র সহ। যৌক্তিক ভ্রান্তিতে ২৬%, কলেজ রসায়নে ২৫% আর পেশাদার আইনে ১৮%। ৬.৪৯% হল পুরো পরীক্ষার জন্য তাঁদের অনুমান, নমুনা থেকে বিস্তার করে নেওয়া। লেখকরা উল্লেখ করেন যে ৮,৩৪২টি প্রশ্ন যাচাই করা হয়নি, আর তাঁদের পদ্ধতি ‘অ্যানোটেটরদের ব্যক্তিগত পক্ষপাতের প্রভাবে থাকতে পারে’।
অঙ্কের একটি নতুন সংকলন
GSM8K স্কুলস্তরের অঙ্কের গল্পভিত্তিক সমস্যার একটি সংকলন। ২০২৪ সালের ১ মে হিউ ঝাং ও সহকর্মীরা GSM1k-কে ঘিরে একটি গবেষণাপত্র প্রকাশ করেন, যাতে আছে স্কেল এআই-এর মাধ্যমে নিয়োগ করা মানুষ অ্যানোটেটরদের লেখা ১,২০৫টি নতুন সমস্যা, লিখতে কোনো ভাষা মডেল ব্যবহার করা হয়নি। GSM1k-তে কিছু মডেলের নির্ভুলতা ৮ পয়েন্ট পর্যন্ত কমে গিয়েছিল। সবচেয়ে বড় ব্যবধান Yi-6B-Chat-এ, ৪৩.৭% থেকে ৩৫.৭%। Phi আর Mistral পরিবার প্রায় প্রতিটি সংস্করণে GSM1k-তে কম স্কোর করে, আর Gemini, GPT ও Claude মডেলে ওভারফিটিংয়ের লক্ষণ ছিল সামান্য। লেখকরা আরও দেখেন, একটি মডেল GSM8K-র উদাহরণ হুবহু উগরে দিতে কতটা প্রবণ আর তার স্কোরের ব্যবধান, এই দুইয়ের মধ্যে একটি সম্পর্ক আছে (স্পিয়ারম্যান আর-স্কোয়ার্ড ০.৩৬)। তাঁরা সতর্ক করেন, দুটি সেট ‘কেবল খুব সদৃশ, অভিন্নভাবে বণ্টিত নয়’। GSM1k যাতে প্রশিক্ষণের তথ্যে ফাঁস না হয়, সে জন্য লেখকরা প্রথমে তা প্রকাশ করেননি।
দূষণ কীভাবে মাপা হয়
দূষণ (কনট্যামিনেশন) মানে পরীক্ষার উপাদান কোনো মডেলের প্রশিক্ষণের তথ্যে ফাঁস হয়ে যাওয়া। তিনটি গবেষণাপত্র এটিকে তিন দিক থেকে ধরেছে।
চুনিউয়ান দেং ও সহকর্মীরা মডেলদের বলেছিলেন একটি বহুনির্বাচনী প্রশ্ন থেকে ঢেকে দেওয়া একটি ভুল উত্তর বিকল্প আন্দাজ করতে। MMLU-তে ChatGPT আর GPT-4 তা হুবহু মেলাতে পেরেছিল ৫২% এবং ৫৭% ক্ষেত্রে। লেখকরা এটিকে ফাঁসের লক্ষণ হিসেবে পড়েন, কিন্তু পদ্ধতিটিকে সরাসরি উদ্ধারের চেয়ে কম নির্ভরযোগ্য বলেন। ইয়োনাটান ওরেন ও সহকর্মীরা পরীক্ষা করেছিলেন, একটি মডেল কোনো বেঞ্চমার্কের মূল প্রশ্নক্রম এলোমেলো করা সংস্করণের চেয়ে বেশি পছন্দ করে কিনা। পাঁচটি প্রকাশ্য মডেলে প্রয়োগ করে পরীক্ষাটি ব্যাপক দূষণের প্রমাণ সামান্যই পেয়েছে। রুইজি শু ও সহকর্মীরা পারপ্লেক্সিটি আর এন-গ্রাম স্কোর দিয়ে অঙ্কের পরীক্ষায় ৩১টি মডেল যাচাই করে পরীক্ষার সেটের উল্লেখযোগ্য অপব্যবহারের ঘটনা জানিয়েছেন। মডেলের নির্মাতা প্রায় প্রতিটি পরীক্ষা নিজে চালিয়েছে, এমন একটি ঘটনার জন্য দেখুন ডিভাইসে চলা মডেল নিয়ে আমাদের লেখা।
HumanEval থেকে তারিখ দেওয়া সমস্যায়
২০২৪ সালের ১২ মার্চ HumanEval-এর মতো পুরনো কোডিং পরীক্ষার বদলে প্রকাশিত LiveCodeBench নেয় LeetCode, AtCoder আর Codeforces থেকে সমস্যা, আর প্রতিটি কবে প্রকাশিত হয়েছিল তা লিখে রাখে, ফলে একটি মডেলকে পরীক্ষা করা যায় শুধু তার প্রশিক্ষণের সীমার পরে প্রকাশিত সমস্যায়। এর লেখকরা জানান, ২০২৩ সালের আগস্টের পরে প্রকাশিত LeetCode সমস্যায় DeepSeek-এর কোড মডেলগুলোর স্কোর তীব্রভাবে নেমে গিয়েছিল। তাঁরা লেখেন, HumanEval হল ‘ছোট ও বিচ্ছিন্ন প্রোগ্রামিং সমস্যা নিয়ে একটি সহজতর বেঞ্চমার্ক, তাই তাতে ওভারফিট করা সহজ’। তাঁরা যোগ করেন, বেঞ্চমার্কটি শুধু পাইথন ধরে, আর কেবল সমস্যা বাছাইয়ের ধরনেই স্কোর ১ থেকে ১.৫% নড়ে যায়, তাই মডেলগুলোর মধ্যে ছোট ব্যবধানের মানে সামান্য।
SWE-bench Verified, মানুষের ছাঁকা সফটওয়্যার কাজের একটি সেট, একই ধরনের যাচাইয়ের মুখে পড়েছে। এপোক এআই ২০২৬ সালের ৩ সেপ্টেম্বর একে ‘ত্রুটিপূর্ণ’ শ্রেণিতে রেখেছে। তারা ওপেনএআই-এর ২০২৬ সালের ২৩ ফেব্রুয়ারির অডিটের কথা বলে, যা ২৭.৬% কাজ দেখেছিল এবং তার ৫৯.৪%-এ পেয়েছিল এমন পরীক্ষা, যা সঠিক সমাধান প্রত্যাখ্যান করত, অর্থাৎ সব কাজের অন্তত ১৬.৪%। এপোক বলে, ২০%-এর বেশি প্রশ্নে স্কোরিংয়ের সমস্যা আছে, এ নিয়ে তাদের যুক্তিসংগত আস্থা আছে, আর এখন সব কাজ ও সমাধান প্রকাশ্য। কোডিং এজেন্ট নিয়ে আমাদের প্রতিবেদনে আছে উত্তীর্ণ প্যাচগুলোর উপর রক্ষণাবেক্ষণকারীদের পর্যালোচনা এবং স্কেল এআই-এর SWE-Bench Pro বোর্ড।
LMArena-য় Llama 4 এন্ট্রি
মেটার ২০২৫ সালের ৫ এপ্রিলের Llama 4 ঘোষণায় বলা হয়েছিল, Llama 4 Maverick-এর সঙ্গে আছে ‘একটি পরীক্ষামূলক চ্যাট সংস্করণ’, যা মানুষের পছন্দের ভোটে গড়া র্যাংকিং LMArena-য় ১৪১৭ Elo স্কোর করেছে। ৭ এপ্রিল মেটার নির্বাহী আহমদ আল-দাহলে টেকক্রাঞ্চের বিবরণ অনুযায়ী মেটা পরীক্ষার সেটে প্রশিক্ষণ দিয়েছে, এই দাবিকে ‘সম্পূর্ণ অসত্য’ বলেন।
LMArena ৮ এপ্রিল নিজেদের বিবৃতি দেয়। তাতে বলা হয়, মেটা তাদের নীতির যে ব্যাখ্যা করেছে তা ‘মডেল সরবরাহকারীদের কাছ থেকে আমরা যা আশা করি তার সঙ্গে মেলেনি’, আর মেটার আরও স্পষ্ট করা উচিত ছিল যে Llama-4-Maverick-03-26-Experimental ছিল মানুষের পছন্দের জন্য সর্বোত্তম করে বানানো একটি কাস্টমাইজ করা মডেল। তারা ২,০০০ বা তার বেশি লড়াইয়ের ফল পর্যালোচনার জন্য প্রকাশ করে এবং জানায় তারা নীতি হালনাগাদ করছে।
২০২৫ সালের ২৯ এপ্রিল শিভালিকা সিং ও সহকর্মীরা ‘দ্য লিডারবোর্ড ইলিউশন’ প্রকাশ করেন। এতে গোনা হয়েছে Llama 4 ছাড়ার আগে অ্যারেনায় মেটার ২৭টি পর্যন্ত গোপন সংস্করণ, এবং অনুমান করা হয়েছে গুগল ও ওপেনএআই পেয়েছে পরীক্ষার প্রম্পটের যথাক্রমে ১৯.২% ও ২০.৪%, আর ৮৩টি ওপেন-ওয়েট মডেল মিলিয়ে ২৯.৭%। একটি ফাইন-টিউনিং পরীক্ষায় ৭ বিলিয়ন প্যারামিটারের একটি মডেল, ৭০% অ্যারেনা তথ্যের মিশ্রণে প্রশিক্ষিত হয়ে, Arena-Hard প্রম্পট সেটে তার জয়ের হার ২৩.৫% থেকে বাড়িয়ে ৪৯.৯% করেছে, ১১২.৩% আপেক্ষিক বৃদ্ধি, অথচ তার MMLU স্কোর ৬৬.৫% থেকে সরে ৬৫.৯%-এ নেমেছে। লেখকরা মেটার হিসাবকে রক্ষণশীল বলেন, বলেন গোপন সংস্করণগুলোর স্কোর তাঁরা দেখতে পান না, এবং জানিয়ে রাখেন যে কয়েকজন লেখক কোহিয়ারে কাজ করেন। তাঁরা স্কোর প্রত্যাহার নিষিদ্ধ করতে এবং প্রতি সরবরাহকারীর গোপন সংস্করণের একটি ঘোষিত সীমা বেঁধে দিতে সুপারিশ করেন।
অ্যারেনা জবাব দেয় ২০২৫ সালের ৯ মে। তারা গবেষণাপত্রের ওপেন-মডেল অংশের হিসাবে আপত্তি জানায়, ২৭ এপ্রিলের পরিসংখ্যানে ওপেন মডেলকে ৪০.৯% বলে। তারা বলে, প্রি-রিলিজ পরীক্ষার ফলে লাভের যে চার্ট গবেষণাপত্রে আছে তা ছিল একটি সিমুলেশন, অ্যারেনার তথ্যের সঙ্গে সম্পর্কহীন, আর ফাইন-টিউনিং পরীক্ষা ব্যবহার করেছে মডেলের বিচার করা একটি স্থির ৫০০-প্রম্পটের বেঞ্চমার্ক। তারা এ-ও বলে যে তাদের প্রি-রিলিজ পরীক্ষার নীতি ২০২৪ সালের ১ মার্চ থেকে প্রকাশ্য, এবং প্রতিশ্রুতি দেয় একাধিক প্রি-রিলিজ সংস্করণ অনুমোদন করার ও আগের স্কোরকে সাময়িক বলে চিহ্নিত করার।
প্রতিরোধ করতে বানানো পরীক্ষা, আর তাদের নিজেদের অডিট
Humanity’s Last Exam (HLE) প্রকাশিত হয় ২০২৫ সালের ২৪ জানুয়ারি, ২,৫০০ প্রশ্ন নিয়ে। প্রতিটি সীমান্তের মডেলগুলোর বিরুদ্ধে পরীক্ষা করা হয়েছে, আর মডেলগুলো সঠিক উত্তর দিলে তা বাতিল। গবেষণাপত্রের সারণিতে আটটি মডেলের সেরা হিসেবে শুধু টেক্সট প্রশ্নে o3-mini (high) ১৩.৪%, আর ওভারফিটিং ধরতে আছে একটি গোপন আলাদা সেট। ২০২৫ সালের ২৩ জুলাই ফিউচারহাউস সাহিত্য-অনুসন্ধানকারী একটি এজেন্ট দিয়ে শুধু টেক্সটের ৩২১টি রসায়ন ও জীববিজ্ঞানের প্রশ্ন যাচাই করে, ১৫০টি ফল বিশেষজ্ঞদের দিয়ে পর্যালোচনা করায়, এবং অনুমান করে যে ২৯% (প্লাস-মাইনাস ৩.৭ পয়েন্ট) প্রশ্নের উত্তর সমকক্ষ-পর্যালোচিত সাহিত্যের সঙ্গে সরাসরি সংঘাতে। ফিউচারহাউসের হালনাগাদ বলছে, HLE দলের নিজেদের পরের যাচাইয়ে একই রকম উপসেটের প্রায় ১৮% সমস্যাযুক্ত পাওয়া গেছে, আর তিনজন বিশেষজ্ঞ পর্যালোচকের অন্তত একজন ২৫% নিয়ে ভিন্নমত দিয়েছেন। দলটি ধাপে ধাপে সংশোধনের পরিকল্পনা করছে।
ARC-AGI, ২০১৯ সালে ফ্রাঁসোয়া শোলে প্রবর্তিত, ধাঁধার একটি সেট, যা মানুষের জন্য সহজলভ্য আর এআইয়ের জন্য কঠিন হওয়ার কথা। ২০২৫ সালের ১৭ মের ARC-AGI-2 গবেষণাপত্র ৪০৭ জন অংশগ্রহণকারীর মানব পরীক্ষার কথা জানায়। তার সারণি, ২০২৫ সালের ১৪ মে অনুযায়ী, আধা-গোপন সেটে সেরা স্কোর দেখায় ৩.০%। লেখকরা বলেন, ৫%-এর নিচের নির্ভুলতাকে সাধারণত অর্থপূর্ণ ধরা হয় না। ২০২৬ সালের ১ মের একটি প্রতিবেদনে NIST-এর পরীক্ষা কেন্দ্র CAISI, যারা ওই সেটকে বলেছে ‘আলাদা রাখা ও দূষণমুক্ত’, তাতে GPT-5.5-এর জন্য ৭৯% এবং অ্যানথ্রপিকের Opus 4.6-এর জন্য ৬৩% মেপেছে। ওই প্রতিবেদনের বাকিটা আছে চীনা মডেল নিয়ে আমাদের লেখায়। CAISI বলে তাদের সংখ্যা কাজগুলোর গড়, যা বেঞ্চমার্কের সরকারি স্কোরিং থেকে আলাদা।
সূত্র ও আরও পড়ার জন্য
- Wang and others, MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark (arXiv:2406.01574, 3 June 2024)
- Gema and others, Are We Done with MMLU? (arXiv:2406.04127, 6 June 2024)
- Zhang and others, A Careful Examination of Large Language Model Performance on Grade School Arithmetic (arXiv:2405.00332, 1 May 2024)
- Deng and others, Investigating Data Contamination in Modern Benchmarks for Large Language Models (arXiv:2311.09783, NAACL 2024)
- Oren and others, Proving Test Set Contamination in Black Box Language Models (arXiv:2310.17623, 26 October 2023)
- Xu and others, Benchmarking Benchmark Leakage in Large Language Models (arXiv:2404.18824, 29 April 2024)
- Jain and others, LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code (arXiv:2403.07974, 12 March 2024)
- Epoch AI: Benchmark review, SWE-bench Verified (3 September 2026)
- Meta AI: The Llama 4 herd (5 April 2025)
- TechCrunch: Meta exec denies the company artificially boosted Llama 4's benchmark scores (7 April 2025)
- LMArena statement on Llama 4, posted on X and reproduced by Simon Willison (8 April 2025)
- Singh and others, The Leaderboard Illusion (arXiv:2504.20879, 29 April 2025)
- Arena (formerly LMArena): Our Response to 'The Leaderboard Illusion' Writeup (9 May 2025, updated 13 June 2025)
- Stanford HAI: 2026 AI Index Report, Technical Performance
- Phan and others, Humanity's Last Exam (arXiv:2501.14249, 24 January 2025; version 11, 28 July 2026)
- FutureHouse: About 30% of Humanity's Last Exam chemistry/biology answers are likely wrong (23 July 2025)
- Chollet and others, ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems (arXiv:2505.11831, 17 May 2025)
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
এই লেখাটি AI সরঞ্জামের সহায়তায় গবেষণা ও রচনা করা হয়েছে এবং নির্ভুলতার জন্য সম্পাদনা করা হয়েছে। এটি কেবল সাধারণ তথ্য ও আলোচনার জন্য, পেশাদার পরামর্শ নয়। আমাদের সম্পাদকীয় মান ও দাবিত্যাগ দেখুন। কোনো ভুল চোখে পড়ল? আমাদের জানান।
ভালো লাগল? পরেরটিও পড়ুন।
একবারে একটি ভালো লেখা, সরাসরি আপনার ইনবক্সে। কোনো স্প্যাম নয়, যখন খুশি বন্ধ করতে পারেন।