رسم: tuput
العربية
يقدّر باحثون أعادوا فحص MMLU أن 6.49% من أسئلته فيها أخطاء. وكتب مدوّنون استأجرتهم Scale AI نحو 1205 مسائل رياضيات مدرسية جديدة، وسجّلت بعض النماذج المفتوحة عليها حتى 8 نقاط أقل مما سجّلته في اختبار GSM8K العلني. وقالت LMArena إن على Meta أن توضح أكثر أن مشاركتها بـLlama 4 كانت مخصصة لتفضيل البشر.
يحتوي MMLU، وهو امتحان اختيار من متعدد في 57 موضوعا يُستخدم لتقييم النماذج اللغوية، على أخطاء في نسبة تقدَّر بـ6.49% من أسئلته، بحسب إعادة فحص في يونيو 2024 أجراها 16 باحثا. وفي قسم علم الفيروسات كانت في 57 من 100 سؤال فحصوها مشكلة. وما يلي هو الحالات الموثقة لتآكل المعايير أو تسربها إلى بيانات التدريب أو التلاعب بها، ومن قاس كل رقم، وما يقوله مؤلفو المعايير أنفسهم عن حدودها.
حين ينفد المجال أمام الاختبار
في 3 يونيو 2024 كتب مؤلفو MMLU-Pro، وهو خلف أصعب لـMMLU، أن الأداء على معايير كهذه “بدأ يستقر عند مستوى ثابت”. ويضم MMLU-Pro 12,032 سؤالا بعشرة خيارات للإجابة، أي ثلاثة أضعاف الخيارات الخاطئة في MMLU. وقد حذف بناته 5,886 سؤالا من MMLU أجاب عنها أكثر من أربعة من ثمانية نماذج مفتوحة إجابة صحيحة، فلا يأتي من MMLU إلا 6,810 من أسئلته ويأتي الباقي من مصادر أخرى. ويذكر المؤلفون أن الدقة تنخفض بين 16% و33% مقارنة بـMMLU في النماذج التي اختبروها، وأن الحساسية لصياغة الطلب تنخفض من 4 إلى 5% إلى 2%. وبالنسبة إلى GPT-4o يذكرون أن التفكير خطوة بخطوة رفع MMLU-Pro من 53.5% إلى 72.6% لكنه رفع MMLU من 87.2% إلى 88.7% فقط.
ويقول مؤشر الذكاء الاصطناعي 2026 من ستانفورد: “التقييمات التي كان يُقصد أن تظل صعبة سنوات تتشبع في أشهر”. ويضيف أن النماذج الرائدة كسبت 30 نقطة مئوية في سنة واحدة على Humanity’s Last Exam، وهو اختبار صُمم ليكون صعبا على الذكاء الاصطناعي.
أخطاء في مفتاح الإجابات
مفتاح إجابات خاطئ يحصر أفضل درجة ممكنة دون 100%. فقد فحص فريق MMLU-Redux، وأول مؤلفيه أريو برادييبتا غيما، 100 سؤال عشوائي من كل موضوع من المواضيع الـ57، أي 5,700 سؤال من 14,042. وصنفوا المشكلات إلى أسئلة غير واضحة وخيارات غير واضحة وغياب إجابة صحيحة ووجود عدة إجابات صحيحة ومفاتيح خاطئة. وكان علم الفيروسات الأسوأ بنسبة 57%، مع 33 مفتاحا خاطئا. وبلغت المغالطات المنطقية 26% وكيمياء الكلية 25% والقانون المهني 18%. أما رقم 6.49% فهو تقديرهم للاختبار كله، مستقرأ من العينة. ويلاحظ المؤلفون أن 8,342 سؤالا لم تُفحص، وأن بروتوكولهم “قد يظل عرضة للتحيزات الشخصية للمدوّنين”.
مجموعة جديدة من مسائل الرياضيات
GSM8K مجموعة من مسائل الرياضيات اللفظية بمستوى المدرسة. وفي 1 مايو 2024 أصدر هيو تشانغ وزملاؤه ورقة قائمة على GSM1k، وهي 1,205 مسائل جديدة كتبها مدوّنون بشر استأجرتهم Scale AI، دون استخدام نموذج لغوي في كتابتها. وعلى GSM1k انخفضت الدقة حتى 8 نقاط في بعض النماذج. وكانت أكبر فجوة لـYi-6B-Chat، من 43.7% إلى 35.7%. وسجلت عائلتا Phi وMistral درجات أقل على GSM1k في أغلب الإصدارات كلها تقريبا، بينما لم تُظهر نماذج Gemini وGPT وClaude إلا قليلا من علامات الإفراط في التكيف. ووجد المؤلفون أيضا ارتباطا بين احتمال أن ينتج النموذج أمثلة GSM8K حرفيا وفجوة درجاته (r تربيع لسبيرمان قدره 0.36). ويحذرون من أن المجموعتين “متشابهتان جدا فقط، لكنهما غير متطابقتين في التوزيع”. وحجب المؤلفون GSM1k في البداية لمنع تسربه إلى بيانات التدريب.
كيف يُقاس التلوث
التلوث يعني أن مادة الاختبار تسربت إلى بيانات تدريب النموذج. وتهاجمه ثلاث أوراق من زوايا مختلفة.
طلب تشونيوان دينغ وزملاؤه من نماذج أن تخمن خيارا خاطئا حُجب من سؤال اختيار من متعدد. وعلى MMLU طابقته ChatGPT وGPT-4 تماما في 52% و57% من المرات. ويقرأ المؤلفون هذا دليلا على التعرض لكنهم يصفون الطريقة بأنها أقل موثوقية من الاسترجاع المباشر. واختبر يوناتان أورين وزملاؤه ما إذا كان النموذج يفضل ترتيب الأسئلة الأصلي في معيار ما على نسخ مخلوطة. وحين طُبق الاختبار على خمسة نماذج عامة، لم يجد دليلا يُذكر على تلوث واسع. وفحص رويجي شو وزملاؤه 31 نموذجا على اختبارات رياضيات بمقياسي الحيرة ودرجات n-gram وأفادوا بحالات كبيرة من إساءة استخدام مجموعة الاختبار. ولحالة أجرت فيها الجهة المصنِّعة للنموذج كل اختبار تقريبا، راجع نظرتنا إلى النماذج على الأجهزة.
من HumanEval إلى مسائل عليها تواريخ
نُشر LiveCodeBench في 12 مارس 2024 بديلا لاختبارات البرمجة الأقدم مثل HumanEval، ويأخذ مسائل من LeetCode وAtCoder وCodeforces ويسجل متى نُشرت كل مسألة، فيمكن اختبار النموذج على المسائل الصادرة بعد تاريخ انتهاء تدريبه فقط. ويذكر مؤلفوه أن نماذج الشيفرة من DeepSeek انخفضت انخفاضا حادا على مسائل LeetCode الصادرة بعد أغسطس 2023. ويكتبون أن HumanEval “معيار أسهل بمسائل برمجة صغيرة ومعزولة، ومن ثم يسهل الإفراط في التكيف معه”. ويضيفون أنه يغطي لغة Python وحدها، وأن أخذ العينات من المسائل وحده يحرك الدرجات بين 1 و1.5%، فالفجوات الصغيرة بين النماذج قليلة المعنى.
وحظي SWE-bench Verified، وهو مجموعة مهام برمجية رشّحها بشر، بالتدقيق نفسه. فقد صنّفه Epoch AI “معيبا” في 3 سبتمبر 2026. ويستشهد بتدقيق OpenAI في 23 فبراير 2026 الذي غطى 27.6% من المهام ووجد اختبارات ترفض إصلاحات صحيحة في 59.4% منها، أي حدا أدنى قدره 16.4% من كل المهام. ويقول Epoch إن لديه ثقة معقولة بأن أكثر من 20% من الأسئلة فيها مشكلات في التقييم، وإن كل المهام والحلول صارت علنية الآن. ويتناول تقريرنا عن وكلاء البرمجة مراجعة المشرفين للتصحيحات الناجحة ولوحة SWE-Bench Pro من Scale AI.
مشاركة Llama 4 في LMArena
قال إعلان Meta عن Llama 4 في 5 أبريل 2025 إن Llama 4 Maverick جاء معه “إصدار تجريبي للمحادثة” سجل Elo قدره 1417 في LMArena، وهو تصنيف مبني على أصوات تفضيل البشر. وفي 7 أبريل وصف المسؤول في Meta أحمد الدحلة الادعاء بأن Meta دربت على مجموعات الاختبار بأنه “غير صحيح ببساطة”، بحسب TechCrunch.
ونشرت LMArena بيانها في 8 أبريل. وقالت إن تفسير Meta لسياستها “لم يطابق ما نتوقعه من مزودي النماذج”، وإن على Meta أن توضح أكثر أن Llama-4-Maverick-03-26-Experimental نموذج مخصص بُني لتحسين تفضيل البشر. ونشرت 2,000 نتيجة مواجهة أو أكثر للمراجعة وقالت إنها تحدّث سياساتها.
وفي 29 أبريل 2025 نشرت شيفاليكا سينغ وزملاؤها “The Leaderboard Illusion”. وتعد ما يصل إلى 27 نسخة خاصة من Meta في الحلبة قبل إصدار Llama 4، وتقدّر أن Google وOpenAI تلقتا 19.2% و20.4% من مطالبات الاختبار مقابل 29.7% لـ83 نموذجا مفتوح الأوزان مجتمعة. وفي اختبار ضبط دقيق، رفع نموذج من 7 مليارات معامل دُرّب على خليط فيه 70% من بيانات Arena نسبة فوزه على مجموعة طلبات Arena-Hard من 23.5% إلى 49.9%، أي مكسبا نسبيا قدره 112.3%، بينما انزلقت درجته في MMLU من 66.5% إلى 65.9%. ويصف المؤلفون عدّهم لـMeta بأنه متحفظ، ويقولون إنهم لا يرون درجات النسخ الخاصة، ويفصحون عن أن عدة مؤلفين يعملون في Cohere. ويوصون بحظر سحب الدرجات ووضع سقف معلن للنسخ الخاصة لكل مزود.
وردت Arena في 9 مايو 2025. فهي تعترض على حصة النماذج المفتوحة في الورقة وتضع النماذج المفتوحة عند 40.9% في إحصاءات 27 أبريل. وتقول إن رسم الورقة لمكاسب الاختبار قبل الإصدار كان محاكاة لا صلة لها ببيانات الحلبة، وإن اختبار الضبط الدقيق استخدم معيارا ثابتا من 500 طلب يحكمه نموذج. وقالت أيضا إن سياسة الاختبار قبل الإصدار علنية منذ 1 مارس 2024، ووعدت بالسماح بعدة نسخ قبل الإصدار ووسم الدرجات المبكرة بأنها مؤقتة.
امتحانات بُنيت لتقاوم، وتدقيقاتها الخاصة
نُشر Humanity’s Last Exam (HLE) في 24 يناير 2025 بـ2,500 سؤال. اختُبر كل سؤال على نماذج رائدة ورُفض إن أجابت عنه إجابة صحيحة. ويسرد جدول الورقة o3-mini (high) عند 13.4% على الأسئلة النصية فقط، وهو الأفضل بين ثمانية نماذج، وتفحص مجموعة خاصة محتجزة الإفراط في التكيف. وفي 23 يوليو 2025 فحصت FutureHouse 321 سؤالا نصيا في الكيمياء والأحياء بوكيل بحث في الأدبيات، وراجع خبراء 150 من مخرجاته، وقدّرت أن 29% (زائد أو ناقص 3.7 نقطة) لها إجابات تتعارض مباشرة مع الأدبيات المحكّمة. ويقول تحديث FutureHouse إن متابعة فريق HLE نفسه وجدت نحو 18% من مجموعة فرعية مشابهة إشكالية، وإن واحدا على الأقل من ثلاثة خبراء مراجعين اختلف في 25%. ويخطط الفريق لمراجعة مستمرة.
وARC-AGI، الذي قدمه فرانسوا شوليه عام 2019، مجموعة ألغاز يُقصد أن تكون في متناول الناس وصعبة على الذكاء الاصطناعي. وتفيد ورقة ARC-AGI-2 في 17 مايو 2025 باختبار بشري شارك فيه 407 مشاركين. ويسرد جدولها، حتى 14 مايو 2025، 3.0% أفضل درجة على المجموعة شبه الخاصة. ويقول المؤلفون إن الدقة دون 5% لا تُعد في العادة ذات معنى. وفي تقرير بتاريخ 1 مايو 2026، قاس مركز الاختبار في NIST، CAISI، الذي يصف تلك المجموعة بأنها “محتجزة وغير ملوثة”، 79% لـGPT-5.5 و63% لـOpus 4.6 من Anthropic عليها. ويتناول مقالنا عن النماذج الصينية بقية ذلك التقرير. وتقول CAISI إن أرقامها متوسط عبر المهام، وهو يختلف عن التسجيل الرسمي للمعيار.
المصادر وقراءات إضافية
- Wang and others, MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark (arXiv:2406.01574, 3 June 2024)
- Gema and others, Are We Done with MMLU? (arXiv:2406.04127, 6 June 2024)
- Zhang and others, A Careful Examination of Large Language Model Performance on Grade School Arithmetic (arXiv:2405.00332, 1 May 2024)
- Deng and others, Investigating Data Contamination in Modern Benchmarks for Large Language Models (arXiv:2311.09783, NAACL 2024)
- Oren and others, Proving Test Set Contamination in Black Box Language Models (arXiv:2310.17623, 26 October 2023)
- Xu and others, Benchmarking Benchmark Leakage in Large Language Models (arXiv:2404.18824, 29 April 2024)
- Jain and others, LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code (arXiv:2403.07974, 12 March 2024)
- Epoch AI: Benchmark review, SWE-bench Verified (3 September 2026)
- Meta AI: The Llama 4 herd (5 April 2025)
- TechCrunch: Meta exec denies the company artificially boosted Llama 4's benchmark scores (7 April 2025)
- LMArena statement on Llama 4, posted on X and reproduced by Simon Willison (8 April 2025)
- Singh and others, The Leaderboard Illusion (arXiv:2504.20879, 29 April 2025)
- Arena (formerly LMArena): Our Response to 'The Leaderboard Illusion' Writeup (9 May 2025, updated 13 June 2025)
- Stanford HAI: 2026 AI Index Report, Technical Performance
- Phan and others, Humanity's Last Exam (arXiv:2501.14249, 24 January 2025; version 11, 28 July 2026)
- FutureHouse: About 30% of Humanity's Last Exam chemistry/biology answers are likely wrong (23 July 2025)
- Chollet and others, ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems (arXiv:2505.11831, 17 May 2025)
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
أُعِدّ هذا المقال وكُتب بمساعدة أدوات الذكاء الاصطناعي، وحُرِّر للتحقق من دقته. وهو للمعلومة العامة والنقاش فقط، وليس مشورة مهنية. راجع معاييرنا التحريرية وإخلاء المسؤولية. وجدت خطأ؟ أخبرنا.
أعجبك المقال؟ احصل على التالي.
مقال جيد واحد في كل مرة، يصلك مباشرة إلى بريدك. بلا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.