插图:tuput
中文
重新检查MMLU的研究者估计,它有6.49%的题目存在错误。通过Scale AI雇来的标注员编写了1,205道全新的小学数学题,一些开源模型在这些题上的得分比在公开的GSM8K测试上最多低了8分。LMArena表示,Meta本应更清楚地说明,它的Llama 4参赛版本是针对人类偏好定制的。
MMLU是一套涵盖57个科目的选择题考试,用来给语言模型打分。2024年6月,16位研究者对它重新检查,估计其中6.49%的题目存在错误。在病毒学部分,他们检查的100道题里有57道有问题。下面是有据可查的几类情形:基准测试用旧失效、泄露进训练数据或被钻了空子,每个数字由谁测得,以及这些基准的作者自己怎么说它们的局限。
当一场测试没有余地
到2024年6月3日,MMLU-Pro(MMLU难度更高的后继者)的作者写道,这类基准上的表现”已开始趋于平台期”。MMLU-Pro有12,032道题,每题十个选项,错误选项是MMLU的三倍。它的制作者剔除了5,886道MMLU的题目,这些题在八个开源模型中有四个以上答对,所以它只有6,810道题来自MMLU,其余来自别的来源。作者报告说,他们测试的模型准确率比在MMLU上下降16%到33%,对提示词措辞的敏感度从4%到5%降到2%。对GPT-4o,他们报告说一步步推理把MMLU-Pro的得分从53.5%提高到72.6%,而MMLU只从87.2%提高到88.7%。
斯坦福2026年《AI指数》写道:“本来要让人几年都觉得难的评测,几个月就饱和了。“它还补充说,在Humanity’s Last Exam(一项专为难倒AI而设计的测试)上,前沿模型一年之内提高了30个百分点。
标准答案里的错误
标准答案有错,最高得分就到不了100%。MMLU-Redux团队(第一作者是Aryo Pradipta Gema)从57个科目各随机抽查了100道题,共5,700道,总数为14,042道。他们把问题分为:题目不清、选项不清、没有正确答案、有多个正确答案和答案标错。病毒学的记录最差,57%,其中33道标错了答案。逻辑谬误是26%,大学化学25%,职业法律18%。6.49%这个数字,是他们根据样本对整套测试作的推算。作者指出,有8,342道题没有检查,而且他们的流程”可能仍难免受标注员个人偏见的影响”。
一套新的数学题
GSM8K是一套小学程度的数学应用题。2024年5月1日,Hugh Zhang等人发表了一篇围绕GSM1k的论文,这是通过Scale AI雇来的人类标注员编写的1,205道新题,写题时没有使用任何语言模型。在GSM1k上,一些模型的准确率最多下降了8分。差距最大的是Yi-6B-Chat,从43.7%降到35.7%。Phi和Mistral系列几乎每个版本在GSM1k上的得分都更低,而Gemini、GPT和Claude系列的模型几乎没有过拟合的迹象。作者还发现,模型逐字生成GSM8K样题的可能性,与它的得分差距之间存在相关性(Spearman r平方为0.36)。他们提醒说,这两套题”只是高度相似,而不是分布完全相同”。作者起初没有公开GSM1k,以免它泄露进训练数据。
数据污染是怎么测出来的
数据污染指测试材料泄露进了模型的训练数据。有三篇论文从不同角度来研究它。
邓春远(Chunyuan Deng)等人让模型去猜一道选择题里被遮住的错误选项。在MMLU上,ChatGPT和GPT-4分别有52%和57%的时候与它完全一致。作者把这解读为模型接触过这些题的迹象,但说这个方法不如直接检索可靠。Yonatan Oren等人检验的是,模型是否更喜欢某个基准原本的题目顺序,而不是打乱后的版本。把这一检验用在五个公开模型上,没有发现多少普遍污染的证据。Ruijie Xu等人用困惑度和n-gram得分检查了31个模型在数学测试上的表现,报告说存在大量滥用测试集的实例。至于一个由模型制作方自己跑完几乎全部测试的例子,可以看我们对端侧模型的报道。
从HumanEval到标了日期的题目
LiveCodeBench于2024年3月12日发布,用来取代HumanEval等较早的编程测试。它从LeetCode、AtCoder和Codeforces取题,并记录每道题发布的时间,这样就可以只用模型训练截止日期之后发布的题来测试它。它的作者报告说,DeepSeek的代码模型在2023年8月之后发布的LeetCode题目上,成绩急剧下滑。他们写道,HumanEval”是一个更容易的基准,题目小而孤立,因而更容易过拟合”。他们还补充说,这个基准只覆盖Python,而且仅仅是题目抽样就会让得分波动1%到1.5%,所以模型之间的小差距没有多大意义。
SWE-bench Verified是一套经人工筛选的软件任务集,也受到同样的审视。Epoch AI在2026年9月3日把它评为”有缺陷”。它引用了OpenAI在2026年2月23日的审查,该审查覆盖了27.6%的任务,发现其中59.4%的测试会拒绝正确的修复,即全部任务的至少16.4%。Epoch说,它有理由相信超过20%的题目存在评分问题,并且所有任务和解答现在都已公开。我们关于编程智能体的报道写了维护者对通过测试的补丁的审查,以及Scale AI的SWE-Bench Pro榜单。
Llama 4在LMArena上的参赛版本
Meta在2025年4月5日发布Llama 4时说,Llama 4 Maverick带有”一个实验性的聊天版本”,在LMArena(一个根据人类偏好投票建立的排名)上的Elo得分为1417。据TechCrunch报道,4月7日,Meta高管Ahmad Al-Dahle称Meta用测试集训练的说法”根本不是事实”。
LMArena在4月8日发表了自己的声明。声明说,Meta对其政策的理解”与我们对模型提供方的期待不符”,Meta本应更清楚地说明Llama-4-Maverick-03-26-Experimental是一个为优化人类偏好而定制的模型。它公布了2,000场以上的对战结果供审查,并说正在更新自己的政策。
2025年4月29日,Shivalika Singh等人发表了《The Leaderboard Illusion》。该文统计出,在Llama 4发布之前,擂台上多达27个Meta的私有变体;并估计Google和OpenAI分别获得了19.2%和20.4%的测试提示,83个开放权重模型加起来是29.7%。在一项微调测试中,一个70亿参数的模型用含70% Arena数据的混合数据训练后,在Arena-Hard提示集上的胜率从23.5%提高到49.9%,相对增幅112.3%,而它的MMLU得分从66.5%略降到65.9%。作者称他们对Meta的统计是保守的,说他们看不到私有变体的得分,并披露其中几位作者在Cohere工作。他们建议禁止撤回分数,并为每家提供方的私有变体数量设定一个明确的上限。
Arena在2025年5月9日作出回应。它对论文中开放模型的占比有异议,在其4月27日的统计中,开放模型占40.9%。它说论文中关于发布前测试收益的图表是一个模拟,与擂台数据无关,而且微调测试用的是由模型打分的、固定的500条提示基准。它还说,自己的发布前测试政策自2024年3月1日起就是公开的,并承诺允许多个发布前变体,并把早期得分标为暂定。
为抵抗而设计的考试,和它们各自的审查
Humanity’s Last Exam(HLE)于2025年1月24日发布,共2,500道题。每道题都用前沿模型测过,只要它们答对就会被剔除。论文的表格列出,在纯文本题上,o3-mini(high)是13.4%,为八个模型中最高,另有一套私有的保留集用来检查过拟合。2025年7月23日,FutureHouse用一个文献检索智能体检查了321道纯文本化学和生物题,请专家审阅了其中150个输出,估计有29%(正负3.7个百分点)的答案与同行评审文献直接冲突。FutureHouse的更新说,HLE团队自己的后续检查在一个类似的子集中发现约18%有问题,三位专家审阅者中至少有一位持不同意见的占25%。团队计划进行滚动修订。
ARC-AGI由François Chollet于2019年提出,是一组旨在让人类容易上手、让AI觉得困难的谜题。2025年5月17日的ARC-AGI-2论文报告了407名参与者的人类测试。其表格(截至2025年5月14日)列出,半私有集上的最高得分是3.0%。作者说,低于5%的准确率一般不被视为有意义。在2026年5月1日的一份报告中,NIST的测试中心CAISI称该集合”保留且未被污染”,测得GPT-5.5在上面是79%,Anthropic的Opus 4.6是63%。我们关于中国模型的文章写了那份报告的其余部分。CAISI说它给出的数字是各项任务的平均值,与该基准的官方计分方式不同。
资料来源与延伸阅读
- Wang and others, MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark (arXiv:2406.01574, 3 June 2024)
- Gema and others, Are We Done with MMLU? (arXiv:2406.04127, 6 June 2024)
- Zhang and others, A Careful Examination of Large Language Model Performance on Grade School Arithmetic (arXiv:2405.00332, 1 May 2024)
- Deng and others, Investigating Data Contamination in Modern Benchmarks for Large Language Models (arXiv:2311.09783, NAACL 2024)
- Oren and others, Proving Test Set Contamination in Black Box Language Models (arXiv:2310.17623, 26 October 2023)
- Xu and others, Benchmarking Benchmark Leakage in Large Language Models (arXiv:2404.18824, 29 April 2024)
- Jain and others, LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code (arXiv:2403.07974, 12 March 2024)
- Epoch AI: Benchmark review, SWE-bench Verified (3 September 2026)
- Meta AI: The Llama 4 herd (5 April 2025)
- TechCrunch: Meta exec denies the company artificially boosted Llama 4's benchmark scores (7 April 2025)
- LMArena statement on Llama 4, posted on X and reproduced by Simon Willison (8 April 2025)
- Singh and others, The Leaderboard Illusion (arXiv:2504.20879, 29 April 2025)
- Arena (formerly LMArena): Our Response to 'The Leaderboard Illusion' Writeup (9 May 2025, updated 13 June 2025)
- Stanford HAI: 2026 AI Index Report, Technical Performance
- Phan and others, Humanity's Last Exam (arXiv:2501.14249, 24 January 2025; version 11, 28 July 2026)
- FutureHouse: About 30% of Humanity's Last Exam chemistry/biology answers are likely wrong (23 July 2025)
- Chollet and others, ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems (arXiv:2505.11831, 17 May 2025)
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。
喜欢这篇吗?下一篇也别错过。
每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。