Ilustración de tuput
Español
Los investigadores que revisaron MMLU estiman que el 6,49% de sus preguntas contienen errores. Anotadores contratados a través de Scale AI escribieron 1.205 problemas nuevos de matemáticas escolares, y algunos modelos abiertos sacaron hasta 8 puntos menos en ellos que en la prueba pública GSM8K. LMArena dijo que Meta debió dejar más claro que su participación de Llama 4 estaba personalizada para la preferencia humana.
MMLU, un examen de opción múltiple de 57 materias que se usa para calificar modelos de lenguaje, contiene errores en un 6,49% estimado de sus preguntas, según una revisión de junio de 2024 hecha por 16 investigadores. En la sección de virología, 57 de las 100 preguntas que examinaron tenían algún problema. Lo que sigue son los casos documentados de benchmarks que se desgastan, que se filtran a los datos de entrenamiento o que se manipulan, quién midió cada cifra y qué dicen los propios autores de los benchmarks sobre sus límites.
Cuando una prueba se queda sin margen
Para el 3 de junio de 2024, los autores de MMLU-Pro, un sucesor más difícil de MMLU, escribieron que el rendimiento en esos benchmarks “ha empezado a estancarse”. MMLU-Pro tiene 12.032 preguntas con diez opciones de respuesta, tres veces más opciones erróneas que MMLU. Sus constructores descartaron 5.886 preguntas de MMLU que más de cuatro de ocho modelos abiertos contestaron bien, de modo que solo 6.810 de sus preguntas vienen de MMLU y el resto de otras fuentes. Los autores informan de que la precisión cae entre 16% y 33% respecto de MMLU en los modelos que probaron, y de que la sensibilidad a la redacción del enunciado baja de 4 a 5% a 2%. Para GPT-4o informan de que el razonamiento paso a paso subió MMLU-Pro de 53,5% a 72,6% pero MMLU solo de 87,2% a 88,7%.
El AI Index 2026 de Stanford dice: “Las evaluaciones pensadas para ser difíciles durante años se saturan en meses”. Añade que los modelos de frontera ganaron 30 puntos porcentuales en un año en Humanity’s Last Exam, una prueba diseñada para ser difícil para la IA.
Errores en la clave de respuestas
Una clave de respuestas equivocada fija el mejor puntaje posible por debajo del 100%. El equipo de MMLU-Redux, con Aryo Pradipta Gema como primer autor, revisó 100 preguntas al azar de cada una de las 57 materias, 5.700 en total de 14.042. Clasificaron los problemas en preguntas poco claras, opciones poco claras, ninguna respuesta correcta, varias respuestas correctas y claves erróneas. Virología tuvo el peor historial, con 57%, y 33 claves erróneas. Las falacias lógicas tuvieron 26%, la química universitaria 25% y el derecho profesional 18%. La cifra de 6,49% es su estimación para toda la prueba, extrapolada de la muestra. Los autores señalan que 8.342 preguntas quedaron sin revisar y que su protocolo “podría seguir sujeto a los sesgos personales de los anotadores”.
Un conjunto nuevo de problemas de matemáticas
GSM8K es un conjunto de problemas de matemáticas con enunciado, de nivel escolar. El 1 de mayo de 2024 Hugh Zhang y colegas publicaron un artículo construido en torno a GSM1k, 1.205 problemas nuevos escritos por anotadores humanos contratados a través de Scale AI, sin usar ningún modelo de lenguaje para escribirlos. En GSM1k, la precisión cayó hasta 8 puntos en algunos modelos. La mayor diferencia fue la de Yi-6B-Chat, de 43,7% a 35,7%. Las familias Phi y Mistral sacaron menos en GSM1k en casi todas sus versiones, mientras que los modelos Gemini, GPT y Claude mostraron pocas señales de sobreajuste. Los autores hallaron además una correlación entre la probabilidad de que un modelo reprodujera textualmente ejemplos de GSM8K y su diferencia de puntaje (un r cuadrado de Spearman de 0,36). Advierten de que los dos conjuntos son “solo muy parecidos, pero no tienen idéntica distribución”. Los autores mantuvieron GSM1k en reserva al principio para evitar que se filtrara a los datos de entrenamiento.
Cómo se mide la contaminación
Contaminación significa que material de prueba se filtró a los datos de entrenamiento de un modelo. Tres artículos la atacan desde ángulos distintos.
Chunyuan Deng y colegas pidieron a los modelos que adivinaran una opción incorrecta que habían ocultado de una pregunta de opción múltiple. En MMLU, ChatGPT y GPT-4 la acertaron exactamente el 52% y el 57% de las veces. Los autores lo leen como señal de exposición, pero consideran el método menos fiable que la recuperación directa. Yonatan Oren y colegas probaron si un modelo prefiere el orden original de las preguntas de un benchmark frente a versiones barajadas. Aplicada a cinco modelos públicos, la prueba halló poca evidencia de una contaminación extendida. Ruijie Xu y colegas revisaron 31 modelos en pruebas de matemáticas con puntuaciones de perplejidad y de n-gramas, e informaron de casos sustanciales de uso indebido del conjunto de prueba. Para un caso en el que el fabricante del modelo ejecutó casi todas las pruebas, véase nuestro repaso de los modelos en el dispositivo.
De HumanEval a problemas con fecha
LiveCodeBench, publicado el 12 de marzo de 2024 como reemplazo de pruebas de programación más antiguas como HumanEval, toma problemas de LeetCode, AtCoder y Codeforces y anota cuándo se publicó cada uno, de modo que un modelo pueda probarse solo con problemas publicados después de su fecha de corte de entrenamiento. Sus autores informan de que los modelos de código de DeepSeek cayeron en picado en los problemas de LeetCode publicados después de agosto de 2023. Escriben que HumanEval es “un benchmark más fácil, con problemas de programación pequeños y aislados, y por tanto más fácil de sobreajustar”. Añaden que el benchmark cubre solo Python y que el solo muestreo de problemas mueve las puntuaciones entre 1 y 1,5%, de modo que las diferencias pequeñas entre modelos significan poco.
SWE-bench Verified, un conjunto de tareas de software filtrado por humanos, recibió el mismo escrutinio. Epoch AI lo calificó de “Flawed” (defectuoso) el 3 de septiembre de 2026. Cita la auditoría de OpenAI del 23 de febrero de 2026, que abarcó el 27,6% de las tareas y halló pruebas que rechazaban correcciones correctas en el 59,4% de ellas, un mínimo del 16,4% de todas las tareas. Epoch dice tener confianza razonable en que más del 20% de las preguntas tienen problemas de puntuación, y que todas las tareas y soluciones son ya públicas. Nuestro informe sobre los agentes de programación cubre la revisión que hicieron los mantenedores de los parches aprobados y el tablero SWE-Bench Pro de Scale AI.
La participación de Llama 4 en LMArena
El anuncio de Llama 4 de Meta del 5 de abril de 2025 decía que Llama 4 Maverick venía con “una versión de chat experimental” que obtuvo un Elo de 1417 en LMArena, una clasificación basada en votos de preferencia humana. El 7 de abril el ejecutivo de Meta Ahmad Al-Dahle calificó de “simplemente falsa” la afirmación de que Meta entrenó con conjuntos de prueba, según TechCrunch.
LMArena publicó su propia declaración el 8 de abril. Dijo que la interpretación que Meta hizo de su política “no coincidía con lo que esperamos de los proveedores de modelos”, y que Meta debió dejar más claro que Llama-4-Maverick-03-26-Experimental era un modelo personalizado construido para optimizar la preferencia humana. Publicó 2.000 o más resultados de enfrentamientos para su revisión y dijo que estaba actualizando sus políticas.
El 29 de abril de 2025 Shivalika Singh y colegas publicaron “The Leaderboard Illusion”. Cuenta hasta 27 variantes privadas de Meta en la arena antes del lanzamiento de Llama 4, y estima que Google y OpenAI recibieron el 19,2% y el 20,4% de los prompts de prueba, frente al 29,7% de 83 modelos de pesos abiertos en conjunto. En una prueba de ajuste fino, un modelo de 7.000 millones de parámetros entrenado con una mezcla con 70% de datos de Arena subió su tasa de victorias en el conjunto de prompts Arena-Hard de 23,5% a 49,9%, una ganancia relativa de 112,3%, mientras su puntaje en MMLU bajó de 66,5% a 65,9%. Los autores llaman prudente a su recuento de Meta, dicen que no pueden ver los puntajes de las variantes privadas y declaran que varios autores trabajan en Cohere. Recomiendan prohibir la retirada de puntajes y fijar un tope declarado de variantes privadas por proveedor.
Arena respondió el 9 de mayo de 2025. Discute la cuota de modelos abiertos del artículo, y pone a los modelos abiertos en 40,9% en sus estadísticas del 27 de abril. Dice que el gráfico del artículo sobre las ganancias de las pruebas previas al lanzamiento era una simulación sin relación con los datos de la arena, y que la prueba de ajuste fino usó un benchmark estático de 500 prompts juzgado por un modelo. Dijo también que su política de pruebas previas al lanzamiento es pública desde el 1 de marzo de 2024, y prometió permitir varias variantes previas al lanzamiento y etiquetar como provisionales los puntajes tempranos.
Exámenes hechos para resistir, y sus propias auditorías
Humanity’s Last Exam (HLE) se publicó el 24 de enero de 2025 con 2.500 preguntas. Cada una se probó contra modelos de frontera y se rechazó si la respondían bien. La tabla del artículo pone a o3-mini (high) en 13,4% en las preguntas solo de texto, el mejor de ocho modelos, y un conjunto privado reservado comprueba el sobreajuste. El 23 de julio de 2025, FutureHouse revisó 321 preguntas de química y biología solo de texto con un agente de búsqueda bibliográfica, hizo que expertos revisaran 150 de sus resultados, y estimó que el 29% (más o menos 3,7 puntos) tenía respuestas en conflicto directo con la literatura revisada por pares. La actualización de FutureHouse dice que el propio seguimiento del equipo de HLE halló problemático cerca del 18% de un subconjunto similar, y que al menos uno de tres revisores expertos discrepaba en el 25%. El equipo planea una revisión continua.
ARC-AGI, presentado por François Chollet en 2019, es un conjunto de rompecabezas pensados para ser accesibles a las personas y difíciles para la IA. El artículo de ARC-AGI-2 del 17 de mayo de 2025 informa de pruebas con humanos con 407 participantes. Su tabla, a 14 de mayo de 2025, anota 3,0% como el mejor puntaje en el conjunto semiprivado. Los autores dicen que las precisiones inferiores al 5% no suelen tratarse como significativas. En un informe del 1 de mayo de 2026, el centro de pruebas del NIST, CAISI, que llama a ese conjunto “reservado y no contaminado”, midió 79% para GPT-5.5 y 63% para Opus 4.6 de Anthropic en él. Nuestro artículo sobre los modelos chinos cubre el resto de ese informe. CAISI dice que sus cifras son un promedio entre tareas, lo cual difiere de la puntuación oficial del benchmark.
Fuentes y lecturas adicionales
- Wang and others, MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark (arXiv:2406.01574, 3 June 2024)
- Gema and others, Are We Done with MMLU? (arXiv:2406.04127, 6 June 2024)
- Zhang and others, A Careful Examination of Large Language Model Performance on Grade School Arithmetic (arXiv:2405.00332, 1 May 2024)
- Deng and others, Investigating Data Contamination in Modern Benchmarks for Large Language Models (arXiv:2311.09783, NAACL 2024)
- Oren and others, Proving Test Set Contamination in Black Box Language Models (arXiv:2310.17623, 26 October 2023)
- Xu and others, Benchmarking Benchmark Leakage in Large Language Models (arXiv:2404.18824, 29 April 2024)
- Jain and others, LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code (arXiv:2403.07974, 12 March 2024)
- Epoch AI: Benchmark review, SWE-bench Verified (3 September 2026)
- Meta AI: The Llama 4 herd (5 April 2025)
- TechCrunch: Meta exec denies the company artificially boosted Llama 4's benchmark scores (7 April 2025)
- LMArena statement on Llama 4, posted on X and reproduced by Simon Willison (8 April 2025)
- Singh and others, The Leaderboard Illusion (arXiv:2504.20879, 29 April 2025)
- Arena (formerly LMArena): Our Response to 'The Leaderboard Illusion' Writeup (9 May 2025, updated 13 June 2025)
- Stanford HAI: 2026 AI Index Report, Technical Performance
- Phan and others, Humanity's Last Exam (arXiv:2501.14249, 24 January 2025; version 11, 28 July 2026)
- FutureHouse: About 30% of Humanity's Last Exam chemistry/biology answers are likely wrong (23 July 2025)
- Chollet and others, ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems (arXiv:2505.11831, 17 May 2025)
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
Investigado y escrito con ayuda de herramientas de IA, y editado para verificar su exactitud. Se ofrece solo como información general y para el debate, no como asesoramiento profesional. Consulta nuestros criterios editoriales y nuestro aviso legal. ¿Has visto un error? Dínoslo.
¿Te ha gustado? Recibe el siguiente.
Una buena lectura cada vez, directa a tu correo. Sin spam, cancela cuando quieras.