Skip to content
El mejor modelo de IA abierto de China obtiene 46 en un índice independiente, frente a 58 del mejor modelo de EE. UU., y cuatro fuentes sitúan el retraso entre 2 y 8 meses
Inteligencia artificial

El mejor modelo de IA abierto de China obtiene 46 en un índice independiente, frente a 58 del mejor modelo de EE. UU., y cuatro fuentes sitúan el retraso entre 2 y 8 meses

Ilustración de tuput

Español

El MiMo-V2.6-Pro de Xiaomi lidera los modelos de pesos abiertos en el índice de Artificial Analysis con 46, por delante del GLM-5.3 de Z.ai y el Kimi K3 de Moonshot. El Claude Opus 5.5 de Anthropic obtiene 58. El propio informe de DeepSeek dice que va de 3 a 6 meses por detrás de la frontera de EE. UU., y el centro de pruebas del Gobierno estadounidense dice que unos 8.

· · 9 min de lectura

El 8 de octubre de 2026, el modelo chino mejor situado en el Intelligence Index de Artificial Analysis es el MiMo-V2.6-Pro de Xiaomi, que obtiene 46 y ocupa el puesto 18 de la tabla general. El Claude Opus 5.5 de Anthropic lidera la misma tabla con 58, y el GPT-6 Astra de OpenAI y el Gemini 4 Argon de Google obtienen 53. El índice combina diez evaluaciones de programación, agentes, trabajo del conocimiento y ciencia en una sola nota, según Trending Topics.

Cuatro fuentes han intentado traducir esa distancia a meses, y sus respuestas van de 2 a 8. Usan pruebas distintas y modelos estadounidenses distintos como vara de medir, y eso explica en buena parte que discrepen.

Los lanzamientos más recientes, con las cifras de los propios laboratorios

Todos son modelos de mezcla de expertos. Cada token se dirige a un pequeño conjunto de subredes especializadas, de modo que el número de parámetros “activos”, las cifras ajustables que se usan realmente por token, es mucho menor que el total. Un token es una palabra o un fragmento de palabra.

ModeloParámetros totales / activosVentana de contextoLicencia
DeepSeek V4-Pro1,6 billones / 49.000 millones1 millón de tokensMIT
DeepSeek V4.1 Flash552.000 millones / 16.000 millones1 millón de tokensMIT
Moonshot Kimi K32,8 billones / 104.000 millones1 millón de tokensKimi K3 License
Alibaba Qwen3.8-2.4T-A95B2,4 billones / 95.000 millones262.144 tokens, ampliable a 1.010.000Qwen3.8-Max License
Z.ai GLM-5.3753.000 millones / 40.000 millones1 millón de tokensGLM-5.3 License
Xiaomi MiMo-V2.6-Pro1,0 billones / 42.000 millones1 millón de tokensMIT

El informe técnico de DeepSeek V4, enviado a arXiv el 26 de abril de 2026, describe una versión preliminar. Dice que V4-Pro se preentrenó con 33 billones de tokens y el V4-Flash, más pequeño, con 32 billones. Con un contexto de un millón de tokens, V4-Pro necesita el 27 % del cómputo por token y el 10 % de la caché de memoria del anterior V3.2 de DeepSeek, según el informe. Las filas de V4.1 Flash y MiMo se apoyan en la tabla de Artificial Analysis y en las etiquetas de licencia de Arena.

La ficha del modelo Kimi K3 da la disposición de 16 expertos de 896, pero no un recuento de tokens de entrenamiento ni el hardware con que se entrenó. El punto de control abierto de Qwen es solo de texto, y su ficha dice que el modo de razonamiento no se puede desactivar. El Qwen3.8-Max alojado añade entrada de imágenes y un contexto por defecto de un millón de tokens. GLM-5.3 reutiliza el modelo base de GLM-5.2, y la ficha de Z.ai dice que las mejoras vienen del posentrenamiento, la fase en que un modelo terminado se afina con retroalimentación.

Las cifras de pruebas de rendimiento de estas fichas son las de los propios laboratorios. La ficha de DeepSeek da 80,6 para V4-Pro-Max en la prueba de programación SWE-bench Verified. El CAISI del NIST midió 74 en la misma prueba y atribuye la diferencia a los prompts de sistema, el andamiaje y los presupuestos de tokens.

Lo que midieron evaluadores externos

Artificial Analysis, en la versión 4.3.2 de su índice, da estas puntuaciones de pesos abiertos: MiMo-V2.6-Pro 46, GLM-5.3 45, Kimi K3 44, GLM-5.3-Flash 42, DeepSeek V4.1 Flash 39, Qwen3.8 27B (un modelo de 27.000 millones de parámetros) 34 y MiniMax-M3 29. Trending Topics da 39,9 para el Qwen3.8 2.4T completo. Las mejores entradas abiertas estadounidenses en la tabla de Artificial Analysis son el Inkling de Thinking Machines, con 25, y el Nemotron 3 Ultra de Nvidia, con 23.

La versión preliminar del Mistral Large 4, de Francia, obtuvo 38,4, lo que lo situaría octavo entre los modelos abiertos, como informó tuput en el artículo sobre Mistral Large 4. El coste difiere mucho. Trending Topics da 0,13 dólares por tarea del índice para MiMo-V2.6-Pro y unos 2 dólares cada una para GLM-5.3, Kimi K3 y Qwen3.8.

En la tabla de texto de Arena, Kimi K3 (max) figura en el puesto 16 con 1488, frente a 1525 del Gemini 4 Argon de Google, que Arena marca como preliminar, y 1507 del Claude Opus 5.5. MiMo-V2.6-Pro es el 26.º, GLM-5.3 el 27.º y DeepSeek V4.1 Flash el 39.º. Ninguno de los modelos indios financiados por la IndiaAI Mission aparece en la tabla de pesos abiertos de Artificial Analysis que leyó tuput. El presupuesto del programa, sus GPU y los constructores financiados se exponen en el artículo sobre la IndiaAI Mission.

Pesos abiertos, y lo que exigen las licencias

“Pesos abiertos” significa que cualquiera puede descargar las cifras del modelo entrenado, y las condiciones de uso difieren según el laboratorio. DeepSeek y Xiaomi usan la licencia MIT, que casi no tiene condiciones. Trending Topics informa de que Artificial Analysis clasifica GLM-5.3, Kimi K3 y el gran Qwen3.8 como restringidos para uso comercial, aunque los textos de licencia que leyó tuput fijan límites más estrechos.

La licencia de Kimi K3 exige que una empresa que gestione un negocio de modelos alojados y tenga más de 20 millones de dólares de ingresos en cualquier periodo de 12 meses firme un acuerdo aparte con Moonshot. Un producto con más de 100 millones de usuarios mensuales, o 20 millones de dólares de ingresos mensuales, debe mostrar “Kimi K3” en su interfaz. El uso interno está exento.

La licencia de Qwen3.8-Max tiene la misma regla de exhibición y fija el umbral de licencia aparte en 50 millones de dólares en 12 meses para negocios de modelos alojados o de asistentes de trabajo con IA. La licencia de GLM-5.3 de Z.ai permite el uso comercial, con una revisión de seguridad de Z.ai solo para negocios de modelos alojados cuyos ingresos combinados superen los 10.000 millones de dólares.

Las cifras de coste de entrenamiento y lo que omiten

La cifra más citada es 5,576 millones de dólares para DeepSeek-V3. El artículo de V3 llega a ella a partir de 2,788 millones de horas de GPU H800 a un precio de alquiler supuesto de 2 dólares la hora. El artículo señala que el total cubre solo la ejecución oficial del entrenamiento y excluye la investigación previa y los experimentos de ablación, las pequeñas pruebas con que se eligen la arquitectura, los algoritmos y los datos.

El informe de V4 da recuentos de tokens pero, en el texto que consultó tuput, ningún coste en dólares ni total de horas de GPU. La ficha del modelo Kimi K3 no da recuento de tokens ni coste.

Qué chips dicen usar los laboratorios

El informe de DeepSeek dice que su kernel fusionado de comunicación entre expertos se validó tanto en GPU de Nvidia como en NPU Ascend de Huawei, con una aceleración de 1,50 a 1,73 veces en inferencia general y de hasta 1,96 veces en tareas sensibles a la latencia, como los despliegues de aprendizaje por refuerzo. No dice con qué chips se entrenó el modelo.

Irene Zhang, Aqib Zakaria y Jordan Schneider, de ChinaTalk, escribieron el 27 de abril que V4 fue “todavía entrenado con chips de Nvidia”, que es su lectura de las pruebas y no una declaración de DeepSeek. El mismo texto cita una nota al pie del anuncio de lanzamiento de DeepSeek: “Debido a las restricciones de cómputo de gama alta, el rendimiento de servicio de V4-Pro está actualmente limitado.” Añade que DeepSeek espera que el precio de Pro baje cuando los supernodos Ascend 950 de Huawei se envíen en volumen en el segundo semestre de 2026.

La ficha de GLM-5.3 dice que el despliegue en Ascend es compatible mediante vLLM-Ascend, xLLM y SGLang, y no da el hardware de entrenamiento. La ficha de Kimi K3 dice que algunas de sus evaluaciones se ejecutaron en GPU Nvidia H20.

Por el lado estadounidense, The Next Web informó el 19 de agosto, citando al Financial Times, de que ByteDance y Tencent habían recibido cada una unos 10.000 chips H200 de Nvidia. Pekín ha dicho a las empresas que los mantengan fuera del territorio continental, y los envíos pasan por Hong Kong. En julio, dice The Next Web, el subsecretario de Comercio Jeffrey Kessler dijo al Congreso que habían llegado “muy pocos”. El desvío de servidores restringidos es el tema del reportaje de tuput sobre la acusación del Departamento de Justicia por servidores enviados a China.

Cuatro estimaciones de la distancia

El informe de DeepSeek dice que V4-Pro-Max supera a GPT-5.2 y Gemini-3.0-Pro en pruebas estándar de razonamiento pero queda ligeramente por debajo de GPT-5.4 y Gemini-3.1-Pro. Lo interpreta como un retraso de aproximadamente 3 a 6 meses respecto de la frontera.

El Center for AI Standards and Innovation del NIST probó V4 Pro en abril y publicó el 1 de mayo que sus capacidades van unos 8 meses por detrás de la frontera. En las nueve pruebas del CAISI, incluidas dos que no se han hecho públicas, V4 Pro rindió de forma parecida a GPT-5, lanzado unos 8 meses antes. En el conjunto semiprivado de ARC-AGI-2 obtuvo un 46 % frente al 79 % de GPT-5.5. El CAISI dice que su cifra de retraso sale de un modelo estadístico que aproxima la capacidad, no de una medición directa.

Nathan Lambert escribió el 21 de septiembre, en un texto ampliado a partir de un testimonio preparado para una sesión informativa del Congreso, que los modelos chinos de pesos abiertos van aproximadamente de 2 a 5 meses por detrás de la frontera cerrada estadounidense. Los modelos abiertos estadounidenses, dice, van de 6 a 9 meses por detrás de OpenAI y Anthropic. Estima que la destilación, entrenar un modelo con las respuestas de otro, reduce la distancia china en 1 a 2 meses.

Jack Edwards y Luke Emberson, de Epoch AI, informaron el 29 de mayo de que desde enero de 2026 los modelos de pesos abiertos más capaces han ido, en promedio, cuatro meses por detrás de la frontera cerrada en el Epoch Capabilities Index, o seis meses con una prueba más estricta, una distancia media de 8 puntos del índice. Eso abarca los modelos abiertos en general, no solo los chinos. Epoch añade que los modelos abiertos tienden a puntuar peor en pruebas privadas, y que su estimación podría subestimar la distancia real.

Share
Copied!

Fuentes y lecturas adicionales

  1. arXiv: DeepSeek-V4, Towards Highly Efficient Million-Token Context Intelligence (technical report, submitted 26 April 2026)
  2. Hugging Face: DeepSeek-V4-Pro model card
  3. arXiv: DeepSeek-V3 Technical Report
  4. Hugging Face: Kimi K3 model card (Moonshot AI)
  5. Hugging Face: Kimi K3 licence text
  6. Hugging Face: Qwen3.8-2.4T-A95B model card (Alibaba)
  7. Hugging Face: Qwen3.8-Max licence text
  8. Hugging Face: GLM-5.3 model card (Z.ai)
  9. Hugging Face: GLM-5.3 licence text
  10. Artificial Analysis: top open-weights models
  11. Artificial Analysis: leaderboard of all models by Intelligence Index
  12. Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models (6 October 2026)
  13. Arena: text leaderboard
  14. NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
  15. Epoch AI: Open models lag state-of-the-art closed models by 4 months (29 May 2026)
  16. Interconnects: The current balance of power in open models (Nathan Lambert, 21 September 2026)
  17. ChinaTalk: DeepSeek V4 (27 April 2026)
  18. The Next Web: Nvidia's H200 finally reaches Chinese buyers (19 August 2026)

Investigado y escrito con ayuda de herramientas de IA, y editado para verificar su exactitud. Se ofrece solo como información general y para el debate, no como asesoramiento profesional. Consulta nuestros criterios editoriales y nuestro aviso legal. ¿Has visto un error? Dínoslo.

#chinese ai#deepseek v4#kimi k3#qwen3.8#glm-5.3#open-weight models#artificial analysis#export controls

¿Te ha gustado? Recibe el siguiente.

Una buena lectura cada vez, directa a tu correo. Sin spam, cancela cuando quieras.

Más en Inteligencia artificial
Le Chonk, el modelo de 1 billón de parámetros de Mistral, obtuvo 38 puntos en un índice independiente de IA, octavo entre los modelos abiertos, antes de que sus pesos se hayan publicado siquiera
La francesa Mistral ha puesto en línea un modelo de un billón de parámetros y dice que los pesos descargables llegarán este mes. Los evaluadores externos lo sitúan como el mejor modelo abierto de fuera de China y el octavo entre los abiertos, y las cifras de la propia Mistral sobre su tamaño no coinciden del todo.
Fiscales de EE. UU. dicen que un empresario de California desvió a China, vía Malasia y Singapur, más de 300 millones de dólares en servidores de IA, una acusación aún no probada ante un tribunal
Al dueño de una empresa informática de City of Industry se le acusa de enviar a compradores chinos servidores llenos de chips restringidos. Los correos, el dinero y las normas detrás del cargo son públicos, y también lo son los huecos de las estimaciones más amplias.
El ranking SWE-Bench Pro de Scale pone al mejor agente de programación en 61,5 %, los mantenedores rechazan muchas correcciones que superan las pruebas, y METR dice que su último ensayo no puede mostrar cuánto tiempo ahorran los agentes
Los benchmarks dicen que los agentes son fuertes. Los mantenedores, un ensayo aleatorizado y un montón de informes de incidentes dicen que el panorama es más estrecho. Esto es lo que mide realmente cada cifra.
← todos los artículos