Ilustración de tuput
Español
Google DeepMind publicó el 30 de julio de 2026 tasas de éxito de Gemini Robotics 2, desde el 32% en una tarea con recogedor hasta el 92% al desenroscar una bombilla, sin indicar el número de intentos. De los modelos que tuput revisó, NVIDIA, Xiaomi y Unitree han puesto sus pesos en línea, y las cifras principales son de los propios laboratorios o llegan sin que se diga quién hizo la prueba.
El lanzamiento de Gemini Robotics 2 por Google DeepMind, el 30 de julio de 2026, vino con gráficos de tasas de éxito para un robot humanoide: 92% al desenroscar una bombilla, 36% al enroscarla, 32% al usar un recogedor. La página de DeepMind no dice cuántos intentos hay detrás de ninguna de ellas.
Un modelo base para robots es una sola red entrenada que recibe imágenes de cámara y una instrucción escrita y produce órdenes para los motores, para muchas tareas y muchos cuerpos de robot. Ocho laboratorios han presentado en 2026 un modelo así o una actualización de uno. En todas las cifras destacadas que tuput pudo rastrear, el laboratorio hizo sus propias pruebas, o la página no dice quién las hizo. Qué pesos, es decir, los números entrenados que un desarrollador puede descargar, son públicos varía mucho.
Las cifras humanoides de Google, y quién puede usarlas
Gemini Robotics 2 es un modelo de visión, lenguaje y acción, o VLA: lee imágenes y lenguaje y produce acciones. La entrada de Carolina Parada en el blog de DeepMind dice que puede controlar humanoides completos «de los pies a la punta de los dedos», además de robots de dos brazos. Con él salieron dos modelos complementarios. ER 2 es un planificador que divide un trabajo en pasos y llama al VLA. On-Device 2 es una versión más pequeña que se ejecuta en el propio ordenador del robot.
En el humanoide Apollo 2 de Apptronik con manos Inspire, DeepMind informa de que recoge un objeto en el 68,4% de los casos desde una mesa, el 76,3% desde un estante y el 45,7% desde el suelo. Con manos Sharpa informa de un 92% al desenroscar una bombilla, 44% al atar una bolsa de basura, 40% con una bolsa con cierre, 36% al enroscar una bombilla y 32% con el recogedor. En brazos Franka Duo con pinzas, las cifras son 74,2% en coger y colocar, 78,9% en preparar herramientas y 89,6% en inserción precisa. Google dice que la destreza con varios dedos sigue siendo difícil y que sus robots aún tienen que moverse más rápido. El problema de la mano detrás de esas cifras bajas se explica en nuestro texto sobre cómo aprende a agarrar una mano robótica.
El acceso es estrecho. El VLA y On-Device 2 van a socios de acceso anticipado, y la página del modelo cita a más de 100 probadores de confianza. ER 2 puede probarse en Google AI Studio, donde figura como versión preliminar.
ER 2 tiene sus propias cifras, de las evaluaciones de Google: 57,4% de precisión en clasificar el progreso, que ubica un fotograma de vídeo en una de cinco franjas según lo avanzada que esté una tarea, y 91,3% en encontrar el momento, que señala el fotograma donde ocurre un suceso clave, con un error medio de 0,96 segundos. Google publicó también una prueba de seguridad llamada ASIMOV-Agentic, y dice que en los ensayos ER 2 detuvo a un humanoide cuando una persona se acercó.
La ficha del modelo On-Device 2 es más directa que el blog. Enumera una generalización limitada a tareas fuera de la distribución de entrenamiento y una capacidad limitada para controlar robots con muchas articulaciones. Sus pruebas de seguridad cubrieron solo trabajo de pie con dos brazos, de modo que los riesgos del cuerpo entero quedan fuera de su alcance. DeepMind dice que un robot nuevo de dos brazos puede adaptarse con menos de 200 ejemplos reunidos a lo largo de unas pocas horas.
Physical Intelligence: pi0.7 y el problema de lo «no visto»
Physical Intelligence subió su artículo sobre pi0.7 a arXiv el 16 de abril de 2026. El modelo tiene unos 5000 millones de parámetros: una base de lenguaje y visión de 4000 millones de parámetros, que parte de Gemma 3 de Google, más un módulo de acción de 860 millones de parámetros.
La prueba principal es doblar camisas con un brazo UR5e para el que no se había reunido ningún dato de doblado. Los autores informan de un 80% de éxito y un 85,6% de avance en la tarea para pi0.7, frente al 80,6% de éxito y el 90,9% de avance de diez teleoperadores humanos con experiencia. El estudio lo hicieron los autores. En tareas no vistas o en combinaciones nuevas de tarea y robot informan de un éxito de aproximadamente el 60% al 80%, mientras que las tareas ya vistas a menudo superaban el 90%. Doblar ropa es una prueba de esfuerzo habitual, y por qué sigue siendo difícil se cuenta en nuestro texto sobre los robots que ganan al ajedrez y fracasan con la colada.
Los autores escriben que es difícil determinar qué cuenta como no visto dado el tamaño de su conjunto de datos. The Decoder dio un ejemplo: un robot que metía una batata en una freidora de aire necesitó que se le guiara paso a paso, y los datos de entrenamiento contenían solo dos episodios de un robot cerrando una freidora de aire.
El artículo no dice si se publicarán los pesos. La página del repositorio openpi que tuput leyó enumera pi0, pi0-FAST y pi0.5 con licencia Apache 2.0, y no pi0.7.
S1 de Skild: 66% en tareas no vistas, 86% con entrenamiento corriente
El blog de Skild AI presenta S1 como un modelo que ve un solo vídeo de una tarea y después la hace, sin cambiar sus pesos. Las tareas llegan a los diez minutos. En tareas no vistas, tras 100.000 horas de preentrenamiento, Skild informa de un 66% de éxito frente al 9% de un VLA guiado por lenguaje entrenado con los mismos datos, la misma arquitectura y el mismo cómputo. La métrica es el éxito por paso, promediado en tareas largas. Skild dice que se usaron dos conjuntos internos de pruebas y no da el número de tareas ni de intentos. Operadores humanos podían intervenir para recuperar los intentos fallidos, sobre todo en el caso del modelo de referencia, que de otro modo obtenía cero en tareas largas no vistas.
Las propias cifras de Skild muestran también el límite. Un VLA posentrenado con 2000 demostraciones alcanzó el 86% en la tarea nueva que Skild probó, por encima del 66% obtenido con un vídeo. Skild calcula que un vídeo equivale a unas 380 demostraciones y llama a esa cifra interpolada. La entrada ofrece una inscripción de acceso anticipado, no una descarga.
The Robot Report cita al director ejecutivo Deepak Pathak diciendo que S1 aún no se ha escalado a humanoides y no está listo para los hogares. La entrada no nombra los robots en los que se ejecutó.
Pesos abiertos de NVIDIA, Xiaomi y Unitree
GR00T N1.7 de NVIDIA tiene unos 3000 millones de parámetros. Su comunicado del 16 de marzo lo describía como disponible en acceso anticipado con licencia comercial. Una entrada técnica del 7 de julio dice que se publica bajo Apache 2.0, con los pesos en Hugging Face y el código de entrenamiento en GitHub, tras un preentrenamiento con unas 32.000 horas de datos reales y de humanos en primera persona y 8000 horas de simulación. Sus mejoras sobre N1.6 se dan solo en términos relativos: un 61% más en una prueba DROID y un 5% más en SimplerEnv Bridge. La ficha de Hugging Face del mismo modelo nombra la NVIDIA Open Model License, de modo que las dos páginas de NVIDIA no coinciden en la licencia.
El lanzamiento de NVIDIA de marzo adelantó también GR00T N2, que se basa en la investigación DreamZero. Los ingenieros de NVIDIA describen DreamZero como un modelo mundo-acción, una sola red que genera a la vez vídeo previsto y acciones. NVIDIA dice que acierta en tareas nuevas en entornos nuevos más del doble de veces que los principales VLA y que ocupa el primer puesto en las clasificaciones MolmoSpaces y RoboArena. El comunicado no da datos que respalden esa afirmación, y N2 está previsto para finales de 2026.
XR-1 de Xiaomi publica sus pruebas junto con sus pesos. Su README, bajo Apache 2.0, describe un preentrenamiento con más de 100.000 horas de datos de demostración grabados sin cuerpo de robot, y luego un posentrenamiento con más de 10.000 horas en distintos tipos de robot. Los puntos de control, el código de posentrenamiento y el código de evaluación son públicos, y el informe técnico pasó a arXiv el 16 de julio. Xiaomi informa de un 57,4% en la prueba de simulación RoboCasa365 frente al 46,6% del segundo mejor modelo. En cuatro tareas con robots reales y menos de 10 horas de datos por tarea informa de un 75% en conjunto frente al 40% de pi0.5, y de un 85% frente al 53% con menos de 40 horas. Cargar la lavadora llegó al 100% frente al 50% en el caso de 40 horas. La comparación con robots reales es de la propia Xiaomi, y el README dice que XR-1 ocupa el primer puesto en las clasificaciones RoboCasa365 y RoboDojo al 15 de julio.
Unitree anunció el 10 de septiembre que publicaba en código abierto UnifoLM-WLA-1.0, un modelo que, según la empresa, maneja tanto el trabajo sobre una mesa como el de cuerpo entero. Su página de Hugging Face enumera un punto de control base bajo Apache 2.0, pero la ficha del modelo estaba vacía cuando tuput la leyó, así que no había cifras por tarea. El hardware humanoide de Unitree, y lo que comparte con las aspiradoras robot, se trata en nuestra comparación de ambos.
Figure y AgiBot
Helix 02 de Figure, presentado el 27 de enero de 2026, ejecuta según Figure un trabajo de lavavajillas de cuatro minutos con 61 acciones y sin reinicios. Su capa de equilibrio es una red de 10 millones de parámetros entrenada con más de 1000 horas de datos de movimiento humano. La página no da tasas de éxito y vincula las tareas a nivel de dedos con el hardware del Figure 03, con sensores en las yemas que detectan fuerzas de apenas tres gramos. Figure llama a los resultados iniciales. Lo que han hecho humanoides de este tipo en pilotos de pago está en nuestro reportaje sobre humanoides que fichan.
A GO-2 de AgiBot, anunciado el 9 de abril, The Robot Report le atribuye un 98,5% en el conjunto de simulación LIBERO, un 86,6% en LIBERO-Plus y un 82,9% en transferencia al mundo real tras un entrenamiento solo en simulación. Las tres son cifras de AgiBot, y el artículo no dice si los pesos de GO-2 son públicos.
Por qué los porcentajes no pueden ponerse en fila
Un 98,5% en LIBERO es una puntuación en un conjunto fijo de simulación. Un 32% con un recogedor es un humanoide real con manos de 22 articulaciones. Un 66% de Skild promedia el éxito por paso en tareas largas. Ningún par de estas cifras comparte tarea, robot o regla de puntuación, y los laboratorios que se comparan con otros nombran como rival a pi0.5 o a versiones anteriores de sus propios modelos.
El comunicado de NVIDIA de marzo dice que GR00T N2 está previsto para estar disponible a finales de 2026.
Fuentes y lecturas adicionales
- Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots (30 July 2026)
- Google DeepMind: Gemini Robotics 2 overview and trusted tester programme
- Google DeepMind: Gemini Robotics On-Device 2 model card
- Google: Introducing Gemini Robotics ER 2 (30 July 2026)
- Physical Intelligence: pi 0.7, a Steerable Generalist Robotic Foundation Model with Emergent Capabilities (arXiv 2604.15483, 16 April 2026)
- The Decoder: Physical Intelligence shows robot model with LLM-like generalization, flaws included
- Physical Intelligence: openpi repository (GitHub)
- Skild AI: Introducing S1, In-Context Learning for Robotics (August 2026)
- The Robot Report: Skild AI unveils S1 flagship robot foundation model (31 August 2026)
- NVIDIA: NVIDIA and Global Robotics Leaders Take Physical AI to the Real World (16 March 2026)
- NVIDIA Technical Blog: Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T (7 July 2026)
- NVIDIA Technical Blog: Pretrained to Imagine, Fine-Tuned to Act, the Rise of World-Action Models (15 June 2026)
- Hugging Face: NVIDIA GR00T-N1.7-3B model card
- GitHub: Xiaomi-Robotics-1 (XR-1) README
- Hugging Face: Unitree Robotics models, UnifoLM-WLA-1.0-Base
- PANews: Unitree Robotics open-sources UnifoLM-WLA-1.0 embodied foundation model
- Figure: Introducing Helix 02, Full-Body Autonomy (27 January 2026)
- The Robot Report: AGIBOT releases GO-2 foundation model for embodied AI (9 April 2026)
Investigado y escrito con ayuda de herramientas de IA, y editado para verificar su exactitud. Se ofrece solo como información general y para el debate, no como asesoramiento profesional. Consulta nuestros criterios editoriales y nuestro aviso legal. ¿Has visto un error? Dínoslo.
¿Te ha gustado? Recibe el siguiente.
Una buena lectura cada vez, directa a tu correo. Sin spam, cancela cuando quieras.