Skip to content
Gemini Robotics 2 拧下灯泡成功率92%,拧上灯泡只有36%,小米的开源机器人模型在自家真机测试中报告75%,而pi0.5为40%
机器人

Gemini Robotics 2 拧下灯泡成功率92%,拧上灯泡只有36%,小米的开源机器人模型在自家真机测试中报告75%,而pi0.5为40%

插图:tuput

中文

谷歌DeepMind于2026年7月30日公布了Gemini Robotics 2的成功率,从簸箕任务的32%到拧下灯泡的92%不等,但没有给出试验次数。在tuput查证的模型中,英伟达、小米和宇树把权重放到了网上,而那些最醒目的数字,要么出自实验室自己的测试,要么没有注明由谁测试。

· · 1 分钟阅读

谷歌DeepMind于2026年7月30日发布Gemini Robotics 2时,附上了一台人形机器人的成功率图表:拧下灯泡92%,拧上灯泡36%,使用簸箕32%。DeepMind的页面没有说明其中任何一项背后做了多少次试验。

机器人基础模型,是指用一个训练好的网络,接收摄像头画面和书面指令,为多种任务、多种机器人本体输出电机指令。2026年已有八家实验室发布了这类模型或其更新版本。tuput能追溯到的每一个醒目数字,要么由实验室自己测试,要么页面没有说明由谁测试。至于哪些权重(即开发者可以下载的训练后参数)是公开的,各家差别很大。

谷歌的人形机器人数字,以及谁能用

Gemini Robotics 2是一个视觉-语言-动作模型(VLA):它读取图像和语言,输出动作。卡罗莱纳·帕拉达(Carolina Parada)在DeepMind的文章中说,它既能控制双臂机器人,也能”从脚到指尖”控制完整的人形机器人。随它一同发布的还有两个配套模型。ER 2是一个规划器,把任务拆成步骤并调用VLA。On-Device 2是较小的版本,在机器人自己的计算机上运行。

在Apptronik公司装有Inspire灵巧手的Apollo 2人形机器人上,DeepMind报告的抓取成功率是:从桌面拾起物体68.4%,从架子上76.3%,从地上45.7%。换上Sharpa灵巧手后,拧下灯泡92%,系垃圾袋44%,封口袋40%,拧上灯泡36%,簸箕32%。在配有夹爪的Franka Duo双臂上,拾取放置得分74.2%,工具配套78.9%,精密插入89.6%。谷歌表示,多指灵巧操作仍然很有挑战,机器人的动作还需要更快。造成这些低分的手部问题,在我们关于机器人之手如何学会抓握的文章中有解释。

能用到的人很少。VLA和On-Device 2只提供给早期访问合作伙伴,模型页面提到有100多家受信任的测试者。ER 2可以在Google AI Studio中试用,标注为预览版。

ER 2有谷歌自己评测得出的数字:进度分类的准确率为57.4%(把视频帧归入任务完成程度的五个档位之一),时刻定位为91.3%(挑出关键事件发生的那一帧),平均误差0.96秒。谷歌还发布了一个名为ASIMOV-Agentic的安全基准,并称在测试中,有人靠近时ER 2让人形机器人停了下来。

On-Device 2的模型卡比博客文章直白得多。它列出的局限包括:对训练分布之外的任务泛化有限,控制多关节机器人的能力有限。它的安全测试只涵盖站立式双臂作业,所以全身动作的风险不在范围之内。DeepMind称,一台新的双臂机器人,只需几个小时内采集的不到200个示例就能适配。

Physical Intelligence:pi0.7,以及”未见过”的麻烦

Physical Intelligence于2026年4月16日把pi0.7的论文发布到了arXiv。该模型约有50亿参数:一个40亿参数的语言与视觉主干(起点是谷歌的Gemma 3),加上一个8.6亿参数的动作模块。

最醒目的测试是在UR5e机械臂上叠衬衫,而此前没有为这台机械臂采集过任何叠衣服的数据。作者报告pi0.7的成功率为80%,任务进度为85.6%,十名经验丰富的人类遥操作员则是成功率80.6%,任务进度90.9%。研究是作者自己做的。在未见过的任务或新的任务与机器人组合上,他们报告的成功率大约在60%到80%,而见过的任务常常超过90%。叠衣服是常用的压力测试,它为什么一直很难,见我们关于机器人下棋拿冠军、洗衣却不及格的文章。

作者写道,考虑到他们数据集的规模,很难判断什么算是未见过。The Decoder报道了一个例子:一台机器人把红薯放进空气炸锅,需要一步一步地指导,而训练数据里只有两段机器人关上空气炸锅的记录。

论文没有说是否会发布权重。tuput读到的openpi代码库页面,列出的是Apache 2.0许可下的pi0、pi0-FAST和pi0.5,没有pi0.7。

Skild的S1:未见过的任务66%,常规训练86%

Skild AI的博客介绍说,S1是一个看一遍某项任务的视频就能去做的模型,不需要改动权重。任务时长最长十分钟。经过10万小时的预训练,在未见过的任务上,Skild报告成功率为66%,而用同样数据、同样架构和同样算力训练、由语言提示的VLA为9%。这个指标是长任务中逐步成功率的平均值。Skild说使用了两套内部基准,但没有给出任务数或试验次数。失败的执行过程可以由人工操作员介入恢复,主要用在对照基线上,否则它在未见过的长任务上得分为零。

Skild自己的数字也显示了局限。用2000次示范做后训练的VLA,在Skild测试的这项新任务上达到了86%,高于看一遍视频得到的66%。Skild估计一段视频相当于约380次示范,并称这个数字是插值得来的。这篇文章提供的是早期访问报名,而不是下载。

The Robot Report引述首席执行官迪帕克·帕塔克(Deepak Pathak)的话说,S1尚未扩展到人形机器人,也还没有做好进入家庭的准备。文章没有说明它在哪些机器人上运行过。

英伟达、小米和宇树的开放权重

英伟达的GR00T N1.7约有30亿参数。3月16日的新闻稿称它以商业许可的方式提供早期访问。7月7日的一篇技术文章称,它采用Apache 2.0发布,权重在Hugging Face上,训练代码在GitHub上,预训练使用了约3.2万小时的真实数据和第一人称人类数据,以及8000小时的仿真数据。它相对N1.6的提升只以相对值给出:在一项DROID测试上提高61%,在SimplerEnv Bridge上提高5%。同一模型在Hugging Face上的模型卡写的却是NVIDIA开放模型许可,所以英伟达的两个页面对许可的说法并不一致。

英伟达3月的发布还预告了GR00T N2,它基于DreamZero研究。英伟达的工程师把DreamZero描述为世界-动作模型,即一个同时生成预测视频和动作的网络。英伟达称,它在新环境中完成新任务的成功率,是领先VLA的两倍多,并在MolmoSpaces和RoboArena排行榜上排名第一。发布文件没有提供这一说法背后的数据,N2预定于2026年底推出。

小米的XR-1把测试和权重一起公布。它的说明文件采用Apache 2.0,写明先用超过10万小时、不带机器人本体录制的示范数据做预训练,再用跨越多种机器人类型的超过1万小时数据做后训练。检查点、后训练代码和评测代码都是公开的,技术报告于7月16日上了arXiv。小米报告在RoboCasa365仿真基准上为57.4%,第二名的模型为46.6%。在四项真机任务上,每项任务数据不足10小时的情况下,总体为75%,pi0.5为40%;数据不足40小时时是85%对53%。在40小时的设定下,洗衣装机达到100%,对比为50%。真机对比是小米自己做的,说明文件还称,截至7月15日,XR-1在RoboCasa365和RoboDojo排行榜上排名第一。

宇树于9月10日宣布开源UnifoLM-WLA-1.0,称这个模型既能驱动桌面操作,也能驱动全身作业。它在Hugging Face上的页面列出了一个Apache 2.0许可的基础检查点,但tuput读到时模型卡是空的,所以没有任务数据可查。宇树的人形机器人硬件,以及它与扫地机器人共用的部分,见我们对两者的比较。

Figure和智元

据Figure称,2026年1月27日推出的Helix 02,可以不重置、连续执行一项长达四分钟、包含61个动作的洗碗机任务。它的平衡层是一个1000万参数的网络,用超过1000小时的人体运动数据训练。页面没有给出成功率,并把手指层面的任务与Figure 03的硬件挂钩,该硬件的指尖传感器能感知小到三克的力。Figure称这些结果还处于早期。这类人形机器人在付费试点中做了什么,见我们关于人形机器人开始上班的报道。

智元4月9日宣布的GO-2,据The Robot Report称,在LIBERO仿真套件上达到98.5%,在LIBERO-Plus上为86.6%,仅经仿真训练后的真实世界迁移为82.9%。这三个数字都是智元自己给出的,文章没有说GO-2的权重是否公开。

为什么这些百分比无法并排比较

LIBERO上的98.5%,是在一套固定仿真任务上的得分。簸箕上的32%,是一台装有22个关节灵巧手的真实人形机器人。Skild的66%,是对长任务逐步成功率的平均。没有哪两个数字共用同一项任务、同一个机器人或同一种评分规则,而那些拿自己与别人比较的实验室,点名的对手是pi0.5,或者是自家模型的早期版本。

英伟达3月的发布文件称,GR00T N2预定于2026年底前推出。

Share
Copied!

资料来源与延伸阅读

  1. Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots (30 July 2026)
  2. Google DeepMind: Gemini Robotics 2 overview and trusted tester programme
  3. Google DeepMind: Gemini Robotics On-Device 2 model card
  4. Google: Introducing Gemini Robotics ER 2 (30 July 2026)
  5. Physical Intelligence: pi 0.7, a Steerable Generalist Robotic Foundation Model with Emergent Capabilities (arXiv 2604.15483, 16 April 2026)
  6. The Decoder: Physical Intelligence shows robot model with LLM-like generalization, flaws included
  7. Physical Intelligence: openpi repository (GitHub)
  8. Skild AI: Introducing S1, In-Context Learning for Robotics (August 2026)
  9. The Robot Report: Skild AI unveils S1 flagship robot foundation model (31 August 2026)
  10. NVIDIA: NVIDIA and Global Robotics Leaders Take Physical AI to the Real World (16 March 2026)
  11. NVIDIA Technical Blog: Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T (7 July 2026)
  12. NVIDIA Technical Blog: Pretrained to Imagine, Fine-Tuned to Act, the Rise of World-Action Models (15 June 2026)
  13. Hugging Face: NVIDIA GR00T-N1.7-3B model card
  14. GitHub: Xiaomi-Robotics-1 (XR-1) README
  15. Hugging Face: Unitree Robotics models, UnifoLM-WLA-1.0-Base
  16. PANews: Unitree Robotics open-sources UnifoLM-WLA-1.0 embodied foundation model
  17. Figure: Introducing Helix 02, Full-Body Autonomy (27 January 2026)
  18. The Robot Report: AGIBOT releases GO-2 foundation model for embodied AI (9 April 2026)

本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。

#robot foundation models#gemini robotics 2#physical intelligence#nvidia gr00t#skild ai#xiaomi robotics#humanoid robots#vision-language-action

喜欢这篇吗?下一篇也别错过。

每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。

同类更多: 机器人
2002年的Roomba售价199.95美元,没有地图;今天的人形机器人与扫地机器人行业共用充电难题和激光雷达供应商,硬件却所剩无几
2002年的Roomba没有地图也能行进,因为位置感知系统会让它的成本增加1,000多美元。iRobot、禾赛、石头科技、科沃斯的资料和学术论文显示,它的哪些思路传到了今天的人形机器人身上。
恐怖谷不是一条自然法则。它是一个设计决定
随着人形机器人大量涌入这个世界,一种古老的不安感也随之回归:当一台机器看起来几乎像人类时,那种令人反胃的感觉。我们把它当作心智中一个固定的事实。但事实并非如此。这是一个工程师可以选择避开的陷阱。
2026年,人形机器人终于打卡上班了
几十年来,那种会走路、会说话的机器人一直被说成'再过几年就实现了'。今年,它们开始出现在工厂车间和机场里,从事真实的任务,记录下真实的工时。问题在于它们的数量有多稀少。
← 全部文章