Skip to content
一只机器人手学会魔方花了相当于1.3万年的模拟练习,而到了2026年,一只五指手拧上灯泡的成功率仍只有36%
机器人

一只机器人手学会魔方花了相当于1.3万年的模拟练习,而到了2026年,一只五指手拧上灯泡的成功率仍只有36%

插图:tuput

中文

OpenAI的机器人手在大约1.3万年的模拟练习之后,十次尝试里有两次解开了最难的魔方打乱状态。此后各实验室又加入了人类示范、触觉传感器和更便宜的手,谷歌DeepMind在2026年7月公布的五指手数据,成功率从32%到92%不等。

· · 1 分钟阅读

OpenAI的机器人手在模拟中练习了相当于大约1.3万年之后,用它最好的一套设置,十次尝试里有两次解开了最难的魔方打乱状态。报告这一结果的论文于2019年10月16日上传到arXiv。此后,各实验室也开始用人类示范、触觉传感器和更便宜的硬件来教机器人手,而五指手最新的实测结果来自谷歌DeepMind,发布于2026年7月30日,视任务不同,成功率从32%到92%不等。

下面每一个数字,都是有名有姓的实验室在自己的论文或公告里报告的。它们大多来自不同的机器人、不同的物体和不同的成功标准,所以这不是一张排行榜。

OpenAI的魔方手到底做到了什么

这只机器人手是Shadow Dexterous E Series Hand,一只五指的仿人手,由三台RGB摄像头盯着魔方。OpenAI完全在模拟环境里训练了控制策略和视觉系统,然后把它们搬到真实的手上。它把功劳归于自动域随机化:模拟器不断生成越来越难的各种世界变体,让策略无法依赖其中任何一种。

论文给出魔方策略累计的训练经验约为1.3万年,运行在64块NVIDIA V100图形芯片和920台工作机上,每台机器有32个处理器核心。

真实机器人的结果列在一张表里,每种策略做十次试验。最好的策略在魔方各面角度由Giiker传感器提供的情况下,需要15次转面的打乱状态在60%的试验中解开,最坏情况下需要26次转面的打乱状态为20%。只靠视觉读取各面角度时,同一策略的成绩是20%和0%。如果魔方掉落,或者手在1600个时间步(约128秒)内没有完成,这次试验就结束。论文报告说,当策略转错了面或者魔方滑落时,它通常能通过重新抓握恢复过来。

向人的双手学习

模拟并不是教一只手的唯一办法。可以由人向机器人演示任务,机器人模仿动作。2023年4月,Tony Zhao、Vikash Kumar、Sergey Levine和Chelsea Finn发表了ALOHA,这是一套低成本的双臂系统,由定制的遥操作界面驱动,也就是由人远程操控机器人。他们的算法叫Action Chunking with Transformers,学会了六项真实世界的任务,包括打开半透明的调料杯和装入电池,用大约10分钟的示范就达到80%到90%的成功率。项目页面说,硬件是在2万美元的预算内造出来的。

接下来是把许多实验室的示范汇集起来。2023年10月发布的Open X-Embodiment论文合并了21家机构22种机器人的数据,涵盖527项技能。在涌现技能测试中,它的RT-2-X模型得分75.8%,RT-2为27.3%。作者说,他们没有测试感知和执行方式差别很大的机器人,也没有研究向新机器人推广的能力。

Cui及其同事在2025年10月写道,手动遥操作一只灵巧的臂和手,会让人类操作员不堪重负。他们的办法是把工作拆开:由人通过虚拟现实引导手臂,由一个学习得来的策略根据触觉和摄像头反馈来驱动手指。他们报告,在各种物体上(包括没见过的)成功率为90%。2025年6月,Elvis Nava、Robert Katzschmann及其同事介绍了mimic-one,一只有16个自由度的手,用手套和虚拟现实示范训练,在分布外测试中的成功率最高为93.3%,所谓分布外,是指与训练数据不同的情形。

机器人也可以从自己的错误中学习。Physical Intelligence在2025年11月18日发布的pi*0.6论文,介绍了一种叫RECAP的训练方法,它把示范、机器人自己的尝试和人类遥操作员的纠正混在一起。该公司报告说,由此得到的模型能在真实的家里叠衣服、组装纸箱、做浓缩咖啡饮品,在一些最难的任务上,这种方法让吞吐量提高了一倍以上,失败率大约减半。洗衣服也正是tuput之前那篇讲莫拉维克悖论的文章用作标题的例子。

让指尖有触觉

F-TAC Hand来自一个包括Zihang Zhao、Kaspar Althoefer和Song-Chun Zhu在内的团队,它在70%的表面上布有空间分辨率为0.1毫米的触觉感知。预印本于2024年12月19日出现,伦敦玛丽女王大学于2025年6月9日宣布了发表在《自然·机器智能》(Nature Machine Intelligence)上的正式版本。作者报告说,在600次真实世界试验中,带触觉的手在复杂操作任务上胜过没有触觉的方案(p小于0.0001)。

Meta的人工智能研究团队于2024年10月31日发布了Digit 360指尖。Meta称它有800多万个触觉像素(taxel,即感知触摸的像素),能感知小到1毫牛的力,并配有Sparsh,一个用46万多张触觉图像预训练的触觉模型。GelSight将生产Digit 360,Wonik Robotics将生产一款触觉Allegro Hand,两者都计划在2025年广泛供货。

触觉不一定要很复杂。Qi Ye及其同事在《科学·机器人学》(Science Robotics)上的一篇论文,于2026年2月17日被报道,它用的是低成本的四指LEAP Hand,配一台普通网络摄像头和简单的有触觉或无触觉传感器,此前已用结合视觉与触觉的人类示范做过预训练。这只手完成了它的八项任务,总体成功率73%,在模拟中练过的五项任务为85%。其余三项没见过的任务,包括削铅笔和拧松螺丝,Phys.org的报道说是”大部分时候”完成了,没有给出具体数字。列出的失败包括:小瓶盖,手的扭矩不够拧不动;还有手指卡在狭窄的水龙头手柄槽里。

更便宜的手,用缆绳代替电机

Kenneth Shaw、Ananye Agarwal和Deepak Pathak在2023年9月写道,由于缺少合适的硬件,灵巧操作的学习方法大多停留在模拟中。他们的LEAP Hand造价约2000美元,用现成的零件花四个小时就能组装起来。摘要称,这大约是最接近的竞争对手Allegro Hand价格的八分之一。

一些较新的手用称为肌腱的缆绳来驱动手指。mimic-one就是一例。Ruka-v2也是,它来自包括Lerrel Pinto和Irmak Guzey在内的团队,发布于2026年3月27日。它在最初的Ruka基础上增加了一个两自由度的手腕和手指的侧向运动,作者说最初的Ruka造价可以低于1300美元。在遥操作任务的用户研究中,Ruka-v2相比最初版本把完成时间缩短了51.3%,把成功率提高了21.2%。它在13项任务上做了遥操作,其中3项是自主学会的。

模拟又回来了

模拟并没有失去它的位置。Toru Lin、Jitendra Malik、Yuke Zhu及其同事在2025年2月报告了一套在模拟中训练的强化学习流程,用于一台装有两只多指手的Fourier GR1人形机器人。他们报告,见过的物体成功率约为90%,新物体为60%到80%。按任务看,最好的策略平均成绩是:抓取并伸手62.3%,抬起箱子80%,双手交接52.5%,每个物体做十次试验。作者推测,交接成绩偏低是因为对模拟物理只用了简单的随机化,并说这些能力离通用的、达到人类水平的操作还差得很远。

2026年2月的一篇论文DexRepNet++报告,一个在40种物体上训练、在5000多种没见过的物体上测试的策略,在模拟中的抓取成功率为87.9%。它的摘要提到模拟与真实硬件之间的差距很小,但没有给出真实世界的成功率。

DeepMind 2026年7月的五指手数据

2026年7月30日,谷歌DeepMind发布了Gemini Robotics 2。这个模型控制着Apptronik的Apollo 2人形机器人上那只五指、22个自由度的SharpaWave手。DeepMind的文章给出了这只手的成功率:拧下灯泡92%,拧上灯泡36%,系垃圾袋44%,簸箕任务32%,密封袋40%。在Franka Duo平台的双指夹爪上,它报告通用抓取放置为74.2%,工具配套为78.9%,精确插入为89.6%。

DeepMind的文章说,多指灵巧操作依然很有挑战。它还说,新的双臂机器人通常用不到200个示例就能适配。

tuput那篇讲2026年人形机器人上岗的报道,讲的是这类机器在工厂和机场的一面。

仍然会失败的地方

第一个问题是难以比较。Weiguang Zhao及其同事2026年5月对灵巧手研究的一份综述说,各项研究对机器人、传感器、任务、训练数据和评估采用不同的假设,系统性的比较因此很困难。

第二个是示范与没见过的物体之间的差距。2019年的魔方手在最坏情况的打乱状态上十次里解开了两次,Lin及其同事在新物体上的数字落后于见过的物体,DeepMind报告的五个五指结果中有四个低于50%,全部来自DeepMind自己的测试。《科学·机器人学》那个团队把扭矩、卡住和打滑列为尚未解决的机械问题。

第三个是获取渠道和速度。据The Robot Report 2026年8月2日的报道,DeepMind把Gemini Robotics 2模型及其设备端版本只限于早期访问的合作伙伴,并表示机器人在运动速度上还有更多需要提升的地方。

Share
Copied!

资料来源与延伸阅读

  1. OpenAI: Solving Rubik's Cube with a Robot Hand (arXiv:1910.07113 abstract, 16 October 2019)
  2. OpenAI: Solving Rubik's Cube with a Robot Hand (full text, results tables)
  3. Zhao, Kumar, Levine and Finn: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ALOHA, arXiv:2304.13705)
  4. ALOHA project page (Tony Zhao)
  5. Open X-Embodiment: Robotic Learning Datasets and RT-X Models (arXiv:2310.08864)
  6. Open X-Embodiment, full text with Tables I and II
  7. Shaw, Agarwal and Pathak: LEAP Hand, Low-Cost, Efficient, and Anthropomorphic Hand for Robot Learning (arXiv:2309.06440)
  8. Zhao et al.: Embedding high-resolution touch across robotic hands enables adaptive human-like grasping (F-TAC Hand, arXiv:2412.14482)
  9. Queen Mary University of London: Robotic hand with human-like touch (9 June 2025)
  10. Meta FAIR: Digit 360 and Sparsh tactile releases (31 October 2024)
  11. Phys.org / TechXplore: Robot hand approaches human-like dexterity with visual-tactile training (Science Robotics, 17 February 2026)
  12. Nava et al.: mimic-one, a Scalable Model Recipe for General Purpose Robot Dexterity (arXiv:2506.11916)
  13. Liu et al.: Ruka-v2, Tendon Driven Open-Source Dexterous Hand (arXiv:2603.26660)
  14. Cui et al.: End-to-End Dexterous Arm-Hand VLA Policies via Shared Autonomy (arXiv:2511.00139)
  15. Physical Intelligence: pi*0.6, a VLA That Learns From Experience (arXiv:2511.14759)
  16. Lin et al.: Sim-to-Real Reinforcement Learning for Vision-Based Dexterous Manipulation on Humanoids (arXiv:2502.20396)
  17. Liu et al.: DexRepNet++ (arXiv:2602.21811)
  18. Google DeepMind: Gemini Robotics 2 brings whole body intelligence to robots (30 July 2026)
  19. The Robot Report: Google DeepMind says Gemini Robotics 2 enables full-body control (2 August 2026)
  20. Zhao et al.: Towards Robotic Dexterous Hand Intelligence, A Survey (arXiv:2605.13925)

本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。

#robot hands#dexterous manipulation#imitation learning#tactile sensing#sim-to-real#gemini robotics

喜欢这篇吗?下一篇也别错过。

每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。

同类更多: 机器人
四条腿的机器人,已经在走进那些足以要你命的地方
一类不太起眼的机器已经悄悄潜入了地球上一些最危险的工作场所:辐射弥漫的房间、充满毒气的矿井、随时可能坍塌的建筑物。它们用四条腿行走,而且不需要呼吸。
恐怖谷不是一条自然法则。它是一个设计决定
随着人形机器人大量涌入这个世界,一种古老的不安感也随之回归:当一台机器看起来几乎像人类时,那种令人反胃的感觉。我们把它当作心智中一个固定的事实。但事实并非如此。这是一个工程师可以选择避开的陷阱。
2026年,人形机器人终于打卡上班了
几十年来,那种会走路、会说话的机器人一直被说成'再过几年就实现了'。今年,它们开始出现在工厂车间和机场里,从事真实的任务,记录下真实的工时。问题在于它们的数量有多稀少。
← 全部文章