通用机器人,离我们还有多远?
过去一年,VLA(视觉-语言-动作模型)、机器人基础模型、世界模型,这些关键词在具身智能领域内几乎轮番成为热点。各种演示视频让人应接不暇:机器人叠碗、插管、倒水、整理桌面,看起来它们正从“听懂指令”稳步迈向“动手执行任务”。
然而,一个更为核心的问题始终悬而未决:这些模型的实际能力究竟强在哪里?它们是仅在仿真环境中表现亮眼,还是在真实世界中也能稳定运行?它们能完成单个动作,还是能把一整套流程顺畅地执行到底?
曾推出RoboTwin系列基准的团队,近日发布了RoboDojo——一套致力于统一覆盖仿真与真实机器人操作的具身智能评测体系。该体系包含42个仿真任务、18个真实机器人任务,并将30个具有代表性的机器人策略置于同一标准下进行横向比较。
评测结果颇具启示:在仿真环境中,当前表现最佳的通用机器人策略,平均成功率仅为8.80%;而迁移到真实世界后,头部模型的平均成功率也只有12.8%。作为对照,人类专家在仿真中的成功率为76.03%,在真实世界里更是直接达到了100%。
这说明了什么?很简单,当前的机器人基础模型确实在进步,但要达到“可靠”与“可复现”这两个通用操作的关键要求,仍有相当长的路要走。

论文标题:RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

RoboDojo 项目介绍视频。
RoboDojo:为具身智能打造一套“综合能力考核”
RoboDojo的核心思路,与其说是堆砌任务数量,不如说是拆解一个更本质的问题:机器人操作到底需要哪些核心能力?
他们将这个问题分解为五个维度,更贴近真实场景的挑战:
- 泛化能力:模型能否适应新背景、新光照、新物体和杂乱场景?
- 记忆能力:模型能否记住之前看到的信息,并在后续动作中加以运用?
- 精细操作能力:模型能否完成插入、对齐、接触等高精度动作?
- 长程执行能力:模型能否连续完成多个相互依赖的步骤?
- 开放语义理解能力:模型能否理解从未见过的语言指令,并将其转化为相应动作?

这些任务,远非传统pick-and-place的简单变体。在泛化任务中,桌面杂物数量、物体外观、背景与光照都会发生变化;记忆任务里,机器人需要记住传送带上曾出现又消失的目标;长程任务中,拿起、移动、对齐、放置,任何一个步骤出错,都可能导致最终失败。

RoboDojo 仿真任务总览
这也是具身智能与纯视觉、纯语言任务的一个主要区别:在物理世界中,微小的误差也可能导致任务失败。
从仿真到真机,评测的终极考验
RoboDojo并未停留在仿真环境中自我验证。团队设计了18个真实世界任务,覆盖ARX X5、Piper、Piper X三种双臂机器人平台,每个平台各承担6个任务。从制作食物、插管、插充电器,到叠碗、挂杯子、清扫积木,再到给物体分类、把物品装进背包,这些任务听起来日常,但对机器人而言,挑战性十足。

RoboDojo Real-World Benchmark:18 个任务覆盖 3 种机器人平台

真实机器人操作任务示例
真实世界会引入一系列仿真中不存在的“意外”:相机噪声、标定误差、机械臂延迟、夹爪打滑、接触不稳定、物体初始位置偏差等等。一个在仿真中表现稳定的策略,迁移到真机后,性能下降几乎是必然的。
为了提升真机评测的可比性和可复现性,RoboDojo-RealEval做了大量标准化工作:统一硬件配置、工作空间布局、光照条件、场景复位流程、评测协议和部署接口。每个trial都由评审双盲打分,既看最终结果,也看中间步骤的完成情况。

RoboDojo-RealEval 标准化评测平台
这使得它更接近一套标准化的评测流程,而不仅仅是某个科研团队的个例展示。
榜单结果:头部模型与人类专家,差距依然显著
在仿真榜单中,团队评测了30个具有代表性的机器人操作策略,包括Hy-Embodied-0.5-VLA、Spatial Forcing、π0.5、X-VLA、GR00T-N1.7、π0、OpenVLA-OFT等。

排名第一的是Hy-Embodied-0.5-VLA,平均成功率为8.80%。虽然领先其他模型,但与人类专家76.03%的仿真成功率相比,差距依然巨大。

仿真榜单:Hy-Embodied-0.5-VLA 暂列第一,平均成功率 8.80%
真实世界榜单中,π0.5排名靠前,总体成功率为12.8%,平均分为22.9。InternVLA-A1、GalaxeaVLA、Xiaomi-Robotics-0、X-VLA等模型也进入头部区间,但整体成功率依然处于较低水平。

真实世界榜单:π0.5 暂列第一,总体成功率 12.8%
特别值得关注的是开放语义任务上的结果:当前表现最好的模型,在Open任务上的成功率仅有1.67%。
这些数据清晰地表明,当前机器人模型已具备一定的操作能力,但在稳定性和任务完整度上,仍有巨大的提升空间。它们往往能完成部分步骤,但在对齐、插入、放置、恢复等关键环节,还是容易出现失误。

RoboDojo 将排行榜可视化为一座“具身珠峰”
为什么单个demo,不足以反映通用能力?
RoboDojo的结果揭示了一个现实:机器人基础模型的能力增长并不均衡。有的模型视觉识别更强,有的动作执行更顺畅,有的在长程任务中能推进更多步骤。
而通用机器人,恰恰需要同时在多个维度上表现稳定——既要理解环境,也要记住关键信息;既要规划合理,也要执行准确;既要处理熟悉任务,也要理解开放指令;既要在仿真中跑通,也要在真实机械臂上稳定运行。
因此,单个任务、固定环境,或经过筛选的成功片段,往往不足以全面反映一个模型是否可靠、是否具备泛化能力、是否适合实际部署。RoboDojo的价值在于,它把这些差异放到同一张榜单中比较,让不同模型在记忆、泛化、动作精度、长程执行和真机迁移等维度上的表现,变得更加清晰可见。
不只是评测,也是基础设施
除了benchmark本身,RoboDojo还提供了两项关键基础设施。
首先是异构并行仿真。传统仿真并行往往复制同一场景,只改变初始状态;而RoboDojo支持不同任务、不同物体、不同布局同时运行,显著提升了评测效率。
其次是XPolicyLab,一个统一接入层,专门处理不同机器人策略之间的数据格式、预处理流程、训练脚本、动作表示和部署环境差异。不同模型只要接入统一的observation-action接口,就能在RoboDojo仿真环境和RoboDojo-RealEval真机平台上运行。
这让RoboDojo不只是一次性论文基准,而更像一个可持续更新的具身智能竞技场:模型可以持续上榜,任务可以继续扩展,真实机器人评测也可以远程接入。

RoboDojo 后续计划扩展至灵巧操作、人形全身操作、触觉操作和移动操作
具身智能,需要更统一的评测标准
过去,机器人领域的发展常常由demo推动。一个模型完成几个漂亮的任务,很容易让人产生“通用机器人即将成熟”的错觉。
RoboDojo的评测结果,则提供了一个更完整的参照系:当前模型确实在持续进步,但距离可靠、泛化、可部署的通用机器人操作,整体上仍有差距。
从研究角度看,这样的基准有助于把问题描述得更清楚。通用机器人,并不只是会抓取物体,或者只会执行一句指令,而是需要在复杂、变化、带噪声的真实环境中,把感知、记忆、规划、控制和纠错串联起来,形成稳定闭环。
RoboDojo提供了一套可重复使用的评测框架,为后续模型迭代和能力对比,提供了一个共同的参照。
