说到双臂灵巧操作,行业里一直有个尴尬的局面:现有的VLA系统要么聚焦双臂低自由度的夹爪控制,要么专攻单臂高自由度的灵巧手,始终没法把"双臂协同"和"精细手指动作"真正统一起来。
举个例子你就明白了。活塞插入需要双臂精准配合,拧瓶盖、精细取物又得靠多指灵活调控——这类任务长期缺一个统一的VLA解决方案。直到最近,首个原生面向双臂双高自由度(36自由度)灵巧操作的开源VLA模型——Dexora的出现,才打破了这种形态壁垒,给通用灵巧机器人的落地提供了全新思路。

同时支持双臂协同、双灵巧手高自由度精细操作
——端到端VLA模型

硬件与遥操作:虚实协同的灵巧数据底座
高自由度灵巧操作的核心前提,是精准、可规模化的数据采集。
Dexora没有走简单的"单一遥操作"路线,而是打造了一套"外骨骼+VR"混合遥操作系统,同时驱动物理机器人与MuJoCo数字孪生,从根源上解决了数据采集的精度与规模难题。

▲Dex 硬件与混合遥操作系统示意图
硬件层面,Dexora搭载了两台6自由度AIRBOT机械臂和一对12自由度XHAND灵巧手。单只手的12个关节全都可以独立驱动,拇指和食指还支持侧摆动作,能实现扭转、捏取这类类人精细操作。整套系统加起来36个自由度,为复杂双手协同任务提供了实打实的硬件基础。
遥操作设计上,采用的是"大动作+小动作"分离策略:定制外骨骼背包负责捕捉机械臂的整体运动(无漂移、低延迟),Apple Vision Pro则做无标记手指追踪。这样一来,既保住了手臂大范围移动的稳定性,又兼顾了手指精细动作的灵活性。

▲仿真 / 真实数据集物体与任务分布示意图
更关键的是虚实同步设计:遥操作指令会同时下发给物理机器人和数字孪生,两者的传感器数据(4路RGB、36自由度关节状态)以20Hz的频率同步记录。这种做法既保障了真实场景数据的真实性,又能在仿真环境中低成本扩展任务场景,形成一套"真实+仿真"互补的数据集。
最终构建的数据集规模相当可观:10万条仿真轨迹(650万帧)、1万条真实遥操作轨迹(292万帧),覆盖30类仿真物体和17类真实物体,基础抓取和精细灵巧任务都兼顾到了。

模型架构:扩散Transformer+质量判别器双核心
Dexora采用了一种基于数据质量感知的端到端VLA架构,核心思路是用扩散Transformer生成动作,再搭配一个离线质量判别器过滤噪声数据,解决遥操作数据质量参差不齐、高维动作训练不稳定的行业痛点。

▲Dexora 整体总览图(动机 / 数据 / 架构 / 性能 / 泛化)
扩散Transformer策略网络
策略核心是一个解码器-only的扩散Transformer。输入是多视角RGB图像、语言指令和当前关节状态,输出是36自由度的连续动作序列。模型用T5编码语言指令、SigLip编码图像特征,然后交替注入Transformer块,通过去噪预测生成动作。这种设计既兼顾了多模态融合能力,也保证了高维动作的建模精度。
数据质量判别器
遥操作数据经常会因为操作误差或传感器噪声产生低质量轨迹,直接拿来训练会拉低模型性能。Dexora设计了一个离线判别器,通过"运动平滑度+任务成功率"双重标准来筛选数据:先预筛选,计算轨迹的加速度和抖动值,把运动平稳的样本留下;再后验证,把轨迹重放一遍,只保留那些无碰撞、能成功完成任务的样本。
判别器以冻结的预训练策略为基准,预测轨迹质量得分(0-1之间)。训练时把得分转化为权重,高质量轨迹权重大、低质量轨迹权重小,公式可以简化为:
其中是质量权重,为预测噪声,为真实噪声。这种设计的核心逻辑是让模型聚焦在有效数据上,大幅提升高维灵巧动作的训练稳定性。

训练流程:三阶段渐进式优化
Dexora的训练分为三个渐进阶段:"仿真预训练+判别器训练+真实微调",目的是平衡基础能力与灵巧技能,实现从仿真到真实的平滑迁移。

▲Dex 数据过滤、判别器训练、质量感知训练框架图
第一阶段,用10万条仿真轨迹做预训练,让模型掌握抓取、组装这类基础操作,形成初步的动作生成能力;第二阶段,用筛选后的高质量真实数据训练判别器,让它能精准识别轨迹好坏;第三阶段,用全部真实数据微调策略,通过质量权重引导,让模型从基础能力进阶到拧瓶盖、精细取物这类灵巧技能。

性能与泛化
实验结果显示,Dexora在基础任务、灵巧任务、跨形态泛化这三大维度上都实现了明显突破,验证了双臂双高自由度设计以及质量感知训练的有效性。

▲基础任务示例图

▲基础任务成功率对比表
先看基础任务(抓取、组装、关节操作):平均成功率达到89.6%,12项任务中有7项的成功率超过了90%。在双臂协同任务上(比如双手递物、嵌套碗分离),优势尤其明显,远远超过GR00T N1(82.1%)和π0(50.4%)等基线模型。

▲灵巧任务示例图

▲灵巧任务成功率对比表
再看灵巧任务(拧瓶盖、用钢笔、切韭菜等):平均成功率66.7%,比最优基线GR00T N1(51.7%)提升了整整15个百分点。尤其是那些需要双手配合加多指调控的任务,比如拧瓶盖、精细面团操作,基线模型基本失效,而Dexora依然能稳定完成。

▲分布外泛化性能图
泛化能力方面也有亮点:一是分布外泛化,在未知背景、光照、物体、遮挡等场景下,成功率只有小幅下降,鲁棒性相当强;二是跨形态迁移,这个36自由度的模型可以直接适配单臂夹爪、双臂夹爪、单臂低自由度手,不需要重新训练,只需要适配动作维度就行,打破了VLA对特定形态的依赖。

▲基础任务成功率对比表
消融实验也证实了,质量判别器能有效降低动作抖动、提升任务稳定性。可以说,"真实数据+质量感知"是灵巧VLA的核心要素。

▲质量判别器效果对比轨迹图

灵巧VLA:价值与局限并存
Dexora作为首个原生双臂双高自由度VLA,证明了一个重要方向:高自由度模型可以向下兼容低自由度设备,为通用机器人提供"高维训练、低维部署"的新思路。
虚实协同采集加上质量感知训练,解决了灵巧数据稀缺、噪声大的老大难问题,为高维VLA的数据建设提供了可参考的范本。

▲Dexora 与主流 VLA 的形态覆盖对比图
当然,局限性也很明显:
硬件方面,36自由度系统成本偏高,短期内很难普及,而且没有触觉反馈,像拧瓶盖这类接触敏感的任务成功率仍然偏低。
任务层面,复杂的长时序任务(比如多步骤装配)、动态环境适应能力还不够。
泛化边界方面,跨材质、极端场景下的稳定性还需要继续提升。
回顾一下,过去的VLA要么"能双手但不精细",要么"能精细但没法双手"。Dexora首次把这两者统一了,而且通过开源模式降低了门槛,为服务机器人、工业灵巧操作等场景提供了一个可行的方案。
未来如果能融合触觉反馈、强化长时序推理,Dexora很有希望进一步缩小与人类操作的差距,推动通用灵巧机器人从实验室真正走向实际应用。
Ref
论文标题:Dexora: Open-source VLA for High-DoF Bimanual Dexterity
论文作者:Zongzheng Zhang, Jingrui Pang, Zhuo Yang, Kun Li, Minwen Liao, Saining Zhang, Guoxuan Chi, Jinbang Guo, Huan-ang Gao, Modi Shi, Dongyun Ge, Yao Mu, Jiayuan Gu, Rui Chen, Hao Dong, Huazhe Xu, Li Yi, Yixin Zhu, Hang Zhao, Pengwei Wang, Shanghang Zhang, Guocai Yao, Jianyu Chen, Hongyang Li, Hao Zhao
论文链接:https://arxiv.org/pdf/2605.18722
项目链接:https://dexora vla.github.io/
