机器人硬件升级后,过去积累的高成本历史数据是否还能继续发挥作用?一项最新研究揭示了一个反直觉的结论:旧数据并非从一开始就能派上用场,而是只有当新硬件的性能跨越某个“临界点”后,才会突然“开窍”并释放出巨大价值。 该研究由千寻智能高阳团队主导,为昂贵的数据采集策略提供了全新的思路。
一个真实且昂贵的难题:硬件升级后,旧数据真的“作废”了吗?
机器人要在真实世界中稳定工作,离不开大量的演示数据(即人工示教数据,通过人直接操作机器人采集)。然而,现实是机器人硬件不断迭代升级:摄像头可能更换为视野更广、清晰度更高的新型号,夹爪也可能换成更灵活的新设计。
这些硬件改动会直接改变机器人“感知到的画面”和“执行动作的方式”,从而引发一个现实问题:在旧硬件上投入大量人力、资金采集的演示数据,还能用于新机器人吗?
一个直观的思路是将海量历史数据与少量新数据混合训练(即“co-training / 共同训练”),让旧数据“辅助”新机器人学习。以往的研究(如 RoboNet、BridgeData)表明,旧数据确实能降低新场景的数据采集成本,但并未回答一个更关键的问题:硬件更换后,旧数据是否从一开始就具备价值? 迁移学习的经验告诉我们,当新旧数据差异过大时,旧数据不仅无用,甚至可能干扰学习过程。
反直觉的发现:旧数据并非“越多越好”,而是存在一个“开窍时刻”
研究团队在一个轮式人形机器人平台上开展了系统性实验,跨越两代硬件,更换了摄像头和夹爪,但机器人整体形态保持不变。他们对比了两种策略的表现:
- 仅使用新数据训练的策略
- 旧数据 + 新数据共同训练的策略

图2:真实机器人实验平台与操作任务(插花、插笔等精细操作)
结果令人意外。以“插花”这一精细操作为例:
- 当新硬件数据仅有 4.3 小时,机器人自身成功率仅为 10% 时,加入旧数据共同训练,成功率依旧维持在 10%——旧数据完全没有发挥作用。
- 但当新硬件数据增加到 15.6 小时,机器人自身成功率提升至 23.3% 时,同样加入 17 小时的旧数据,成功率直接跃升至 86.7%——大幅提高了 63.4 个百分点。
这意味着,新机器人自身能力的一点点提升,就足以让旧数据从“毫无价值”转变为“点石成金”。
将不同任务、不同数据量下的结果汇总,一个清晰的“三阶段规律”逐渐显现:
- 第一阶段(新机器人能力很低): 旧数据毫无用处,加入后无任何增益。
- 第二阶段(能力跨越某个临界点): 旧数据的收益急剧爆发,带来显著提升。
- 第三阶段(能力接近满分): 旧数据的边际收益开始递减。
这种从“无效”到“突然有效”的跳变,研究团队称之为“涌现式迁移”(Emergent Transfer)。它与大模型领域的“涌现能力”、“grokking(顿悟)”现象类似,但这里的“顿悟”并非依靠堆叠模型规模或延长训练时间触发,而是随着新硬件自身任务能力的提升而被触发。

图3:三阶段相变曲线。迁移阈值 τ(T) 标出了旧数据开始产生显著收益的临界点。
为什么会这样?一个“迁移阈值”及其背后的两套机制
研究团队用一个关键概念来刻画这一跳变:迁移阈值 τ(T)(transfer threshold)。
通俗来说,它相当于“徒弟必须先掌握的基本功水平”——只有当新硬件策略自身的成功率跨越这个任务相关的阈值时,旧数据才会开始发挥作用。
- 阈值之下: 新策略连任务的基本结构都尚未掌握,即使提供再多旧数据的“高级经验”,它也无法有效利用。
- 阈值之上: 新旧数据的梯度方向开始“对齐”,旧数据的经验能够顺畅地迁移过来,导致收益大幅提升。
- 接近满分时: 可提升的空间本就有限,旧数据的边际价值自然下降。
团队进一步从理论层面给出了解释,核心包括两套机制:
- 梯度对齐(Gradient Alignment): 解释了“旧数据何时开始发挥作用”——当新旧数据的梯度方向足够一致时,共同训练不会相互干扰,反而能相互促进。
- 策略残余不确定性(Residual Policy Uncertainty): 解释了“旧数据的收益为何在接近满分时递减”——当策略已经非常确定时,旧数据能补充的信息已经所剩无几。
有什么用?一条“看火候下菜”的数据采集策略
这一规律最实用的价值,在于指导如何高效采集数据。
过去人们通常默认“数据越多越好”,一上来就大规模采集新硬件数据。但这项工作提出了更聪明的“相位感知(phase-aware)数据采集策略”:
- 先仅采集新硬件数据,直到新机器人的能力跨过迁移阈值。
- 然后再引入旧数据进行共同训练。
换言之——先让徒弟练到“开窍”,再请老师傅出手,效果和性价比最高。
研究团队在一个全新的、未被用来推导规律的“移动双臂浇花”任务上验证了这套策略:
- 按照相位感知策略,仅需采集 1.5 小时 的新硬件数据(而按传统做法需要 8 小时)。
- 任务成功率从 40.0% 提升至 78.3%。
以不到 1/5 的新数据采集量,换来了成功率的大幅提升,这对于大量依赖人工示教、成本高昂的真实机器人场景而言,意义重大。

图4:移动双臂浇花任务。相位感知策略将新数据需求从 8 小时压缩到 1.5 小时,成功率从 40.0% 提升到 78.3%。
小提示: 在实际应用中,建议先评估新硬件自身在目标任务上的初始成功率,如果低于某个阈值(例如任务复杂程度不同,阈值可能不同),则优先采集新数据,而非急于混合旧数据。
常见问题
问:迁移阈值 τ(T) 如何确定?
答:团队通过实验发现,迁移阈值并非固定值,而是与任务复杂度、数据量以及新旧硬件差异相关。一个实用的方法是,在新硬件上逐步增加数据量,同时观察新旧数据共同训练后的成功率变化,当成功率出现跳跃式增长时,即可认为跨过了阈值。
问:如果旧数据与当前任务差异很大,还会有效吗?
答:实验表明,即使新旧硬件差异明显(如摄像头和夹爪都换了),只要任务形态不变(如都是精细操作),旧数据在跨过阈值后依然有效。但如果任务本身也发生了根本性变化(如从抓取变为行走),则迁移效果可能大打折扣。
总结
这项工作系统性地揭示并刻画了跨配置机器人学习中的“涌现式迁移”现象,核心贡献可概括为以下三点:
- 发现三阶段迁移规律: 旧数据在新硬件能力较低时无用、跨过阈值后收益爆发、接近满分时收益递减,并提供了统计层面的支持。
- 提出迁移阈值 τ(T) 与理论解释: 利用梯度对齐和策略残余不确定性,阐明了旧数据“何时开始发挥作用”以及“为何后期收益递减”。
- 给出可落地的数据采集策略: 先采集新数据跨过阈值,再引入旧数据共同训练,在浇花任务上将新数据需求从8小时压缩到1.5小时。
对于正走向大规模真实世界部署、且硬件不断迭代的具身智能领域而言,这项工作回答了一个既基础又实用的问题:面对硬件升级,我们究竟应该在什么时候、以什么方式,去复用那些昂贵的历史数据。
作者简介
该工作产自千寻智能后训练团队,该团队负责千寻智能Manipulation Model的后训练和强化学习工作。团队成员来自清华、北航、苏黎世联邦理工等高校,多位拥有博士学位。团队背景覆盖大模型、具身智能与自动驾驶,核心成员曾任职于百度、小米等企业,长期深耕模型后训练,兼具算法研究与工程落地经验。
