在 action chunking 已经成为 VLA(视觉-语言-动作模型)主流配置的当下,「一次究竟执行多少步动作」几乎都被视为固定超参数。北京大学与微软亚洲研究院的一项最新研究指出:这一默认设定本身,恰恰可能是机器人任务失败的重要根源——它会让重规划变成与任务进度脱节的周期性调度;一旦没有任何一次重规划恰好发生在关键操作阶段之前,机器人就只能带着已经过时的 action chunk 进入关键执行环节。
研究团队据此提出 Bernoulli-Continuation Policy(BCP)。该方法冻结基座 VLA,仅训练一个 16.4M 参数的轻量级 head,把「应该执行多久」拆解为一连串「继续执行还是重新规划」的伯努利决策,并通过 GRPO 基于轨迹级结果进行优化。在 RoboTwin 2.0 全部 50 个任务上,LingBot-VLA 的平均成功率从 89.88% 提升至 93.94%,在 VLA 方法中达到 SOTA;在真机挂马克杯任务中,成功率也从 44% 提升至 84%。

论文标题:Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon ExecutionarXiv:2608.03483项目主页:https://fleetfootwork.github.io/BCP/
一、研究背景:一个长期被当作工程细节的关键决策维度
Action chunking 使 VLA 不再逐步预测单个动作,而是一次性生成未来一段动作序列。这种做法既能降低模型推理频率,也有助于提升动作时序的一致性。在 chunk-based VLA 中通常存在两个 horizon:prediction horizon 表示模型一次预测多少步动作,execution horizon 则表示这批动作里有多少步会被真正执行,执行完成后机器人再重新观测环境并进行规划。
OpenVLA、π_0.5、LingBot-VLA 等主流 VLA 工作普遍采用固定的 execution horizon。在自由空间中的粗粒度运动阶段,这样做通常问题不大——更长的动作序列往往更平滑、更稳定;但当任务进入接触、对齐、夹爪闭合等对精度高度敏感的阶段时,微小位姿误差就可能快速累积,机器人必须在进入这些环节前重新观测环境。而固定重规划节奏并不能保证这一点。
为了量化这一问题,研究团队设计了一个 phase-shift 实验:所有变体都使用完全相同的 50 步 horizon,唯一差别在于第一个 chunk 只执行 φ 步后就重新规划,之后仍然每 50 步规划一次。也就是说,模型与 horizon 完全一致,唯一改变的是重规划边界落在什么位置。RoboTwin 2.0 的 50 个任务结果如下所示:

最高结果与最低结果之间相差 11.3 个百分点。需要注意的是,这里的 Upper / Lower Bound 都属于 hindsight oracle,在真实部署中不可能提前获知。但这一实验清楚说明了一件关键事实:replanning timing,也就是重规划时机,本身就是一个非常强的决策变量。
在 Placing Dual Shoes 任务中,这种差异尤为直观:当 φ=32 时,机器人执行了一个已经失效的夹爪闭合动作,最终导致任务失败;而当 φ=23 时,恰好有一次重规划发生在关键操作阶段之前,机器人获得了新的观测信息,因此能够准确完成抓取并顺利完成任务。在同一任务上,最佳相位的成功率达到 92%,而最差相位仅有 80%。

图 1 同一模型、同一 50 步 horizon,仅改变重规划边界的落点:φ=32 时夹爪闭合幅度过时导致失败,φ=23 时边界恰落在操作阶段前而成功。成功率随相位在 0.80–0.92 间剧烈波动。
更重要的是,最优相位并不存在可复用的统一规律。论文统计了 50 个任务各自的最佳 φ,并进行了卡方拟合优度检验:χ² = 5.00,p = 0.287,无法拒绝均匀分布的原假设。也就是说,关键时刻会在不同任务、不同阶段出现在不同时间点,因此不存在一个固定相位能够对齐所有对精度敏感的操作阶段。
基于这一发现,论文提出了核心问题:给定一个已经预测好的 action chunk,机器人究竟应该执行多久,再停下来重新规划?
二、方法:三个挑战,对应三项设计
要学习这样的自适应执行策略并不容易。论文明确总结出三个核心挑战,并分别给出了解决方案。

图2:BCP框架。冻结的VLA预测定长的action chunk,Bernoulli-Continuation Head复用其表征输出一串「继续概率」,据此选定执行horizon;整体通过GRPO+Replanning-Efficiency Reward进行优化。
2.1 候选 horizon 之间具有天然的前缀共享结构
例如执行 40 步与执行 50 步时,前 40 个动作完全相同,二者差别只在于第 40 步之后是否继续执行。标准 softmax 分类器却会把不同候选 horizon 当成彼此独立、没有顺序关系的类别,从而忽略这种天然存在的前缀共享结构。
Bernoulli-Continuation Head 的设计思路是:输出 M−1 个 logit,并通过 sigmoid 转换为一组「继续执行概率」



这种因子化分解与 chunk 执行本身的嵌套结构高度一致:只有当当前 chunk 被连续判断为可信时,策略才会逐步走向更长的 horizon;与此同时,相邻 horizon 的概率也天然更接近。这正是传统分类策略缺乏的序数归纳偏置,也是 BCP 能更自然建模执行长度决策的重要原因。

2.2 per-chunk 监督信号本身不可辨识
每一次 horizon 决策都会与后续 chunk 以及之后的决策相互耦合。相同的最终任务结果,可能由多种不同的 horizon 序列共同导致,因此并不存在唯一正确的 ground-truth 停止标签。基于这一点,研究团队没有采用监督学习,而是使用 GRPO 直接从轨迹级结果中优化策略。


2.3 只用成功率奖励会导致 horizon 向过短方向塌缩
短 horizon 天然更加保守。如果仅使用二值成功率作为奖励,策略很容易退化为高频重规划,从而浪费昂贵的 VLA 推理调用。为了解决这个问题,论文设计了 Replanning-Efficiency Reward(RER),在保证成功率优先的同时兼顾规划效率。
首先定义相对效率项,其中 C 表示 VLA 的调用次数,tanh 用于限制数值范围:

对于失败轨迹,奖励直接归零,与效率无关,因此策略无法通过「更短但失败」的方式进行套利,任务成功仍然始终占据主导地位;

这一设计还改善了 group-based 优化效果。若仅使用二值成功奖励,当一个 group 中的轨迹全部成功或全部失败时,就无法产生有效梯度;而加入效率项后,可以根据 VLA 调用次数进一步区分成功轨迹,使得即使在全成功 group 中也能产生非零 advantage。参考轨迹的锚定还保证了当「固定策略成功、自适应策略失败」时,系统依然能够获得明确的负向学习信号。只有当参考轨迹与全部自适应轨迹都失败时,该 group 才会被丢弃,从而显著缓解稀疏任务奖励带来的梯度稀疏问题。
三、实验结果
3.1 RoboTwin 2.0:在 VLA 方法中达到 SOTA 表现
以 LingBot-VLA 作为底座,在原始成功率低于 90% 的 13 个低成功率任务上:
Clean:75.15% → 86.23%(+11.08%)Randomized:73.54% → 83.46%(+9.92%)
在全部 50 个任务上:
Clean:89.88% → 93.94%(+4.06%)Randomized:88.78% → 92.84%(+4.06%)
这一结果让 BCP 在所有对比的 VLA 方法中取得 SOTA,同时也接近了 WAM 的最佳表现。单任务中提升最明显的是 Hanging Mug:41% → 87%(Randomized 下为 36% → 62%);其余如 Blocks Ranking Size(70% → 88%)、Turn Switch(60% → 72%)、Click Alarm Clock(80% → 91%)、Place Object Scale(80% → 91%)等任务,也都包含对精度敏感的抓取、放置或交互环节。
尤其值得注意的是,BCP 仅在 Clean 设定下训练,但在直接迁移到 Randomized 设定后,依然获得了 +4.06% 的一致增益。这说明它学到的并非特定视觉条件下的过拟合策略,而更像是「什么时候可以继续信任当前 chunk、什么时候必须及时重新规划」这类与任务阶段密切相关的执行知识。
这种收益在不同底座模型上同样成立:在 ABot-M0 上,13 个任务分别提升 +10.69%(Clean)和 +11.77%(Randomized);在 ACT 上也取得了 +5.38% 的提升。

图 3 RoboTwin 2.0 定性对比。BCP 在关键操作阶段前主动缩短 horizon(40 步 / 20 步)刷新观测,避免带着过时 chunk 执行。
3.2 LIBERO / LIBERO-PRO:任务难度越高,优势越明显
在更强调泛化能力的 LIBERO-PRO 基准上,BCP 带来了 +6.8% 的性能提升,相比 AAC 高出 2.9 个百分点;并且在扰动幅度最大的 ×0.4 设定下,优势最为明显(16.8% vs 11.8%)。这说明自适应 execution horizon 在高难度、强扰动场景下更具价值。

3.3 重规划更多,但总体运行时间反而更低

Continuation head 每次推理只带来 2.03 ms 的额外开销。虽然 VLA 的调用次数略有增加,但由于动作执行更准确、无效运动明显减少,总执行步数从 269 步下降到 248 步。按 50 Hz 控制频率综合计算后,整体运行时间反而更低。
在与 8 种执行策略(Random、Fixed 20/30/40、Action Trigger、Uncertainty Proxy、AAC、AutoHorizon)的成功率–运行时间权衡对比中,BCP 同时取得最高成功率和最低运行时间。Fixed 20 甚至没有超过 full-chunk 基线,这说明更短的 horizon 并不天然更优;而 Uncertainty Proxy 与 AAC 因为需要采样多个 chunk 来估计不确定性或熵,其运行时间则明显更高。

图 4 50 个任务上的成功率–运行时间权衡。BCP(红星)同时位于最高成功率与最低运行时间处;Uncertainty Proxy 与 AAC 因需采样多个 chunk 而运行时间显著更高。
3.4 消融实验:三个核心组件逐一验证

通过消融实验,可以得到三个非常明确的结论:
其一,仅训练一个 16.4M 参数的轻量级 head,就已经基本追平微调 442.8M 参数 action expert 的效果(78% vs 79%),两者参数规模相差约 27 倍。这直接支持了论文的核心判断——这类失败在很大程度上来自重规划时机的错配,而不一定是基座 VLA 的动作生成能力不足。
其二,将 softmax 替换为 Bernoulli-Continuation Head 后,成功率进一步提升 +5%(78% → 83%),验证了显式建模 horizon 序数关系和前缀共享结构的实际价值。
其三,加入 RER 后又额外带来了 +4%(83% → 87%)的提升,同时将 VLA 调用次数从 13.825 降低到 10.158,运行时间从 21.55 s 降低到 18.17 s。可以看到,在没有 RER 时,BC Head 的确存在向短 horizon 塌缩的保守倾向,相应的 VLA 调用次数也是最高的。
超参数实验还进一步表明,候选 horizon 的粒度同样十分关键:当候选集合从 {15, 20, 25, …, 50} 改为更粗粒度的 {20, 30, 40, 50} 后,成功率从 87% 降至 78%。这说明过于粗糙的候选集合会迫使策略在关键阶段停得过早或过晚。至于 Transformer 深度,2 层效果最佳(1 层 82%,4 层 84%,6 层 83%)。
3.5 真机实验:AGIBOT G1 上同样有效
在 AGIBOT G1 真机平台上,研究团队以 LingBot-VLA 为基座,每个任务采集 250 条任务特定的遥操作轨迹,并与 2000 条通用抓取轨迹联合训练 SFT 策略;随后仅使用 128 条真实轨迹训练 BCP,且基座 VLA 始终保持冻结。在评测阶段,每个任务都在相同的 50 个 seed 上分别进行三次实验:
Grasping Bottle(瓶身光滑、抓取位姿容错低):74% →92%Hanging Mug(杯柄与挂钩的相对位置误差要求小于 2 cm):44% →84%,同期 AAC 为 48%
从执行序列可以看出,BCP 会在接近关键操作阶段时主动缩短 horizon,在抓取与悬挂动作前刷新观测,从而生成更精准、更稳健的动作。

图 5 真机 AGIBOT G1。抓瓶子 74% → 92%,挂马克杯 44% → 84%。
四、总结与局限
这项工作的价值并不只是把成功率提高了几个百分点,更重要的是,它指出了一个长期被当作工程细节的问题:execution horizon 本身就是一个重要且能够以较低成本优化的决策维度。
当大量研究都在聚焦「如何让动作生成更准确」时,这篇论文表明,相当一部分机器人任务失败其实来自「机器人在错误时机闭着眼继续执行」——而修复这一问题,只需要额外引入一个 16.4M 参数的轻量级 head。由于基座 VLA 在整个过程中保持冻结、具备即插即用特性,并且单次前向即可得到结果,因此 BCP 对已经部署的 chunk-based VLA 系统具有非常直接的迁移和落地价值。
当然,论文也明确说明了方法边界:BCP 只负责决定什么时候停止执行当前 chunk 并重新规划,并不会修改 VLA 本身生成的动作序列。它的有效性依赖于基座 VLA 至少能够生成基本合理、可执行的 action chunk;如果预测出来的动作本身就存在明显错误,那么仅靠调整 execution horizon 或重规划时机,依然不足以纠正整条执行轨迹。
作者简介
作者团队来自北京大学和微软亚洲研究院,共同一作 Weichen Xu 为北京大学在读博士生,目前在 MSRA 实习;共同一作 Zhenhua Liu 为 MSRA 高级研究员;通讯作者 Jiaolong Yang 担任 MSRA 资深研究员主管,研究方向为 3D 视觉与具身智能。
