视频生成模型在视觉上已经相当惊艳了,但有一个老大难问题始终没解决——几何一致性。具体来说,生成的视频里经常出现几何漂移、摄像机轨迹飘忽不定、场景结构前后不连贯。对于具身智能、世界动作模型这类需要稳定摄像机运动和连贯3D几何的下游应用来说,这几乎是致命的。
过去,研究者们基本上是两条路:要么改生成器架构,加模块或做几何感知对齐;要么用基于强化学习的后训练来对齐。但问题也很明显——改架构容易破坏互联网规模预训练模型的泛化能力,而对齐方法呢,不仅局限在静态场景,还得依赖RGB空间的奖励,反复做VAE解码,计算量巨大,而且根本没法泛化到高度动态的真实世界。
最近,来自Google、哥本哈根大学、牛津大学等机构的研究者拿出了一个大招——VGGRPO(Visual Geometry GRPO,已被ECCV 2026收录)。这项工作的核心问题非常直接:怎么在不牺牲预训练模型泛化能力的前提下,高效提升视频生成的几何一致性,还得能处理动态场景。他们的思路,是在隐空间(latent space)里用4D几何奖励做几何感知的视频后训练。

图1 VGGRPO生成的世界一致视频。左侧是基线模型,右侧是VGGRPO对齐后的模型。在挑战性动态场景中,VGGRPO显著减少了几何漂移和结构伪影,生成了更连贯的场景结构和更平滑的摄像机运动。

VGGRPO 做了什么?
VGGRPO是一个由隐式几何引导的、基于组的强化学习(GRPO)视频后训练框架。它包含两个紧密耦合的核心组件:隐式几何模型(Latent Geometry Model, LGM)和VGGRPO训练流程。

图2 VGGRPO方法概览。(a) 隐式几何模型训练:通过轻量级连接层将VAE隐变量与几何基础模型对齐,直接从隐空间预测4D场景几何。(b) VGGRPO训练:在隐空间中利用摄像机运动平滑度奖励和几何重投影一致性奖励进行GRPO优化。
第一步,VGGRPO构建了一个隐式几何模型(LGM)。通过一个轻量级的连接层,LGM将视频扩散模型的隐变量与几何基础模型“缝合”在一起。这意味着,模型可以直接从隐空间解码出场景几何信息,完全不需要先解码回RGB像素空间。更关键的是,这套模型采用了具备4D重建能力的几何模型(Any4D),这让VGGRPO自然扩展到动态场景,突破了以往方法只能处理静态场景的瓶颈。
在这基础上,VGGRPO设计了两个关键的奖励机制,在隐空间中进行组相对策略优化(GRPO),彻底省去了昂贵的VAE解码过程。
1. 摄像机运动平滑度奖励:告别抖动的镜头
生成的视频里,不稳定的摄像机运动往往导致时间上的扭曲和结构上的伪影。为鼓励稳定且符合物理规律的摄像机轨迹,VGGRPO基于隐式几何模型预测的摄像机位姿,计算平移和旋转的加速度,对抖动的轨迹进行惩罚。平滑、近匀速的轨迹奖励接近1,而抖动的运动则会让奖励下降。这个奖励机制,直接促使模型生成更平滑的镜头运动。
2. 几何重投影一致性奖励:跨视角的3D连贯性
镜头平滑只是第一步,更关键的是——同一场景在不同视角下必须保持几何上的一致。VGGRPO利用预测的点云、深度、摄像机参数和场景光流,将预测的3D结构重投影到各个视角中,再比较深度图的差异。对于动态场景,它还能利用场景光流过滤掉动态区域,只聚合静态点来获得稳定的场景表示,强有力地保证了跨视角的几何连贯性。
实验结果

图3 静态和动态场景的定性比较。
实验结果显示,VGGRPO在静态和动态场景基准测试中均取得了显著提升。在几何相关指标上,VGGRPO领先所有基线方法。在通用视频质量指标上,VGGRPO同样超越基线,说明几何感知后训练并没有牺牲预训练模型的生成能力。

图4 奖励组件消融实验。
图4的奖励组件消融实验进一步揭示了两个奖励的互补性:单独使用摄像机运动奖励(r_motion)可以稳定摄像机轨迹,但几何伪影依然存在(绿圈标注)。加入几何重投影一致性奖励(r_motion + r_geo)后,场景几何得到进一步改善,同时保持了平滑的摄像机运动。
VGGRPO 的意义是什么?
现在的视频生成模型,不仅要生成视觉真实的画面,还得“创造一个符合物理规律的一致世界”。
VGGRPO给出的答案直接干脆:不需要复杂的架构修改,也不需要昂贵的像素级奖励。通过把几何先验直接引入隐空间,并在4D维度上进行强化学习对齐,模型在生成视频时,既能保持镜头的平滑,又能构建出跨视角连贯的物理世界,而且适用于动态场景。
对于世界动作模型、具身智能等领域来说,稳定而一致的世界建模能力,是模型进行预测、规划与交互的重要基础。VGGRPO为此提供了一种高效、灵活的几何感知后训练范式。
