谷歌 DeepMind 团队近期发布了一项引人瞩目的新成果——GenCeption 模型。简而言之,他们逆向应用了传统的视频生成 AI 技术,打造出一款能够深度理解现实世界的视觉分析引擎。以往,深度估计、图像分割、3D 姿态估计等任务往往需要分别构建专用模型,各自独立运行。而 GenCeption 仅用一个模型即可同时完成五项核心视觉任务,效率大幅提升。

该模型基于阿里巴巴开源的通义万相 Wan2.1 框架进行训练,仅需一次前向传播即可完成预测,处理速度显著提升。用户只需通过简单的文本提示输入指令,模型便能直接输出深度图、分割掩码、相机运动轨迹等丰富信息,省去了大量中间处理步骤。
单人合成数据训练,泛化能力保留发丝级细节
令人惊讶的是,GenCeption 的训练集其实非常有限——仅用了约 7500 段由 Blender 渲染的单人合成视频数据。然而,它的泛化能力却令人惊叹,不仅能够高效处理真实世界中的多人视频,还能顺利迁移到动物和机器人等类别上。从实际测试来看,小模型处理 81 帧视频仅需约 6 秒,140 亿参数的大模型也只需 10 秒左右。更令人惊叹的是,它还原的细节甚至超越了训练所用的合成原图,连猫的胡须和单根发丝边缘都能清晰保留。这一现象背后的逻辑值得深思——合成数据训练出来的模型,反而在真实场景中表现得更细腻,某种程度上颠覆了“合成数据质量不足”的传统认知。
