游乐游手机版
首页/AI热点日报/热点详情

谷歌DeepMind公司正式发布全新人工智能视觉模型GenCeption

类型:热点整理2026-07-23
谷歌DeepMind推出GenCeption模型,基于阿里通义万相Wan2 1,将预训练视频生成模型反向重构为多任务视觉理解系统。仅需一次前向推理即可同步完成深度估计、语义分割等五项任务,训练数据仅7500段合成视频,性能媲美专用模型,且跨域迁移能力稳健。

7月21日,The Decoder消息传来,谷歌DeepMind正式亮出了GenCeption模型。这波操作有意思的地方在于,它把预训练的视频生成模型拿来“反向重构”,硬生生改造成了一个多任务视觉理解系统。而它的底子,是阿里巴巴的通义万相Wan2.1。

谷歌DeepMind发布GenCeption视觉模型

说白了,这模型就干了一件事:碘伏计算机视觉领域里那个“单任务、单模型”的老规矩。你猜怎么着?GenCeption只需要一次前向推理,就能根据文本指令,同步完成深度估计、语义分割、3D人体姿态估计等五项关键视觉分析任务。更让人意外的是,它的训练数据量只有7500段合成视频,比主流的同类模型少了一大截,但在多项指标上,居然能跟DepthAnything这类专用的单任务模型掰手腕,甚至还有超越。

说到泛化能力,GenCeption的跨域迁移表现相当稳健。它不仅能处理真实场景下的多人视频,连训练中从没见过的动物、机器人等类别也能应对自如。部分输出结果的细节还原度,甚至比原始训练渲染质量还要高。当然,话说回来,当前版本在推理速度与多任务协同优化之间的平衡,还有提升空间。不过,能走到这一步,已经足够让人对这条技术路线抱有期待了。

来源:https://www.php.cn/faq/2865287.html?uid=1246273

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。