李飞飞团队主导的世界模型排行榜,近日迎来了新的冠军登顶。
△WorldScore榜单
此次登顶的模型,是由兔展智能团队与北京大学、鹏城实验室联合研发的UniWorld-View(该模型已全面适配国产昇腾算力平台)。
用户只需随手拍摄一段视频,甚至仅提供一张图片,模型便能生成一段“相机轨迹可自由指定”的全新视角视频——
支持推、拉、摇、移等操作,甚至能实现“围绕场景360°环视”,提供“精准且高度可控的相机位姿调节”能力。
无论是单张图片的3D生成,还是视频的4D生成,均采用“同一套代码、同一个模型”完成。
真正实现了“统一世界视角”(UniWorld-View)。本次世界模型的训练数据由北京大学孵化的初创企业元空智能提供,所有代码与模型权重均已完全开源。
仅凭正面图像,生成背面视角
首先,我们来理解这项任务的难点所在。
新视角合成(Novel View Synthesis)的核心,是让AI“脑补”出未曾拍摄到的角度。
而真正的挑战,集中在“大基线(large-baseline)”这一关键点上——
通俗地讲,就是只给AI展示正面,要求它绘制出侧面甚至背面视角。
传统技术路线如NeRF、3DGS遵循“重建”逻辑:观察视角越多,重建效果越好。
但随手拍摄的单目视频,视角覆盖几乎为零。输入这些模型后,轻则出现空洞与伪影,重则直接生成失败。
生成式路线则敢于“脑补”。然而,大多数方法仅将相机位姿视为一个“口头指令”(即抽象的条件向量)输入扩散模型——
由于缺乏显式3D建模,生成的画面稍作移动就会失真,大角度旋转时更是完全失控。
因此,近两年业界探索出了第三条路径:
首先利用几何模型将画面转换为3D点云,然后将目标视角的点云渲染图作为条件输入视频扩散模型。
几何处理与生成任务各司其职,相机控制精度大幅提升。ViewCrafter、英伟达GEN3C等模型均采用此路线。
然而,在研发过程中,团队发现这一路线隐藏着一个普遍存在但未被认真解决的难题。
点云渲染中的“穿帮”现象
问题恰恰出在点云渲染环节。
点云本质上是一堆离散的点:既缺乏点与点之间的连接关系,也无法判断各点的朝向。
当视角大幅转换时,渲染图会出现两种经典“穿帮”现象:
第一类是前景与背景撕裂。
深度边界处缺乏连接信息,视角变化时,前景纹理如同口香糖般被拉扯到背景上,或背景像素直接覆盖到前景区域。
第二类是背面漏光。
点云不具备“面”的概念,无法自动遮挡。当相机移动到物体背面时,正面的点会直接穿透显示,相当于透过后脑勺看到了正脸。
在小幅度视角变换下,这些穿帮尚不明显,生成模型还能勉强应付。
但一旦进入大基线场景,条件图中充斥错误几何信号,扩散模型随即被误导:结构扭曲、伪影丛生。
UniWorld-View的第一项关键技术,正是针对此问题——提出“遮挡感知点云渲染”(Occlusion-aware Point Cloud Rendering)。
第一招:双重投影(Double-Reprojection),有效解决撕裂问题。
△遮挡感知点云渲染:解决前景背景撕裂
将源画面投影到目标视角,再反向投影回源视角。
经过这一来回投影,所有“无法返回”的像素,即为被遮挡的区域。
将这些区域沿相机轨迹逐帧累积形成遮挡掩码(mask),在渲染时直接剔除——该留空洞的地方就保留空洞,交由生成模型进行填充,从而避免错误纹理对模型的误导。
第二招:法向过滤(Normal Filtering),专门应对背面漏光。
△法线过滤点云渲染:解决背面漏光
为每个点估算法向量,并与视线方向计算夹角:背向相机的点,直接排除在渲染之外。
经过这两项处理,条件图中的错误信号被清除,留下的只有可靠的几何信息与明确的待填充区域。
双分支架构:一个负责构图,一个负责上色
几何问题解决后,还有第二个矛盾亟待处理:
点云渲染图“位置准确,但内容缺失”;源视频“内容完整,但位置不匹配”。
如何让生成结果既精准匹配目标视角,又与原始视频高度一致?
UniWorld-View的解决方案是“双流条件注入”机制:
- “几何流”:将点云渲染图与掩码编码后叠加到潜变量上,确保生成内容严格贴合3D结构;
- “外观流”:源视频通过新设计的“Ref-DiT模块”处理——以新视角特征作为Query,源视频特征作为Key/Value执行交叉注意力,模型能够自主从原始视频中“查找素材”,哪里缺失补充哪里,甚至能顺便修复点云伪影导致的模糊纹理。
一个负责构图,一个负责上色,分工清晰明确。
△模型框架图
4D重建能力
更进一步:既然能够任意切换机位,那么多次切换机位后,“单目视频不就转化为多视角视频了吗”?
一旦获得多视角视频,4D重建(动态3DGS)便从不可能任务转变为常规操作。
此处还有一个巧妙设计。常规生成式方法中的相机是“边走边拍”,空间变换与时间推进耦合在一起,导致视角在4D空间中分布极不均匀。
UniWorld-View直接将两者解耦,分两步执行:
- “先拍摄静态定妆照”:将时间冻结在第一帧,围绕场景生成一圈静态环绕视图,作为整个场景的外观锚点;
- “再拍摄动态视频”:在固定机位上生成同步多视角视频,每个机位的第一帧利用“定妆照”进行对齐,前景的自遮挡通过迭代生成逐步补全。
生成多视角视频后,将其输入4DGS进行优化,最终得到完整的4D场景。
从单目随手拍摄,到可自由视角漫游的4D场景,实现全流程贯通。
兔展智能由北京大学校友与北京大学视觉领域青年领军人才共同创立,公司专注于视觉AI大模型研发,拥有世界领先的基于视觉大模型的多模态大模型底层自研技术,是国内视觉AI大模型领域的标杆企业。
公司自主研发了Open-Sora Plan、UniWorld等系列视觉AI模型。其中,Open-Sora Plan是行业内首个开源文生视频模型,2024年代码引用量位居全球首位;UniWorld视觉大模型率先探索了理解与生成统一架构。
其中,2025年,兔展智能发布了UniWorld-V2,这是一款采用理解与生成统一架构的视觉大模型,比NanoBanana早三个月发布,引领了理解与生成一体化的发展方向;
2026年4月,兔展智能发布了UniWorld-V2.5,不仅与GPT-Image-2同周发布,还在InfoGraph、图文交错、文字密集等场景中达到了与GPT-Image-2相当的生成能力。
在持续推进视觉AI大模型技术演进的同时,兔展智能正加速推进UniWorld大模型能力的产品化进程,近期将推出产模一体设计生产工具RabbitVis,进一步推动视觉AI融入商业设计工作流。
