前几天,小米汽车正式放出一项重磅技术成果——发布了名为 Xiaomi Auto World Model 的全新框架。这不仅为小米汽车技术体系增添了新的核心能力,从智能汽车与辅助驾驶行业的发展视角来看,它也为辅助驾驶世界模型的设计与落地提供了一种全新思路,标志着行业正从传统的“场景感知”阶段,进一步迈向“认知推演、场景进化”的更高阶形态。

客观来说,这一框架最引人关注的亮点,在于它是业内首个将三维重建与视频生成深度融合的一体化架构。过去,行业普遍沿用“重建归重建、生成归生成”的独立拆分路线,而小米汽车这次提出的核心思路是“重建锚定几何、生成补足推演”,通俗理解,就是让两种能力彼此协同、相互赋能。最终效果也非常突出——在 Waymo、nuScenes 等主流基准测试中,Xiaomi Auto World Model 取得了全面 SOTA(当前最先进水平)的成绩,并且已经在小米汽车的合成数据、仿真测试和智能座舱三大核心应用场景中实现落地。
先来看一下技术背景。目前,世界模型相关研究大致沿着两条主要技术路线推进:重建(WorldRec)和生成(WorldGen)。
重建路线,核心逻辑是基于多视角观测恢复几何精确的 3D 场景。它的优势在于还原度高、空间一致性强,适合构建真实可靠的场景结构;但局限也很明显——它只能复原已经观测到的内容,无法对尚未发生或未被观测到的对象与事件进行有效推演。
生成路线,则是通过扩散模型直接预测未来画面,能够生成此前未见过的视角与场景内容,具备更强的“想象”和泛化能力。但代价在于,它缺少显式 3D 结构支撑,在长时序预测任务中容易出现轨迹漂移、细节失真以及场景不稳定等问题。
那么问题就在于:能否找到一种方法,让重建的稳定性与生成的灵活性实现优势互补?
Xiaomi Auto World Model 给出的答案,就是将重建模块与生成模块进行深度耦合,让两者在整体架构中形成相互约束、相互增强的关系。重建负责提供 3D 几何信息,作为稳定可靠的“结构化锚点”,像底座一样为生成过程提供方向与边界;生成则将预测能力延伸到观测范围之外,补齐重建在未知场景推演上的短板。两者共同形成闭环,因此真正实现了“1+1>2”的效果。具体来看,优势主要体现在三个关键层面:
高稳定性:WorldRec 提供的确定性几何约束,能够有效抑制长时间自回归预测中常见的误差累积、轨迹偏移和内容漂移问题。
高一致性:4D 场景表征相当于跨帧共享的“记忆单元”,无论是在不同时间轴之间切换,还是在不同视角之间观察,场景内容都能保持全局一致,避免前后不匹配的问题。
高真实性:WorldGen 以 WorldRec 渲染得到的 RGB 图像作为几何骨架,因此生成结果不仅符合物理世界的空间布局规律,也更接近真实传感器的观测效果,从而有效缩小仿真环境与真实道路场景之间的差距。
更值得关注的是,这套世界模型框架并非停留在概念验证或论文阶段。从当前公开成果来看,它已经在小米汽车的三类实际业务场景中完成应用落地:
合成数据生成:目前已交付超过 10 万 clips 的高质量合成数据,并直接用于感知模型训练,进一步提升了车辆在各类危险驾驶场景中的识别与感知能力。
仿真测试:依托该框架构建了完整的闭环仿真环境,不仅提升了测试效率、完善了测试流程与规范,还能够在仿真系统中复现真实事故场景,进而开展针对性的优化与验证。
辅助驾驶学堂:借助世界模型动态生成第一人称驾驶教学视频。当用户面对复杂道路环境或特殊路况时,系统可以直接播放一段生成式教学视频,演示正确的驾驶操作方式。目前,这项功能已经在小米全车型的“辅助驾驶学堂-实景模拟场景”中正式上线。
如果你希望进一步了解这项技术的原理、论文内容和更多细节,下面附上相关资源入口:
技术主页:https://JointWM.github.io/
论文链接:https://arxiv.org/pdf/2605.18137
