6月8日,高德正式对外发布了一项重磅技术——ABot-Earth 0.5,号称全球首个完全基于3D数据训练、并且工程可用的3D原生城市世界模型。简单来说,它不再依赖传统二维图像的拼接,而是直接从3D数据出发,让模型能够“理解”并“生成”完整的城市级3D场景。

这一模型的技术含金量,主要体现在几个关键环节的突破上,而非仅仅停留在实验室的Demo阶段。
先说训练环节。传统的3D模型训练通常受困于如何将海量、无序的点云数据转化为模型能够“读懂”的语言。ABot-Earth 0.5 首创了直接面向3DGS点云的压缩-生成框架。你可以把它想象成一个高效的“压缩器+解码器”:它能够将动辄包含数百万基元的真实3D场景,先编码到一个紧凑的隐空间里,再从这个空间逆向生成全新的场景。这样做的优势在于解决了3DGS的无序性问题,让模型真正具备了直接“阅读”和处理大体量3D数据的能力。此外,得益于高德自身积累的三维数据,模型生成的内容在几何与空间一致性上有了保障——生成出来的城市,与真实环境在空间位置上能够完全对应。
推理环节的挑战则在于“尺度”。要生成公里级别的广域城市,而非仅仅一个小区或街区,难度呈指数级增长。ABot-Earth 0.5 为此设计了一种高效的滑窗推理机制。其实际运作方式是:将大范围区域分割成小块进行生成,然后在重叠区域通过智能融合算法,将分块的结果无缝拼接起来。这样一来,就能实现公里级的连续空间构建,确保生成场景在空间上的连贯性,不会出现断裂或错位。
模型生成阶段,有一个细节值得特别关注——跨域自适应模块。这一模块的核心作用是弥合卫星影像与三维训练数据之间的域差异。因为卫星图的分辨率与3D训练数据的分辨率往往存在差距,若不处理这个“缝隙”,模型生成的结果就容易失真。此外,模型内部还内置了多层次细节解码器,这使得生成的3D场景自带远近景深效果,无需额外后处理,就能在不同视距下流畅漫游。
最后的交付环节,ABot-Earth 0.5 构建了一条完整的自动化管线。它输出的不是需要手工修复的原始数据,而是原生可渲染的3D城市场景。用户可以直接将这些内容导入Unity、Unreal Engine等主流游戏引擎,添加交互逻辑后就能直接用于实际生产,例如游戏场景、仿真测试、数字孪生等应用场景。
目前,ABot-Earth 0.5 已经正式开放内测。如果您对这项技术感兴趣,可以直接前往官方网站(abot-earth.amap.com)提交申请,亲身体验空间智能技术对传统3D生产方式的重构——这不仅是效率的提升,更是一种范式转变。
项目资源:
技术报告详情:https://github.com/amap-cvlab/ABot-Earth-0.5/blob/main/tech-report.pdf
