AI在视觉理解领域已经取得了显著进展——能够识别图像、生成场景,甚至在虚拟环境中规划行动路径。
然而,当智能体真正进入物理空间时,问题变得复杂起来。它只能看到眼前的局部区域。
门在身后,杯子被其他物体遮挡,沙发也只露出半张脸,上一秒刚经过的区域此刻早已超出视野范围。眼前的画面无法提供足够的信息,仅凭瞬时观测支撑长期稳定的世界理解,几乎是不可能的。
这意味着,智能体不能仅依赖瞬时观测来生存。它必须在内部构建一套稳定、可更新、并能用于推理的空间表征——这是支撑后续所有认知与生成任务的基础。
最近,中国科学院自动化研究所联合多所高校发布了一篇综述论文,题目是《Spatial Intelligence from a Cognitive Map Perspective: A Survey》。文章的核心视角是“认知地图”(Cognitive Map),并以此重新梳理了空间智能研究的全貌。有趣的是,他们将这个原本源于生物导航的概念,扩展为空间智能系统中的一张“内部表征蓝图”。有了这张图,空间感知、空间推理和空间生成不再是孤立的研究领域,而是可以在同一个机制框架下被统一理解和讨论。

- 论文标题:Spatial Intelligence from a Cognitive Map Perspective: A Survey
- 项目主页:https://klingsor-tyx.github.io/spatial-cognitive-map/
- 论文链接:https://github.com/Klingsor-tyx/Awesome-Spatial-Cognitive-Map/blob/main/survey.pdf
- GitHub:https://github.com/Klingsor-tyx/Awesome-Spatial-Cognitive-Map

图1:认知地图视角下的空间智能统一框架
认知地图:空间智能的表征蓝图
空间智能的相关研究发展十分迅速。空间感知已经从二维图像识别演进到三维场景理解;空间推理从局部关系判断扩展到长时序导航和多视角推断;空间生成也从单个对象做到室内外场景乃至世界状态的模拟。
但任务越来越长、视角越来越多、环境越来越动态,问题也随之而来。如果系统只处理当前输入,那么前一刻看到的场景结构、被遮挡的物体、跨房间的关系——这些信息都会在时间上断裂。因此,从底层来看,这些方向实际上在向同一个目标汇聚:智能体需要一种统一的内部表征机制,将局部的观察转化为可积累的空间记忆,把零散的线索整合成全局布局,然后在推理、生成和行动中反复利用。
那么核心问题就变成了:系统如何构建、维护、调用并最终实现这张内部空间地图?
“认知地图”最初来自生物空间认知研究,用于描述生物体在环境中形成的内部表征。在这篇论文中,这个概念被扩展为现代空间智能系统里支撑感知、推理与生成的统一内部空间表征。具体而言,认知地图是智能体从局部、碎片化的观察逐步构建出来的,用于整合环境中的空间结构、对象关系和动态变化。有了这个内部表征,智能体才能开展推理与规划,并进一步将其转化为外部场景或交互行为。
为了让这个概念落地,论文提出认知地图需要同时具备三种性质:抽象性、全局性和持久性。
- 抽象性:认知地图不能仅保存像素、点云或体素,它必须将原始感知转化为结构化概念——对象、属性、关系,甚至拓扑结构。从低层几何输入到高层空间语义,这一步跨越至关重要。
- 全局性:认知地图必须超越当前视野,将不同时间、不同视角下的局部观察整合成跨视角一致的整体空间布局,而不是一个“盲人摸象”式的局部拼图。
- 持久性:认知地图是一个需要持续维护和更新的内部状态。它要通过记忆机制记录空间信息,并在新观察到来时进行检索、修正和更新——在动态环境中这一点尤为重要。

图 2:认知地图的三种核心性质:抽象性、全局性与持久性。
只有一种表征同时具备这三条,它才算是真正超越了单纯描述空间的层面,去支撑空间智能的发展。而从这一视角来看,认知地图的价值就在于明确了一套系统的基本运作模式:先把原始观测抽象为结构化表征,再把不同时空的局部线索整合成全局布局,然后持续维护这张地图,支持交互中的反复查询、更新和验证。
认知地图视角下的空间智能统一框架
在这个框架里,空间感知、推理和生成可以被看作围绕认知地图展开的三个连续过程:
- 感知:认知地图的内部构建
- 推理:基于认知地图的推理
- 生成:认知地图的外部实现
感知阶段从原始传感数据出发构建内部空间表征;推理阶段读取、操作并利用这个表征进行空间推断和决策;生成阶段则将内部表征外化为可见的场景、三维环境或动态模拟结果。三者共同构成了空间信息在外部环境与内部系统之间的循环路径。

图3:论文整体结构。空间智能被统一为认知地图的构建、推理与实现。
通过这种组织方式,认知地图从一个概念标签变成了分析空间智能的坐标系。原本并列的感知、推理和生成任务,成了围绕同一内部表征展开的不同阶段:地图被构建出来、被推理模块调用、并最终被实现为外部空间形式或预测结果。
构建认知地图:空间感知
论文首先讨论的是空间感知阶段,也就是认知地图的构建过程。
在这个视角下,感知不仅仅是检测物体或提取视觉特征,而是从局部、短暂且通常不完整的传感器数据中,形成一个具备抽象性和全局性的内部空间表征。这一步完成的是从物理世界传感数据到内部空间模型的转换——从数据到认知的跃迁。
论文把认知地图的表征范式分成了三类:
- 度量表征强调空间的几何结构和物理属性。它通常在语义信息基础上显式建模坐标、距离、尺度、形状和三维布局,还可以进一步分为基于显式几何和基于参数化坐标两类。前者的常见形式包括2D栅格图、BEV、点云、体素等。几何一致性强,适合需要精确空间定位的任务。
- 关系表征更关注对象、区域和结构之间的拓扑关系。具体形式包括结构化图表征和可序列化为文本的图表征。这类方法弱化了精确几何信息,更适合表达支撑与相邻关系、可达性等拓扑结构,也更容易与语言模型推理机制结合。
- 混合表征同时利用度量信息和关系信息。因为真实空间理解很多时候既需要几何精度,也需要关系抽象。许多方法通过层级架构或特征融合,把底层几何结构与高层关系组织结合起来,让认知地图同时支持空间定位、结构理解和多层次推理。


图 4:认知地图构建的三类表征方式:度量表征、关系表征和混合表征。
总体而言,认知地图从单一表征形式向度量与关系混合的表征发展,反映的是空间智能向着更统一内部表征体系演进的趋势。
读取认知地图:空间推理
认知地图构建好之后,它的核心价值就在于支持智能体进行复杂的空间推理——路径规划、物体搜索、情境理解,都依赖它。通过这个机制,空间信息被读取、处理,最终转化为可执行的决策信号。空间推理可以看作是由认知地图介导的推理过程,关键在于推理模块如何访问、解读并利用其中编码的空间信息。
论文把基于认知地图的空间推理范式归纳为三种:
- Map as Embedding:把认知地图编码为潜空间特征,让它直接参与匹配、状态传播和决策。此时地图通常就是推理模块的内部状态,支持跨感知、语言和行动的高效检索、对齐与定位,但可解释性不强。其中,Structural State Propagation把空间组织成可传播的结构状态(比如在网格或图中传播不确定性、cost或value),把认知地图转化为可执行的策略信号;Latent Feature Matching则把认知地图作为记忆空间,通过当前观察、目标或指令与地图中的区域、地标、对象或上下文特征进行匹配。
- Map as Prompt:把认知地图转换成文本、视觉或多模态提示,输入给LLM或VLM。常见的方式包括序列化为文本摘要、渲染成视觉提示或构成多模态上下文。这种范式灵活性高,更容易与基础模型兼容,但往往伴随着信息压缩的瓶颈。
- Map as API:把认知地图设计成可查询、可更新、可调用的外部接口。推理模块可以在运行过程中调用它,查询对象位置、更新状态变化、检索历史记忆,或者用它来约束当前决策。这种范式的闭环交互能力很强,对动态任务和长期规划尤为重要。代价是系统复杂度高,涉及状态管理和工具使用。按是否存储历史状态信息,还可以进一步分为实时状态快照和持久化空间记忆两类。


图 5:认知地图支持推理的三种范式:Embedding、Prompt 与 API。
从这个脉络来看,空间推理能力不仅取决于模型本身,也取决于内部地图以什么方式参与推理,依赖于推理模块如何访问、解释和操作认知地图。
外化认知地图:空间生成
如果说感知是从外部世界到内部认知地图,那生成就是反向过程:从抽象、全局统一、持久维护的内部空间表征出发,实现或模拟具体的外部空间形式。这个阶段,生成不是凭空想象,而是把内部空间知识——布局、关系、属性——外化为可见或可交互的空间结果,完成从抽象到具象的表达。论文把这一部分分成了两类:
- 静态场景合成关注如何利用认知地图中的布局、对象语义和拓扑关系等结构先验,生成具体的三维场景。认知地图可以作为检索蓝图,引导系统从资产库中选择物体并约束布局;也可以作为生成模型的条件输入,让模型端到端地生成符合空间关系和功能约束的场景。
- 动态世界模拟侧重时空演变的模拟,强调认知地图作为一个可持续更新的内部状态存储。生成模块需要基于它维持空间连续性,模拟场景的动态演化,并保持时序上的一致性。


图 6:空间生成的两种范式:静态场景合成与动态世界模拟。
现有研究呈现出从静态到动态、从场景合成到世界建模的趋势。这个趋势表明,认知地图正从空间组织的先验变成一种持久的结构性基础,不仅能支撑结构化场景合成,还能支持未来状态预测和连贯可交互世界的模拟。
应用:从理解世界到改变世界
在应用层面,论文根据智能体与系统之间的交互方式,把相关任务分成了两类:开环空间认知和闭环空间交互。
- 开环空间认知:系统主要进行观察、理解、回答或生成,不需要实时改变外部环境。论文讨论的代表任务包括空间问答、室内场景合成和开放世界生成。在这些任务中,认知地图主要起到结构化桥梁的作用——把分散的视觉输入、语言意图和空间结构组织起来,让系统能超越单一视角和局部输入进行空间理解。
- 闭环空间交互:要求智能体在持续的感知—行动循环中使用和更新认知地图。代表任务包括具身导航和具身操作。在这类任务中,认知地图不只是被动存储空间信息,而是不断被行动结果检验和修正。智能体要根据新观察更新地图,根据地图选择行动,并在行动过程中持续处理遮挡、变化和不确定性。

图 7:基于智能体—系统交互方式的两类应用范式:开环空间认知与闭环空间交互。
从认知地图看空间智能的下一步
从认知地图的视角来看,空间智能的未来问题不只是把地图做得更大,而是让它更懂语义、更能跨尺度、更能长期更新,并真正进入行动闭环。基于认知地图的核心特性和运作机制,论文总结了几个关键方向:
- 更深层的语义抽象。当前很多认知地图还停留在对象类别和基本空间关系层面。未来的地图节点需要表达对象身份、物理属性、状态、功能和可供性;地图边也需要从简单的位置关系,扩展到物理约束、交互逻辑和因果机制。
- 扩展全局空间理解。现有模型在局部空间关系上已有进展,但对于大尺度环境结构、房间连接、对象共现和未观测区域补全,还缺少稳定的空间先验。未来需要面向大规模三维场景和地图的空间基础模型,帮助智能体从稀疏局部证据推断全局空间骨架。
- 动态环境中的长期持久性。真实空间是动态的——物体会移动,布局会变化,旧信息可能失效。未来的认知地图需要发展为4D时空表征,通过主动遗忘和结构化巩固来区分短期变化与长期背景,从而支持持续运行中的空间维护。
- 认知地图作为生成式模拟器。认知地图应从空间信息仓库扩展为面向未来推理的动态引擎。它可以支持未观测区域补全、未来状态预测和反事实推演,让智能体在内部概念空间中进行模拟。
- 弥合感知与行动之间的鸿沟。当前许多地图模块偏向被动记录环境,没有充分参与行动决策。未来的空间智能系统需要让认知地图里的不确定性、预测误差和盲区主动影响智能体行为,让建图和行动形成更紧密的闭环。
结语
这篇综述从认知地图的视角重新梳理了空间智能的研究,强调了背后共享的表征机制:空间信息如何被抽象、整合并持续维护,又如何参与推理、决策和生成。这样一来,不同的研究方向可以围绕同一个问题被重新比较——智能体怎么构建和使用它的内部空间表征,并把它转化为外部空间形式或行为结果。
从这个视角看,空间智能应该走向一种更统一的系统形态。只有当认知地图的抽象性、全局性与持久性能贯穿空间感知、推理与生成的全过程时,我们才可能迈向真正类人甚至超过人类水平的空间智能。
作者信息:本文第一作者田雨萱,中国科学院自动化研究所博士生,研究方向为空间智能,在CVPR等国际学术期刊会议上发表多篇论文。通讯作者为郑晓龙研究员。
