游乐游手机版
首页/AI热点日报/热点详情

中科院发布空间智能综述 机器理解世界需认知地图

类型:热点整理2026-07-19
从认知地图视角出发,空间智能被统一为感知、推理与生成三个连续过程。认知地图具备抽象性、全局性与持久性,能将局部观察整合为全局空间布局,支撑智能体的空间理解与行动决策,推动系统走向统一表征。

先说个直观的感受:AI 现在确实厉害,能看懂图像、生成场景,甚至还能规划行动。但问题是,当它真正进入一个空间,一个更棘手的问题就冒出来了——它眼里只有自己眼前那一亩三分地,却必须理解整个世界。

门关上了?它看不见。杯子被挡住了?不知道。沙发露了个角,刚才走过的走廊早已离开视线。单靠当前画面的那一瞬间,根本撑不起一个稳定、长程的空间理解。

换句话说,智能体没法只靠“看一眼”就搞定一切。它需要在自己的脑袋里,形成一张能维护、能更新、还能推演的“空间地图”。只有这样,它才能支撑后续的推理和生成任务。

最近,中国科学院自动化研究所的研究团队联合多所高校,发了一篇重磅综述《Spatial Intelligence from a Cognitive Map Perspective: A Survey》。文章的核心思想很有意思——他们从生物导航里的“认知地图”(Cognitive Map)出发,把它扩展成了空间智能系统的内部表征蓝图。感知、推理、生成,这些以往看起来各玩各的方向,现在被放在同一个框架里,统一讨论。





图1:认知地图视角下的空间智能统一框架

认知地图:空间智能的表征蓝图

空间智能这几年发展得飞快。感知从二维图片识别走向三维场景理解;推理从局部关系判断扩展到长时序导航和多视角推断;生成也不再是单打独斗,而是搞起了室内外场景生成和世界状态模拟。

但任务越来越长、视角越来越多、环境越来越动态,问题就来了:如果系统只处理当前输入,那么前一秒看到的墙壁结构、被遮挡的物体、房间之间的关系、状态的动态变化……统统都会在时间轴上断掉。

所以,这些看似各自为战的研究方向,其实都指向同一个需求:智能体需要一种统一的内部表征机制。它要把局部的观察变成能积累的空间记忆,把跨视角的线索拼成全局布局,而且在后续的推理、生成和行动里,还能反复调用。空间智能的核心问题,说白了就是——系统到底怎么建出一张能用的内部空间地图,怎么维护它,怎么调用它,又怎么把它实现出来?

认知地图这个概念,最早是从生物空间认知研究里来的,讲的是生物体在环境里形成的内部表征。论文把它扩展到了空间智能系统里,成为支撑感知、推理与生成的统一内部空间表征。具体来说,智能体从零碎的、局部的观察里,逐步构建起这张地图,把环境中的空间结构、对象关系和动态变化全都整合到一起。然后,基于这个内部表征,智能体可以推理、规划,再反过来生成外部场景、模拟结果或交互行为。

为了让这个概念更落地、更可操作,论文特别强调了认知地图应该具备三种核心性质:抽象性、全局性和持久性

  • 抽象性(Abstraction):认知地图不能只是存像素、点云或体素,它得把原始感知输入转化成结构化概念,比如对象、属性、关系,甚至是拓扑结构。这是一个从低级几何输入到高级空间语义的跃迁。
  • 全局性(Globality):这意味着地图要超越当前的视野,把不同时间、不同视角下观察到的局部线索整合起来,形成一个跨视角、一致的整体空间布局。
  • 持久性(Persistency):这张图不是看一次就完事的,它是一个可以持续维护和更新的内部状态。得有记忆机制,能记录空间信息,新观察来了,能检索、修正、更新。



图 2:认知地图的三种核心性质:抽象性、全局性与持久性。

这三种性质,一起回答了一个关键问题:为什么认知地图能支撑空间智能?答案很直接——只有当一种表征同时具备了抽象性、全局性和持久性,它才能超越单纯的“描述空间”,真正支撑起空间智能。

更重要的是,从这条线往下看,认知地图的价值在于它画出了空间智能系统的基本运作模式:先把原始观测数据抽象成结构化表征,再把不同时空下的局部线索整合起来,形成全局连贯的空间布局,最后通过持续维护这个表征,支撑反复的查询、更新和验证。

认知地图视角下的空间智能统一框架

在这个框架里,空间感知、推理与生成,其实可以看作围绕认知地图展开的三个连续过程:

  • 感知(Perception):认知地图的内部构建
  • 推理(Reasoning):基于认知地图的推理
  • 生成(Generation):认知地图的外部实现

感知阶段负责从原始传感输入里,把内部空间表征建起来;推理阶段则读取、操作并利用这个表征,做出空间推断和决策;生成阶段,是把内部的表征“倒”出来,变成可见的场景、3D环境或者动态模拟结果。三者一起构成了一个完整循环——空间信息在外部环境和内部系统之间来回跑。



图3:论文整体结构。空间智能被统一为认知地图的构建、推理与实现。

这么一组织,认知地图就不再只是一个概念标签了,它变成了一张分析空间智能的坐标系。原本并列的感知、推理和生成任务,现在成了围绕同一个内部表征的不同阶段:地图被构建,被推理模块调用,最后被实现为外部形式或预测结果。

构建认知地图:空间感知

论文首先讨论空间感知阶段,这对应的是认知地图的构建过程。

在认知地图的视角下,感知不能只是从图像里检测物体或提取视觉特征。它得从局部、短暂、通常不完整的传感器数据里,形成一个有抽象性、有全局性的内部空间表征。这个阶段完成的,是从物理世界的传感数据到内部空间模型的转换,也就是从数据到认知的跃迁。

按照内部结构和信息组织方式,论文把认知地图的表征范式分成了三类:

  • 度量表征(Metric Representation):强调空间的几何结构和物理属性。它通常显式建模坐标、距离、尺度、形状和3D布局。还可以再分成基于显式几何的(像2D栅格图、BEV、点云、体素)和基于参数化坐标的。几何一致性强,适合需要精确定位和空间对齐的任务。
  • 关系表征(Relational Representation):更关注对象、区域和结构之间的拓扑关系。常见的有结构化图表征,还有能序列化为文本或符号的图表征。这类方法一般会弱化精确几何,更擅长表达支撑、相邻、可达性这些拓扑关系和依赖,也更容易和语言模型的推理机制结合。
  • 混合表征(Hybrid Representation):度量信息和关系信息一块儿用。毕竟,真实的空间理解往往既要几何精度,也需要关系抽象。很多方法通过层级架构、特征融合等操作,把底层的几何结构和高层的关系组织结合起来,让认知地图能同时支持空间定位、结构理解和多层次推理。





图 4:认知地图构建的三类表征方式:度量表征、关系表征和混合表征。

总体来看,认知地图从单一的表征形式,逐渐向度量与关系混合发展,这个演变反映了空间智能向更统一内部表征体系发展的趋势。

读取认知地图:空间推理

地图建好了,核心价值就是拿来用——支持智能体做复杂的空间推理,像路径规划、物体搜索、情境理解等等。通过这个机制,空间信息被读取、处理,最后变成可执行的决策信号。

论文把基于认知地图的空间推理范式归纳为三类:

  • Map as Embedding:把认知地图编码成潜空间特征,直接参与匹配、状态传播和决策。地图经常被视为推理模块的内部状态,能支持跨感知、语言和行动的高效检索、对齐和定位,不过它的推理过程通常不太容易解释。这里面又分两类:一类是Structural State Propagation,把空间组织成可传播的结构状态,比如在网格或图里传播不确定性、cost或value,从而把认知地图变成可执行的策略信号;另一类是Latent Feature Matching,把认知地图当作记忆空间,通过当前观察、目标或指令,和地图里的区域、地标、对象或上下文特征做匹配,检索最相关的空间信息。
  • Map as Prompt:把认知地图转成文本、视觉或多模态提示,喂给LLM或VLM。比如序列化成文本或结构化摘要(Textual Prompt),或者渲染成视觉提示(Visual Prompt),再或者一起构成多模态上下文(Multimodal Prompt)。这种范式灵活性强,跟基础模型兼容也好,但通常会有信息压缩的瓶颈。
  • Map as API:把认知地图设计成一个可查询、可更新、可调用的外部接口。推理模块可以在运行过程中调用它,查询对象位置、更新状态变化、检索历史记忆,或者用地图约束当前决策。这种方式的闭环交互能力很强,尤其适合动态任务和长期规划任务。当然,代价是系统复杂度更高,涉及状态管理和工具使用。它还能再分成两类:实时状态快照(Real-time State Snapshot),关注当前环境状态的实时维护与更新;持久化空间记忆(Persistent Spatial Memory),强调跨时间积累和空间经验复用,让系统能保存历史观察、事件记录和长期交互结果。





图 5:认知地图支持推理的三种范式:Embedding、Prompt 与 API。

顺着这个脉络看,空间推理能力不仅取决于模型本身,还取决于内部地图到底以什么方式参与推理。推理模块怎么访问、怎么解释、怎么操作那张认知地图,这很关键。

外化认知地图:空间生成

如果说感知是从外部世界到内部认知地图,那生成就是反向过程:从一张抽象、全局、持久的内部空间表征出发,实现或模拟出具体的外部空间形式。生成不是凭空想象,而是把内部的空间知识(比如布局、关系、属性)外化成可见或可交互的空间结果。

论文把生成这部分分成两类:

  • 静态场景合成(Static Scene Synthesis):关注怎么利用认知地图里的布局、对象语义和拓扑关系这些结构先验,生成具体的3D场景。认知地图可以当检索蓝图,引导系统从资产库里选物体,并约束布局(Map-based Retrieval);也可以当生成模型的条件输入,让模型端到端地生成符合空间关系和功能约束的场景(Map-to-Scene Generation)。
  • 动态世界模拟(Dynamic World Simulation):侧重时空演变的模拟。认知地图在这里是一个可持续更新的内部状态存储。生成模块需要基于它维持空间连续性,模拟场景的动态演化,还要保持时序上的一致性。





图 6:空间生成的两种范式:静态场景合成与动态世界模拟。

现有研究呈现出从静态到动态、从场景合成到世界建模的趋势。这其实也说明,认知地图正从一个空间组织先验,演变成一个持久的生成性基础结构。它不仅能支持结构化场景合成,还能支持未来状态预测,甚至连贯、可交互世界的模拟。

应用:从理解世界到改变世界

在应用层面,论文根据智能体与系统的交互方式,把相关任务分成了两类:开环空间认知闭环空间交互

  • 开环空间认知:系统主要做观察、理解、回答或生成,不需要实时改变外部环境。代表任务包括空间问答、室内场景合成和开放世界生成。在这些任务里,认知地图主要是一个结构化的桥梁:它把分散的视觉输入、语言意图和空间结构组织起来,让系统能超越单一视角和局部输入做空间理解。
  • 闭环空间交互:要求智能体在持续感知-行动的循环里,使用和更新认知地图。代表任务有具身导航和具身操作。在这里,认知地图不只是被动存储空间信息,它会被行动结果不断检验和修正。智能体要根据新观察更新地图,根据地选行动,还要在执行过程中持续处理遮挡、变化和不确定性。



图 7:基于智能体—系统交互方式的两类应用范式:开环空间认知与闭环空间交互。

从认知地图看空间智能的下一步

从认知地图这个视角看,空间智能的未来问题,不只是把地图做得更大,而是让它更懂语义、更能跨尺度、更能长期更新,并真正进入行动闭环。论文基于认知地图的核心特性与运作机制,总结了几个关键突破方向:

  • 更深层的语义抽象:很多当前的认知地图,还停留在对象类别和基本空间关系层面。未来的地图节点,得能表达对象的身份、物理属性、状态、功能和可供性;地图的边,也得从简单的位置关系,扩展到物理约束、交互逻辑和因果机制。
  • 扩展全局空间理解:现有模型在局部空间关系上已经有进展,但对大尺度环境结构、房间连接、对象共现和未观测区域补全,还缺稳定的空间先验。未来需要面向大规模3D场景和地图的空间基础模型,帮智能体从稀疏的局部证据里,推断出全局空间骨架。
  • 动态环境中的长期持久性:真实空间是动态的。物体会移动,布局会变化,旧信息会失效。未来的认知地图需要发展成4D时空表征,通过主动遗忘和结构化巩固,区分短期变化和长期背景,从而支持持续运行中的空间维护。
  • 认知地图作为生成式模拟器:认知地图应该从空间信息仓库,扩展成面向未来推理的动态引擎。它能支持未观察区域的补全、未来状态的预测、反事实推演,让智能体在内部概念空间里做模拟。
  • 弥合感知与行动之间的鸿沟:现在很多地图模块还是偏向被动记录环境,没充分参与行动决策。未来的系统需要让认知地图里的不确定性、预测误差和盲区,主动影响智能体的行为,让建图和行动形成更紧密的闭环。

结语

这篇综述从认知地图的视角,重新梳理了空间智能的研究,强调了背后共享的表征机制:空间信息是怎么被抽象、整合并持续维护的,它又是怎么参与推理、决策和生成的。这样一来,不同方向的研究就有了一个共同的比较标尺——智能体如何构建和使用内部空间表征,把它转化成外部空间形式或行为结果。

从这个角度看,空间智能应该走向一种更统一的系统形态。只有认知地图的抽象性、全局性与持久性,能贯穿空间感知、推理与生成的全过程,我们才可能迈向真正类人、甚至超越人类水平的空间智能。

来源:https://www.163.com/dy/article/KV071KIM0511AQHO.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。