空间推理新突破!中山大学SpatialDreamer性能提升55%
来自中山大学等机构的研究者推出了SpatialDreamer,这项技术通过模拟人的主动心理想象和空间推理过程,显著提升了模型在复杂空间任务中的表现。它借鉴了人类主动探索、想象与推理的认知方式,有效解决了现有模型在视角变换等任务中因视角单一而能力受限的问题,为人工智能的空间智能发展开辟了新的方向。
免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈
尽管多模态大语言模型(MLLMs)在场景理解方面取得了长足进步,但在需要心理模拟的复杂空间推理任务上,其表现仍有提升空间。
现有的方法大多依赖于对空间数据的被动观察,缺乏人类在空间认知中所特有的主动想象与动态更新内部表征的能力。
例如,在需要变换视角来判断被遮挡物体位置的任务中,现有模型往往因只能依赖单一视角而出现推理偏差。
为此,来自MBZUAI与中山大学的研究团队提出了SpatialDreamer。这是一个基于强化学习的框架,旨在通过一个“主动探索、视觉想象与证据融合”的闭环过程,赋予MLLMs类人的空间心理模拟能力。

论文链接:https://arxiv.org/pdf/2512.07733

SpatialDreamer模拟了人类的空间认知过程,构建了一个包含以下三个步骤的闭环推理流程:
1) 探索:模型根据当前场景推理出最优的自我中心动作(如“前进0.75米”或“左转45度”);
2) 想象:调用世界模型(如SVC)生成执行该动作后所对应的新视角图像;
3) 推理:整合所有累积获得的视觉证据,生成最终的问题答案。
这一过程使得模型从“被动观察”转向了“主动目标导向的想象”,使其能在内部三维环境中自主决定“看向哪里、看到什么、以及如何推理”。
为了解决长序列推理任务中奖励稀疏的问题,研究团队提出了GeoPO,这是一种结合了树状采样结构与几何一致性约束的策略优化方法:
1) 树状采样:每一步采样多个动作分支,支持回溯与多路径探索;
2) 多级奖励设计:融合任务级奖励与步骤级奖励,提供更精细的反馈信号;
3) 几何惩罚机制:对冗余或冲突的动作(如连续同向或反向移动)施加惩罚系数(如0.9),鼓励模型生成高效的探索轨迹。
GeoPO在有效提升模型性能的同时,也显著加快了其训练收敛速度。

为了进一步引导模型学习“思考-想象-回答”的推理模式,团队构建了SpatialDreamer-SFT数据集,其中包含了单轮推理数据(single-pass)以及反思式推理数据(reflective reasoning)。反思式数据通过“错误注入 → 自我纠正 → 重建推理链”的方式来构建。
实验结果
研究团队在多个空间推理基准上验证了SpatialDreamer的有效性:
1) SAT:在真实与合成图像中均达到SOTA性能,平均准确率分别高达93.9%与92.5%;
2) MindCube-Tiny:整体准确率达到84.9%,较基线模型Qwen2.5-VL-7B提升超过55%;
3) VSI-Bench:在物体计数、相对方向、路径规划等任务中全面领先,平均准确率达62.2%。
迈向具备空间想象能力的通用智能
SpatialDreamer的意义不仅在于提升了空间推理的准确率,更关键的是:它证明了MLLMs可以通过增强“想象力”来提升推理能力,这是朝着实现类人空间智能迈出的重要一步。
相关攻略
4月5日消息,据“上海交通大学”公众号消息,日前,米哈游联合创始人、总裁、董事长、上海交通大学2005级信息工程专业本科、2009级通信与信息系统专业硕士校友刘伟,代表米哈游创始团队蔡浩宇、罗宇皓,
据彭博社近日报道称,尽管2026年Alphabet、亚马逊、Meta和微软等科技巨头都要投入超过6,500亿美元扩展人工智能(AI),但关键电气元件可用性成为主要障碍,近50%将因电力基础设施短缺和
4月6日消息,最近两年AI发展速度越来越快,AI取代大量工作导致人类失业的说法甚嚣尘上,然而事实可能不是这样。著名风投机构创始人a16z联合创始人Marc Andreessen也是AI圈的大佬,他日
4月6日消息,今日,红果短剧发布《关于持续治理AI短剧素材违规使用行为的公告》(以下简称《公告》)。《公告》显示,今年一季度,平台已累计下架违反平台治理规范的漫剧1718部。其中,针对近期AI短剧素
4月4日消息,发布仅1天的阿里千问新模型Qwen3 6-Plus,冲上全球知名大模型API调用平台OpenRouter的日榜榜首,成为当下最受企业和开发者热捧的大模型。OpenRouter最新数据显
热门专题
热门推荐
加密货币行业翘首以盼的监管里程碑,终于有了实质性进展。美国证券交易委员会(SEC)主席保罗·阿特金斯(Paul Atkins)近日证实,那份允许加密项目在早期获得注册豁免权的“安全港”框架提案,已经正式送抵白宫,进入了最终审查阶段。 在范德堡大学与区块链协会联合举办的数字资产峰会上,阿特金斯透露了这
微策略Strategy报告:第一季录得144 6亿美元浮亏 再斥资约3 3亿美元买进4871枚比特币 市场震荡的威力有多大?看看Strategy的最新季报就明白了。根据其最新向美国证管会(SEC)提交的8-K报告,受市场剧烈波动影响,这家公司所持的比特币在第一季度录得了一笔惊人的数字——144 6亿
稳定币巨头Tether的动向,向来是加密世界的风向标。这不,它向Web3基础设施的版图扩张,又迈出了关键一步。公司执行长Paolo Ardoino在社交平台X上透露,其工程团队正在全力“烹制”一个新项目——去中心化搜索引擎 “Hypersearch”。这个消息一出,立刻引发了行业的广泛猜想。 采用D
基地位于Coinbase旗下以太坊Layer2网络Base的Seamless Protocol,日前正式宣告了服务的终结。这个曾经吸引了超过20万用户的原生DeFi借贷协议,在运营不到三年后,终究没能跑赢时间。它主打的核心产品是Integrated Leverage Markets(ILMs)——一
PAAL代币揭秘:深度解析Web3社区治理的核心钥匙 在去中心化自治组织的浪潮中,谁真正掌握了项目的话语权?PAAL代币提供了一套系统化的答案。它不仅是生态内流转的价值媒介,更是开启链上治理大门的核心凭证。通过持有并质押PAAL代币,用户能够对协议升级、资金分配乃至战略方向等关键事务投出决定性的一票





