2026年6月2日,奥地利维也纳,国际机器人与自动化会议(ICRA 2026)进入第二天议程。普渡大学计算机科学系教授、IDEAS Lab实验室主任Aniket Bera登上讲台,带来了一场主题演讲。演讲标题很长——"RobotsSafe Na vigation in Unstructured & Human-Centered Environments",但核心观点却异常直接,甚至有些“不太客气”。
他说,如今绝大多数看似“成功”的自主系统,本质上并不是因为机器人真正理解了现实世界,而是因为我们主动把世界变得更简单了。
这句话非常尖锐。工厂中的机械臂被围栏隔离,仓储场景里的AGV依赖地面标记,自动驾驶系统离不开高精地图——这些人为预设的外部条件,本质上都是帮助系统运行的脚手架。而真正意义上的机器人自主性,恰恰要求最终能够拆掉这些脚手架。
那么,当这些辅助条件被移除之后,机器人系统还值得信赖吗?
Bera教授给出了一套贯穿其实验室研究工作的核心框架,用一句话概括就是——“学习负责提议,结构负责决策”(Learning proposes, Structure decides)。
在这一范式下,任何学习型模块——无论是视觉感知模型还是大语言模型——都不应该直接输出最终控制指令。它们必须先经过一道“可检查接口”(Checkable Interface)。这是一种能够被形式化方法验证、由约束求解器审查的结构化输出。简单说,学习模块可以提供丰富候选,但最终拍板的必须是规则、约束与可验证结构。
这条原则贯穿了IDEAS实验室的四大支柱研究。

总结来看,Bera给出了一条十分清晰的机器人技术路线图:学习赋予机器人灵活性与泛化能力,结构赋予机器人可靠性与安全性。二者并非彼此对立的技术路线,而是同一套自主系统中不可分割的两个侧面——这也正是让自主机器人从实验室“温室”真正走向现实“荒野”的关键路径。
以下是Aniket Bera在ICRA 2026大会发表的演讲精编稿,基于原英文演讲内容进行了翻译与整理。
一、成功的假象:我们不是在造聪明机器人,而是在造温室
先说一个不那么令人舒服的事实:许多所谓“成功”的自主系统,其实都运行在一个被精心设计过的环境里。给机械臂加围栏、在仓库地面贴标记、为车辆提供高精地图、在工厂流程里写死固定脚本——这些系统之所以能稳定工作,并不是因为机器人真正理解了环境,而是因为环境被改造成了机器人容易应对的样子。
而Bera和他的实验室真正关注的场景,恰恰是那些需要拆除这些脚手架的复杂环境。机器人要在没有GPS、没有先验地图、没有稳定作业流程的条件下运行,一个错误动作带来的代价,可能就是切切实实的物理损失。几周前,他们的实验室就经历过一次代价高昂的事故。
二、核心框架:学习负责提案,结构负责决策
因此,Bera把自主系统的核心问题定义为:在语义约束、社交约束和安全约束共同作用下的闭环决策。

经常有人问他:你们采用的是传统机器人方法,还是基于机器学习的方法?Bera认为,这个问题本身问错了。真正有价值的问题是——学习型模块向自主系统其他部分暴露的“接口”究竟是什么?
感知模块不应该只输出特征向量,它应该输出物体、位姿、尺寸以及相应的不确定性信息。同样,大语言模型也不应该直接给出机器人的控制指令——它应该输出某种可以被监控、可以被约束求解器检查、可以被形式化验证的内容。这就是所谓的“可检查接口”。
学习负责提出更丰富的表示、更强的先验和更多候选方案;结构负责判断哪些信息值得信任、哪些动作可以执行。这正是实验室全部研究工作的底层逻辑,也是可信机器人系统设计的核心思路。
三、感知:从好看的地图到可用的状态
在机器人能够进行推理或执行动作之前,它首先需要一个状态估计——这个状态必须同时具备几何属性、语义属性、可定位能力,并且真正对下游任务有用。机器人需要持久化的物体表征、语义含义以及不确定性信息——归根结底,它需要一种能够被底层规划器直接查询和使用的表示。而其中最困难的部分在于:这些能力还必须实时完成。
核心问题在于:你的感知系统最终输出的到底是什么?如果输出的是原始像素,或者某种难以解释的黑箱嵌入向量,那么系统栈中的其他模块就很难对安全性做出严谨论证。相反,如果它输出的是类型化状态(Typed State),那么规划层和验证层才能真正利用它,构建可解释、可审查的自主决策链路。
近年来,神经渲染领域(如3D高斯溅射)的研究为机器人建图、定位和SLAM带来了强大的表示能力。它可以生成稠密、接近照片真实感、并且可连续优化的地图。但这里存在两个关键问题:第一,依赖“渲染-比较-优化”光度误差来估计相机位姿的管线,对于无人机这类需要快速闭环控制的机器人场景而言,往往过慢且脆弱;第二,一张视觉上完美的高斯地图,并不天然等同于一个可用于规划的状态表示——它缺少物体身份、开放词汇语义以及校准过的不确定性。

实验室的FastSLAM项目正是针对这一时延问题提出的解决方案。他们将位姿估计从“渲染-优化”改为“匹配-刚体注册”:把当前帧与活跃关键帧进行匹配,反投影后得到两个3D点集,再求解SE(3)上的最小二乘对齐——SVD解法可直接通过互协方差矩阵得到旋转量。这样一来,位姿估计变成了快速的几何计算,而重建质量则可以异步持续优化。这套系统已经部署在搭载NVIDIA Jetson的无人机平台上,并在茂密森林环境中实现了实时定位与建图。
沿着相同的思路,GoSLAM解决的是“如何让重建得到的物体具备可指称性与开放词汇语义”——让规划器能够通过物体名称查询地图,而不只是依赖像素坐标。TransLocNet则解决“无GPS环境下如何为局部地图提供全局锚定”——通过将地面观测与航拍影像进行跨视角、跨季节配准。试想一下:森林中大雪覆盖、树叶尽落,而卫星图却是夏季拍摄的——这要求系统的表征能力必须超越像素层和坐标层的简单对应。
所有这些机器人感知与SLAM技术问题,都被同一条主线串联起来:感知系统必须产出一个可查询、可定位、可被关注和利用的类型化状态。
四、可信自主:大模型不是决策者,而是被审查的提案者
接下来是第二大支柱:可信自主(Dependability)。在这里,科学论证更加明确。一个学习型模块可以非常有帮助,但它同样可能具有风险——它可能在分布偏移下失效,置信度也可能被错误校准;在大语言模型的应用场景中,它甚至可能生成一个听起来很合理、实际上却违反任务级约束的计划。
因此,问题再次回到最初的原点:什么才是一个“可检查的对象”?对于感知来说,答案是类型化状态;对于规划来说,答案必须是一个可容许、可验证的计划或动作。
实验室的项目SELP(ICRA 2025最佳论文入围)正是围绕这一目标展开。它的核心思想是:把大语言模型的角色从“无约束的规划器”重新定义为“受约束的提案机制”。

SELP的具体工作方式是这样的:先将机器人任务翻译成时序逻辑规范(Temporal Logic Specification),然后在生成过程中逐步施加约束——在每个token被采样之前,系统都会先检查:如果加入这个token,当前部分计划是否依然可行?如果答案是否定的,那么这个token会在采样前直接被屏蔽。大语言模型依然可以作为有价值的先验知识来源,但它不再是安全问题上的最终权威。
这意味着,约束并不是“事后修补”——不是等模型输出完成后再额外叠加一层安全检查;约束本身已经被嵌入到生成过程之中。形式化规范不只是护栏,更是整个搜索空间的边界条件。
沿着相同的设计哲学,实验室还开发了CAsForD(上下文感知决策安全)——当用户指令不安全时,系统不只是简单回答“不行”,而是能够识别其中不安全的成分,并进一步选择安全的修复方案。另一些研究则让模型生成数学优化程序,以表达运动规划中的时间约束。其一以贯之的原则是:学习型模块永远不应获得未经审查的权威,它生成的计划、修复方案和控制策略都必须可验证、可约束、可认证。
五、人不是移动障碍物:行为感知导航与多机器人协作
在第三和第四大支柱中,研究工作进一步延伸到更复杂的社交交互与多机器人协作场景。
在人类行为建模方面,相关研究问题包括:在密集社交场景中预测人类运动、建模群体层面的动力学、人-物交互,以及当场景中的物体需要被移动或重新布置时如何进行规划。核心主题是:人类不仅仅是移动中的障碍物——他们彼此交互,也与物体交互、与环境交互,从而在机器人周围形成一个耦合且充满不确定性的动力学系统。机器人必须具备预测人类行为、推理以物体为中心上下文的能力,并在单纯依赖几何约束不足以保障安全时采取合适行动。
在多机器人协作方面,实验室研究了协作式主动重建、多智能体信息路径规划、可扩展多智能体SLAM等问题。其核心主题是去中心化团队自主性:每个机器人都必须基于局部观测和有限通信做出行动决策。对应的策略是,在训练阶段采用集中式学习获取性能优势,而在部署阶段以去中心化方式独立运行——以适应部分可观测、通信受限以及多智能体动态交互的真实条件。
六、结语:让机器人走出温室
回到最初提出的四大支柱,Bera希望留下的核心理念是:安全可靠的自主系统并不是某一个单独模块的成果,而是整个系统栈相互编织、协同约束的结果。学习赋予机器人灵活性,结构赋予机器人可靠性。真正的目标是——当现实世界变得混乱:没有GPS、地图不完整、物体在移动、周围充满不确定性——机器人依然能够以安全、稳定、可信的方式行动。
Q&A 问答环节
听众A: 感谢演讲。我在思考一个很现实的问题:工业界存在明显脱节——一方面大家在追逐KPI数字,另一方面真正部署可验证、可认证、安全的机器人系统却是另一回事。您如何看待基于物理的方法与神经渲染(如高斯溅射)在验证与安全方面的关系?
Aniket Bera: 这个问题非常关键,也切中了核心。所有神经模型都需要所谓的“护栏”。但护栏最大的问题在于,它本质上是一种事后补救:你先把机器学习模型训练好,然后再叠加一层基于物理约束或现实世界约束的机制,试图在它做出危险行为前拦住它。我认为这种做法并不理想。
这些约束——无论是物理先验,还是来自其他领域的先验知识——都应该被直接“嵌入”到学习空间本身。这也就是为什么我们要把问题转化为形式化方法规范:这样我们才能独立地约束输出空间中的每一个结果,从一开始就保证生成内容的可靠性与可信性。目标并不是“把一切都押注在学习方法上”,而是找到一种更智能的组合方式——在什么位置植入形式化方法规范,在什么位置植入物理约束,以及在什么位置植入特定应用所需的其他约束。
听众A(追问): 您的意思是,约束应该“内置”而不是“后置”。但从社区角度看,我们有时仍然在追逐KPI数字,而真正部署物理机器人系统时,需要考虑的远不止这些数字。怎样才能让这两者更接近?
Aniket Bera: 我要讲一些可能不太受欢迎的话。在与工业界合作,尤其是与制造业和国防领域的工程伙伴打交道时,我能理解为什么很多工程方案更偏向传统控制方法——因为学术界常常把“学习”包装成一种万能神谕,仿佛它能自动解决下游所有问题。
我认为,弥合这两个世界、也让工程界真正对基于学习的方法建立信心的方式,就是从一开始就给学习型问题加入约束、赋予清晰语义。我们不应该只盯着“教科书式指标”,而更应该关注系统会在什么地方失败,以及下游真正重要的可靠性指标是什么。这正是学术界与工业界需要更频繁展开对话的地方。
听众B: 您提到了让机器人行为更具社交性。我想问的是,如何把这些行为信号真正传导到操作层面?比如在布置餐桌任务中,用户可能期望先放杯子再放盘子,这种对齐该如何进一步传导到运动规划层?
Aniket Bera: 这是一个非常有意思的问题。我认为,如果你能够在任务层面使用更好的物理约束来约束生成过程——确保步骤序列在物理上可行,不会引导系统进入灾难状态或伦理失效状态——那么形式化方法的很多技巧就能发挥作用。你可以把基于学习的方法拆分为多个子模块,并逐步判断每一步是否仍然处在规划边界之内,还是已经进入安全关键区域。
安全约束与文化约束、行为约束的性质并不相同。但如果你能够把每一种约束都明确建模,并嵌入到像SELP这样的形式化方法规范中,那么我认为,只要整体仍处于安全范围内,就没有理由不能同时处理文化线索和行为线索。
