游乐游手机版
首页/AI热点日报/热点详情

国产AI方向感觉醒,第一视角认路纠偏率高达98.15%

类型:热点整理2026-07-23
星源智提出DA-Nav方向感知视觉语言导航框架,将商业指令与第一视角空间理解整合,实现偏航后主动恢复。在长程闭环评测中,纠正成功率98 15%,导航成功率59 00%,使长程导航从路径生成推进为持续执行问题。

给机器人导航,和给人指路,是两码事。商业地图可以告诉它“前方右转”,却没法直接告诉它眼前应该从哪里转、沿哪一侧通过;就算路线已经生成好了,控制误差、地面变化、动态障碍这些现实因素,也可能让机器人在行进过程中一点点偏离预定轨道。

说白了,这背后反映的是一个核心问题:路径被规划出来,并不等于路径可以被执行。

这正是长程导航从“规划正确路线”走向“真实闭环执行”时,必须跨越的一道坎。

正是为了解决这个问题,星源智提出了DA-Na v——一套面向城市级长程场景的方向感知视觉语言导航框架。它的思路很清晰:把商业导航指令、机器人第一视角的空间理解,以及偏航后的恢复能力,统统整合到同一条决策链路里。这样一来,机器人不仅能够理解“往哪里走”,还能判断“当前是否走偏”,并且一旦偏离,可以主动回到正确路线。

这套设计最核心的变化在于:导航系统开始具备“执行过程中的自我校正能力”。


DA-Na v架构图

突破指令与动作鸿沟

把“前方右转”落到眼前

对人类来说,“前方右转”是一条足够清楚的指令。人可以结合路口结构、当前朝向和道路形态,自然判断下一步该从哪里经过。但这一认知过程,本质上依赖的是人类对三维空间的完整理解,而不是语言本身。

所以,对机器人而言,这类面向人类认知设计的方向指令仍然过于抽象,不能直接转化为局部轨迹。

DA-Na v的解决方式很巧妙:它没有让视觉语言模型直接预测连续的三维坐标,而是把机器人第一视角中的道路空间划分为候选区域,让模型先在画面里判断接下来应该经过哪些位置,再由控制模块把这些空间落点转化为可执行轨迹。

这一机制的关键意义在于:语言指令第一次被稳定映射到了“空间决策点”,而不是停留在抽象语义层面。

换句话说,模型不再凭空“画出一条路”,而是在自己看到的场景中连续指出:下一步走这里,再走这里。这一变化,将视觉语言模型的“理解能力”转化为了“空间执行能力”。


DA-Na v空间落点机制

在此基础上,DA-Na v进一步将导航决策组织为:状态判断—动作选择—轨迹预测。机器人首先判断当前是否偏离路线,再决定继续前进、转弯或进行方向修正,最后生成局部空间目标。

这一结构,让导航从“直接响应指令”,转向了“持续状态判断驱动”。对Na vBrain而言,这建立起了从长程方向理解到局部行动执行之间,更清晰、更稳定的决策链路。

结构化决策

让导航从直接预测走向先判断、再行动

这里必须强调一点:在长距离导航中,偏航不是偶发异常,而是持续执行中的常态。说白了,偏航不是错误,而是系统运行过程中必然的状态。

地面打滑、控制误差、动态障碍、视觉波动——这些因素都可能让机器人逐渐离开原定路线。但传统导航数据集通常以专家正确轨迹为主,模型学习的是“理想情况下应该怎么走”,却很少真正经历偏航与恢复的过程。

这类模型可以沿正确路线前进,却未必知道自己何时已经走偏,更不知道应该如何重新回到路线。

为此,DA-Na v构建了ReDA恢复感知导航数据集,通过受控扰动主动制造偏航状态,并记录相应的专家恢复行为。模型由此不仅学习如何走对,也系统学习了三个问题:什么时候已经偏航、应该向哪一侧修正,以及如何重新回到正确路线。

这意味着,导航学习从“单一正确轨迹学习”,扩展为“包含错误状态的完整经验学习”。


真实路口基础动作对比

ReDA共包含约28.6万条时序样本,其中约12.8万条为恢复数据。大规模恢复样本让模型在训练阶段接触了大量非理想状态,并建立起了偏航判断与纠正动作之间的稳定关联。从实验结果来看,这一设计补上了长程导航中“错误经验缺失”这块短板。

完整模型的纠正成功率高达98.15%;去除恢复数据后,这一指标骤降至15.46%,导航成功率也由59.00%下降至29.71%。这组差异意味着,纠偏并不是模型在执行过程中自然获得的附加能力。只学习正确路线,机器人可能能走一段;只有把错误状态和恢复过程明确纳入训练,机器人才能在偏航后真正找回方向。

所以,DA-Na v的贡献在于,不只训练机器人怎样走对,也训练它走错后怎样回来。

98.15%纠正成功率

提升Na vBrain长程闭环上限

在覆盖已见和未见城市场景的长程闭环评测中,DA-Na v取得了59.00%的导航成功率、77.82%的路线完成率和98.15%的纠正成功率。这一组结果的关键意义,并不在于整体成功率,而在于“纠偏能力接近稳定可靠”。


DA-Na v跨城泛化与压力测试

其中,98.15%的纠正成功率最能体现这项研究的价值。如果把长程导航比作沿着一条细线行走,传统方法更擅长在没有干扰时沿线向前;DA-Na v则进一步具备在偏离细线后主动靠回来的能力。这意味着系统不只是“能走对”,而是“能在走偏后恢复正确路径”。

对长程任务而言,每一次成功纠偏,阻止的都不只是一次局部错误,而是误差在后续过程中的持续累积。机器人不会因为一次偏移彻底离开路线,而能够在行进过程中不断判断、不断修正。

这种能力,也让DA-Na v具备了更强的跨场景和跨本体迁移价值。同一高层导航策略,在没有使用真实世界数据进行微调的情况下,被部署到四足机器人和人形机器人上,并完成了超过1200米的真实环境导航验证。这说明系统学习到的不是“某条路径”,而是一种可迁移的导航决策能力。

从单点决策到长程闭环

DA-Na v升级Na vBrain导航能力

在Na vBrain的能力链路中,DA-Na v扮演的角色是长程方向理解、局部目标生成与主动纠偏。它并不是要替代规划模块,而是让规划结果能够在执行过程中持续成立。

它接收地图提供的全局方向,结合机器人第一视角判断下一步应该经过的位置,并在执行偏差发生后主动恢复。由此,Na vBrain形成了一条更加完整的闭环:理解方向—生成目标—执行轨迹—判断偏差—主动修正。

DA-Na v的研究价值,不只是将“前方右转”转化成一个局部空间落点,也不只是提升一次轨迹预测的准确率。它更关键的贡献在于:将长程导航从“路径生成问题”,推进为“持续执行问题”。

对Na vBrain而言,这意味着导航能力不再停留在“知道目的地在哪里”,而是进一步具备了在复杂、连续、不断变化的真实环境中,把一条路线持续走下去的能力。

来源:https://www.163.com/dy/article/L2FCPA070511ABV6.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。