近年来,大模型技术热度持续攀升,但仅有“大脑”缺乏“身体”支撑,终究难以落地。最近,奥比中光团队完成了一项颇具突破性的实践——将机械臂与大模型深度融合,使机械臂不仅能理解自然语言,还能根据指令执行具体操作。

具体实现方式如下:通过整合语音大模型、语言大模型与视觉-语言大模型,并借助Orbbec Gemini 2系列深度相机采集的环境数据,构建出一套能够理解并执行语音指令的机械臂系统。该项目的技术基础源自斯坦福大学李飞飞教授团队设计的机器人智能体框架,但奥比中光将其从仿真环境迁移至真实物理世界——这一工程化落地过程面临泛化能力、观测精度、运动控制等多重挑战,每个环节都需要攻克实质性难题。
融合多种大模型能力,让机械臂理解并执行语音指令
自去年以来,各类大模型呈现井喷式发展,机器人产业也随之迎来新一波浪潮。尽管“大模型+机器人”目前仍处于早期技术探索阶段,但发展方向已十分明确:机器人需要更智能的“大脑”、更敏锐的“眼睛”以及更灵活的“身体”,才能真正实现具身智能。
奥比中光这套方案的核心思路是:以语音指令(Prompts)作为输入,依托多种大模型的理解能力与视觉感知能力,生成空间语义信息,最终驱动机械臂完成动作。具体流程分为以下步骤:
- 首先,利用语音大模型识别任务下达者的语音指令;
- 同时,部署两台Orbbec Gemini 2双目结构光相机,采集高质量的环境RGB图像与深度数据;
- 接着,借助SAM、CLIP等视觉-语言大模型,理解场景中的物体类别与空间关系,并实时进行碰撞检测,最后执行相应动作。
基于这一原理,机械臂可以完成一系列高智能指令,例如:
- “请记住当前的状态”
- “把红色的方块放到黄色的框中”
- “把绿色的方块放到白色的框里面”
- “把蓝色的方块逆时针旋转30°”
- “将蓝色方块朝着绿色方块的方向移动10cm”
- “把蓝色方块放到绿色的方块上面”
- “请恢复最开始的状态”
- “请把所有的方块放到黄色的框中”
目前该项目已实现1.0版本,打通了多模态大模型在机械臂上的应用基线。后续团队正重点优化多模态指令理解、多传感器融合感知、机械臂轨迹规划控制以及末端抓取控制等环节。目标非常明确:推出大模型机器人控制系统,让机器人更智能、更灵活,适应更复杂的操作场景。
克服泛化、观测、控制难题,从仿真变为现实
坦率地说,国内外许多机器人智能体的研究仍停留在仿真环境阶段。虚拟世界中的相机基于理想成像模型运行,不存在畸变,也不受环境光照干扰——一旦迁移到真实世界,各类问题便暴露无遗。这正是工程化落地面临的最大挑战。
奥比中光研发团队基于预训练的多模态机械臂模型,逐一攻克了以下难关:
- 为实现快速准确的语音输入与理解,团队引入了语音预训练大模型,使机械臂能够灵敏响应语音指令;
- 为确保机械臂在真实世界中具备足够的泛化能力,采用了视觉-语言大模型,使机械臂能够理解并适应复杂场景,在多样化环境中稳健执行任务;
- 针对预训练模型基于理想相机成像的问题,设计了全新的标定方案,优化相机自动曝光策略,有效应对环境光、成像畸变、透视形变等因素带来的挑战,大幅提升了鲁棒性;
- 为提高机械臂在复杂环境中的安全性,引入了深度相机碰撞检测与抓取修正功能,优化控制策略,最终提升了抓取性能、精度与适应性。
这些关键技术的引入与创新,使奥比中光成功打通了多模态机械臂在多个交叉领域的工程化应用,真正跨越了从仿真到现实的“最后一公里”。
值得一提的是,奥比中光在机器人视觉领域已有超过8年的行业落地经验,服务过100多家机器人企业。从3D传感器、激光雷达到模型算法,积累了扎实的实战经验,这也是他们能够快速将实验室成果推向量产的关键所在。
布局多模态视觉大模型,升维机器人应用潜力
融合多种大模型能力的机械臂,究竟能在哪些领域落地?
随着机器人的“眼睛”(视觉传感器)、“大脑”(大模型)和“身体”(本体)的持续进化,智能机器人及机械臂有望率先在工业制造、柔性物流、商用服务等场景中实现应用。例如,在自动化工厂内,基于多模态大模型的机械臂可与无人小车协同,完成智能分拣与搬运;在家用服务机器人场景中,用户只需通过简单的自然语言指令,就能让机器人帮忙倒水、取快递等。
面向机器人产业,奥比中光目前可提供单目结构光、双目结构光、iToF、激光雷达、dToF等全技术路线的3D视觉传感器,并支持多传感器融合。与此同时,针对AI大模型与具身智能机器人的发展趋势,他们正在搭建机器人及AI视觉中台,通过多模态视觉大模型与智能算法的研发,结合机器人视觉传感器,形成完整的自主移动定位导航与避障产品方案。简而言之,奥比中光致力于为下游客户提供全方位的能力平台与系列化产品,迎接智能机器人时代的全面到来。
