游乐游手机版
首页/AI热点日报/热点详情

机器人从会表演到能干活还需多久

类型:热点整理2026-07-19
机器人从展台演示到稳定执行任务,需整合数据、模型、终端与基础设施。京东展示的JoyAI模型矩阵、第一视角数据采集链路及JoyInside智能终端,旨在构建让机器人持续学习与真实场景连接的系统。

先说几个核心判断。一个人站在货架前,戴上头戴设备,拿起一瓶饮料,看一眼标签,然后放回原位——这个动作在生活中再普通不过了。但几米外的大屏上,这一切正在被翻译成另一种语言:视线落点、手部轨迹、商品位置、抓取力度,以及任务是否完成。经过数据处理和模型训练,一台机器人伸出机械臂,开始学习同样的动作。

这是2026世界人工智能大会京东展区的一幕。

大会进入第三天,展馆里的机器人依然是当之无愧的人气主角。它们跳舞、递水、下棋,在聚光灯下完成一个个流畅动作。但看得越多,一个问题就越值得思考:走出展台,换一排货架、换一种商品,甚至只是光线发生变化,机器人还能不能把事情做好?

从完成一次演示到稳定执行任务,中间隔着的,远不只是一台机器人。人工智能走进物理世界,需要看懂环境、理解人的意图,也需要把判断转化为动作;既要有持续产生的真实数据,也要有承载模型的智能终端和支撑长期运行的计算基础设施。

在本届大会上,京东集中展示的并不是某个炫酷的机器人本体,而是一套完整的系统:JoyAI模型矩阵、具身智能数据全链路基础设施、JoyInside智能终端和京东云AI基础设施。与一些企业聚焦机器人本体或单一模型不同,京东试图回答的是一个系统性问题——如何把数据、模型、终端和真实场景连接起来,让人工智能在现实中持续学习、接受检验。

从“看懂”到“动手”

整理货架看似简单,对机器人却是一项复杂任务。它首先要看清商品与货架的空间关系,理解“把饮料放回原位”的指令;操作过程中,还要持续观察环境变化,判断什么时候抓取、从哪个方向接近,并根据结果调整动作。

围绕这条能力链,京东在展区集中展示了多款JoyAI模型:

  • JoyAI-Image、JoyAI-Image-Edit着力提升图像和空间理解能力;
  • JoyAI-VL-Interaction能够持续观察视频画面,根据现场状态判断何时回应;
  • 此次亮相的JoyAI-Talker强化了低延迟、可打断的连续语音交互;
  • JoyAI-RA则进一步将视觉观察和语言指令转化为机器人可以执行的动作。

这些模型对应着人工智能进入物理世界的不同环节:看见空间、理解变化、与人交流,最后完成行动。问题在于,单项能力不断提升之后,更重要的事情是让它们围绕一项现实任务连续运转起来。

把日常工作变成“教材”

机器人学习现实任务,首先要有足够多的现实经验。互联网可以为大模型提供海量文本、图片和视频,却很少记录一个动作使用了多大力度、物体发生了怎样的位移,以及任务最终是否成功。真机遥操作虽然能获得精确数据,但成本较高,也难以快速覆盖家庭、零售、工业等开放场景。

所以,问题就来了。京东选择从人类第一视角数据切入。

在现场展示中,体验者戴上自研采集终端JoyEgoCam,双手可以像往常一样整理商品、叠衣服或完成清洁任务。设备记录下第一视角双目视频和运动信息,再从中提取动作轨迹、空间结构和任务语义。依托这种方式,京东开源了EgoLive数据集——包含2000小时高保真双目视频、65866个任务片段,覆盖346项真实任务。

不过,视频并不会自动变成机器人的能力。数据上传后,还要经过清洗、对齐、标注和结构化处理,再通过仿真平台补充现实中较难采集的场景,最终进入模型训练和真机评测。从人类完成一次操作,到机器人学会完成任务,一条围绕现实经验的数据链正在形成。

从一台设备走向一个空间

离开数据采集展区,京东搭建的“AI Home”呈现了人工智能进入现实世界的另一种形态。这里没有一台机器人包办所有事情。台灯、床垫、电视、玩具和机器狗都保留各自的硬件能力,而JoyInside则负责帮助设备听懂语言、理解需求和调用功能。

一句“今天有点累”,不再只对应某个固定开关。床垫可以围绕睡眠需求调整支撑,灯光和其他设备也可以参与响应。人工智能由此不只是附着在单个产品上的问答功能,而是开始尝试协调多个终端共同完成任务。这才是更接近真实世界的状态——不是一台万能机器人,而是一群能协作的设备。

来源:https://finance.sina.com.cn/wm/2026-07-19/doc-iniihzcp0431843.shtml

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。