先说几个核心判断。一个人站在货架前,戴上头戴设备,拿起一瓶饮料,看一眼标签,然后放回原位——这个动作在生活中再普通不过了。但几米外的大屏上,这一切正在被翻译成另一种语言:视线落点、手部轨迹、商品位置、抓取力度,以及任务是否完成。经过数据处理和模型训练,一台机器人伸出机械臂,开始学习同样的动作。
这是2026世界人工智能大会京东展区的一幕。

大会进入第三天,展馆里的机器人依然是当之无愧的人气主角。它们跳舞、递水、下棋,在聚光灯下完成一个个流畅动作。但看得越多,一个问题就越值得思考:走出展台,换一排货架、换一种商品,甚至只是光线发生变化,机器人还能不能把事情做好?
从完成一次演示到稳定执行任务,中间隔着的,远不只是一台机器人。人工智能走进物理世界,需要看懂环境、理解人的意图,也需要把判断转化为动作;既要有持续产生的真实数据,也要有承载模型的智能终端和支撑长期运行的计算基础设施。
在本届大会上,京东集中展示的并不是某个炫酷的机器人本体,而是一套完整的系统:JoyAI模型矩阵、具身智能数据全链路基础设施、JoyInside智能终端和京东云AI基础设施。与一些企业聚焦机器人本体或单一模型不同,京东试图回答的是一个系统性问题——如何把数据、模型、终端和真实场景连接起来,让人工智能在现实中持续学习、接受检验。
从“看懂”到“动手”
整理货架看似简单,对机器人却是一项复杂任务。它首先要看清商品与货架的空间关系,理解“把饮料放回原位”的指令;操作过程中,还要持续观察环境变化,判断什么时候抓取、从哪个方向接近,并根据结果调整动作。
围绕这条能力链,京东在展区集中展示了多款JoyAI模型:
- JoyAI-Image、JoyAI-Image-Edit着力提升图像和空间理解能力;
- JoyAI-VL-Interaction能够持续观察视频画面,根据现场状态判断何时回应;
- 此次亮相的JoyAI-Talker强化了低延迟、可打断的连续语音交互;
- JoyAI-RA则进一步将视觉观察和语言指令转化为机器人可以执行的动作。
这些模型对应着人工智能进入物理世界的不同环节:看见空间、理解变化、与人交流,最后完成行动。问题在于,单项能力不断提升之后,更重要的事情是让它们围绕一项现实任务连续运转起来。
把日常工作变成“教材”
机器人学习现实任务,首先要有足够多的现实经验。互联网可以为大模型提供海量文本、图片和视频,却很少记录一个动作使用了多大力度、物体发生了怎样的位移,以及任务最终是否成功。真机遥操作虽然能获得精确数据,但成本较高,也难以快速覆盖家庭、零售、工业等开放场景。
所以,问题就来了。京东选择从人类第一视角数据切入。
在现场展示中,体验者戴上自研采集终端JoyEgoCam,双手可以像往常一样整理商品、叠衣服或完成清洁任务。设备记录下第一视角双目视频和运动信息,再从中提取动作轨迹、空间结构和任务语义。依托这种方式,京东开源了EgoLive数据集——包含2000小时高保真双目视频、65866个任务片段,覆盖346项真实任务。

不过,视频并不会自动变成机器人的能力。数据上传后,还要经过清洗、对齐、标注和结构化处理,再通过仿真平台补充现实中较难采集的场景,最终进入模型训练和真机评测。从人类完成一次操作,到机器人学会完成任务,一条围绕现实经验的数据链正在形成。
从一台设备走向一个空间
离开数据采集展区,京东搭建的“AI Home”呈现了人工智能进入现实世界的另一种形态。这里没有一台机器人包办所有事情。台灯、床垫、电视、玩具和机器狗都保留各自的硬件能力,而JoyInside则负责帮助设备听懂语言、理解需求和调用功能。
一句“今天有点累”,不再只对应某个固定开关。床垫可以围绕睡眠需求调整支撑,灯光和其他设备也可以参与响应。人工智能由此不只是附着在单个产品上的问答功能,而是开始尝试协调多个终端共同完成任务。这才是更接近真实世界的状态——不是一台万能机器人,而是一群能协作的设备。
