在南加州大学,王越教授创立的PSI Lab(Physical Superintelligence Lab),堪称过去两三年间,在具身智能领域崛起速度最快的年轻研究团队之一。
王越于2024年从MIT EECS获得博士学位,毕业前曾在NVIDIA自动驾驶研究组担任研究科学家。2024年,他正式加入USC计算机系担任助理教授,并随即创立了PSI Lab。博士就读期间,他荣获了2020年NVIDIA研究生奖学金;任教之后,又陆续获得了Toyota青年研究员奖、Powell教师奖学金等多项荣誉。
他的早期代表作包括点云理解领域的经典工作DGCNN、DCP,以及自动驾驶3D感知方法DETR3D。其中,DGCNN是点云深度学习中不可绕过的一篇重要论文,长期位列ACM Transactions on Graphics高引用论文的前列。
PSI Lab成立时间虽不长,但其学生团队的学术产出密度却相当高。在过去两三年里,该实验室学生已斩获的奖项和奖学金名单令人印象深刻,涵盖NVIDIA奖学金、高通奖学金、Capital One、Annenberg、亚马逊等知名机构项目。此外,本科生也获得了CRA杰出本科研究者的相关荣誉。对于一所年轻实验室而言,如此高的获奖与产出密度确实极为罕见。
这条发展路径也清晰解释了PSI Lab的定位——它并非从纯计算机视觉突然转向机器人领域,也不是只专注于控制,而是立足于3D世界理解、物理世界感知和真实机器人任务的交叉点。目前,实验室的研究方向覆盖人形机器人、灵巧操作、从人类视频中学习机器人策略,以及面向真实部署的数据与学习系统。

PSI Lab 团队主页
在今年的CVPR 2026具身智能Workshop上,王越带领的PSI Lab与合作伙伴一举斩获三项大奖。
Psi-0荣获3D-LLM/VLA Workshop的最佳论文奖,PhysWorld获得同一Workshop的最佳论文提名奖,Humanoid Everyday也赢得了Embodied AI Workshop (EAI)的最佳论文奖。这三篇论文后续均被各自方向的主会议接收:Psi-0被RSS 2026录用,PhysWorld和Humanoid Everyday均被ICRA 2026录用。
这三项成果恰好对应了人形机器人当前最核心的三个环节。Humanoid Everyday解决的是数据问题——开放世界中人形机器人的日常操作数据及其配套评测基准;Psi-0则更进一步,旨在训练一个能够迁移到人形机器人身体上的基础动作模型;PhysWorld则再向前迈一步,让模型不仅“看懂”眼前的世界,还能预测执行某个动作后,世界将发生怎样的变化。
如果将人形机器人视为一个需要长期构建的系统,而非一次性的演示,这三项工作实际上串联成了一条相对完整的路径:首先获取足够真实、多样化的数据,接着利用这些数据训练出能够部署到机器人身体上的基础模型,最后让模型具备对动作后果的预测能力。

王越教授
Psi-0:人形机器人的基础模型框架
Psi-0的全称是Ψ₀:An Open Foundation Model Towards Universal Humanoid Loco-Manipulation。
Loco-manipulation,指的是将移动与操作结合的任务,例如推车、递送、倒水、清洁、开水龙头、拉椅子等。机器人并非固定在桌前抓取单一物体,而是需要移动身体、协调双臂和手部动作,并在长程任务中持续处理场景状态的动态变化。

这类任务更接近人形机器人未来要面对的真实应用场景,其复杂度远高于桌面操作。
一个直接的问题是:人形机器人的基础模型应该用什么数据来训练?
过去的一种思路,是将人类视频、机器人轨迹以及其他多模态数据混合在一起进行训练。但人与机器人并非同一种“身体形态”(embodiment)。人类的臂长、关节活动范围、手指灵活性以及运动方式,都与机器人存在显著差异。人类视频中包含丰富的操作经验和物体交互过程,但它们不能直接等同于机器人可执行的动作。
Psi-0采用分阶段训练策略。
第一步,使用约829小时的EgoDex第一人称人类视频进行预训练。第一人称视频更接近操作发生时的视角,能够提供手如何接近物体、物体如何被移动、视野如何随动作变化等人类操作先验。这一阶段学习的是宽泛的视觉、交互和任务过程先验。此外,这类数据天然易于规模化:无需遥操作,也无需专门的采集设备,一部头戴相机甚至一部手机就能录制,数据量级远大于真机示教数据。
第二步,使用约31小时的Humanoid Everyday人形机器人轨迹进行后训练。这一阶段的目的,是将预训练阶段学到的操作和交互先验,进一步对齐到人形机器人的身体结构、动作空间和真实控制约束上。
第三步,利用少量目标任务数据进行适配。模型无需为每个任务从零开始学习,而是在已有的人类视频先验和人形机器人动作能力基础上,针对具体任务进行微调。
因此,Psi-0关注的核心并非简单扩大机器人数据规模,而是如何有效组织不同来源的数据。人类第一视角视频提供规模化的操作先验,真实人形机器人轨迹提供身体形态对齐,而少量目标任务数据则完成具体任务的适配。
这项工作的意义在于,它将人形机器人基础模型的训练问题,拆解为更清晰的阶段:首先从人类数据中学习可迁移的交互先验,再通过机器人数据将这些先验转化为可执行的动作。它并非简单地将所有数据混合在一起,而是让人类视频和机器人轨迹在不同阶段承担不同的角色。
PhysWorld:世界模型开始负责物理
PhysWorld的论文全称为Robot Learning from a Physical World Model。
在机器人领域的语境中,世界模型关注的是:给定当前状态和可能的动作,世界接下来会如何变化。
过去一年,许多世界模型研究主要以视频预测或视频生成的形式呈现。给定一张图、一个任务指令,模型生成一段未来的视频。视频越稳定、越真实,往往越像是在“理解世界”。
然而,对于机器人来说,视觉上的合理性还远远不够。
一个视频模型可以生成“手把杯子推走”的画面,但这并不意味着它已经掌握了机器人真正需要的物理信息:杯子的位姿如何变化,接触点是否成立,摩擦和支撑关系是否合理,生成的运动能否由机器人自身的身体执行。
PhysWorld正是处理这个中间环节的。它并未将世界模型停留在未来视频生成的层面,而是尝试将视频生成、物理世界重建和机器人策略学习连接起来。

其流程可以拆解为三步:首先,给定图像和任务指令,生成与任务相关的视频;其次,从视频中重建背后的物理世界,形成以物体为中心的场景表示;最后,通过以物体为中心的残差强化学习(object-centric residual reinforcement learning),将视觉预测进一步转化为机器人可执行的轨迹。
这里的“以物体为中心”(object-centric),是指围绕物体来组织场景和动作信息。在机器人操作中,真正重要的通常不是整张图像,而是目标物体的位置、姿态、运动,以及它和机器人、桌面、其他物体之间的接触关系。
残差强化学习(Residual RL)可以理解为:在已有视觉指导的基础上,通过强化学习进行物理层面的修正,使动作更符合机器人动力学和环境约束。
因此,PhysWorld真正关注的并非视频质量本身,而是物理可执行性(physical actionability):世界模型预测出的未来,能否进一步转化为机器人可执行的轨迹。如果一个世界模型只能生成视觉上合理的未来,那么它本质上仍是一个生成模型;只有当这些预测能够进入机器人训练和控制链路时,它才开始接近机器人真正需要的世界模型。
Humanoid Everyday:开放世界人形操作的数据与评测底座
Humanoid Everyday是一个面向开放世界人形操作的数据集和评测平台,全称为A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation。

它关注的是人形机器人学习中的一个基础问题:如何构建覆盖真实场景、复杂任务和多模态感知的数据基础设施。
与固定机械臂和桌面操作任务相比,人形机器人面临的是更开放的任务设置。它不仅要感知物体,还需要协调身体、双臂和移动能力,在家庭、办公、工业等日常环境中完成长程、接触丰富的操作任务。移动后操作、搬运、工具使用、柔性物体操作、铰链物体操作、人机交互和高精度操作,都属于这类问题。
Humanoid Everyday正是在这一背景下提出的。该数据集覆盖260个任务、7类任务类型、1.03万条轨迹、超过300万帧数据,模态包括RGB、深度、LiDAR、触觉和自然语言标注。它不仅提供训练数据,还提供云端评测平台,使不同方法可以在统一控制环境中进行部署和评估。
云端评测平台是这项工作的一个重要组成部分。
机器人学习领域长期面临一个评测难题:不同论文往往使用不同的机器人、环境、物体和任务定义,导致方法之间难以直接比较。对于开放世界人形操作,这个问题会更加突出,因为任务本身包含移动、接触、双臂协同和长程执行,任何环境差异都可能影响结果。
标准化评测的意义,在于为模型能力提供一个更稳定的比较基准。它让研究者不仅能展示某个策略在特定场景中的表现,还能在统一任务和控制设置下,比较不同方法的泛化能力、鲁棒性和执行效果。
因此,Humanoid Everyday的价值不仅在于数据规模,更在于它将开放世界人形操作纳入了一个可训练、可评测、可复现的研究框架中。它是人形机器人基础模型训练中非常关键的一层:面向真实日常任务的多模态数据集,以及能够持续比较模型能力的评测基础设施。
数据、模型、世界预测,被放进同一条链路
Humanoid Everyday更接近数据基础设施。它关注的是:如果要训练开放世界中的人形机器人操作能力,真实、可复现、可评测的数据从哪里来。
Psi-0更接近基础模型框架。它关注的是:人形机器人能否先从大规模人类第一视角视频中学习操作先验,再通过真实人形机器人数据完成后训练,从而获得更可迁移的移动操作能力。
PhysWorld则把问题推进到世界模型层面。它关注的是:世界模型生成的未来,能否进一步转化为机器人可执行的轨迹,而不只是停留在视觉上合理的视频预测。
这三项工作的对象不同,但可以放在同一个问题链条里来理解:
数据如何构建,能力如何学习,动作后果如何被预测和利用。
这也是人形机器人相比一般VLA任务更复杂的地方。机器人不是只在图像和语言之间建立对应关系,也不是简单输出一个动作标记。它需要在真实物理环境中移动、接触、调整姿态,处理物体、地形、身体约束以及长程任务中的误差累积。
因此,对于人形机器人来说,单纯扩大端到端模型规模,未必能覆盖全部问题。更重要的是,数据、模型训练和物理世界预测之间能否形成有效配合。
从这个角度看,Humanoid Everyday、Psi-0和PhysWorld分别落在这条链路的不同位置。它们没有给出一个单一的答案,而是共同指向一个更系统的问题:人形机器人基础能力的形成,可能需要数据底座、机器人原生模型和物理世界预测一起推进。
两个判断
第一个判断:人形机器人需要一套为其重新设计的基础模型框架——包括预训练、后训练、部署等环节。
机器人要解决的问题,与VLM、世界模型本质上并不是一回事。后者的落脚点是理解和生成,而机器人最终需要的,是在物理世界里把一个动作做对、做完。将语言或视觉模型的那套范式直接搬过来,大概率会“不合身”,更值得做的是打造一套机器人原生(robotics-native)的基础模型,让每个环节都按照机器人自身需求来设计。
Psi-0的路线,就是先从人类视频中学习先验,再通过机器人数据落地。这个判断不会只出现在Psi-0里。EgoScale、DreamDojo等研究方向也都在指向同一件事:机器人必须先向人类数据借力,再想办法跨越身体形态差异(embodiment gap)。
第二个判断:世界模型最重要的问题不是视频质量,而是物理可执行性。
如果世界模型只是在比较谁生成的视频更清晰、更长、更稳定,那它离机器人还差一步。机器人需要的不是漂亮的视频,而是可执行的未来:杯子会不会滑落,接触点对不对,物体会不会翻倒,动作能否由机器人自己的身体完成——这些才是真正决定任务成败的关键。
PhysWorld指向的正是这个悬而未决的问题:世界模型生成的未来,能否进入控制闭环。换句话说,世界模型对机器人真正有用的时刻,不是它生成了一段好看的视频,而是它能帮助机器人判断下一步该怎么做。
这也是王越团队这组三篇工作的核心脉络。Humanoid Everyday解决数据从哪里来,Psi-0解决人形机器人的基础动作能力怎么学,PhysWorld解决动作之后的物理后果如何预测。三篇放在一起看,它们不是在讲述一个更大的端到端模型,而是在搭建一条更完整的链路。
人形机器人的基础能力,可能不会只来自模型规模的继续放大。它更可能来自数据底座、机器人原生模型和物理世界预测之间的系统闭环。
