(上海,2026年7月19日)当大模型在语言、数学、代码这些数字世界里已经完成了能力跃迁,人工智能的下一个主战场,毫无悬念地转向了物理世界。机器人怎么感知环境、理解任务、执行动作,并在持续反馈中自我进化?物理AI的“ChatGPT时刻”,究竟什么时候会来?

围绕这些最热门的议题,7月19日,智元和觅蜂科技联合主办了2026世界人工智能大会的核心分论坛——“智启具身论坛2026:迎接物理AI智能涌现”。这场论坛的阵容相当有分量,从清华大学、佐治亚理工学院,到Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics、腾讯Robotics X,海内外顶尖高校、机器人实验室和头部科技企业的技术领军者坐在一起,专门拆解一个难题:物理AI怎么翻越Scaling Law的“物理墙”,真正实现通用物理智能的涌现。
智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO姚卯青作主旨演讲
姚卯青抛出了一个关键判断:理解物理AI,得先回到智能的两条主线——表征与闭环。表征,是对世界的抽象压缩;闭环,则是智能体与环境之间持续发生的“感知、理解、决策、行动、反馈”循环。数字AI的成功,本质上是知识表征在数字环境里的成功。而物理AI的难点在于,它必须同时打通经验表征与真实世界闭环。
在他看来,物理智能要实现规模化,得先翻越三道墙。第一道是数据墙,真实交互数据极度稀缺,获取成本高得吓人;第二道是表征墙,跨任务、跨场景、跨本体的统一物理表征还没成形;第三道是闭环墙,真实试错代价昂贵,反馈缓慢,根本没法规模化。他特别强调,物理AI从“能演示”走向“能干活”,关键不在于单点模型能力,而在于能不能形成一套可泛化、可优化、可进化的通用具身智能系统。
清华大学计算机系副研究员苏航作主题分享
清华大学计算机系副研究员苏航围绕《数据驱动的具身基座模型》指出,具身智能正在经历一次根本性的预训练范式演化。不再是面向单一机器人和特定任务的行为模仿,而是转向面向开放世界的通用能力预训练。未来具身基座模型的目标,不只是学习“看到什么、如何动作”,而是要形成对物理世界规律、动作后果和任务进程的统一理解。
他认为,这个范式将沿着三条主线加速演进:数据从单一本体走向多源混合,模型从行为模仿走向世界建模,学习从离线训练走向真实部署中的持续进化。机器人轨迹、遥操作数据、第一视角视频和人类行为视频,都会被纳入统一的预训练体系。不同机械臂、人形机器人和应用场景中的经验,也将从彼此割裂的数据,转化为可迁移、可复用的通用能力。
苏航强调,具身预训练的核心逻辑正在从“看得更多、模仿得更像”,升级为“理解世界、预测后果、持续进化”。这意味着,未来行业竞争的焦点,也会从单项任务成功率和演示效果,转向基座模型的通用性、迁移性和持续学习能力。只有完成从被动世界理解、统一世界建模到闭环自我改进的范式跃迁,具身智能才可能真正从“预编程的任务执行器”,走向能适应开放环境的通用智能体。
Genesis AI 联合创始人王尊玄作主题分享
接下来是另一个核心问题:机器人怎么从实验室展示,走向稳定可靠的真实部署?
Genesis AI 联合创始人王尊玄分享了《面向通用灵巧操作的人类数据与仿真扩展》,介绍了Genesis AI面向灵巧操作的全栈方法。核心思路是:以1:1人类手部数据策略为基础,结合Genesis World仿真环境、多模态大模型GENE与部署数据飞轮,推动机器人在数据、仿真、模型和真实部署之间持续迭代。
王尊玄指出,通用灵巧操作的突破不只是模型架构问题,更依赖高质量数据的规模化供给。预训练数据规模越大,模型在任务级微调后的效能和效率也越高。Genesis AI通过接近人类尺度的机器人手与非侵入式手套数据采集方式,缩小了人手与机器人手之间的数据鸿沟。同时,Genesis World仿真环境不仅用于强化学习后训练,也用于模型评测,加速模型迭代。
圆桌论坛
过去几年,数字大模型靠数据、模型和算力的持续扩展,实现了显著的能力涌现。但到了物理世界,智能不只是理解和生成信息,还必须转化为真实环境中的稳定行动,面对复杂交互、不确定性和硬件约束。
圆桌讨论的第一个焦点,就是机器人的“ChatGPT时刻”究竟需要多大规模的数据。姚卯青的观点很直接:如果把这个时刻定义为机器人能在物理世界中“开箱即用”,完成日常任务,并跟随开放式自然语言指令行动,那么具身数据规模与语言模型预训练语料之间,至少还有万倍以上的差距。物理世界噪声更大、信息冗余更高,要实现对通用物理规律、开放式指令理解与任务规划能力的隐式掌握,需要亿小时级别的数据,才能让常见任务的基础成功率达到70%到80%。
关于数据来源,嘉宾们形成了一个重要共识:物理AI的数据不可能只依赖单一来源,而是会形成由互联网数据、第一视角数据、UMI/Ego数据、真机数据、仿真数据与部署回流数据共同组成的“数据配方”。
圆桌论坛
赵子豪提出,短期看,低成本、低偏差的数据采集方式有助于提升预训练效率;长期看,真正决定系统持续进化的,将是机器人在多样化部署环境中形成的真实回流数据。马也骋也补充,部署数据进入下一轮预训练后,可以让后续部署越来越高效,最终缩短新场景落地的周期。但前提是,底层必须具备海量、高多样性的预训练数据。张正友则进一步指出,具身智能的数据飞轮必须回到物理交互本身。无论成功还是失败,机器人与真实世界交互产生的数据都应被收集起来,尤其要从失败数据中学习,持续提升模型能力。
在模型路线方面,嘉宾们围绕“物理AI的终局是端到端VLA、世界模型/WAM,还是更复杂的Agent系统”展开了激烈辩论。任至意认为,VLA与WAM并不冲突,未来更可能逐渐融合。模型既要理解上下文,也要具备对未来状态的预测能力,通过对未来建模来提升表征能力。马也骋也认为,不同架构各有优势,语言指令理解、未来预测、鲁棒执行等能力并不互斥。在部分强调高成功率和少数据效率的任务中,WAM可能比VLA更高效。张正友则提出,具身智能还处于早期阶段,还没有像大语言模型Transformer那样收敛的统一框架,未来更可能是认知系统、感知行动系统和底层反应系统之间分层协同、相互闭环。
讨论还延伸到了机器人本体设计。多位嘉宾认为,本体并不是越复杂越好,关键在于能否匹配具体场景的任务需求、成本约束和部署节奏。对于是否必须自研本体,任至意表示,Physical Intelligence当前更关注通用策略模型能力的涌现,因此会优先使用相对简单、维护成本较低的机器人本体,搭建数据与模型研发基础设施,加快模型迭代。姚卯青则认为,面向商业化落地,机器人必须满足客户对可靠性、成本、成功率和一致性的要求。全栈路线的价值,正在于能够打通本体、硬件、模型、控制和部署,在系统层面寻找最优解。
圆桌尾声,嘉宾们对机器人“ChatGPT时刻”的到来时间给出了判断。尽管具体预判从两年到五年不等,但大家形成了一个共同判断:物理AI的智能涌现不会来自单一模型、单一数据源或单一路线,而是取决于数据规模、模型架构、仿真评测、真机反馈、部署场景与硬件系统共同构成的持续进化飞轮。
从技术愿景走向路线图
从数据飞轮、基座模型、虚实学习到商业规模化落地,这场智启具身论坛完整串联起了物理AI从技术原理到产业落地的全链路思考。Scaling Law的“物理墙”并非不可逾越——当数据、表征与闭环系统实现共同规模化扩展,当学界与产业界在统一表征、虚实融合、真机进化等方向持续深耕,物理AI的涌现,正在从愿景走向路线图。
作为全球AI顶级盛会,WAIC不仅是汇聚全球智慧的重要平台,也是中国科技创新走向世界的舞台。而具身智能作为中国“新质生产力”的代表,正是与全球并肩探索的智能边疆。这场论坛汇聚中美产学研顶尖力量同台论道,已成功连续举办两届,也展现了以智元、觅蜂为代表的中国硬科技企业,正在全球尖端技术领域实现从参与者向引领者的角色转变。
