自从去年OpenAI和Figure AI分手之后,外界就一直猜测:奥特曼是不是要自己撸起袖子造机器人了?现在,这个猜测终于得到了实锤。
6月1日,奥特曼在社交平台发了一条招聘信息,正式宣告成立“OpenAI Robotics”团队,大张旗鼓进军实体机器人领域。奥特曼还给出了清晰的路线图:短期先专注开发能帮建筑和基础设施领域技术工人干活的机器人;长期愿景则是让每个人都能拥有一个可以满足各种需求的个人机器人。
据了解,这个新成立的机器人业务板块,是从OpenAI的“世界模拟研究项目”升级演化而来的。有意思的是,挂帅的竟然是OpenAI研究副总裁阿迪亚·拉梅什——这位可是文生图模型DALL·E和视频生成模型Sora的核心开发者。
这一人事安排让人浮想联翩:按阿迪亚·拉梅什的老本行,技术路线很可能就是基于Sora和VLA(视觉-语言-动作)大模型来落地机器人具身智能。不过,这条技术路径已经被不少业内人士质疑,认为它很难真正实现通用具身智能。
那么,OpenAI到底会开辟全新的世界模型研究套路,还是继续吃ChatGPT的老本,去闯荡人形机器人江湖?

起大早赶晚集
OpenAI在机器人上的筹谋其实可以追溯到2017年,比绝大多数火得不行的人形机器人企业起步还要早。
最开始,他们瞄准的是灵巧手,原型取名Dactyl。2019年,通过强化学习和“自动域随机化”(ADR)技术,他们训练出一个AI系统,让Dactyl成功复原了魔方。这一成就启发了行业:从仿真环境训练再迁移能力到真实机器人,这条路是走得通的。
但作为世界模型的创造者之一,OpenAI却在此后全身心扑到了大语言模型的迭代上,这个项目在2020年前后就被主动放弃了。
OpenAI联合创始人沃伊切赫·扎伦巴后来解释:放弃具身智能,根子在数据瓶颈。机器人物理交互数据极其稀缺、采集成本高昂、迭代慢得要命。反观互联网上的文本和图像数据,海量又容易抓取。从通往通用人工智能(AGI)的效率路径来看,把资源集中到大语言模型(LLM)——也就是后来的ChatGPT上,显然更明智。
当然,OpenAI从未真正放弃在机器人领域的布局,只不过角色从亲自下场变成了“投资人”。
2024年,他们领投了人形机器人公司1X Technologies。同年2月,又参与了Figure AI总额6.75亿美元的B轮融资,并宣布为其人形机器人开发专属的多模态AI模型。官宣合作后不到一个月,Figure 01机器人就展示了部分自然语言交互与物体操作能力,当时宣称搭载了OpenAI的具身智能。
然而,后续OpenAI与Figure AI的决裂,却折射出机器人与大语言模型之间天然的“水土不服”。
2025年2月,Figure AI创始人布雷特·阿德考克正式宣布终止与OpenAI的合作,转向自主研发端到端机器人AI模型。他在采访中解释:OpenAI规模太大、业务太杂,为机器人这类具体对象装配AI并不是他们的主要关注点。“我们发现,要想在现实世界中大规模解决具身智能问题,就必须垂直整合机器人AI——我们不能外包AI,理由和我们不能外包硬件一样。”阿德考克说。
不再“让语言学家当司机”
对于OpenAI与Figure AI的分手,外界还有另一种猜测:Figure AI其实并不看好基于大语言模型或其Transformer架构在人形机器人上的可行性。
怎么理解这件事?打个比方:你向大模型发送一张盲文图片,它能明白这是盲文,但它很难自主解答这个盲文的意思——因为它没有真的看到盲文的点位,只是读到“这似乎是一张盲文图片”这样的话。
一款通用人形机器人无疑需要同时具备语言能力和动作能力。但在具身智能的架构上,语言能力和动作能力却可能走的是南辕北辙的技术路线。
宇树科技创始人王兴兴有个形象的比喻:VLA模型就像“让一位语言学家去开车”——他虽然能读懂交规,却很难瞬间判断刹车距离或障碍物方位。
斯坦福大学教授李飞飞也指出:用语言模型理解物理世界有结构性短板,空间理解、物理推理这些难题从来没有真正解决。
当然,按照奥特曼的说法,OpenAI世界模拟研究项目在过去一年里发展迅速,现在演变成了OpenAI Robotics。但团队仍由Sora负责人来领衔,这暗示他们可能还是会沿用Transformer架构来推进人形机器人具身智能。
然而,Meta前首席AI科学家杨立昆却直言:Sora生成的视频存在大量物理规律上的错误,比如物体突然消失、因果关系混乱。它学到的是“视频数据的统计规律”,生成的是“看起来合理”的幻觉,而非真正符合物理的世界模拟。称其为“世界幻觉生成器”恐怕更准确。
就算随着模型升级,今天的Sora不再生成那么“巅”的视频,但按照大语言模型的训练量级,以及训练机器人需要的高质量数据需求,用类似方式完成具身智能研究,几乎是一项不可能完成的任务。
智元机器人合伙人、高级副总裁姚卯青指出:如果把大语言模型的训练过程和具身智能模型训练作对比,GPT-5大语言模型的训练量级约100万亿Tokens,大约是100亿小时量级;而当前高质量具身智能真机交互数据仅在50万小时量级。两者可用数据之间存在数量级的“鸿沟”。难点在于数据获取方式的差异——大语言模型可以“安静地读书”,从互联网的海量文本、图像、视频中汲取一维或二维信息;具身智能则必须在三维开放世界中“摸爬滚打”,通过本体与环境的物理交互产生闭环数据。
现实的考量
事实上,就连OpenAI自身的技术报告也承认,Sora作为世界模拟器目前仍存在诸多局限。例如,它并不能准确模拟许多基本相互作用的物理原理,比如玻璃破碎;其他交互如吃东西,也并不总是能产生正确的物体状态变化。这表明,从“生成逼真视频”到“精确模拟物理世界以训练机器人”,还有很长的路要走。
不过,从OpenAI此次的安排来看,开辟一条与ChatGPT和Transformer架构差异极大的具身智能研发路径,可能成为现实。
从OpenAI Robotics的招聘岗位设置也能看出这一思路。根据最新招聘页面,岗位覆盖硬件和软件协同、仿真环境、仿真真实性,以及负责缩小“仿真到现实”差距的工程师。具体职位包括3D打印实验室技术员、执行器设计工程师、电气工程师、机器人数据系统工程师、仿真工程师等。
电气工程师岗位要求参与下一代机器人系统开发,覆盖从概念探索、原型设计、电路、PCB到集成部署的完整硬件流程。仿真相关岗位则强调缩小“模拟到现实”的差距,涉及物理、传感器、渲染等工具链,目标是构建一个从虚拟训练到实体部署的完整闭环。
短期目标聚焦于建筑、基建等场景,似乎也是看中了这些场景任务相对结构化、市场明确,而且能避开与特斯拉Optimus、波士顿动力Atlas以及众多中国人形机器人厂商在通用人形机器人上的直接竞争。
值得注意的是,此次高调宣布机器人战略还有一个不容忽视的背景:OpenAI已于2026年5月22日秘密提交了IPO招股书草案,计划最早于2026年9月上市。而在今年3月完成的最新一轮融资中,其估值已达到8520亿美元。
