游乐游手机版
首页/AI热点日报/热点详情

WAIC面对面:具身智能闯关,物理AI泛化不能只靠肌肉记忆

类型:热点整理2026-07-20
具身智能面临数据稀缺、算力瓶颈与技术路径分歧三大挑战。数据规模与语言模型存在万倍差距,需亿小时级积累。算力平台存在瓶颈,技术路线尚未收敛,语言体系不可或缺。预计2027年底至2028年初将迎来物理AI的“涌现时刻”,商业化落地正加速推进。

具身智能行业正站在从实验室迈向实际应用的关键转折点,但数据稀缺、算力瓶颈和技术路径分歧三大难题,如同三座大山横亘在通往物理AI“ChatGPT时刻”的路上。在2026世界人工智能大会“智启具身论坛”上,智元合伙人、觅蜂科技董事长兼CEO姚卯青一针见血地指出:“如果只是通过示教进行模仿学习,成功率不管怎样都不会很高。”以下基于他的深入分析,为你梳理当前行业的真实面貌与未来预判。

图:智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO姚卯青

数据缺口:与语言模型存在“万倍差距”

要将机器人的能力提升到“开箱即用”、能跟随自然语言指令完成日常任务的水平,当前具身数据的规模远远不够。姚卯青透露,具身数据规模与语言模型预训练语料之间存在万倍以上的差距。要实现对通用物理规律、开放式指令理解与任务规划能力的隐式掌握,至少需要亿小时级别的数据积累,才能让常见任务的基础成功率达到70%到80%。

面对这一巨大缺口,行业正探索“开源”与“节流”并行的路径:

  • 高精度真机数据(塔尖):通过遥操作采集,用于后训练阶段的监督微调(SFT)。
  • 低成本大规模数据(基座):众包方式采集人类操作视频,成本可降至传统真机摇操的三分之一甚至更低。

姚卯青介绍,觅蜂科技通过众包方式,今年目标是达到千万小时级规模,目前已经到百万小时级别。但他强调,摇操并未被放弃——它是数据金字塔最上层的真机部分,在具体场景落地时,后训练依然需要大量摇操数据。不过,当前市面上能满足模型精度需求的数据源“说实话不多”,能同时具备大规模运营交付能力的团队更是凤毛麟角。需求仍然大于供给,数据基础设施建设仍是关键瓶颈。

小提示: 数据采集方案成本对比——遥操作采集(真机)精度高,但成本高昂(约每台每天数千元);众包视频(无本体)成本可降至传统摇操的三分之一,但需要大量清洗和标注,适合构建预训练数据。

算力隐忧:下一代平台面临挑战

在算力层面,国产端侧平台已在部分场景投入使用,但未来存在隐忧。姚卯青透露,智元在不少部署场景已依托国产算力平台投放应用,“国产现在在很多应用场景是可以用的状态。”但当前模型参数量偏小——无论开源模型π0.5还是智元的GO-1、GO-2,均在100亿参数以内,能在边缘端实现10到20赫兹的推理频率。

“但如果要进一步形成智能涌现,推进到几百亿参数的MOE架构,现在国内国外最新已投入使用的平台,在算力和显存通信带宽上都存在一些瓶颈。”姚卯青表示,这需要整个产业链向下一代平台推进。

路线分野:技术终局尚未收敛,但语言是必经之路

关于物理AI的技术路径,行业远未形成统一答案。是端到端的VLA(视觉-语言-动作)模型,还是强调物理规律预测的世界模型(WAM)?姚卯青提出了“世界推理动作大模型”(WRAM)的概念。

“动物可以表演杂技,但没法帮你收拾整个家,因为它没法进行任务规划和判断。”姚卯青以此比喻说明,要到达智能涌现的程度,语言知识体系不可或缺。VLA模型也好,世界模型也好,最终一定是集合了视觉、语言、动作的多模态体系。

他进一步阐释,未来的具身基座模型必须具备两个特征:

  • 理解与生成一体化:既能理解指令进行规划,也能生成对未来画面的预测和动作轨迹。
  • 架构足够简洁:能够通过离散自回归Transformer等可扩展架构,吸收百万甚至千万小时的数据,实现不同模态间的有机融合。

常见问题: 什么是VLA模型?
VLA是视觉-语言-动作(Vision-Language-Action)模型的缩写,它结合了视觉感知、自然语言理解和动作执行,让机器人能根据指令和视觉信息直接输出动作。而世界模型(WAM)则更侧重于预测物理世界的未来状态,两者各有侧重,但最终可能融合。

行业预判:2027年底有望看到“涌现时刻”

当被问及物理AI的“GPT-3.5时刻”何时到来时,姚卯青给出了相对明确的判断:“我认为在2027年底到2028年初会看到。”支撑这一判断的,是数据量从千小时、万小时级向百万小时级迈进过程中,已经浮现的线索。“我们确实看到了很多通用泛化的迹象,无论是指令跟随还是零样本操作泛化。”

过去一年超出预期的,不仅是技术进展,更是商业化落地的速度。“一年前大家认为行业还在做实验室技术展示,但今年我们已经把机器人真正安在工厂里,客户付费,24小时7天高强度运行,硬件稳定,软件做到4个9的成功率。”姚卯青说,从首批项目需要三四个月,到如今二次开发伙伴一两周就能复制落地,边际成本正在快速下降。

对于越来越多大厂入局,姚卯青持开放态度:“更多人来试,能加速并行探索的速度。有些是歪路有些是正路,试过总比没试过好。”他认为,行业需要更多参与者共同推动数据规模的扩大,“1亿小时的数据需要非常多的人一起参与,才能加速在2027年实现。”

常见问题: 为什么具身数据这么难获取?
具身数据需要真实物理交互,不同于互联网文本可以轻松爬取。采集方式包括人工遥操作(成本高、速度慢)、众包视频(需要大量清洗和标注)、仿真合成(存在sim-to-real gap)。目前行业还没有通行的标准化数据集,每家都在自建,导致数据规模远小于语言模型。

总体而言,具身智能行业正从“能不能动”转向“能不能用”,数据、算力和路线三大难题正在被逐步攻克。姚卯青的预测为行业描绘了一个清晰的倒计时:距离物理AI的“涌现时刻”,或许还有不到两年时间。

来源:https://tech.huanqiu.com/article/4SRez3aYXGK

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。