2026年世界人工智能大会(WAIC)刚刚落下帷幕,一个清晰的行业共识已然形成:人工智能正加速从数字世界迈向真实物理世界。
走进展区,具身智能的进化速度令人惊叹。前几年,人形机器人还停留在静态展示阶段;去年,它们已能登上舞台进行拳击比赛;而今年,这些机器人直接走进各类场景,开始实实在在地“工作”了。这不禁让人期待:明年的具身智能,又将带来哪些突破?
与展台上的热闹景象形成对比,业界的观点显得更为冷静和理性。在面壁智能主办的“智在终端,惠及千行”端侧AI创新与行业发展论坛上,面壁智能联合创始人、首席科学家刘知远指出,尽管具身智能领域已有400至500家企业入局,但该行业仍处于前沿探索阶段,技术路线尚未收敛。行业需警惕“虚假繁荣”,而“先通后专”的发展模式,或许才是必经之路。

端侧AI:进入物理世界的关键支撑
人工智能正加速从“数字世界”迈向“真实世界”,而端侧AI正是支撑这一进程的核心底盘。
北京智源人工智能研究院联合端侧实验室发布的《端侧智能2026——规模化落地元年》报告明确指出,2026年,端侧智能正从概念验证走向规模化落地,产业化拐点已然到来。
报告指出,受限于成本、时延和隐私这三重约束,大模型正经历第二次结构性跃迁:从以云端为唯一算力中枢的单点智能,转向端云分工、协同共生的分布式智能系统。端侧AI也因此成为产业焦点。

“2026年是端侧AI规模化落地的元年。”面壁智能CEO李大海的判断十分直接,他们的定位清晰——致力于打造普惠千行百业的大模型基座。以技术引领做深底座,以产业推动做实场景,以生态共建做大未来。
数据也在佐证这一判断。截至2026年6月30日,面壁智能MiniCPM开源模型系列累计下载量已突破3800万次,覆盖文本、视觉、语音全模态。基于“密度定律”技术路线,MiniCPM已落地手机、汽车、具身智能、航天等多元终端,并已搭载于吉利银河M9、长安马自达EZ-60等车型的智能座舱。
在端侧AI论坛上,面壁智能继续拓展技术边界,发布了两种重量级产品。
MiniCPM5-2B端侧文本大模型,仅20亿参数,却在综合知识、数学推理、代码、指令遵循和智能体能力上均做到同尺寸领先,在AA榜单中位列2B以下模型第一。
VLA具身模型,则以通用智能为起点,让机器人能够直接处理普适、长程、流水线式任务。该模型融合多模态技术沉淀与视觉Token极致压缩能力,在保留完整历史观测记忆的同时,计算量与不保留记忆时持平,在机器人上下文记忆基准上取得了显著优势。
警惕“Demo繁荣”,回归基座泛化能力
今年WAIC,具身智能的进化确实令人眼前一亮。不少机器人“上得厅堂下得厨房”,能进工厂能搬货,前景广阔。
不过,业内专家也提出了冷静思考。有专家指出,行业展示的具身智能Demo,大多是为特定场景微调的“专家模型”。这些Demo视觉效果固然惊艳,但缺乏基础泛化能力,并未真实反映领域实际进展。

面壁智能学术合伙人、多模态智能首席科学家姚远在接受专访时坦言,面壁智能短期内的策略并非快速推出场景化Demo,而是专注于打磨基础数据、Infra工程链路及模型的泛化基座。“通过提升模型的基础能力,许多场景应用将迎刃而解,这是一种更本质但见效较慢的路径。”在他看来,过早追求特定场景的微调落地,可能是一种“干扰”,容易导致虚假繁荣。
那么,具身智能3至5年后的中期发展会是怎样一番景象?刘知远提出了一个鲜明的判断:具身智能必将遵循“先通后专”的发展模式。这有些类似于大学的通识教育和专业教育。他以人类学习为例:“通用人工智能的核心逻辑是先具备关于世界的常识,即感知与思考,再学习专业技能,即行动。如同人类先有十几年的世界交互经验,才能快速学会开车。相比之下,仅依靠专用数据训练单一能力的路线已触及天花板,无法解决长尾问题。”他认为,未来具身智能的竞争,不是单纯的数据竞赛或场景卡位战,而是一场关于“世界常识”基座构建的马拉松。
当谈及商业化节奏时,刘知远提供了一个极具参考价值的成熟度评估框架。他认为,应将具身智能置于“端侧智能”的大范畴内考量,模型需兼具感知、思考决策与行动三大能力。
“目前,语言模型的成熟度最高,多模态感知成熟度约70%至80%,而行动模块尚处早期,成熟度可能不足40%。”基于此,商业化落地需与技术成熟度紧密贴合。当前阶段,通过感知与决策的闭环,在车载内外感知等场景已展现出广阔前景,而涉及复杂物理行动的具身应用则相对靠后。
姚远进一步补充了面壁智能的策略选择。“我们的策略是专注技术本身的增长,待基础模型实现质变后,应用场景将自然涌现。”他说,企业希望确保商业信号真实反映技术实力,而非为了短期落地而扭曲技术路线。
