面壁智能在WAIC 2025期间正式发布了MiniCPM-Robot系列具身智能模型,并同步开源了推理框架PhyAI。这一系列模型以极小的参数量(1.5B和0.9B)实现了机器人操作与跟踪导航的核心能力,强调在本地算力、弱网环境下的稳定运行,为具身智能的实用化提供了新思路。
核心模型概览
MiniCPM-Robot系列目前包含两个模型:
- MiniCPM-RobotManip:参数量仅1.5B,负责机械臂操作,能够理解自然语言指令并执行长程任务(如制作三明治)。
- MiniCPM-RobotTrack:参数量0.9B,负责机器人的跟踪与导航,让机器狗在动态环境中持续跟随指定目标,即使在弱网或无网环境下也能正常工作。
两个模型均基于面壁智能长期积累的多模态模型技术,并搭配开源推理框架PhyAI,实现从模型部署到硬件适配的高效闭环。
MiniCPM-RobotManip:1.5B的通用操作模型
在主流评测中跻身第一梯队
尽管参数量只有1.5B,MiniCPM-RobotManip在LIBERO、Calvin、RoboTwin2等主流VLA评测中整体表现已进入第一梯队,与π0.5等模型处于相近水平。下图展示了其与其他模型的对比结果:

关键优势:上下文记忆与低延迟
与其他VLA模型仅根据当前帧做判断不同,MiniCPM-RobotManip会将历史观测和此前执行过的动作一并纳入判断,从而知道任务进行到哪一步、何时该停止。在专门考察上下文记忆的RMBench中:
- π0.5的成绩约为10分(接近随机水平)
- MiniCPM-RobotManip达到约53分
这一能力对真实机器人执行长任务(如叠衣服、收拾桌面)至关重要。
在延迟方面,面壁给出的单帧推理对比(H100 GPU、bf16精度)显示:
- MiniCPM-RobotManip单次决策延迟约120毫秒
- π0.5约234毫秒
- 前者的延迟接近后者的一半
更快的决策速度让机械臂动作衔接更顺畅,减少卡顿感。
技术核心:视觉Token压缩与流式计算
MiniCPM-RobotManip基于MiniCPM-V 4.6训练,通过压缩视觉Token来减少不必要的信息(如桌面纹理、墙面图案),保留关键内容,从而降低单次推理所需处理的数据量,提升推理速度。
同时采用流式计算:前面已经处理过的历史信息可以复用,新画面进来后只需接着往下计算,避免每次重新计算全部历史,使得机器人可以携带更长的历史记忆,同时计算量不会暴涨。
小提示: 1.5B的尺寸并非随意选择。面壁发现约200毫秒是机器人操作体验的临界线,目前多数VLA模型控制在4B以内,进一步增大模型尺寸能否带来等比例的真实收益仍在验证中。
MiniCPM-RobotTrack:0.9B的智能跟踪导航模型
三种真实场景下的性能
MiniCPM-RobotTrack以MiniCPM4-0.5B为基础,总参数量0.9B。它主要测试三种场景:
- 单目标跟踪:机器狗根据明确指令持续跟随指定的人。
- 多人干扰:周围多人同时移动、交叉甚至交换位置,模型依然认准最初目标。
- 模糊目标跟踪:指令本身模糊(如“跟着穿黑衣服的人”),现场有多个穿着相近的人,模型需结合画面理解指令所指。
在没有进行下游强化学习优化的情况下,MiniCPM-RobotTrack在三类任务上的追踪率分别达到:
- 单目标跟踪:89.8%
- 多人干扰:73.4%
- 模糊目标跟踪:80.4%
这三项均为开源方案中的最优结果。相比OpenTrackVLA,分别提高7.0、14.6和6.5个百分点。与闭源模型TrackVLA++相比,在单目标跟踪和模糊目标跟踪上分别高出8.8和17.0个百分点。下图展示了具体对比:

自进化数据管线:不断补足长尾场景
为解决真实世界中罕见但容易失败的情况(如目标快速横穿、短时遮挡、多人交叉),面壁搭建了自进化数据管线:
- 先对原始数据进行检查清洗,剔除异常轨迹和无效交互。
- 让模型在仿真和真实环境中持续运行,主动暴露薄弱环节。
- 系统将易出错的场景集中收集,通过专家策略纠偏,并放回下一轮训练。
这就像给机器狗准备了一本自动更新的“错题本”,不断强化对长尾问题的处理能力。
端到端响应与本地部署优势
面壁围绕宇树Go2 Edu的完整运行链路做了系统级优化:
- 在机器狗原生本地算力上稳定达到5Hz以上
- 端到端响应延迟约180毫秒
本地部署意味着摄像头数据和用户指令在本地处理,无需上传云端。在电梯、地下停车场等弱网甚至无网环境下,机器狗依然能完成目标识别、持续跟踪和运动控制。
重要提示: 直接拔掉网卡,机器狗仍然能正常工作。这一特性对隐私、数据合规和任务可靠性至关重要。
此次开源内容不仅包含模型权重,还涵盖环境安装、模型加载、摄像头接入、文本指令输入、控制接口和一键启动脚本。准备一台Go2 Edu即可按流程部署。
PhyAI:加快模型落地速度的开源推理框架
PhyAI由明体科技联合北京邮电大学、北京大学研发,旨在解决具身模型从实验室到真实机器人的硬件适配、量化、算子优化和部署问题。
在RTX 5090上运行π0、π0.5和GR00T时,PhyAI相较模型原始仓库分别实现约2.85倍、1.82倍和2.28倍加速。适配MiniCPM-Robot系列模型时:
- 通过CUDA Graph将推理帧率从10.12Hz提高到33.28Hz
- 加入定制融合算子后,在NVIDIA H20上进一步提高到36.77Hz
PhyAI让模型更快地跑上硬件,缩短了从模型发布到实际部署的时间。

产业合作:从实验室走向真实场景
与乐聚机器人的合作
面壁将端侧多模态大模型、夸父机器人本体和导航系统组合,推出展厅导览Agent和园区巡检Agent:
- 展厅导览机器人在无网环境下也能基于本地知识库完成离线讲解和自由问答,且能理解环境与人指令,规划导览路线并避障。
- 园区巡检机器人可识别车辆违停、路面异常和公共设施问题,敏感画面本地处理,数据留在客户侧。
与吉利汽车的合作
面壁与吉利共同训练VLA模型,并通过RoboHarness框架将VLM、VLA、机器人本体和导航系统整合,让机器人执行仓储中的长程任务。RoboHarness充当物理世界中的Agent执行框架:
- 上层VLM负责规划任务
- VLA和导航系统作为可调用的工具
- 框架管理长任务的上下文和记忆,遇到失败时进行重试和恢复
- 每次任务完成后的运行数据进入可治理的数据闭环,持续帮助模型进化

常见问题解答
Q1: 1.5B和0.9B的模型真的够用吗?
是的。MiniCPM-RobotManip在主流评测中已进入第一梯队,其记忆和延迟表现优于一些更大模型。MiniCPM-RobotTrack在复杂跟踪场景下达到开源最优。小模型在本地部署、弱网环境、成本控制方面具有明显优势。
Q2: 如何部署MiniCPM-RobotTrack到宇树Go2 Edu?
需要一台宇树Go2 Edu机器人,按照开源仓库(https://github.com/OpenBMB/MiniCPM-Robot)的指引安装环境、加载模型、配置摄像头和文本指令接口,即可一键启动。不需要额外开发板。
Q3: PhyAI是否只支持面壁的模型?
不是。PhyAI是通用开源推理框架,目前已支持π0、π0.5、GR00T以及MiniCPM-Robot系列,并且开放接口,便于适配其他VLA和世界模型。
总结
面壁智能此次发布的MiniCPM-Robot系列,以极小的参数量实现了机器人操作和跟踪导航的核心能力,并通过视觉Token压缩、流式计算、自进化数据管线等技术,在性能、记忆、延迟和本地部署方面取得了均衡突破。搭配开源推理框架PhyAI,以及乐聚、吉利等产业合作,这一方案正在回答一个实际问题:当AI真正长出手脚,除了聪明,还得跑得动、用得起,最后把活干完。
GitHub链接:https://github.com/OpenBMB/MiniCPM-Robot
HuggingFace链接:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
