游乐游手机版
首页/AI热点日报/热点详情

PhyAgent OS 重磅升级 具身智能新一代开源操作系统

类型:热点整理2026-07-23
智能比拼已进入全新阶段,重点从单一模型能力转向了系统的可靠性与持续进化能力。具身智能竞赛正步入深水区,业界聚焦的核心,已从“模型能否思考”转变为“系统能否可靠执行,并在实践中持续迭代升级”。前沿领域不断涌现创新思路。不久前,NVIDIA 团队推出的 CaP-X 与 ASPIRE 项目,一个聚焦于代码

智能比拼已进入全新阶段,重点从单一模型能力转向了系统的可靠性与持续进化能力。

具身智能竞赛正步入深水区,业界聚焦的核心,已从“模型能否思考”转变为“系统能否可靠执行,并在实践中持续迭代升级”。

前沿领域不断涌现创新思路。不久前,NVIDIA 团队推出的 CaP-X 与 ASPIRE 项目,一个聚焦于代码即策略(Code-as-Policy)的系统评估与优化,另一个则深入探索执行轨迹分析、故障诊断与程序自动修复。它们的研究方向高度一致:从单纯的“训练端到端策略”,转向“让智能体生成可执行的控制程序,在执行反馈中发现问题,并将修正后的能力沉淀为可复用的技能模块”。

与此同时,中国研究团队也在这一方向展开了积极探索。

01

一个真实多机器人协作的智能购物助手诞生

近日,由中山大学 HCP 实验室、鹏城国家实验室具身智能研究所与 X-Era Lab(拓元智慧)共同发起的 PhyAgentOS 完成重大升级,全面开源并迅速获得业界广泛关注。

这是一套专为物理智能模型(如 VLA、WAM)、仿真环境及异构机器人设计的开源运行底座。其核心目标是为这些模型与环境提供统一、可管理、可追溯的执行基础设施,使 AI 从“会思考”切实迈向“可靠执行”。

为直观展示 PhyAgentOS 的实战能力,我们首先来看一个真实物理场景下的多本体长程协作任务

在一个模拟零售商店的场景中,顾客推着黄色购物车进入店内。XEra 移动导购机器人立即主动上前迎接:

  • 它主动问候顾客,观察其穿着并展开自然对话:“您这件蓝色T恤精神十足,看来是打算好好逛一逛吧?”
  • 当顾客询问饮料位置时,机器人清晰指引方向,并主动带领顾客前往对应货架。
  • 顾客挑选完商品后,机器人继续提供引导服务,直至将顾客引领至结账区域。

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

随后,Piper 双臂机器人接手精细操作任务:

  • 精准拾取衣物、饮料、零食等各类物品,并稳妥放置于桌面。
  • 熟练完成衣物折叠、塑料袋打开等操作,并将商品有序装袋。
  • 最后,由 XEra 移动机器人拿起装满商品的红色塑料袋,稳稳送至收银台。

整个过程由PhyAgentOS 的 Session 机制统一调度,实时显示当前 Target(XEra / Piper)和 SkillRuntime(na vigate、Openvla、PI0.5 等),全面支持人机自然交互、长时序任务分解、跨机器人协同以及语义验收(Session Verified)。

该演示充分体现了 PhyAgentOS 的核心价值:

  • 自然人机交互:实现多轮对话与动态意图理解,提升交互自然度。
  • 异构多机器人协同:移动平台(XEra)负责导航与运输,双臂机器人(Piper)负责精细操作,系统实现无缝调度与协作。
  • 长时序复杂任务闭环:从对话引导 → 导航 → 物体操作 → 装袋 → 交付,全程实现可靠执行。
  • 高透明度与可控性:Session 记录全程状态,便于实时监控、调试与人工干预。
  • 真实场景实用性:贴近零售、服务等实际应用场景的落地需求。

02

大模型如何更好地进入物理世界

大模型在任务规划与语义理解方面表现出色,但当智能体从虚拟屏幕进入物理世界时,常常面临“执行困难”的窘境。

机械臂看似执行了指令,却未能成功抓住杯子;模型返回“执行成功”的状态,真实世界却毫无变化;更换一个新机器人或仿真环境,整条执行链路便需重新搭建;一旦任务失败,问题难以定位,经验也无法有效积累。

单纯的端到端策略进一步放大了这些问题。它将感知、规划与控制高度耦合,虽然在特定场景下表现亮眼,但泛化能力弱、调试困难、可解释性低,且难以跨平台迁移和长期迭代。一旦部署环境发生变化,往往需要从头训练,成本高昂。

以大型模型为核心大脑、通过智能体(Agent)进行分层控制的方式,正成为突破这一瓶颈的最有效路径。

它将“思考”与“执行”清晰解耦,让大模型专注于高级规划与推理,而由底层系统负责可靠执行、状态监控、错误诊断与经验积累。这种架构不仅显著提升了系统的可调试性、可复用性与长期进化能力,更为跨平台部署与多机器人协作提供了坚实基础。

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

PhyAgentOS 对应的技术报告信息如下:

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

03

PhyAgentOS 核心设计:为机器人打造统一操作系统

通过上述真实购物协作 Demo 可以看到,不同形态的机器人(移动平台 + 双臂)如何在同一套系统下默契配合,共同完成复杂的长时序任务。

它就像为各种机器人安装了一套统一操作系统,让不同“身体”能够听懂同一个高层指令,并可靠地执行完成。

PhyAgentOS 以 Session(会话)为核心,构建了一套完整的任务管理系统。它既有效分离了“思考”与“执行”,又让两者紧密协同,从根本上解决了传统机器人系统碎片化、调试困难、迁移不便的问题。

下面我们逐一解析其关键设计:

▎Session 机制:任务全过程可管理、可追溯

传统机器人系统通常围绕驱动或单步动作来组织代码,长时序任务中的状态管理、异常处理与资源释放极易分散于各个模块。

PhyAgentOS 将 Session(会话)设定为最小执行单元。一次 Session 不仅明确“要做什么”,还会完整记录:

  • 任务目标分配给哪个 Target。
  • 采用何种 Skill Runtime。
  • 策略服务与远程执行端的位置。
  • 执行时长上限与步数限制。
  • 需要经过哪些 Adapter 与动作契约。
  • 最终状态是成功、失败、超时,还是在启动前就被拒绝。

只有目标、技能、传感器、动作格式、适配器关系与安全条件全部满足,Session 才会真正启动。运行过程中,系统还会持续监控心跳、超时、取消请求、策略服务状态以及 SafetyGuard。

▎Markdown 协议文件:系统状态全程透明可读

PhyAgentOS 并未将系统状态隐藏于难以查看的数据库中,而是采用一组结构化的 Markdown 文件作为协议边界。

这五份核心文件就像一套任何人皆可阅读的“工作台账”:

  • TARGETS.md——设备名册,详细列出所有执行目标及其能力与位置。
  • SKILLRUNTIME.md——方法说明书,描述各种执行方式的输入与输出。
  • SESSIONS.md——任务工单,记录当前执行进度与结果。
  • ENVIRONMENT.md——现场地图,描述物体、场景关系与感知结果。
  • LESSONS.md——经验记录本,沉淀预检、执行与验收中的问题及避免方法。

此外,EMBODIED.md 描述本体能力与限制,传感器配置、感知模型、动作契约与安全规则则通过 YAML 文件明确定义。

这种“状态显式化”设计带来了巨大优势:研究者可以逐步讲解,工程师可以快速排障,Agent 可以直接读取数据,失败后还能进行系统性复盘。

▎Adapter 适配机制:实现跨平台兼容与安全保障

平台间最难迁移的往往是数据格式。一台机器人可能输出两路相机加 7 维关节状态,而另一套仿真环境可能是三路图像加 23 维状态。

PhyAgentOS 使用三层明确的适配关系:

  • TargetAdapter:将不同目标的原始数据转换为 Runtime 可理解的形式。
  • PolicyAdapter:将 Runtime Observation 转换为策略模型所需输入,并将模型输出转换回来。
  • ActionBridge:完成动作转换与约束处理。

执行前,系统会进行严格的兼容性检查(Preflight),若不匹配则明确拒绝,避免出现隐性故障。

安全同样贯彻全链路:认知侧 Critic 检查任务意图,Runtime Preflight 验证执行契约,Target 侧 SafetyGuard 约束工作空间与速度,Operator Override 保留人工干预权限。

▎Session Verifier:将实验评测转化为标准化流水线

Runtime 记录执行事实,但最终判断权交由 Agent 侧的 SessionVerifier。

系统会自动打包任务前后的图像、环境快照等证据,由 Agent 进行最终判断,给出「成功」「失败」或「需要重新规划」的结论。

失败也能形成可检查的证据链,支持长期记忆与持续自进化。

▎Benchmarking:标准化实验评测流水线

PhyAgentOS 的 Benchmarking Skill 复用标准 Runtime,实现从任务生成、环境初始化、策略执行、结果记录到失败分析、Agent Retry 的完整闭环。

在 LIBERO、CALVIN、RoboCasa365 等基准测试中,系统显著提升了策略的最终完成率,同时保留 first attempt(原始能力)与 final outcome(系统干预后能力)的区分,使实验数据更加科学可信。

▎评估与进化 Showcase:让实验流水线与能力进化真实可见

一个机器人策略是否真正进步,不能只看一次 Demo 的成功与否。

真正重要的是看在哪些任务上失败,失败后系统能否查明原因、留下可查证据,并尝试继续完成任务。

PhyAgentOS 将这一过程纳入标准的 Session 流水线。每一次评估都是从任务生成、环境初始化、策略执行、结果记录,到失败分析、Agent Retry 和最终汇总的全链路统一管理。

在 LIBERO 基准测试中,我们使用 Pi0.5、X-VLA 等策略进行自动化评估。结果显示,在四个 suite 共 2000 个 episode 中:

Pi0.5 的首次执行成功率达 97.0%,经 PhyAgentOS Agent Retry 后,最终成功率提升至97.8%

X-VLA 的首次执行成功率达 97.3%,最终成功率提升至98.6%,系统额外成功挽救了 26 个原本失败的 episode。

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

图:PI0.5、X-VLA 等策略在 LIBERO 基准上的基础自动评估与 PhyAgentOS 介入性能对比。

在 CALVIN 长时序操作基准上,系统对连续任务的恢复能力得到进一步验证:

  • PI0 五步完整成功率从 38.9% 提升至45.6%
  • PI0.5 从 85.3% 提升至89.4%
  • X-VLA 从 74.3% 提升至75.7%

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

图:PI0、P0.5、X-VLA 策略在 CALVIN 基准上的基础自动评估与 PhyAgentOS 介入性能对比。

在 RoboCasa365 家庭场景基准中,恢复效果同样显著:

  • PI0.5 总体成功率从 17.6% 提升至26.8%
  • RLDX-1 从 35.6% 提升至42.8%
  • WorldDreamer 从 34.0% 提升至42.4%

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

图:PI0.5、RLDX-1、WorldDreamer 策略在 RoboCasa365 基准上的基础自动评估与 PhyAgentOS 介入性能对比。

PhyAgentOS 并不修改策略模型本身,而是通过统一的 Session Runtime,将任务调度、执行、验收、失败分析与重试组织成完整闭环。它严格区分 First Attempt(策略原始能力)与 Final Outcome(系统介入后的最终能力),使 Benchmark 成为一条可记录、可复盘、可进化的评测流水线。

04

真实部署验证:已在多种平台成功落地

▎Unitree Go2 快速接入

无需编写底层驱动代码,仅需安装环境并填入用户配置,十几分钟内即可完成 Go2 机器狗从开箱到系统接入的全过程。

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

▎自动化仿真评测

通过与 Agent 交互,系统可自动选择、启动评估流程,并整理生成评估结果。

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

▎游戏环境中的 Agent 能力演示

Minecraft

PhyAgentOS 在 Minecraft 中通过 Session 协议,实现了从自然语言指令到游戏内执行的完整链路。

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

星露谷物语

基于积累的经验与自主学习知识,Agent 完成家园区域的石头与杂草清理任务。

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

在 StarDojo Lite-100 多任务 benchmark 中,PhyAgentOS 基于 DeepSeek v4 Flash 的总分达到22.0%,超越 SPIKE(Qwen3.5-397B)的 18.0% 与 SPIKE(GPT5.4)的 20.3%。

分项来看,PhyAgentOS 在 Crafting 上达到50.0%(此前最高 baseline 为 19.0%),在 Combat 上达到16.7%(SPIKE 为 8.3%),验证了操作系统层对复杂多步任务与战斗闭环的显著增益。

Farming 与 Exploration 分别为 28.6% 与 17.9%,仅次于参数量更大的 SPIKE。这一结果说明:通过 Memory 接口将跨 episode 的种植周期、工具配方与 NPC 交互历史写入结构化记忆,Agent 能够将失败修复后的策略沉淀为可复用 Skill,实现持续自进化。

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

图:在 StarDojo Lite-100 上,PhyAgentOS 与 SPIKE 的各分类结果对比,SPIKE 的数值来自该论文报告的平均值。结果表明我们的 PhyAgentOS 仅依赖 DeepSeek v4 flash 即可超越 GPT5.4 的性能。

饥荒

在《饥荒》中,接入 PhyAgentOS 后,DeepSeek v4 Flash 的平均存活天数从 1.02 天提升至2.10 天,Day 3 生存率从 0% 提升至30%

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

图:DeepSeek v4 Flash 在《饥荒》秋季第 0 天、白天阶段(10 轮 episode)上的表现。PhyAgentOS 使 Agent 存活时间翻倍,并成功突破第 3 天的生存阈值。

这些游戏实验验证了,物理智能体的瓶颈往往不在于“模型能否想出正确动作”,而在于“系统能否确保动作在正确时机被可靠执行,并将反馈转化为长期经验”。PhyAgentOS 正在把游戏中验证的长期记忆与自进化能力,逐步迁移到真实机器人平台。

05

适用场景与上手指南

无论您是研究者、开发者还是教育工作者,PhyAgentOS 都能为您提供有力支持。以下是它的适用场景与简单上手指南。

  • 研究者:将宝贵时间留给真正有价值的创新,新策略、新感知方法或新环境都能快速接入统一协议,实验结果结构化、易于复现。
  • 高校教师和学生:完整可视化的执行流程,让“智能体闭环”从抽象概念变得具体可教。
  • 模型团队:策略不再被单一平台绑定,可在多种 Target 上进行统一评测。
  • 机器人与自动化团队:提供清晰的接入路径和安全边界,已在多种主流平台完成验证,加速真实场景部署。

刚刚 PhyAgent OS 重磅升级,具身智能迎来新一代开源操作系统

系统提供不依赖真实硬件的 Dummy Runtime,也支持快速连接游戏、仿真环境与真实机器人。

从第一条 Session 开始,您可以逐步扩展到复杂评测与多本体协同。

06

物理 AI 觉醒时刻才刚刚开始

从 VLA 到代码即策略,从世界模型到多模态推理,我们正在快速获得越来越聪明的“大脑”。但要让这些大脑真正进入现实世界,仅有模型还远远不够。

物理智能体还需要一套能够管理任务、检查契约、监督执行、接收反馈、验收结果并持续积累经验的系统基础设施。

PhyAgentOS 正是对这个问题的回答。

当 AI 开始触碰真实世界,我们不仅要让它会想、会做,更要让每一次行动都有清晰边界、每一次结果都有可查证据、每一次失败都能成为下一次进步的坚实起点。

物理 AI 的“觉醒时刻”,或许才刚刚开始。

来源:https://www.aitntnews.com/newDetail.html?newId=27510

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。