清华大学自然语言处理实验室联合中国人民大学、面壁智能与 OpenBMB 社区,近期正式发布了一项备受关注的成果——业内首个 4B 参数规模的端侧智能体模型 AgentCPM-Explore。虽然参数量仅为 4B,但它在 GAIA、HLE、BrowserComp 等 8 项主流长程智能体基准测试中取得了全面领先的表现,不仅刷新了同参数级别模型的性能纪录(SOTA),还展现出可比肩甚至超越部分 8B 模型的推理能力,个别指标更接近某些 30B+ 大模型的上限水平。更值得关注的是,该模型能够稳定支持超过 100 轮连贯、逻辑清晰的多步交互,同时具备较强的“质疑能力”与“实证导向”——也就是说,它能像真正的研究型智能体一样,在任务执行过程中持续探索、动态调整策略,实现灵活应变与目标驱动。

AgentCPM-Explore 核心优势概览
- 突破参数限制:作为业界首个在 GAIA、Xbench、BrowserComp 等 8 个高难度长程智能体任务中均取得突出成绩的 4B 端侧模型,AgentCPM-Explore 重新定义了轻量化 AI 智能体与端侧大模型的性能边界。
- 持久深度探索:模型可稳定完成超过 100 轮无重复、高一致性的环境交互,持续推进复杂任务流程,最终实现更精准、更完整的任务闭环。
- 全栈开源支持:不仅模型本体开源,还同步开放工具调度平台 AgentDock、全异步强化学习训练框架 AgentRL,以及一体化智能体评测系统 AgentToLeaP,覆盖训练、部署、评估全流程的完整开源链路,便于开发者、研究团队和社区快速复现并持续迭代优化。

此次开源内容十分完整,包括模型权重、强化学习训练代码、标准化评测套件以及工具集成平台等关键资源均已同步提供。对于希望在端侧部署智能体模型、开展智能体任务开发的团队而言,这套方案能够显著降低落地门槛,也有助于提升研究复现效率与应用开发速度。
