什么是MemHarness?智能体记忆重构框架详解
直接将历史经验植入当前上下文,听起来简单直接,但实际效果往往不尽如人意——旧经验与当前状态不匹配,反而会干扰决策。上海AI Lab联合浙江大学、复旦大学、上海交通大学等高校推出的MemHarness,正是为了解决这一痛点而设计。它受人类记忆重构机制的启发,在检索到记忆和执行动作之间,特意嵌入了一个“批判与重构”环节。简单来说,就是先判断这段历史经验是否适用于当前场景,再决定是保留、改写还是彻底舍弃。整个流程通过GRPO进行端到端训练,无需额外的人工标注。
MemHarness的核心功能特性
- 智能记忆检索:Agent根据当前观测生成查询,从Milvus向量记忆库中召回top-k相关的历史经验,同时保留这些经验当初的来源状态信息。
- 批判与重构机制:统一策略模型将记忆来源状态与当前状态进行对比分析,判断这段经验是否可用——可用的经验被改写为与当前状态对齐的指导信息,不可用的则直接舍弃。
- 精准动作生成:基于重构后的指导信息,或让模型自主推理,生成可执行的环境动作,确保决策的准确性。
- 经验回写与剪枝优化:每轮交互结束后,将轨迹摘要成经验写回记忆库,执行语义去重,并定期按效用进行剪枝,清理低价值的记忆,保持记忆库的高效性。
- 端到端强化训练:通过GRPO统一优化检索、重构和动作生成三个环节,重构阶段无需独立的标注数据,大幅降低训练成本。
MemHarness的技术原理深度解析
- 五阶段决策流程:MemHarness将记忆引导的决策过程拆解为环境观测、经验检索、记忆批判、上下文记忆重构和动作生成五个连续阶段。这一设计模拟了人类“检索—评估—重构”的认知过程,而非传统Agent那样直接回放记忆。
- 上下文记忆重构机制:策略模型将任务描述、当前历史、检索到的经验及其来源状态拼接在一起,形成重构上下文。通过对比来源状态与当前状态,识别差异,保留可迁移的知识,改写不匹配的内容,或输出
标记拒绝这段记忆,回退到自主推理模式。 - 统一策略模型架构:检索查询生成、记忆批判重构、可执行动作生成这三个阶段共享同一个策略模型的参数。重构模块无需单独训练价值网络或监督数据,记忆利用与决策推理在同一个模型中紧密耦合,提升效率。
- GRPO端到端训练方法:由于重构指导信息缺乏真值标注,MemHarness采用GRPO对检索—重构—动作的全链路进行端到端优化。奖励由稀疏的任务结果和格式奖励组成,通过组归一化优势将轨迹级的信用分配到所有token上,同时训练思考、重构和动作生成能力。
如何快速上手使用MemHarness
- 克隆仓库并创建环境:执行
git clone https://github.com/KnowledgeXLab/MemHarness.git,创建python==3.12的Conda环境,然后依次安装vLLM、Flash Attention 2以及MemHarness本体。 - 部署嵌入服务:通过
vllm serve BAAI/bge-m3 --port 8001启动BGE-M3嵌入模型,为Milvus记忆库提供向量编码服务。 - 安装目标交互环境:根据任务需求,分别安装ALFWorld或WebShop交互环境,并下载对应的游戏文件及预训练检测器。
- 冷启动SFT(可选):运行
scripts/build_*_coldstart_data.py构建冷启动数据,再执行scripts/cold_start_sft.sh让模型对齐交互格式和记忆摘要格式。 - GRPO端到端训练:运行
run_scripts/train_alfworld.sh或run_scripts/train_webshop.sh,框架会自动启动记忆向量数据库、执行Agent检索、经验回写与剪枝,完成GRPO训练。
MemHarness的核心竞争优势
- 重构优于简单回放:显式插入批判与重构环节,将静态的记忆片段转化为上下文敏感的状态对齐指导,有效避免负迁移现象。
- 小模型性能超越大模型:仅7B参数规模,在ALFWorld和WebShop上分别超越Gemini-2.5-Pro达23.1%和39.7%,以小博大。
- 强大的OOD鲁棒性:在分布外场景中平均成功率达到85.9%,显著高于原始记忆回放的76.3%,展现出优异的泛化能力。
- 隐式推理能力增强:即使测试时关闭记忆功能,重构训练目标仍然让基础策略的成功率从76.4%提升至83.0%,从根本上强化了Agent的内在推理能力。
- 无需额外标注数据:重构能力通过GRPO端到端训练自然涌现,不依赖人工编写的重构监督数据,降低部署门槛。
MemHarness项目资源与官方地址
- GitHub仓库:https://github.com/KnowledgeXLab/MemHarness
- HuggingFace模型库:https://huggingface.co/KnowledgeXLab/MemHarness
- arXiv技术论文:https://arxiv.org/pdf/2607.28272
MemHarness与同类竞品的对比分析
| 对比维度 | MemHarness | EvolveR |
|---|---|---|
| 记忆范式 | 显式记忆库 + 状态条件重构 | 显式记忆库 + 经验演化 |
| 核心机制 | 检索后批判重构,支持保留/改写/丢弃 | 检索后直接注入,依赖经验演化迭代 |
| 训练方式 | GRPO端到端,无需重构标注 | RL训练,记忆经验需逐步演化积累 |
| OOD表现 | 85.9%(ALFWorld OOD场景) | 未重点报告OOD鲁棒性 |
| 可解释性 | 重构过程可检查,支持EMPTY拒绝机制 | 记忆注入过程相对黑盒 |
| 模型规模效率 | 7B即超越Gemini-2.5-Pro | 通常需要更大规模或更多训练步数 |
MemHarness的典型应用场景
- 具身智能家务场景:在ALFWorld等家庭环境中,Agent可以重构过往取物、清洁的经验,灵活适配不同房间布局,高效完成复杂家务任务。
- 自主在线购物:在WebShop等电商平台中,根据历史购物经验重构为当前商品搜索和筛选策略,显著提升目标导向的购物成功率。
- 智能客服对话:客服Agent检索历史相似工单后重构解决方案,避免直接套用旧答复导致答非所问,提升客户满意度。
- 代码辅助开发:编程Agent重构过往bug修复经验,适配当前代码上下文,提供精准的修复建议,而非照搬旧方案。
- 科研实验规划:实验Agent根据历史实验参数与结果,重构为当前实验条件的最优配置建议,有效减少试错成本,加速科研进程。
