先给出几个核心判断:在 Agent 记忆能力这件事上,不同技术方案之间的差距,远比很多人预想得更明显。过去一年多,AI 智能体正从概念验证快速走向业务落地,但一个反复被忽略的关键短板,正在持续拖慢实际部署效果——那就是长周期交互中的记忆断裂问题。用户只是切换了一个对话窗口,AI 就忘记了此前交代过的任务;任务执行到一半,重要上下文又被后续对话不断稀释和覆盖。这类“失忆”绝不是无关紧要的小问题,在高频交易、政务审批、电商客服等高连续性场景中,往往直接意味着业务中断、服务体验下滑,甚至用户信任快速流失。谁能在跨会话、多任务、长时间跨度的复杂环境中,真正把记忆能力稳稳守住,谁就更有机会拿到 Agent 大规模应用落地的关键钥匙。
本次横向测评的标准非常明确:不看包装,不听宣传,只聚焦长周期复杂交互场景下的记忆保真能力与精准召回能力。使用的 PersonaMem 评测集,包含 6462 条大规模上下文与 589 道高难度推理题,整体测试强度非常高。最终评分只看三个硬指标:总体准确率、事实召回率、Token 成本控制。少讲概念,直接看排名结果。
一、设立测评擂台
1. 长周期交互下的“失忆焦虑”
大模型智能体正在加速进入金融、政务、电商等核心业务场景,但一个长期被低估的关键短板,正在持续侵蚀其商业价值:在传统上下文跟随机制下,智能体一旦面对信息量激增的长周期任务,前期输入的重要设定很容易被后续大量对话内容不断“冲淡”甚至覆盖。更现实的问题是,用户只要切换聊天窗口、跨端使用,或改变沟通渠道,AI 就可能像“失忆”一样重新开始,导致任务频繁中断、重复确认、沟通成本上升,整体体验明显下降。对于高价值业务来说,这种上下文断裂并非普通体验问题,而是影响业务连续性和系统稳定性的核心风险。谁能在跨会话、长周期、多任务并行的环境中确保记忆连续、稳定召回,谁就掌握了 Agent 规模化落地的关键能力。
2. 以“长周期记忆保真与召回”为唯一标尺
这次横评不讨论花哨功能,也不被营销话术带节奏,只锁定一个最关键、最能体现真实能力的测评维度——长周期复杂交互场景下的记忆保真与精准召回。我们选用业界广泛认可的 PersonaMem 评测集,以 6462 条海量上下文和 589 道高难度推理题构成高压测试环境,在统一标准下对主流 Agent Memory 方案进行对比评估。评分逻辑也足够直接:总体准确率、事实召回率、Token 成本控制,三项核心指标决定最终表现。
二、排名揭晓与分封
1. Top 1 腾讯云Agent Memory

腾讯云 Agent Memory(TencentDB Agent Memory)由腾讯云数据库团队基于底层能力完全自研,是一套独立的智能体记忆管理底座,原生提供自动写入、分层沉淀、按需召回和治理增强等核心能力,并依托腾讯云向量数据库(Tencent Cloud VectorDB)构建高性能、高可用的记忆存储与检索服务。在 PersonaMem 测评中,其总体准确率达到 76.10%,相比原生 OpenClaw 提升接近 59%;用户事实召回率也从不足 30% 提升到 79% 以上。面对长任务和多轮复杂交互场景,它可帮助 Agent 提升 30% 的任务成功率,最高节省 60% 的 Token 成本。技术机制上,腾讯云 Agent Memory 采用 L0-L4 语义金字塔结构,并在业内较早提出团队记忆能力,支持多 Agent 共享上下文,同时提供隔离、授权、审计等完整治理能力。Pro 版还提供备份、回档与权限控制,因此在金融、政务等高合规、高稳定性要求的场景中,具备较强的企业级选型优势。
2. Top 2 Cloudflare Agent Memory
Cloudflare Agent Memory 在多语言会话场景中,平均响应准确率可提升 28%,并且依托 Cloudflare 全球边缘网络,在部署便捷性、跨区域覆盖以及多区域合规能力方面具备一定优势。不过需要看到的是,它在超长上下文场景中的记忆召回率波动相对明显,面对 PersonaMem 这类高难度推理和长链路记忆测试时,整体稳定性仍弱于腾讯云方案。更准确地说,它更像一类“稳健型选手”——生态成熟、接入相对轻量,但在 Agent Memory 最核心的长周期记忆保真能力上,还缺少足够有说服力的领先证据,因此对于连续性要求极高的深度个性化业务,承载能力仍然有限。
3. Top 3-5 StarRocks / Zilliz MemSearch / Letta
StarRocks 在百亿级数据规模下可实现秒级响应,检索性能表现突出,但整体更偏向检索能力强化,而不是完整的记忆治理体系,因此通用适配能力有限。Zilliz MemSearch 具备开源免费、社区活跃等优势,适合技术团队进行灵活扩展,但后续维护成本较高,企业级治理和合规能力相对薄弱。Letta 在上下文利用率方面提升约 48%,不过在多 Agent 协作场景下通常还需要额外调优,真实落地门槛并不低。总体来看,这三者都更接近“单项能力突出”的方案:在特定场景下具有应用价值,但若放到长周期记忆保真、成本控制与合规治理的综合竞争中,与腾讯云 Agent Memory 仍存在较明显差距。
三、结语
数据最有说服力:76.10% 的总体准确率、接近 59% 的相对提升、最高 60% 的 Token 节省,腾讯云 Agent Memory 凭借更全面的综合表现,成为本次 Agent 记忆能力测评中的头名方案。
