这项由浙江大学、华南理工大学、华中师范大学和联想集团共同完成的研究,以论文《LightMem-Ego: Your AI Memory for Everyday Life》的形式发布于2026年7月,发表于计算语言学领域的学术预印本平台。

你上次把钥匙放在哪里?
这个问题,几乎每个人都碰上过。一把钥匙、一张医保卡、昨天同事说过的一句重要提醒,或是上周医生嘱咐的用药时间——这些本该记牢的生活细节,总在忙碌中悄悄溜走。如果有个贴身助手,能像一本永远在线的日记,默默记下你眼前的一切,等你随时问一句“那件事是啥时候发生的”——那该多好?
浙江大学等高校和机构的研究团队,正是带着这个质朴的出发点,构建了一套名为LightMem-Ego的系统。这套系统可以运行在智能手机或AI眼镜上,通过摄像头和麦克风持续感知用户的日常生活,并将这些视觉与声音信息组织成一套“分层记忆”,让用户随时可以用自然语言提问,获得有据可查的回答。
一、为什么我们需要一个“AI记忆系统”?
回到那把钥匙。现有的AI助手——无论是手机上的语音助手,还是对话框里的聊天机器人——在回答“你上次把钥匙放哪里”这个问题时,几乎都无能为力。原因很简单:它们没有“记忆”,每一次对话对它们来说都是全新的开始,它们根本不知道你昨天早上做了什么。
研究团队指出,这个问题背后实际上有三道难关横亘其中。
第一道难关,是怎么从源源不断的视频和音频流里,捞出“有意义的事件”。摄像头拍下的是连续的影像,不会自动告诉系统“这段时间你在开会”或“这一刻你把钥匙放在了厨房桌上”——系统必须自己判断哪里是事件的边界,哪些画面值得记住。
第二道难关,是如何把不断涌入的记忆有效组织起来。你昨天发生的事、上周的规律、五年来的习惯,在重要性和查询频率上完全不同,如果全部混在一起,查找时会极其低效。系统需要像人脑一样,把新鲜的事情放在“工作记忆”里,把沉淀下来的经验归入“长期记忆”。
第三道难关,是如何根据用户的问题,自动判断该去哪一层记忆里找答案。问“我现在手里拿着什么”和问“我平时几点起床”,显然需要从完全不同的地方取证,系统不能用同一套逻辑处理所有问题。
正是针对这三道难关,LightMem-Ego被设计出来——它是一套专门为日常生活记忆辅助而生的、轻量化的多模态流式记忆系统。
二、记忆的三个“抽屉”:系统是怎么工作的?
理解LightMem-Ego最直观的方式,是把它的工作原理类比成一套精心设计的文件管理系统——就像一张大书桌,桌面上摆着今天正在处理的文件,旁边有一个收纳盒放着最近几天的记录,而书柜里则存放着更久远、更系统化的档案。
LightMem-Ego把记忆分成了三个层级,分别对应不同的时间跨度和查询场景。
第一层叫做当前记忆,相当于桌面上正在翻看的文件。它记录着此刻正在发生的事情,处理的是“我现在看到了什么”“我手边有什么”这类即时性问题。这一层的数据更新非常频繁,像一个滚动播放的实时窗口。
第二层叫做短期记忆,相当于收纳盒里最近几天的记录。当系统捕捉到一段视频或音频,并判断其构成了一个“事件”——比如一段通话、一次购物、一场会议——就会把这个事件及其关键信息存入短期记忆。这一层能回答“我今天下午做了什么”“医生说了什么”这类问题。
第三层叫做长期记忆,相当于书柜里整理好的档案。它又细分为两个子类:一类叫情节记忆,存储过去发生的具体事件;另一类叫语义记忆,存储从这些事件中提炼出来的高层次规律,比如“你通常在周五下午去购物”“你到了办公室之后习惯先查消息、再泡咖啡、然后参加早会”。这一层能回答“我通常几点睡觉”“我有什么饮食偏好”这类跨越较长时间段的问题。
三层记忆各司其职,共同构成了一套完整的个人记忆档案库。
三、从摄像头到记忆:信息是如何被捕捉和整理的?
现在来看看这套系统是如何运转的——就像了解一家工厂的流水线,从原材料到成品需要经过哪些工序。
原材料是用户眼镜或手机摄像头拍摄的视频帧,以及麦克风采集的音频片段。研究团队用一个数学公式简洁地描述了这一点:每个时刻的输入,都由视觉信息、听觉信息和辅助元数据三部分构成,比如大致的地理位置、屏幕活动或传感器读数。所有这些信息都被统一打上时间戳,对齐在同一条时间轴上,这样系统就能知道“这幅画面”和“这段声音”是同时发生的。
关键的设计考量是:手机或眼镜端只做轻量级的工作,即采集、压缩、打时间戳、上传,不在设备本地做复杂的图像理解或语言推理。真正“费力气”的计算都发生在后端服务器上,这样就避免了快速耗尽手机电池或让眼镜过热的问题。
原始的视频流进入后端后,首先经过一个事件分割的环节。系统会根据视频帧之间的视觉变化和时间连续性,自动把视频切分成一段一段的“微事件”,每一段对应一个相对完整的生活片段,比如“在厨房站了一会儿”或“和某人说了几分钟话”。每个事件片段都会存储它的时间范围、代表性画面、初步的视觉描述,以及尚在处理中或已完成的语音转文字内容。随着更多信息陆续到来,系统会异步地为已有的事件补充更精确的描述和完整的对话记录。
这些事件片段形成了后续记忆构建的基本单元,就像乐高积木的小方块——单独看都很简单,但拼在一起就能构成复杂的生活图景。
四、问一个问题,系统如何找到答案?
当用户开口问“我把徽章忘在哪了”,系统在幕后会做一系列工作,就像一位经验丰富的档案管理员接到查档请求后的操作流程。
第一步是理解这个问题的“时间范围”和“意图类型”。这个问题显然是在问不久前发生的事,而且是在找一个具体物品的位置,所以系统会优先去短期记忆中检索,而不是翻查几个月前的长期档案。研究团队称这一机制为记忆路由,它让系统能够根据查询的性质,选择“最便宜”、也就是最高效的信息来源——当前记忆用于即时场景问题,短期记忆用于近期事件回顾,长期记忆用于习惯和规律方面的问题。
第二步是检索相关证据。系统从选定的记忆层级中,提取出与问题最相关的事件记录,这些记录可能包括时间戳、代表性图像帧、语音转录片段、事件描述,以及从中提炼出的关键事实。
第三步是把这些零散的证据整合成一个紧凑的“证据视图”,然后交给语言模型生成最终答案。答案不是凭空编造的,而是有具体的记忆证据作为支撑,所以能做到像“你今天早上8点15分,在厨房桌上放下了它”这样准确而具体的回应。
这种“先检索、再生成”的模式,保证了答案的可溯源性,而不是让AI胡乱猜测。
五、系统能帮你做什么?四个日常场景的真实演示
研究团队围绕四类最典型的日常记忆需求,对系统进行了具体演示。
找东西是最直接的场景。用户问“我把徽章忘在哪了”,系统从短期事件记忆中检索,找到对应的图像证据,回答“你今天早上8点15分把它放在了厨房桌上”。这对于总是在出门前手忙脚乱找东西的人来说,实际上能节省相当多的时间和焦虑。
对话回忆是另一个高频需求。看完医生回家,你可能已经记不清医生说了什么具体的嘱咐。系统会结合短期事件记忆和语音转录内容,找到“今天上午10点30分的就诊对话”,告诉你“医生说饭后服药,下周五复诊”。这对于老年用户或需要记录重要谈话内容的职场人士,具有相当实际的价值。
生活总结让系统能回答“我今天下午都做了什么”这样的问题。系统会把今天下午发生的多个事件拼接成一个连贯的时间线,告诉你“下午两点开了会,三点半和同事喝了咖啡,五点去超市购物了”。这类功能对于喜欢复盘或需要写工作日报的人来说,省去了大量回忆的脑力消耗。
习惯发现是最能体现长期记忆价值的场景。用户问“我通常到了办公室之后先做什么”,系统会调取过去几天或几周的长期语义记忆,归纳出“你通常先查消息,再泡咖啡,然后参加早会”这样的规律性描述。这对于想要优化自己日常效率、或是建立更好生活习惯的人来说,相当于有了一个不带评判的生活观察员。
六、实际测出来的数字:系统到底好不好用?
研究团队不仅展示了演示场景,还做了一套正式的量化评估,用实际数据来衡量系统的性能。
在记忆检索准确率方面,研究团队用“检索到的前几条结果里有没有正确答案”来衡量系统找到对的记忆的能力。结果显示,在找东西、对话回忆和生活总结三个场景的综合表现中,系统在检索前3条时能覆盖74.1%的正确答案,在检索前5条时能覆盖77.8%。不同场景的表现有所差异:生活总结场景的检索效果最好,前3条结果命中率高达100%;找东西的难度最大,前1条命中率只有22.2%,说明精确定位某个具体物品对系统来说仍然具有挑战性。
在问答准确率方面,研究团队请真人和AI评委分别打分,评估系统给出的回答是否正确。综合来看,人类评委打出的准确率为55.6%,AI评委打出的准确率为51.9%。生活总结场景表现最好,两种评判方式都达到77.8%;而对话回忆场景最难,准确率只有33.3%,说明精确还原口头对话内容还有很大的提升空间。
在响应速度方面,系统在手机和眼镜两类设备上都进行了测试,区分了短期记忆查询和长期记忆查询两种情况。对于短期记忆查询,手机端的中位响应时间(P50)约为5.86秒,眼镜端约为7.01秒,基本达到了“接近实时”的体验。对于需要深挖长期记忆、汇总多个事件的复杂查询,手机端的中位响应时间延长到14.87秒,眼镜端为19.96秒。研究团队认为,近期记忆查询适合提供接近即时的辅助,而长期记忆查询则适合用于回顾性总结,这种延迟在实际使用场景中是可以接受的。
七、和其他产品比起来,LightMem-Ego特在哪里?
研究团队把LightMem-Ego和市面上多个相关系统做了横向对比,包括ChatGPT的记忆功能、Mem0、Memories.ai、Gemini Live、Ray-Ban Meta AI眼镜,以及几个学术界的前沿系统如Vinci、VisualClaw、VisionClaw、Egocentric Co-Pilot和EgoButler。
对比维度包括六个方面:是否支持实时视听流输入、是否有当前/短期多模态记忆、是否有长期多模态情节记忆、是否有长期语义记忆、以及是否支持带时间戳的证据检索。
大多数现有系统都只覆盖其中一部分能力。ChatGPT的记忆功能只处理文字对话,不涉及视觉信息,长期记忆也是“部分支持”。Gemini Live虽然能处理实时视频,但没有明确的短期或长期记忆存储机制。Ray-Ban Meta眼镜也是类似情况,实时感知能力不错,但记忆层次不完整。Memories.ai专注于视频档案的长期存储和检索,但缺乏实时流和短期记忆机制。学术系统如Vinci和EgoButler在某些维度上表现较好,但也都未能同时覆盖全部六个能力维度。
LightMem-Ego是这个对比表格中唯一在六个维度上全部打钩的系统——实时视听流、当前短期记忆、长期情节记忆、长期语义记忆、带时间戳的检索,缺一不可。这套完整的分层记忆结构,是LightMem-Ego区别于其他系统的核心设计点。
八、这套系统还有哪些不完美的地方?
研究团队在论文中坦诚地列出了现阶段系统的局限性,这种诚实本身也是科学研究中值得肯定的态度。
目前,LightMem-Ego在运行时高度依赖外部API服务,包括语音识别、图像理解、语言生成和检索等核心功能,都需要调用第三方接口。这意味着系统的准确率和响应速度,会受到这些外部服务的稳定性、运行波动和访问限制的影响。如果语音转录出了错,或者图像描述不够准确,这些错误可能会像多米诺骨&牌一样传导到后续的记忆构建和问答环节,影响最终答案的可靠性。
此外,对连续视听流进行实时处理、分割、摘要、向量化和存储,在计算资源消耗上仍然不容忽视。记忆的更新机制也还处于初期阶段,目前系统缺乏一套成熟的策略来决定何时修正、合并、遗忘或晋升某一条记忆——这是人类记忆的重要特征,但在AI系统中尚未被充分模拟。
在隐私方面,研究团队也做出了相当审慎的说明。用眼镜或手机持续记录日常生活,必然会涉及旁观者的面孔、私人对话、敏感文件和个人位置信息。目前的原型系统还没有实现自动屏蔽敏感内容、旁观者同意管理、精细化访问控制或成熟的数据留存和删除策略。研究团队表示,未来的工作将重点在记忆生命周期中加入隐私保护机制,包括设备端预处理、选择性采集、敏感内容过滤、加密存储,以及用户自主编辑和删除记忆的能力。
归根结底,LightMem-Ego做的事情,是把“记住生活”这件本来完全依赖人脑的事情,变成一个可以由机器辅助完成的任务。它不是要取代人的记忆,而是像一个随身携带的笔记本,只不过这个笔记本会自己记录、自己整理、自己检索。
当然,55.6%的问答准确率说明这个系统现在还远不完美——大约有一半的问题,它给出的答案可能不尽如人意。但研究团队所构建的这套分层记忆框架,以及“先检索、再生成”的设计逻辑,代表了一个很有潜力的技术方向:AI助手不应该只活在当下这一刻,而应该像真正的助手一样,记得你昨天说了什么,知道你上周做了什么,了解你平时的习惯是什么。
对隐私敏感的读者或许会对“全天候记录生活”这件事心存顾虑,这种顾虑完全合理,研究团队自己也承认现有系统在这方面还有相当大的完善空间。但技术的发展从来不是非此即彼的,如何在“记住更多”和“保护隐私”之间找到那个平衡点,将是未来这类系统能否真正走进日常生活的关键。
Q&A
Q1:LightMem-Ego的三层记忆分别是什么,有什么区别?
A:LightMem-Ego把记忆分成三层。当前记忆记录此刻正在发生的事,适合回答“我手里拿的是什么”这类即时问题。短期记忆存储最近几天发生的具体事件,适合回答“医生说了什么”或“我今天下午做了什么”。长期记忆则分为情节记忆(具体过去事件)和语义记忆(归纳出的习惯和规律),适合回答“我平时几点起床”或“我到办公室之后通常先做什么”这类跨越较长时间的问题。
Q2:LightMem-Ego的问答准确率有多高?
A:在找东西、对话回忆、生活总结三个场景中,综合问答准确率为55.6%(人类评委打分)。其中生活总结场景表现最好,准确率达77.8%;对话回忆最难,只有33.3%。检索前3条的命中率为74.1%,说明系统找到相关证据的能力较强,但生成准确答案还有改进空间。
Q3:LightMem-Ego会不会泄露用户隐私?
A:目前这套系统是研究原型,还没有完整的隐私保护机制,不能自动屏蔽敏感内容或管理旁观者同意。研究团队在论文中明确承认了这一局限,并表示未来会加入设备端预处理、敏感内容过滤、加密存储和用户自主删除记忆等隐私保护功能。用户在使用类似系统时,需要对持续录制日常生活可能涉及的隐私风险保持充分意识。
