编程 半个月前提的海鲜过敏还能记住:MemOS的Agent记忆存储索引与召回机制

2026-09-05 19:16:15

半个月前提的海鲜过敏还能记住:MemOS的Agent记忆存储索引与召回机制

用Agent时很多人都有过这种体验:上一轮刚讲完需求,下一轮它就忘了,你只能把背景从头到尾再复述一遍。

MemOS 试图解决这个问题。它不是简单地给Agent挂一个向量库就完事,而是从操作系统层面重新设计了记忆的存储、索引和召回结构。项目在GitHub上已获得超过10.5K Star。

一个真实场景的测试

半个月前,用户在规划一次亲子游时随口提到孩子对海鲜过敏,当时没有细看结果就关掉了对话。最近重新打开继续聊旅游话题,让AI安排三天两晚行程,没有做任何额外说明。

结果方案让人意外:推荐住在陵水清水湾而非人多的亚龙湾,推荐的餐厅菜品中完全没有海鲜,连甜品都避开了芒果班戟换成了清补凉。用户完全没有重复半个月前说过的话,但这些信息都被正确保存并调用了。

记忆的存储、索引、召回全部由MemOS在后台自动完成。

统一评测才是真正的考验

市面上记忆产品不少,但一直缺少统一、透明、可复现的评价体系。不同产品使用的模型、Agent环境、Prompt、检索策略和评测标准都不一样,结果很难直接比较。

OmniMemEval 做的事情就是把试卷和评分标准统一:相同的数据集、相同的回答模型、相同的Prompt、相同的Judge和指标逻辑,将不同的Memory系统接入同一个评测流程。

评测分两条线:

  • Agent Memory:考察记忆能否提高Agent完成复杂任务的概率
  • User Memory:考察系统能否长期记住用户的事物、喜好、经历、时间变化以及遗忘需求

Agent Memory评测:任务完成率稳定提升

评测在OpenClaw和Hermes两种Agent环境下进行五项长程任务。

在OpenClaw环境中,MemOS五项任务平均准确率为50.07%,表现最佳。

在Hermes环境中——Hermes本身就是一个注重任务执行、自我反思和经验积累的Agent——接入MemOS后,五项任务平均完成率从45.15%提升至53.05%。这说明MemOS的效果并不依赖某一种特定的Agent架构。

User Memory评测:长期信息理解更准确

LoCoMo横评包含14种Memory方案,在相同配置下,MemOS以88.83的Overall得分排名第一,平均Context Token仅为5400,远低于其他方案的1.7万到3.2万。更高的分数来自更有效的记忆抽取和检索,而不是靠更长的上下文堆叠。

在LongMemEval横评中,MemOS获得89.20的Overall,同样排名第一。

PersonaMem-v2关注个性化记忆、敏感偏好、安全偏好等场景,MemOS也获得了最高分,在个性化记忆管理、敏感偏好处理、遗忘机制等方面表现稳定。

三项技术优化支撑性能提升

第一项:抽取上下文增强。 不只对单个chunk进行抽取,而是在召回相关上下文之后再一起抽取,提高记忆提取的完整性。

第二项:时间理解能力提高。 为相对时间生成标准化timespec,检索时基于timespec进行时间渲染,让系统能正确处理"上周""下个月"这类相对时间表达。

第三项:Evolve链路优化。 先轻量记录Trace,再基于执行DAG切分成Span,批量做压缩和质控,提升记忆处理的效率和质量。

接入方式

Agent接入:安装插件即可运行

如果正在使用OpenClaw或Hermes,直接安装插件,它会自动把记忆能力注入Agent运行过程,不需要修改业务代码。安装后重启,Agent就能记住用户偏好了。

代码集成

自研系统可以通过HTTP API或SDK接入,保存对话、搜索记忆、更新偏好只需调用几个接口。注册API Key并设置好环境变量即可调用。

小结

MemOS让Agent从"金鱼记忆"变成了能长期记住用户偏好的助手。它的价值不仅在于功能本身,更在于通过统一评测证明了效果的可复现性。项目基于MIT协议开源。

开源地址:https://github.com/MemTensor/MemOS

复制全文 生成海报 MemOS Agent记忆 记忆系统 LLM

推荐文章

程序员茄子在线接单