AI Agent记忆层2026硬核选型:LoCoMo跑出92.5分,开发者别再把记忆塞进上下文

三年前,给AI Agent加记忆的主流做法只有一种:把对话历史整个塞进上下文窗口,然后祈祷模型自己记住关键信息。会话一结束,一切归零。用户上周说过的偏好、三个月前改过的收货地址、去年被验证失败的推荐,Agent全都不记得。

2026年,这套做法已经被淘汰。记忆层成为独立的技术赛道,有了专属benchmark、专属研究文献、可量化的性能差距。Mem0发布的年度报告给出了最新的行业基准。

三个benchmark定胜负

过去记忆质量全靠厂商自卖自夸,实验室之间无法复现对比。现在三套标准benchmark统一了测量口径。

LoCoMo:1540道题,覆盖单跳、多跳、开放域、时序记忆四类,测多会话场景下的记忆召回。

LongMemEval:500道题,六个类别,知识更新和多会话召回难度最高。

BEAM:在100万和1000万token规模上测试。这个benchmark无法靠堆上下文窗口解决,最贴近生产环境的真实负载,十个类别包括偏好遵循、事件排序、弃权判断、矛盾消解。

评估框架统一看五个维度:BLEU、F1、LLM评分、token消耗、延迟。准确率高但每次查询烧2.6万token的方案,生产环境用不起。

最新数据:6900个token干掉26000个

Mem0在2026年4月发布的新算法,成绩单如下:

  • LoCoMo:92.5分,平均每查询6956个token
  • LongMemEval:94.4分,平均6787个token
  • BEAM(100万token规模):64.1分
  • BEAM(1000万token规模):48.6分

对比全上下文方案每次对话约2.6万token的消耗,token效率提升接近4倍。

提升最大的两个类别:时序推理+29.6分,多跳推理+23.1分。这两项直接对应真实用户画像——事实会累积、会变化、会互相牵连。

架构上有两处关键改动。一是单遍ADD-only抽取,Agent自己生成的事实(确认、推荐)与用户陈述的事实同等权重入库。二是多信号检索,语义相似、关键词匹配、实体匹配三路并行打分,融合后的结果优于任何单一信号。

云厂商集体下场

2026年年中,记忆层进入云平台军备竞赛。

AWS Bedrock AgentCore Memory已经正式可用。Google Vertex AI Memory Bank同步开放。Cloudflare Agent Memory在2026年4月进入私有测试。Anthropic走了另一条路,把Memory直接做进Claude模型本身,零基础设施开销,代价是锁定Claude生态——没有时序图,没有失效逻辑,本质是一个模型级key-value存储。

Mem0的集成生态更能说明碎片化程度:官方文档覆盖21个框架和平台,包括LangChain、LangGraph、LlamaIndex、CrewAI、AutoGen、Dify、Flowise、Google ADK、OpenAI Agents SDK、Mastra,外加20种向量存储。没有任何一个框架赢得了Agent战争,记忆层必须框架无关。

开源选型:四个代表方案的真实取舍

Zep:时序知识图谱架构,底层Graphiti引擎跑在Neo4j、FalkorDB或Kuzu上。事实带valid_at和invalid_at时间戳,低延迟检索,生产验证充分。代价是要额外运维一个图数据库。

Letta(前身MemGPT):有状态Agent运行时,核心记忆块常驻提示词,归档记忆走数据库,Agent用工具检索。配合vLLM和Ollama跑本地模型很顺。短板是没有时序失效,记忆块要手动编辑。

Cognee:LLM驱动的记忆管线,Remember-Recall-Improve-Forget四步,产出Neo4j三元组图。抽取时不查询已有图谱,更新和矛盾会与旧事实并存,需要下游自己处理。

Mem0:社区规模最大,向量存储加实体链接,入库时用LLM做冲突消解,最新声明优先。GitHub星标超过6.3万。

选型逻辑一句话说清:Agent的世界基本静态、只需要召回,向量方案够用;事实会互相取代、真相随时间变化,就要把记忆当作数据库问题来处理。

动手上手

Mem0的接入代码足够短:

“`python

from mem0 import MemoryClient

client = MemoryClient(api_key=”your-key”)

client.add(“I prefer Python over JavaScript”, user_id=”aashi”)

results = client.search(“programming language preferences”, user_id=”aashi”)

print(results)

“`

自托管走GitHub开源版,数据不出内网。评估框架也已开源,地址是github.com/mem0ai/memory-benchmarks,自己跑分自己验证,别信厂商的宣传页。

三个未解难题

行业报告列出了当前最难的开放问题:跨会话身份识别、大规模时序抽象、记忆陈旧性。BEAM千万token规模48.6分的成绩说明,长程记忆远没到终点。

Agent要真正长记性,记忆层这条基础设施赛道值得每个开发者持续投入。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号