清华、上海交大和 MemTensor 最近提交了一篇论文,系统评测了 12 种 Agent 记忆架构。重点从“谁的模型更强”,转向“记忆系统该怎么选”:什么时候用 RAG,什么时候用向量数据库,什么时候引入知识图谱。
论文标题:我们准备好构建 Agent 原生记忆系统了吗?
论文把 Agent 记忆拆成 4 个环节:
表示与存储 → 提取 → 检索与路由 → 维护
然后分别评估每个环节对长期记忆效果的影响。
几个核心结论:
没有万能架构
不同任务适合不同记忆系统,关键在于记忆架构和 workload 的匹配度。
局部维护更划算
只更新受影响的记忆片段,比每次全局重构更省成本,效果也接近。
差距主要体现在两点
12 个系统跑了 5 个 benchmark、11 个数据集后发现,真正拉开差距的是检索精度和长周期稳定性。
实操上可以这样理解:
简单问答场景:向量检索基本够用。
需要多跳推理:最好加知识图谱层。
知识频繁变化:优先做局部维护,别动不动全量重建。
这篇论文的价值在于,它把 Agent 记忆从“概念讨论”推进到了“工程选型”:不同场景该用什么记忆系统,终于有了一套相对系统的评测框架。
论文:
代码:
顯示更多