最近在 GitHub 上刷到 agentmemory 这个开源项目,给各类 AI 编程助手打造了持久化记忆引擎。
它能够在后台静默记录代码修改和上下文,自动提取并压缩成结构化记忆。
在下次新建会话时,无需重新解释,AI 就能直接调用之前的技术栈细节和开发习惯。
GitHub:
帮我们节省长上下文带来的 Token 消耗,还能跨 Codex、Claude Code 等多个主流工具共享同一份记忆。
支持开箱即用,所有数据和本地向量模型都可以完全跑在本地,不用担心核心代码泄露。
适合重度使用 AI 辅助编程的开发者,让 AI 真正变成懂我们的专属搭档。
显示更多
Agent 记忆最危险的时候,往往是它太相信过去。
很多 Memory Agent 找到相似经验后,会直接把它塞进上下文。但任务相似,不代表当前状态相同,旧经验有时反而会把决策带偏。
这篇论文提出 MemHarness,把 Agent 使用记忆的过程改成三步:
先检索过去经验,再结合当前状态进行判断和重构,最后才生成行动。
有用的部分会被保留,不匹配的内容会被修改或直接丢弃。整个能力通过 GRPO 和任务奖励端到端训练,不需要额外标注重构过程。
基于 Qwen2.5-7B,MemHarness 在 ALFWorld 和 WebShop 上分别达到 85.2% 和 75.6% 的成功率,比纯 GRPO 提升 8.8 和 9.5 个百分点。
在未见过的环境中,它也达到 85.9%,而直接回放原始记忆只有 76.3%。这说明记忆用错了,确实可能比没有记忆更糟。
这篇工作把 Agent Memory 从「保存过去」推进到了「根据现在重新理解过去」。
真正可靠的记忆系统,需要知道哪些经验值得保留,哪些需要改写,哪些应该及时忘掉。
📎 arxiv:
显示更多
我的 Trading Agent 换上了这个大脑后,明显聪明了几个量级!
长期以来,我在使用 Agent 的过程中,都被同一个问题所困扰:它太容易失忆了!
每次开启一个新会话,我都要重新交代背景:
我是谁、我在做什么项目、我的判断标准是什么、哪些资料已经看过、哪些坑已经踩过、哪些结论已经被推翻过。
这带来的问题非常明显:
第一、Agent 很难保持连续性。今天它帮我分析了一个项目,明天再问它相关问题,它往往又像第一次接触一样,从零开始推理。
第二、Agent 很难沉淀经验。一次研究中已经证明无效的路径,下次它可能还会重复。而一次写作中已经验证有效的结构,下次它也未必会主动再用。
第三、记忆很容易被锁在某个工具里。Claude Code 里沉淀的上下文,换到 Codex、OpenClaw 或其他 Agent 工作流里,就很难自然迁移。
第四、传统的补救方案也不够优雅。把 Prompt 越写越长,会增加 token 成本,也容易污染上下文;自己搭向量库,又经常变成一个黑盒,能搜到碎片,但很难检查、编辑、回滚和复用。
也就是说,Agent 真正需要是一套可以持续积累、可以被人类检查、可以跨工具复用的记忆系统。
直到我遇到 EverOS,我才意识到:
Agent memory 不应该只是“把历史记录塞进 RAG”,而应该更像一个面向 AI Agent 的记忆操作系统。
EverOS 最吸引我的地方,是它把“记忆”这件事做得非常工程化。
它不是把所有内容扔进一个看不见的向量数据库,而是把记忆保存成可读、可编辑、可版本管理的 Markdown。
这样一来,Agent 的记忆不再是黑盒,人可以打开看,可以修改,可以用 Git 管理,也可以在需要时回滚。
它也不是只做简单语义搜索,而是采用本地优先的 Markdown + SQLite + LanceDB 架构,并结合 BM25、标量过滤等方式,让记忆既能被语义检索,也能按项目、用户、Agent、应用、会话等维度精确限定范围。
更关键的是,EverOS 区分了两类记忆:用户记忆和代理记忆。
用户记忆记录的是“我是谁”:
我的偏好、长期目标、判断标准、历史项目、常用工作方式。
代理记忆记录的是“Agent 怎么做事”:
完成过哪些案例、哪些路径有效、哪些错误发生过、哪些工作流可以复用。
这个区分非常重要。因为一个真正有用的 Agent,不仅要记住用户,还要记住自己做过什么,并且从自己的执行轨迹中沉淀出技能。
EverOS 的自我进化机制,正是解决这个问题的关键。
一次任务完成后,它可以把这次执行过程沉淀成 Case;
当某类成功路径反复出现,就可以进一步提炼成可复用的 Skill。
也就是说,Agent 不只是记住发生过什么,而是开始形成“以后遇到类似问题应该怎么做”的程序性记忆。
我把 EverOS 最适合落地的场景,放在了我的 AI Trading 和 Research Agent 上。
这个 Agent 的任务是帮我持续做研究:追踪 AI x Trading 项目、整理项目文档、提取交易假设、比较同赛道竞品、记录风险点、形成研究笔记,再输出适合发布的内容草稿。
在没有 EverOS 之前,这个 Agent 有几个明显问题。
它会忘记我的研究标准。比如我反复强调不要只看叙事,要看产品机制、资金流、风控结构、真实用户、可验证的数据和同赛道比较,但下一次分析新项目时,它还是可能滑向空泛总结。
它会忘记我已经踩过的坑。比如某些信源质量不高、某些指标容易误导、某些项目的营销话术不能直接采用,这些经验如果不能沉淀,下次就还要重新提醒。
它也很难复用成熟工作流。一次完整研究往往要经过“资料导入—事实提取—机制拆解—风险核查—竞品比较—交易假设—内容输出”几个步骤。如果每次都从零开始设计流程,Agent 就很难真正提高效率。
接入 EverOS 后,我会把这个 Agent 的记忆分成几层。
第一层是项目资料记忆。白皮书、官网、GitHub、截图、PDF、文章、推文、数据表,都可以作为多模态资料导入,让 Agent 在后续研究中能检索到原始上下文。
第二层是用户偏好记忆。比如我的研究偏好是“证据链优先、少用空话、避免 Shill、必须对比同赛道、必须写风险点、必须区分事实和推测”。这些不应该每次重新写进 Prompt,而应该成为长期用户记忆。
第三层是研究案例记忆。每次分析一个项目,都记录这次研究用了哪些资料、得出了什么结论、哪些假设被保留、哪些判断被推翻、哪些风险后来被验证。
第四层是技能记忆。当某个流程反复有效,比如“AI Trading 项目拆解模板”、“交易型 Agent 风控检查表”、“项目亮点转 X 长文结构”、“竞品比较框架”,就把它沉淀成 Agent 可以重复用的 Skill。
这样一来,Agent 的工作方式就发生了变化。
以前它像一个一次性助手:每次叫醒它,都要重新喂背景、重新讲规则、重新纠正偏差。
现在它更像一个会积累的研究搭档:它知道我以前看过什么,知道我更重视哪些判断标准,知道哪些路径曾经失败,也知道哪些工作流可以复用。
这才是我认为 EverOS 最有价值的地方。
它不是让 Agent 瞬间变成全知全能,而是让 Agent 的每一次有效工作不再归零。
长期看,Agent 的竞争力不只来自底层模型,而来自它能不能把用户、任务、项目、错误、决策和工作流持续沉淀下来。
没有记忆的 Agent,只是一个反复被唤醒的工具。
有了可读、可迁移、可检索、可进化的记忆层,Agent 才开始接近真正的长期协作伙伴。
如果你也在构建 AI Agent、LLM 应用、AI Coding 工作流,或者任何需要长期上下文的系统,强烈建议把 Star 一下这个 Repo !!!
因为下一代 Agent 真正重要的能力,可能不是一次回答有多聪明,而是它能不能记住过去、理解现在,并在下一次任务中变得更好
链接:
显示更多
🔥 想做 AI Agent 最烦的不是调模型,而是 RAG、记忆、评估、部署、数据库这些东西全都散在不同教程里,拼起来非常累。
最近发现一个神器:Oracle 官方整理的 oracle-ai-developer-hub。
GitHub:
1️⃣ 完整 AI 应用示例提供 Agentic RAG、金融 AI Agent、自然语言查询电商数据库等真实落地案例。
2️⃣ Notebook 实战演示手把手演示 RAG、Hybrid Search、Agent Reasoning、Agent Memory 等核心做法。
3️⃣ 企业级混合数据处理把向量、关键词、图、JSON、关系型数据放到同一个数据库场景里讲,告别玩具版 RAG。
4️⃣ 从 RAG 到多 Agent Workshop提供完整 Workshop,按步骤动手跑一遍,帮你系统性从 RAG 进阶到多 Agent。
5️⃣ 多框架记忆型 Agent 示例包含 OpenAI Agents SDK、Claude Agent SDK、LangGraph 等不同框架的记忆型 Agent 实现。
适合特别想把 AI Agent 做得更像生产系统,而不是只停留在聊天 demo 的人收藏使用。
显示更多
腾讯做的这个团队记忆 Tencent Agent Memory
可以让团队里的多个 AI Agent 共享记忆
那多个 Agent 共用一份团队记忆后,如果写进去的是错误信息怎么办?
显示更多