註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Agent记忆
Agent记忆 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Agent记忆 的搜尋結果
Agent 记忆最危险的时候,往往是它太相信过去。 很多 Memory Agent 找到相似经验后,会直接把它塞进上下文。但任务相似,不代表当前状态相同,旧经验有时反而会把决策带偏。 这篇论文提出 MemHarness,把 Agent 使用记忆的过程改成三步: 先检索过去经验,再结合当前状态进行判断和重构,最后才生成行动。 有用的部分会被保留,不匹配的内容会被修改或直接丢弃。整个能力通过 GRPO 和任务奖励端到端训练,不需要额外标注重构过程。 基于 Qwen2.5-7B,MemHarness 在 ALFWorld 和 WebShop 上分别达到 85.2% 和 75.6% 的成功率,比纯 GRPO 提升 8.8 和 9.5 个百分点。 在未见过的环境中,它也达到 85.9%,而直接回放原始记忆只有 76.3%。这说明记忆用错了,确实可能比没有记忆更糟。 这篇工作把 Agent Memory 从「保存过去」推进到了「根据现在重新理解过去」。 真正可靠的记忆系统,需要知道哪些经验值得保留,哪些需要改写,哪些应该及时忘掉。 📎 arxiv:
顯示更多
0
42
119
17
轉發到社區
Agent 记忆不是“存聊天记录”,而是让系统能持续改变行为的闭环。 最近合并研究多家的记忆系统,推荐这篇论文 中国人大高瓴人工智能学院 + 华为诺亚方舟实验室👇
顯示更多
现在agent 记忆也是大乱斗了
给 LLM Agent 堆越花哨的"记忆"架构,效果不一定越好。一篇新论文实测了 12 个记忆系统,没有通用赢家。 它把 Agent 记忆当成数据库来拆——表示与存储、抽取、检索与路由、维护四个模块,拉来 Mem0、Letta、Zep、Cognee、MemOS、MemTree、A-MEM、LightMem 等 12 个系统,外加 Long Context 和 Embedding RAG 两个基线,跑 5 类负载、11 个数据集。 几个反直觉的点: 1)在数据库操作类任务 DB-Bench 上,裸的 Long Context(48.20 EM)和最朴素的 MemoChat 反而赢过一众精致记忆系统。强记忆看的是它对主导瓶颈的对齐程度,而不是用了多花哨的表示。 2)检索的关键是怎么组织证据供后续重建,而不是把最相关那条排第一。证据拉远时图/层级结构碾压扁平:A-MEM Recall@10 达 85.9,而 Embedding RAG 的 Answer-F1 从 37.1 断崖跌到 7.4。 3)成本由"维护范围"而非"结构本身"决定,局部维护远胜全局重组。LongBench 上 LightMem 稳在 17.3 秒,而做全局协调的 Mem0/MemoChat/MemoryOS/A-MEM 飙到 374~552 秒,20~30 倍延迟差。 4)别急着压缩:保留原文胜过摘要,压一压 Substring-EM 就从 26.0 掉到 10.7;抽取要保上下文(MemOS Fast 25.5 EM vs Fine 2.5);维护要保守整合,激进的延迟刷新反而把分数拉低。 还有个普遍毛病叫"过去的幻觉":事实更新后系统照样返回旧值。所以论文标题才会问,我们真的准备好迎接 Agent 原生的记忆系统了吗。
顯示更多
0
42
250
55
轉發到社區
MSR Memora:一个解耦"存什么"和"怎么取"的 agent 记忆系统 问题: 现有 agent 记忆系统在抽象和具体之间无法兼得。RAG/Mem0 保留细节但碎片化;摘要压缩高效但丢失约束和数字。知识图谱需要预定本体论,不跨域。 核心洞察: 记忆内容可以保持丰富(时间线、多轮讨论),但检索走一条独立的轻量结构层。 架构: 每条记忆两个部分。Primary abstraction——6-8 词的短语(what this memory is about),嵌入做相似搜索。Memory value——完整内容,永远不直接通过内容检索。Cue anchors——从 value 里提取的短标签,提供替代检索路径,不需要本体论。 例子:"Dave 和 Sarah 同意原型 4/1、试点 5/2、MVP 5/30"。Primary abstraction = "Updated Project Orion timeline agreed by Dave and Sarah"。Cue anchors = "Dave Project Orion update"、"Project Orion prototype schedule"等。后续查询 Dave 的贡献、原型进度、试点时间,都能通过不同 cue 到达同一条记忆。 检索: 不是一次性 top-k。Policy-guided retriever 迭代精化查询、通过 cue anchors 扩展、决定何时停止。可以蒸馏到小模型。 结果: LoCoMo 86.3%,LongMemEval 87.4%,SOTA。比 RAG、Mem0、Zep、LangMem 全高。多跳推理上差距最大。token 消耗减少 98%(vs 完整上下文)。存储条目数约 Mem0 的一半(344 vs 651)。 代码: | ICML 2026 #Agent记忆# #MSR# #LLM#
顯示更多
🎒 微软出的 AI Agent 入门课,18 个单元全免费 GitHub 上 71.9K stars 想系统学 Agent,网上的资料要么是零散博客,要么是几个月前就过时的教程,学完还是不知道从哪下手写第一个 Agent。 微软这套课把路线铺得挺完整:18 个主题单元,从工具使用、Agent RAG、规划、多智能体,一路讲到元认知、上下文工程、Agent 记忆、计算机操作、部署和安全。每个单元配书面教程、视频和 Python 示例,代码都在 code_samples 目录里。 课程示例用的是 Microsoft Agent Framework 和 Foundry Agent Service V2,涉及 Foundry 的部分需要 Azure 账户;不想开 Azure 的话,部分示例支持 MiniMax 这类兼容 OpenAI 接口的服务商。 大厂愿意把完整课程免费放出来,这种便宜不占白不占。 GitHub:
顯示更多
0
6
101
23
轉發到社區
卡神分享了一套随时随地让 Agent 干活的远程方案,我现在也是这么用的。 家里的 Mac Mini 24 小时开机,通过 ChatGPT App 连接 Codex,开发任务、规则和 Agent 记忆都能同步。 碰到扫码登录、图形界面这类 Codex 不方便处理的操作,就切到手机上的网易 UU 远程,直接接管完整桌面。 UU 远程免费,支持多设备协同,也不用折腾局域网和公网配置。 所以,只需要一台mini主机,一部手机,就能给自己打造一套AI生产力了。
顯示更多
0
59
16
0
轉發到社區
一个法学生,从0开始用 Codex 搞出了 AI 记忆系统和视频商业化产品,YouTube 一个月涨了十万粉,教程全部开源。 每次看完逸尘老师的文章,总有一种坐不住的感觉,想立刻打开 Codex 试试。 逸尘 @gengdaJ 法学出身,后来一头扎进 AI 创业和内容创作。 他现在做的事情是用工具搭知识库、效率系统和视频变现流程,已经跑通了好几个 AI 产品的营收,YouTube 增长速度也很猛。 最让我服气的一点是,他把那些听起来很复杂的工具教学,做成了你照着走就能跑起来的东西。 不是那种“来看看我用了什么工具”就结束的分享。 他是从记忆管理怎么搭、多 Agent 怎么协作、视频怎么剪怎么发怎么赚钱,一步步拆开给你看,核心代码和框架是直接开源的。 看他发的东西,你会有一种感觉:这些工具不是什么遥远的概念,就是能马上拿来干活的。 早期逸尘老师主要是记录自己拿 AI 工具做项目的实验,分享一些心得和踩坑。 后来他发现大家真正缺的不是“这工具好不好用”,而是“我到底怎么一步步靠它做出点成果来”。 于是他开始整理 Codex 的进阶玩法: 从基础记忆优化到复杂的 Agent 记忆库,再到视频自动化和商业化,学习过程全公开,开源项目不断迭代。 后来我觉得转折点是他想通了一件事: 别光讲功能,要讲“从0到1怎么把这东西变成钱或者变成产品”。 把工具和真实问题、收入场景绑在一起,内容的吸引力一下子就不一样了。 那么我们可以从逸尘老师身上学到什么 一个是专注沉淀自我 他不是那种什么新工具都要碰一下的人,就是把 Codex 吃透,拿真实项目反复练、反复优化。 其实今天就可以选一个 AI 工具,挑一个自己想解决的问题: 比如搭个人知识库或者搞个视频处理流程——边做边记录关键步骤和踩过的坑。 另一个是他分享的形式 他会把复杂操作拆成清晰的步骤,配上具体案例和代码,有用的部分直接开源。 以后学东西的时候可以试试这个: 先写基础设置,再写进阶应用,最后加一个实际场景。 这样既巩固了自己的理解,发出来别人也能直接照着做。 还有一个是他始终在想“这东西怎么帮我省时间或者多赚钱”,不是为了学而学 每周花点时间想想,手头的工具到底怎么帮自己创造价值,然后小范围试试,记录结果,慢慢形成自己的一套东西。 第四件事——他会记录完整的创业思考。 不只讲成功的部分,避坑、走弯路、调整方向这些他也说。 把自己的 AI 学习和项目经历整理成笔记,定期回头看看哪些方法有效、哪些该换,进步会快很多。 法学的背景让他讲东西的时候特别注重框架感和能不能落地。 他能把技术操作翻译成普通人看得懂的清晰思路,还会分析风险和实际怎么走通,这点对不是技术出身的人特别友好。 自己学工具的时候有时也会陷进细节里,他的方式提醒我——多想想这东西到底服务于什么目标。 看完他近半年的推文,我有一种很强的感觉: 逸尘在用行动回答一个我一直纠结的问题——文科生怎么把 AI 工具真正用起来,而不是永远停在“了解”的层面。 他的做法是:专注一个工具、把过程拆开分享、绑定实际价值、记录完整过程。 这四件事结合在一起,就是一条可复制的从0到1的路。
顯示更多
0
64
35
6
轉發到社區
清华、上海交大和 MemTensor 最近提交了一篇论文,系统评测了 12 种 Agent 记忆架构。重点从“谁的模型更强”,转向“记忆系统该怎么选”:什么时候用 RAG,什么时候用向量数据库,什么时候引入知识图谱。 论文标题:我们准备好构建 Agent 原生记忆系统了吗? 论文把 Agent 记忆拆成 4 个环节: 表示与存储 → 提取 → 检索与路由 → 维护 然后分别评估每个环节对长期记忆效果的影响。 几个核心结论: 没有万能架构 不同任务适合不同记忆系统,关键在于记忆架构和 workload 的匹配度。 局部维护更划算 只更新受影响的记忆片段,比每次全局重构更省成本,效果也接近。 差距主要体现在两点 12 个系统跑了 5 个 benchmark、11 个数据集后发现,真正拉开差距的是检索精度和长周期稳定性。 实操上可以这样理解: 简单问答场景:向量检索基本够用。 需要多跳推理:最好加知识图谱层。 知识频繁变化:优先做局部维护,别动不动全量重建。 这篇论文的价值在于,它把 Agent 记忆从“概念讨论”推进到了“工程选型”:不同场景该用什么记忆系统,终于有了一套相对系统的评测框架。 论文: 代码:
顯示更多
昨天讲了 AI 短剧全链路,有人问有没有把所有环节封装好的工具 找到了,而且数据很惊人: Toonflow——开源 AI 短剧一站式工作台 GitHub Stars:10,700+,Fork:2,000+ 核心不同于其他短剧工具的地方: 🎬 无限画布生产台 剧本、角色、分镜、素材、视频节点全在一块画布上自由编排 不是线性流程,是可以随时回溯、并行生产的工程系统 🤖 三层 Agent 协作 决策层规划 → 执行层生成 → 监督层审核修订 角色一致性由 Agent 记忆系统跨会话维护,不用每帧手动对齐 💰 实测成本 GPT Image 2 出图 + Seedance 2.0 出视频 + Claude Opus 写剧本 2小时完成2分钟短片,全程费用:约 ¥130 个人学习和内容创作永久免费 👉 #AI短剧# #AI视频# #开源工具# #AI创作#
顯示更多