注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Retrieval
Retrieval 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Retrieval 的推特
盛大集团创始人陈天桥近年来在 AI 领域(尤其是“AI长期记忆”和“脑科学与 AI 交叉”方向)进行了深度布局。 他主张通过模拟人类大脑的记忆与认知机制,解决大语言模型(LLM)的“遗忘”和上下文受限问题,使 AI Agents 具备连贯、可进化且个性化的长期记忆。 旗舰开源项目:EverMemOS(智能记忆操作系统) EverMemOS 是由陈天桥旗下的 EverMind 团队推出的一款旗舰级开源、企业级智能记忆系统,被定位为未来 AI Agents 的“数据与记忆基础设施”。 1. 类脑级记忆生命周期(Engram-Inspired) EverMemOS 的设计灵感来源于人类大脑的记忆编码、巩固与提取机制,包含三个核心阶段: 情境痕迹形成(Episodic Trace Formation):将实时的对话流转化为 MemCells。MemCells 是记忆的原子单元,用于捕获情境线索、事实以及有时效性的预测信号。 语义整合(Semantic Consolidation):将分散的 MemCells 提炼并组织成更高维度的、具有主题性的语义结构 —— MemScenes。在这个过程中,系统会持续自动演化并更新用户画像(User Profile)。 重构式回忆(Reconstructive Recollection):在 AI 需要决策时,通过 MemScene 引导的 Agent 检索机制重构上下文,帮助下游模型完成长周期的连贯推理。 2. 五层技术架构 EverMemOS 将长期记忆的读写流程分层管理: 代理层(Agentic Layer):处理主动的记忆过程,如记忆提取、向量化、检索和重排序。 记忆层(Memory Layer):管理核心存储和情境记忆,专注于 MemCells 的提取与生存周期管理。 检索层(Retrieval Layer):负责多模态检索和对检索结果进行重排序,包括 BM25 + 向量检索的混合搜索以及 RRF(倒数排序融合)等。 业务层(Business Layer):处理上层的业务逻辑与数据操作。 基础设施层(Infrastructure Layer):兼容 MongoDB、Elasticsearch、Milvus、Redis 等主流数据库与缓存组件。 3. 性能与生态集成 Token 优化:充当智能注意力过滤器,在部分场景中可将上下文窗口的 Token 消耗降低多达 70%,同时在 LoCoMo 等长期记忆基准测试中达到了 SOTA 性能。 开源生态与插件:MCP(Model Context Protocol)支持:提供了 evermemos-mcp 插件,支持将 AI 编码助手(如 Claude Code、Cursor、Cline 等)接入 EverMemOS 记忆库。 Agent 框架集成:支持 OpenClaw 插件,使智能体能够自动捕获对话、调取历史记忆;同时支持 Live2D 虚拟角色记忆交互等应用。 GitHub 地址:
显示更多
0
16
90
28
转发到社区
魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需要84G显存). 然后我刚看到了FlashMemory这个论文, 直接能把显存占用压到 1.3GB! 甚至输出效果不降反升! 哥们你骗兄弟可以, 骗自己就没意思了, 真的吗? 压缩后反而性能上升? 我赶紧看了论文细节: 咱们先复习一下传统做法: 模型每吐出一个字,都要把之前的几十万字重新看一遍(这就是全局注意力). FlashMemory 的做法是: 预测未来需要什么, 它内置了一个神经内存索引器(Neural Memory Indexer, 其实就是个小模型了),能够主动预判接下来生成内容时需要用到历史文本里的哪些片段. 然后预先准备好这些片段, 接下来只要做到命中率超高, 那么这个提升就绝对有效. 即它的假设是, KVCache里面的东西并不是生成每个字的时候全都需要的, 只需要按需提前加载即可. 很像做作业的时候, 把参考资料摊满桌子, 然后优化了一下就是把参考资料需要用到的部分直接拍照, 用的时候看照片就行了. 那么听上去很简单, 但实际的难点在于, 训练一个专用的索引器小模型, 需要把 DeepSeek-V4模型加载到显存里一起炼. 相当耗费算力. 于是这篇论文第二个亮点来了, 它搞了个解耦训练. 他们把这个索引器当成一个标准的"双编码器(Dual-encoder,类似做搜索推荐的模型)"来单独训练. 在这个过程中,根本不需要把庞大的 DeepSeek-V4 基座模型加载到显存中. 这让训练成本断崖式下降,且兼容标准的检索(Retrieval)训练框架. (简单来讲就是它是通用方法训练的, 通过query预测需要检索哪些长句子. 所以其实是个通用模型) 听上去靠谱, 那也只是显存占用少了, 怎么就性能还提高了呢? 答案是注意力降噪. 因为每次只提取和当前生成最相关的记忆块(Chunks)放入显存,模型在运算时就看不见那些无关的冗余信息了.天然地起到了一种"去噪"作用,这也是为什么显存占用少了,模型准确率反而略微提升的原因.官方测试在长文本评测集(如 LongBench-v2 等)上的准确率平均最终提升了 0.6%. (其实还有数据如何逐出显存和如何预测数据实现预加载, 这部分也很棒, 很有启发性. 建议看原论文, 篇幅原因写不下了) 论文地址: 项目地址: #FlashMemory# #DeepSeekV4# #FlashMemoryDeepseekV4#
显示更多
0
17
224
19
转发到社区
MSR Memora:一个解耦"存什么"和"怎么取"的 agent 记忆系统 问题: 现有 agent 记忆系统在抽象和具体之间无法兼得。RAG/Mem0 保留细节但碎片化;摘要压缩高效但丢失约束和数字。知识图谱需要预定本体论,不跨域。 核心洞察: 记忆内容可以保持丰富(时间线、多轮讨论),但检索走一条独立的轻量结构层。 架构: 每条记忆两个部分。Primary abstraction——6-8 词的短语(what this memory is about),嵌入做相似搜索。Memory value——完整内容,永远不直接通过内容检索。Cue anchors——从 value 里提取的短标签,提供替代检索路径,不需要本体论。 例子:"Dave 和 Sarah 同意原型 4/1、试点 5/2、MVP 5/30"。Primary abstraction = "Updated Project Orion timeline agreed by Dave and Sarah"。Cue anchors = "Dave Project Orion update"、"Project Orion prototype schedule"等。后续查询 Dave 的贡献、原型进度、试点时间,都能通过不同 cue 到达同一条记忆。 检索: 不是一次性 top-k。Policy-guided retriever 迭代精化查询、通过 cue anchors 扩展、决定何时停止。可以蒸馏到小模型。 结果: LoCoMo 86.3%,LongMemEval 87.4%,SOTA。比 RAG、Mem0、Zep、LangMem 全高。多跳推理上差距最大。token 消耗减少 98%(vs 完整上下文)。存储条目数约 Mem0 的一半(344 vs 651)。 代码: | ICML 2026 #Agent记忆# #MSR# #LLM#
显示更多