注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Retrieval
Retrieval 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Retrieval 的推特
CMP 170HX 今天又有一个比较实在的进展。 8G版解锁64G之后,已经有人单卡把 Qwen3.8-27B 跑到 200K 级真实长上下文了。 vLLM 0.27.1,175W,不超频,1K 大概84 tok/s,64K 还有75 tok/s,200K 还能跑57 tok/s,而且做了160K左右的 needle retrieval,不只是显存能分配出来,是真的在跑长上下文。 温度也还不错,持续负载核心大概66度,显存71度,功耗173W左右。这个和之前170tune测出来的175W甜点位基本对上了。 但我还是那句话,别一看到256K、262K就高潮。 现在公开证据能确认的是200K级真实跑通,不是262K连续跑几天,更不是24到72小时 serving 0 Xid。 还有一点,这个案例用的版本并没有包含最新的 WPR2 修复,所以它证明的是长上下文能力,不代表满显存稳定性问题已经彻底解决。 目前我的判断还是没变。 8G版越来越像真正能拿去部署的64G AI卡了。 10G版的80G,继续当彩票看。没有多人独立复现,没有全显存唯一pattern,没有多CUDA context,没有24到72小时0错误,我就不加一分钱估值。
显示更多
🔥X 平台杠开源了整个平台的算法权重,这次连“你的每个动作值多少分”都公开了。 X 直接放出了主要生产权重、可见性过滤规则、账号与内容标签系统、SimClusters,以及真正用于训练和 Serving 的 Phoenix 生产代码。 先猜你会对每条帖子做什么,再按一张“行为价目表”算分,然后经过限流、去重、圈外折扣、新作者扶持,最后决定你看到什么。 工作原理: 1、先找一批“候选帖子”,现在主要有三个入口: • Thunder:你关注的人刚发的内容 • Phoenix Retrieval:根据你的历史行为和内容语义,从全网找 AI 认为你可能感兴趣的帖子 • SimClusters:根据“哪些人经常喜欢同一类东西”形成兴趣簇,再从这些圈子里捞内容 2、然后 Phoenix 对每条帖子预测一串概率: 点赞 / 回复 / 转发 / 引用 / 分享 / 私信分享 / 复制链接 / 点击 / 看视频 / 关注作者…… 负反馈也一起预测: 不感兴趣 / 静音 / 拉黑 / 举报 / 没有停留。 而且它看的信息比“你过去点过什么赞”多得多。 新版生产模型里还有国家、语言、位置、当地时间、年龄段、性别、已安装 App、帖子年龄等上下文。 3、真正炸裂的地方来了: X 这次把主要生产默认权重公开了。 正向: • 复制链接分享:+20 • 回复:+5 • 引用:+5 • 私信分享:+5 • 关注作者:+4 • 普通分享:+2 • 转发:+1 • 点赞:+0.5 • 点击帖子:+0.4 负向更加夸张: • 举报:−234 • 静音作者:−58.8 • 不感兴趣:−43.2 • 拉黑作者:−31.2 还有一个非常有意思的隐藏项: 如果你和作者互相关注,而且对方发的是原创帖,“你会回复它”的权重额外 +15。 基础回复权重是 5。 也就是说,这类帖子对应的回复预测权重可以直接来到 20。 当然,这些数字不能简单理解成: “1 次复制链接 = 40 个赞”。 系统计算的是: 某个行为发生的概率 × 对应权重。 而且 X 自己在代码里专门解释,这些权重同时考虑了行为价值和这种行为在全网有多稀有。 4、打完分还没结束。 圈外内容,也就是你没有关注的账号,默认分数还要乘 0.75。 同一个作者连续出现,也会被强行衰减。 按目前公开的默认参数计算: 同一批候选里,同一个作者的第二条大约只剩 62.5%,第三条约 43.75%,继续出现会越来越接近 25% 的下限。 所以疯狂连续刷帖,并不能无限霸占推荐流。 更有意思的是,小账号真的有代码级“新人保护”。 当前默认参数里: 作者粉丝不超过 1000,帖子浏览低于 1000,满足条件的原创帖,有机会被系统主动往大约第 16 位附近的目标分数抬。 另外,超过 48 小时的帖子,在打分之前就会被过滤。 5、这次对创作者最重要的一个变化,是“限流”终于开始变得可解释了。 X 把 Visibility Filtering 整条链路开出来了。 Spam、恶意链接、NSFW、辱骂、Do Not Amplify 等标签,都可能让一条帖子在“推荐给非关注者”时直接被 DROP。 这就解释了过去一种很常见的现象: 你的粉丝依然可以看到你。 陌生人的 For You 推荐流里,你却几乎消失了。 X 还配套推出了 Under the Hood,可以查看自己账号和帖子身上影响可见性的标签统计。 6、另外还有一个旧版解读需要更新。 Phoenix 内部依然采用 Candidate Isolation。 模型给某条候选帖打基础分时,它看不到同一批里的其他候选帖,所以 Phoenix 这一层的分数不受 Batch 里其他帖子的影响。 但之后还会继续经过: 作者多样性衰减、圈外 0.75 折扣、新作者扶持,以及 DPP 多样性重排。 所以“每条帖子独立打分”依然成立于 Phoenix 这一层。 最终出现在第几位,依然会受到整个推荐管线影响。 几个最值得记住的结论: 第一,复制链接分享的默认权重非常高。 X 明显很在意一条内容有没有强到让人愿意“带出信息流”。 第二,回复远比普通点赞值钱。 互相关注关系里的原创内容,回复预测还会得到巨额加权。 第三,连续刷屏会被作者多样性机制主动压制。 第四,小账号确实存在明确写进代码里的冷启动机会。 第五,负反馈非常贵。 举报、静音、不感兴趣带来的负权重,远高于一次普通点赞提供的正权重。 第六,这次透明度已经高了一个级别,但距离 100% 仍有空间。 真实生产数据和 checkpoint 没有开放,部分 Grox prompts 和 Botmaker 规则依然保留。 对于创作者来说,新的优先级已经非常清晰: 让内容值得被回复、私信分享、复制链接带走; 建立真实的双向关系; 减少连续刷屏; 尽量避免触发“不感兴趣”、静音、举报和各种安全标签。 X 的算法越来越像一个实时预测“你下一步会做什么”的 AI 编辑部。
显示更多
很多 AWS 用户认为降低 S3 成本就是选择更便宜的 Storage Class,但真正困难的是:你知道自己的数据多久被访问一次吗? 一个常见误区是马上创建复杂的数据分析系统。 更合理的方法: 1. 使用 S3 Storage Class Analysis 观察真实访问模式 2. 对确定的冷数据使用 Lifecycle Policy 3. 对访问模式未知的数据使用 Intelligent-Tiering 不要为了节省几十美元/月,创建一个维护成本更高的系统。 场景1:业务文件、用户上传文件 图片 | 视频 | 文档 建议: 0-30天: S3 Standard 30-90天: S3 Intelligent-Tiering 90天以后: Standard-IA 场景2:日志 CloudTrail | Application logs | ELB logs 通常: 0-30天: Standard 30-90天: Standard-IA 90天-1年: Glacier Instant Retrieval 1年以上: Glacier Deep Archive 场景3:备份 数据库备份: 7-30天: Standard-IA 30-180天: Glacier Flexible Retrieval 180天以上: Deep Archive 欢迎留言讨论 #aws# #AmazonS3# #数据库#
显示更多
盛大集团创始人陈天桥近年来在 AI 领域(尤其是“AI长期记忆”和“脑科学与 AI 交叉”方向)进行了深度布局。 他主张通过模拟人类大脑的记忆与认知机制,解决大语言模型(LLM)的“遗忘”和上下文受限问题,使 AI Agents 具备连贯、可进化且个性化的长期记忆。 旗舰开源项目:EverMemOS(智能记忆操作系统) EverMemOS 是由陈天桥旗下的 EverMind 团队推出的一款旗舰级开源、企业级智能记忆系统,被定位为未来 AI Agents 的“数据与记忆基础设施”。 1. 类脑级记忆生命周期(Engram-Inspired) EverMemOS 的设计灵感来源于人类大脑的记忆编码、巩固与提取机制,包含三个核心阶段: 情境痕迹形成(Episodic Trace Formation):将实时的对话流转化为 MemCells。MemCells 是记忆的原子单元,用于捕获情境线索、事实以及有时效性的预测信号。 语义整合(Semantic Consolidation):将分散的 MemCells 提炼并组织成更高维度的、具有主题性的语义结构 —— MemScenes。在这个过程中,系统会持续自动演化并更新用户画像(User Profile)。 重构式回忆(Reconstructive Recollection):在 AI 需要决策时,通过 MemScene 引导的 Agent 检索机制重构上下文,帮助下游模型完成长周期的连贯推理。 2. 五层技术架构 EverMemOS 将长期记忆的读写流程分层管理: 代理层(Agentic Layer):处理主动的记忆过程,如记忆提取、向量化、检索和重排序。 记忆层(Memory Layer):管理核心存储和情境记忆,专注于 MemCells 的提取与生存周期管理。 检索层(Retrieval Layer):负责多模态检索和对检索结果进行重排序,包括 BM25 + 向量检索的混合搜索以及 RRF(倒数排序融合)等。 业务层(Business Layer):处理上层的业务逻辑与数据操作。 基础设施层(Infrastructure Layer):兼容 MongoDB、Elasticsearch、Milvus、Redis 等主流数据库与缓存组件。 3. 性能与生态集成 Token 优化:充当智能注意力过滤器,在部分场景中可将上下文窗口的 Token 消耗降低多达 70%,同时在 LoCoMo 等长期记忆基准测试中达到了 SOTA 性能。 开源生态与插件:MCP(Model Context Protocol)支持:提供了 evermemos-mcp 插件,支持将 AI 编码助手(如 Claude Code、Cursor、Cline 等)接入 EverMemOS 记忆库。 Agent 框架集成:支持 OpenClaw 插件,使智能体能够自动捕获对话、调取历史记忆;同时支持 Live2D 虚拟角色记忆交互等应用。 GitHub 地址:
显示更多
0
16
90
28
转发到社区
魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需要84G显存). 然后我刚看到了FlashMemory这个论文, 直接能把显存占用压到 1.3GB! 甚至输出效果不降反升! 哥们你骗兄弟可以, 骗自己就没意思了, 真的吗? 压缩后反而性能上升? 我赶紧看了论文细节: 咱们先复习一下传统做法: 模型每吐出一个字,都要把之前的几十万字重新看一遍(这就是全局注意力). FlashMemory 的做法是: 预测未来需要什么, 它内置了一个神经内存索引器(Neural Memory Indexer, 其实就是个小模型了),能够主动预判接下来生成内容时需要用到历史文本里的哪些片段. 然后预先准备好这些片段, 接下来只要做到命中率超高, 那么这个提升就绝对有效. 即它的假设是, KVCache里面的东西并不是生成每个字的时候全都需要的, 只需要按需提前加载即可. 很像做作业的时候, 把参考资料摊满桌子, 然后优化了一下就是把参考资料需要用到的部分直接拍照, 用的时候看照片就行了. 那么听上去很简单, 但实际的难点在于, 训练一个专用的索引器小模型, 需要把 DeepSeek-V4模型加载到显存里一起炼. 相当耗费算力. 于是这篇论文第二个亮点来了, 它搞了个解耦训练. 他们把这个索引器当成一个标准的"双编码器(Dual-encoder,类似做搜索推荐的模型)"来单独训练. 在这个过程中,根本不需要把庞大的 DeepSeek-V4 基座模型加载到显存中. 这让训练成本断崖式下降,且兼容标准的检索(Retrieval)训练框架. (简单来讲就是它是通用方法训练的, 通过query预测需要检索哪些长句子. 所以其实是个通用模型) 听上去靠谱, 那也只是显存占用少了, 怎么就性能还提高了呢? 答案是注意力降噪. 因为每次只提取和当前生成最相关的记忆块(Chunks)放入显存,模型在运算时就看不见那些无关的冗余信息了.天然地起到了一种"去噪"作用,这也是为什么显存占用少了,模型准确率反而略微提升的原因.官方测试在长文本评测集(如 LongBench-v2 等)上的准确率平均最终提升了 0.6%. (其实还有数据如何逐出显存和如何预测数据实现预加载, 这部分也很棒, 很有启发性. 建议看原论文, 篇幅原因写不下了) 论文地址: 项目地址: #FlashMemory# #DeepSeekV4# #FlashMemoryDeepseekV4#
显示更多
0
17
224
19
转发到社区
Anthropic 发布模型硬件标准 MHS(相当于物理版 MCP),让 AI 直接操控实体硬件。在零预训下,Claude 成功操控机械臂分类积木,量子激光校准成功率达 99.3%,甚至将脑成像实验从数周缩至 1 天!虽然目前缺乏物理直觉、遇到光遮挡等故障易卡死,但已与 AWS、树莓派等合作,后续将正式开源。 这下 AI 不光能写代码,连实验室的砖都能替我搬了! 不过遇到故障就原地空转这事,怎么看都有点萌笨。 等正式开源之后,手里的旧树莓派感觉又能拿出来折腾了。我觉得最简单的办法就是今后所有的MHS设备里面要么自带说明书的txt协议一链接就可以让大模型读了后明白怎么操作,要么就是通过型号上网retrieve这些信息,然后把一些重要指标告知大模型,大模型能通过声光振动感应去感知控制效果,我觉得还是挺promising的!
显示更多
MSR Memora:一个解耦"存什么"和"怎么取"的 agent 记忆系统 问题: 现有 agent 记忆系统在抽象和具体之间无法兼得。RAG/Mem0 保留细节但碎片化;摘要压缩高效但丢失约束和数字。知识图谱需要预定本体论,不跨域。 核心洞察: 记忆内容可以保持丰富(时间线、多轮讨论),但检索走一条独立的轻量结构层。 架构: 每条记忆两个部分。Primary abstraction——6-8 词的短语(what this memory is about),嵌入做相似搜索。Memory value——完整内容,永远不直接通过内容检索。Cue anchors——从 value 里提取的短标签,提供替代检索路径,不需要本体论。 例子:"Dave 和 Sarah 同意原型 4/1、试点 5/2、MVP 5/30"。Primary abstraction = "Updated Project Orion timeline agreed by Dave and Sarah"。Cue anchors = "Dave Project Orion update"、"Project Orion prototype schedule"等。后续查询 Dave 的贡献、原型进度、试点时间,都能通过不同 cue 到达同一条记忆。 检索: 不是一次性 top-k。Policy-guided retriever 迭代精化查询、通过 cue anchors 扩展、决定何时停止。可以蒸馏到小模型。 结果: LoCoMo 86.3%,LongMemEval 87.4%,SOTA。比 RAG、Mem0、Zep、LangMem 全高。多跳推理上差距最大。token 消耗减少 98%(vs 完整上下文)。存储条目数约 Mem0 的一半(344 vs 651)。 代码: | ICML 2026 #Agent记忆# #MSR# #LLM#
显示更多