註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Engram
Engram 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Engram 的搜尋結果
DeepSeek-V4.1-Flash 八卡H20 实测来了,一起看下552B 参数加 196B Engram 参数的模型在SGLang运行结果 启动参数: sglang serve --model-path /model --served-model-name deepseek-v41-flash --tp 8 --ep-size 8 --context-length 32768 --max-running-requests 32 --mem-fraction-static 0.85 --attention-backend dsv4 --moe-runner-backend flashinfer_mxfp4 --reasoning-parser auto --tool-call-parser auto --enable-metrics --disable-radix-cache --host 0.0.0.0 --port 30000 测试方法: 核心矩阵为 1,024/128、8,192/128、1,024/512、24,576/128 Token,各测 C1、C8、C32,每组单独预热后正式重复三轮。各轮请求数分别为 8、16、64。C 是客户端并发上限,服务端最大运行序列也是 32 和历史V4测试对比结果: DeepSeek-V4.1-Flash 结果稍快一点,但开始回答之后,输出速度比 DeepSeek-V4-Flash 慢,整体吞吐也更低,实际token/s 速度达不到DeepSeek API 中V4.1三倍提升的效果🤣
顯示更多
盛大集团创始人陈天桥近年来在 AI 领域(尤其是“AI长期记忆”和“脑科学与 AI 交叉”方向)进行了深度布局。 他主张通过模拟人类大脑的记忆与认知机制,解决大语言模型(LLM)的“遗忘”和上下文受限问题,使 AI Agents 具备连贯、可进化且个性化的长期记忆。 旗舰开源项目:EverMemOS(智能记忆操作系统) EverMemOS 是由陈天桥旗下的 EverMind 团队推出的一款旗舰级开源、企业级智能记忆系统,被定位为未来 AI Agents 的“数据与记忆基础设施”。 1. 类脑级记忆生命周期(Engram-Inspired) EverMemOS 的设计灵感来源于人类大脑的记忆编码、巩固与提取机制,包含三个核心阶段: 情境痕迹形成(Episodic Trace Formation):将实时的对话流转化为 MemCells。MemCells 是记忆的原子单元,用于捕获情境线索、事实以及有时效性的预测信号。 语义整合(Semantic Consolidation):将分散的 MemCells 提炼并组织成更高维度的、具有主题性的语义结构 —— MemScenes。在这个过程中,系统会持续自动演化并更新用户画像(User Profile)。 重构式回忆(Reconstructive Recollection):在 AI 需要决策时,通过 MemScene 引导的 Agent 检索机制重构上下文,帮助下游模型完成长周期的连贯推理。 2. 五层技术架构 EverMemOS 将长期记忆的读写流程分层管理: 代理层(Agentic Layer):处理主动的记忆过程,如记忆提取、向量化、检索和重排序。 记忆层(Memory Layer):管理核心存储和情境记忆,专注于 MemCells 的提取与生存周期管理。 检索层(Retrieval Layer):负责多模态检索和对检索结果进行重排序,包括 BM25 + 向量检索的混合搜索以及 RRF(倒数排序融合)等。 业务层(Business Layer):处理上层的业务逻辑与数据操作。 基础设施层(Infrastructure Layer):兼容 MongoDB、Elasticsearch、Milvus、Redis 等主流数据库与缓存组件。 3. 性能与生态集成 Token 优化:充当智能注意力过滤器,在部分场景中可将上下文窗口的 Token 消耗降低多达 70%,同时在 LoCoMo 等长期记忆基准测试中达到了 SOTA 性能。 开源生态与插件:MCP(Model Context Protocol)支持:提供了 evermemos-mcp 插件,支持将 AI 编码助手(如 Claude Code、Cursor、Cline 等)接入 EverMemOS 记忆库。 Agent 框架集成:支持 OpenClaw 插件,使智能体能够自动捕获对话、调取历史记忆;同时支持 Live2D 虚拟角色记忆交互等应用。 GitHub 地址:
顯示更多
0
16
90
28
轉發到社區
部分投資者低估AI推理對內存擴展與存儲優化的需求。CXL內存池化可跨CPU/GPU等統一尋址、調度與訪問,支撐大規模高並發大模型訓練推理。現有架構受插槽與單條容量限制,參數與激活值需頻繁在HBM-DRAM-SSD間遷移,導致延遲放大、頻寬浪費與資源分配不均。CXL能拓展內存空間、提供靈活分配,提升訓練推理能力,並顯著降低數據中心TCO,有望重塑AI算力設施的內存硬件構成。 CXL相關軟硬件已逐步完善,頭部廠商加速布局。CXL 4.0(2025年11月)速率達128 GT/s,較3.0翻倍;NVIDIA收購Enfabrica團隊,Vera CPU支持CXL;阿里雲推出基於CXL 2.0 Switch的PolarDB專用服務器;浪潮推出元腦CXL內存擴展方案。Techinsight預測,CXL在服務器DRAM佔比將從2024年近零成長至2030年約15%,有望成為標配,產業生態加速成熟,滲透率快速提升。 廠商持續創新以適配AI推理。浪潮KOS推出MantaKV,利用CXL池化共享內存實現「存傳一體」KVCache管理,減少傳輸冗餘、提升效率。北京大學與阿里雲等將CXL內存池用於Engram並集成至SGLang,達接近本地DRAM效能,提供可擴展且具成本效益的方案。隨著AI推理需求提升,CXL內存池化空間持續打開,產業鏈有望深度受益。
顯示更多
DeepSeek 下一代还能不能超过 Kimi K3? 我把这个问题丢给了 Apodex。实际跑完后,主要情景的发生概率约 60%,但大概率只会领先 5%–15%,不会碾压。 这里的超过主要指综合评测、推理和代码,不代表每个维度都领先。 因为 超过 这个词太虚了。 代码强算超过,还是 Agent 强算超过?长上下文、多模态、推理能力和调用成本,权重又该怎么分? 这次我先把口径定死:主要看公开综合评测,以及推理和代码能力,不代表每个维度都领先。 按 Apodex 这次整理的公开信息,Kimi K3 当前在综合能力、Agent、长文本检索和多模态上更占优势。 DeepSeek V4 的长处则是代码、推理、调用成本,以及对国产算力的适配。 所以这道题并不是谁全面压过谁,而是 DeepSeek 下一代能不能补齐短板,同时守住自己的优势。 两边的信息其实是打架的。 已经发布的第三方评测更支持 Kimi K3,DeepSeek 的资金、算力和架构路线则更有利于下一代。 Apodex 的取舍是:判断当前差距,优先看已发布评测。预测下一代,再看资金、算力、架构和团队这些硬变量。没有官方确认的参数和发布时间传闻,一律不算核心证据。 它把接下来的胜负拆成了四个变量: 1. DeepSeek 能拿到多少算力和资金 2. Engram 这条架构路线能不能继续跑通 3. 团队扩张后还能不能保持迭代速度 4. 国产芯片能不能接住下一轮训练和推理 对我来说,这些变量比一张未经确认的跑分截图更有参考价值。 基于这些变量,它给了三种情景: 60%:DeepSeek 下一代温和领先 Kimi K3。 30%:两家长期互有胜负。 10%:DeepSeek 研发延期或架构遇到瓶颈,Kimi 继续领先。 这三个数字是情景发生概率。它对整套判断的置信度是 65%,因为下一代模型的参数、数据和训练细节还没有公开。 Apodex 最终没有押 DeepSeek 重新一家独大。 我最开始觉得这个判断有点保守。把四个变量拆开之后再看,它更看好 DeepSeek + Kimi 长期双头竞争。 即使 DeepSeek 下一代综合跑分超过 K3,也很可能只是推理和代码重新领先。到了真实使用里,开发者还是会按场景选模型,不会所有任务只用一家。 我觉得这次回答里最好的一段,是它主动写出了自己会在什么情况下改口。 如果 DeepSeek 新模型继续延期、团队出现明显波动,60% 会降到 30%–40%。 如果官方公开下一代技术路线,第三方评测又在代码、Agent 和浏览任务上全面领先,这个概率才会上升到 75%–80%。 AI 预测最容易写成算命:给一个很准的数字,说完就跑。 但一个预测如果没有证据、失效条件和回来对账的时间点,70% 和 40% 其实没多大区别。 按 Apodex 公布的信息,这套方法在 FutureX 实时预测 benchmark 上拿过领先排名。不过我更在意的,还是它愿意把判断过程和改口条件摊开。 我先把这个时间戳留在这里: 这次用 Apodex 跑出来的主要情景是:DeepSeek 下一代约有 60% 概率在综合评测、推理和代码上超过 Kimi K3。整套判断的置信度是 65%,更长期的格局可能是双头竞争。 等 DeepSeek 正式发布,我们回来对账。 如果你也想看它怎么拆信源和不确定性,可以自己拿一道还没有答案的问题试试: #Apodex#
顯示更多
0
238
117
5
轉發到社區
分析:scaling law的范式转移:scale-up、scale-out和scale-lean 过去两年,随着ai的发展,质疑scaling law的声音越来越多,但其实scaling law不但一直都在,而且还在不断增强。 如果我们稍微回顾一下历史,从 GPT-3 到 GPT-4,本质上都是在把模型做大——参数更多、数据更多、算力更强。这就是典型的 Scale Up。 但从 GPT-4 开始,大家开始越来越多地讨论“推理”。不是简单的生成,而是多步推理、链式思考、更复杂的问题拆解。 模型能力的提升,不再只是来自参数规模,而是来自推理过程本身的优化。这其实是一个很微妙但关键的变化:行业开始意识到,“怎么用模型”,和“模型有多大”,同样重要。 直到最近,像 OpenCLaw、AutoResearch 代表的agent生态开始大火,本质上已经不是在讨论模型本身了,而是在讨论一个系统。模型只是其中一部分,更重要的是任务如何拆解、如何调用工具、如何在多个步骤中反复执行和修正。 这时候,能力的提升,已经不再主要依赖模型本身,而是依赖结构。通过多次调用、流程编排、工具接入,把原本单点能力扩展成一个可以执行复杂任务的系统。这一阶段,其实就是 Scale Out。 但从推理和agetn生态开始跑起来之后,一个更现实的问题马上出现了:成本。 推理一旦复杂化,Agent一旦进入多步执行,调用次数是指数级增长的。推理成本迅速上升,延迟变得不可接受,底层的内存和带宽开始成为瓶颈。你会发现,问题已经从“能力不够”,变成了“跑不起”。 于是最近这段时间,越来越多的论文和工程实践,都开始研究如何降本增效。 比如 DeepSeek 之前的Engram,Google 最近的 TurboQuant,本质上是在做更极致的存储优化、压缩和效率提升 -- 在不显著增加算力的情况下,让系统变得更强、更便宜、更快。 我们可以把它叫做 Scale Lean。 把这三条路径综合起来,可能更能帮助我们把握行业未来的发展。 最早是 Scale Up 占绝对主导,大家都在拼模型大小。然后是 Scale Out 开始出现,系统能力逐渐成为新的增长点。再到现在,Scale Lean 开始变得越来越重要,因为它直接决定这些系统运行成本。 这三者不是替代关系,而是叠加关系。 更重要的是,Scale Up、Scale Out、Scale Lean 三条路径本身就是一个正反馈系统,它们会互相放大彼此的效果,从而加速整个AI进化。 模型变强(Scale Up),会让Agent系统更少出错、步骤更短、整体能力更稳定,从而放大Scale Out的效果; 而一旦系统复杂度上来,调用次数暴增,成本问题就会被迅速放大,这又反过来逼着整个行业去做效率优化,也就是Scale Lean。 等到效率真的被做下来之后,事情又会发生变化——更低的成本、更高的吞吐,会让更复杂的Agent系统变得可行,同时也让模型可以被更频繁地调用、训练和迭代,进一步推动Scale Up。 于是这三者之间形成了一种很典型的正反馈:Up让Out更强,Out逼Lean进化,Lean又反过来加速Up和Out。 AI的发展不再是单一变量的线性推进,而是一个多变量耦合的加速系统,一旦三个方向同时往前,整体能力的提升就很容易从“渐进式”变成“跳跃式”。 基于以上的讨论,我们可以得出一个结论,ai能力的增长速度,不但没有放缓,还在加速。 scaling law不但没有装墙,反而驶上了快车道。
顯示更多
This is the patriotic sentiment that Chinese people have been engraved in their bones since childhood!这就是中国人从小被刻在骨子里的家国情怀! #AmazingChina#
0
1
368
23
轉發到社區