註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

艾略特
@elliotchen100
Raven: the deepthinking self-improving agent harness
1K 正在關注    26.3K 粉絲
昨天卖了个关子,今天可以公布了,新论文叫 CRAFT。 论文里最喜欢的一点,是它不用提前知道用户会问什么。视频压一次,后面换不同的问题,继续用同一份压缩结果。 这对 AI 眼镜很关键。设备不能等你每问一句,再把整段视频从头算一遍。它得先把看过的内容压下来,需要时再拿出来。 约 8× 压缩是论文里的结果。 接下来,更期待看 CRAFT 在真实设备上能省下多少算力和电量。
顯示更多
Another paper from us, this time on video token compression. Video VLMs have a token problem. A single video can produce tens of thousands of visual tokens, making prefill expensive and KV caches large. But aggressively pruning them risks deleting the details needed for temporal reasoning. CRAFT takes a different approach. It separates two decisions: Which tokens should merge? Global similarity decides. How should they merge? Position-aware weights and a channel-wise gate learn how to preserve the information. The process is recursive and query-agnostic, so the video can be compressed once and reused across multiple questions. At roughly 8× compression, CRAFT retains 96.8% of the backbone’s average accuracy while substantially reducing prefill and KV-cache costs. The takeaway: don’t just drop redundant tokens. Learn how to fuse them without losing the details.
顯示更多
0
40
16
1
轉發到社區
这些球类 Agents 思考/计划/执行的动效真好看, 要加进 EverOS 的 CLI 里面。
More types added to the Thinking Orbs library. Large and small sizes, light & dark mode, playground, zero dep npm install thinking-orbs Huge shoutout to @a_brinza who also worked on this
顯示更多
看到 Jeff Dean 说,明天是他在 Google 的最后一天,我表示非常意外。 有幸在线下见过他一次。人非常精瘦,讲话特别快。当时一直在努力跟上他的语速。最直接的感觉就是,这个人脑子转得太快了。 后来又听过不少 Jeff Dean 的传说。工程师圈里还有一套专门的 Jeff Dean Facts。最经典的一条是 Jeff Dean 写的代码不会出错。如果程序报错了,那是编译器的问题。 当然是玩笑。可一个程序员能被同行编出这么多段子,“程序员之神”这个称号也没有多夸张。 我还听说,他后来已经做到 Google 顶层的技术管理者,仍然会找同事一起 pair programming。 当时觉得这个习惯很好,自己也找人试过。效果不怎么样。看来我只学到了形式,资质还是差得有点远。 很长一段时间,我对 Google 有一种很主观的信任。我总觉得,只要 Jeff Dean 还坐在那里,Google 的整体架构和 AI 路线就不会出大问题。发展慢一点没关系,方向不会走偏。 今天他走了。 Jeff Dean 在 Google 工作了 27 年。他看着公司从 25 人长到 19 万多人。他在告别信里写,Google 现在有 13 个用户超过 10 亿的产品。 接下来,他会和 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 一起创办 Disco Loop AI。 Google 当然还会继续运转。可看到 Jeff Dean 告别,我还是觉得有个东西结束了。 也许是我对那个旧 Google 的想象。几个很强的工程师坐在一起,写代码,搭系统,然后一点点把公司撑起来。 Jeff Dean 从很早的时候就在里面,一直走到今天。 所以这次离开,对我来说,确实像一个时代落幕了。
顯示更多
Tomorrow will be my last day at Google after 27 years, and watching it grow from 25 people to 190,000+ has been an amazing journey. Below is a note I shared with many people internally at Google today. An excerpt is: It has been an absolute pleasure to work with you and to help build some of the most widely used and impactful products of all time. As a kid, I dreamed of helping build software that would be used by many people, and Google now has thirteen products used by more than a billion people (amazing!). Our work has had a tremendous impact in the world, and I have been lucky enough to collaborate and form friendships with many colleagues that I deeply admire, respect, and enjoy. It still brings me joy every time I see people out in the world using our products to find information, handle email, translate documents, watch videos, learn new things, navigate and understand the physical world, browse the web, use their phone, run large-scale computations on our infrastructure, ride in an autonomous vehicle, or perform complex tasks with the help of our AI systems. I hope you all share this sense of joy, because it is a shared accomplishment! Thank you to all of my colleagues at Google over many years! Now I'm excited to go start @DiscoLoopAI with my longtime friends and colleagues @Sanjay_Ghemawat, @OriolVinyalsML, and @quocleix. (Updated post: slightly redacted to not have some personal info)
顯示更多
0
87
71
3
轉發到社區
剧透一下。 @EverMind 上半年出圈的 MSA,是我们北京团队做的。 这半年,我们又和北京大学一起,把「记忆」往多模态和穿戴设备上推进了一步。 都知道哈,超长视频会产生大量视觉 token,算力和显存开销也会随之上升,AI 眼镜这类端侧设备,不可能无限堆资源。 新框架会用更高效的方式压缩和存取长视频信息,让这类能力有机会真正跑进穿戴设备,实现「token 自由」。 名字先不说~
顯示更多
论文来了。名字叫 MSA,Memory Sparse Attention。 一句话说清楚它是什么: 让大模型原生拥有超长记忆。不是外挂检索,不是暴力扩窗口,而是把「记忆」直接长进了注意力机制里,端到端训练。 过去的方案为什么不行? RAG 的本质是「开卷考试」。模型自己不记东西,全靠现场翻笔记。翻得准不准要看检索质量,翻得快不快要看数据量。一旦信息分散在几十份文档里、需要跨文档推理,就抓瞎了。 线性注意力和 KV 缓存的本质是「压缩记忆」。记是记了,但越压越糊,长了就丢。 MSA 的思路完全不同: → 不压缩,不外挂,而是让模型学会「挑重点看」 核心是一种可扩展的稀疏注意力架构,复杂度是线性的。记忆量翻 10 倍,计算成本不会指数爆炸。 → 模型知道「这段记忆来自哪、什么时候的」 用了一种叫 document-wise RoPE 的位置编码,让模型天然理解文档边界和时间顺序。 → 碎片化的信息也能串起来推理 Memory Interleaving 机制,让模型能在散落各处的记忆片段之间做多跳推理。不是只找到一条相关记录,而是把线索串成链。 结果呢? · 从 16K 扩到 1 亿 token,精度衰减不到 9% · 4B 参数的 MSA 模型,在长上下文 benchmark 上打赢 235B 级别的顶级 RAG 系统 · 2 张 A800 就能跑 1 亿 token 推理。这不是实验室专属,这是创业公司买得起的成本。 说白了,以前的大模型是一个极度聪明但只有金鱼记忆的天才。MSA 想做的事情是,让它真正「记住」。 我们放 github 上了,算法的同学不容易,可以点颗星星支持一下。🌟👀🙏
顯示更多
0
82
28
4
轉發到社區
一直知道 Notebook LM 是很多人用来做 deep research 然后生成 PPT 学习,没想到 YouMind 在这块做得也非常好。 果然,“彦祖所见略同”。 EverMe 月底要上线的版本也有 deep research, 是我们自己的基模 @miromind_ai 的 MiroThinker 模型。 我们也能生成 PPT 用来学习。 试想一下,打通了共享记忆,共享知识,数字分身,且能 deep research 的应用是不是很酷?
顯示更多
一句话能说清楚的 AI 产品 基本上死得差不多了 以及 YouMind 的产品故事和增长秘诀 视频版本来了 欢迎探讨交流
稍微剧透一下, EverOS 正在更新, 这次是全面 SOTA 的水准。
0
43
12
0
轉發到社區
看过的对 harness 最通俗易懂的解读,没有之一。 把 agent 比作研发师,把 harness 比作厨房,要做好蛋糕,是 agent 重要还是 harness 重要?
形象解读 Harness,小白也能理解。 一个厉害的研发师,可以在实验室做出一块很好吃的蛋糕。但把它变成商业化产品,难点不是照着配方再做一次,而是换一批原料、换一台设备、换一个操作员,结果仍然稳定。靠的是原料标准、工艺参数和质检反馈等。 Agent 也一样。模型偶尔把一个任务做得很惊艳,是能力;换一个任务、拉长流程、碰到异常还能稳定交付,才是 Harness 的价值。 作为一个传统行业的产品人,我每天都受益于 AI。但 Agent Harness 这个概念,我也是花了很长时间才真正弄懂。 所以看到 TianYi 老师邀请开源 Agent Harness 开发者参与 DeepSeek Harness 内测,我真正期待的是:它能不能让同一个模型少跑偏、会验证、出错能恢复,把“偶尔做得很好”变成“可以稳定交付”。 如果能,这才是 Harness 真正解决的痛点。
顯示更多
0
42
34
1
轉發到社區
.@evermind 的日常,下午有茶,晚上有肉。 这是 1 升的桶装,奈雪的茶, 我打赌湾区的朋友没见过这种高级货。😏
又来一篇论文。 这次我也有幸列在作者名单里。贡献边界得说清楚:真正把研究、工程和实验做出来的,都是算法同事。 我做的很少,更多是从产品和 Agent 生态角度参与了一些讨论,提供了一点问题定义和应用反馈,甚是荣幸。🫡 这篇论文研究的问题很实际: 网络上已经有几十万个 SKILL.md。把更多 skills 塞给 Agent,它就会自动变强吗? 团队从约 82.1 万个公开技能文件中,经过结构筛选、去重,以及质量、安全和许可检查,整理出 96,401 个技能。然后通过 retrieval、rerank 和 LLM selector,为每个任务选择 0–2 个真正相关的技能。 在三个 benchmark、两种 agent harness 和两种开源 backbone 下,SkillCorpus 都带来了正向提升,SkillsBench 上的汇总提升达到 +7.5 个百分点。 结论不是「skill 越多越好」,而是要在正确的任务里找到正确的 skill,再让 harness 真正把它执行出来。
顯示更多
Yet another paper. This time, we asked a practical question: Do public SKILL.md files actually make agents better? The open skill ecosystem has a quality problem. The hard part isn’t finding more skills. It’s knowing which ones are unique, useful, safe, permissively licensed, and relevant to the task. We crawled ~821K public skills and curated them into 96,401. Then we tested the full retrieval pipeline across 3 benchmarks, 2 harnesses, and 2 open backbones. It improved all three benchmarks, with the largest pooled gain at +7.5pp on SkillsBench. More skills are not automatically better. Curation, retrieval, and the harness determine whether skills become capability.
顯示更多
0
53
26
3
轉發到社區
前两周发得 Skills Hub 的帖子小火,推友都来关注了我们的 Skills Hub。 今天 @evermind 会发一篇新论文,就是讲我们如何验证 Open-source skill ecosystem,且加强对真实场景下 Agent 的使用。 我也做了一丢丢贡献,所以论文上有我的名字,期待下次可以贡献更多。
顯示更多
怎么判断一个 Skill 是真的好用, 而不是只看下载量和主观评分? 我们在做 Raven 🐦‍⬛ 的时候,一直在想这个问题。 下载量只能说明它被安装过,评分只能说明有人喜欢。它们都回答不了一个更重要的问题:Agent 使用这个 Skill 之后,任务到底完成得更好了吗? 所以我们做了 EverMind Skill Hub。 它不只是一个技能目录。我们把 Skill 的判断拆成了三层: 第一,评估 Skill 本身的实用性、鲁棒性和安全性。 第二,判断 Agent 能不能为当前任务找到真正合适的 Skill。 第三,在真实任务上做“使用 Skill”和“不使用 Skill”的对照实验。 我们在 Raven 和 OpenClaw 两套 Agent Harness、多个模型以及四个真实世界 Benchmark 上进行了重复测试。 SkillsBench、Cybench、QwenClawBench 和 GDPVal 全部取得了统计显著提升。 这并不意味着某个 Skill 在任何任务、任何模型上都一定好用。 Skill 的效果仍然取决于任务覆盖、模型能力,以及 Agent Harness 能不能把它真正执行出来。 但至少,我们不再只能靠下载量和主观评分猜测。 我们现在有了一套可复现的方法,去测量 Skill 什么时候有效、效果有多大、边界在哪里,以及接下来应该怎么改进。
顯示更多
0
54
16
0
轉發到社區
最近 DeepSeek 和 K3 的发布,让大家开始认真看 Agent benchmark 后面的 harness。 Karpathy 这条正好补上了另一半:harness 并不是换一套 prompt 和工具,就能无限放大模型。前提是环境能够把结果反馈给 Agent。 写代码有 compiler、tests 和 logs。 但在动态的 3D 世界里,Opus 5 只能缓慢地截取几张图。它看不到连续的状态变化,也很难判断动作、碰撞和叙事是否真的成立。 所以它能用两小时写出 5500 行 Three.js,却还不能可靠地审计自己的作品。 下一步缺的可能不只是更会生成的模型,而是能让 Agent 真正“看见结果”的 environment 和 verifier。 没有可读的反馈,self-improvement 就没有闭环。
顯示更多
0
67
55
8
轉發到社區
前天看 DeepSeek-V4-Flash 0731 刚发布,最在意的就是那条脚注:最亮眼的 Code Agent 成绩,跑在尚未发布的 DeepSeek Harness 上。 今天又看到 Cui 老师开始招募开源 Agent Harness 团队参与内测。 进度好快,模型能力正在越来越多地通过 harness 被兑现出来:工具怎么调用,失败后怎么修正,经验怎么留下来,都会直接影响最终成绩。 我们自己也在做 Raven 这个 agent harness,所以这不是旁观者兴趣。产品之外,EverMind 还做了 EvoAgentBench,专门测试 Agent 能不能从过去的 execution traces 中提取可复用的程序性能力,再迁移到新的任务,就是所谓的自进化。 公开版本覆盖 web research、reasoning、software engineering 和 knowledge work,采用 528/267 的 train/test split,在 2 种 agent scaffold 和 3 种 backbone 下评测。 结果也很接地气:人工整理过的能力可以跨模型迁移,但现有自动方法还没有一种能在所有设置中稳定提升。这比只看一次任务的跑分,更接近真实 Agent 系统里的问题。 如果能参与内测,我们希望基于 EvoAgentBench 的协议跑一轮,对比接入 Harness 前后,以及 Agent 使用历史经验前后的变化,看看提升来自哪里,又会在哪些任务上退化。 @tianyi 如果名额还开放,我们愿意把 EvoAgentBench 接进去跑一轮,完整设置和结果都可以公开。
顯示更多
如果你是 Agent Harness 相关开源项目的开发者,希望参加 DeepSeek Harness 的内测,可以回复或私信联系我。请附上 GitHub id 以及开源代表作。
0
70
50
2
轉發到社區
DeepSeek 上手,Raven 起飞 🐦‍⬛ DeepSeek-V4-Flash 已经可以在 Raven 里一条命令切换。
DeepSeek-V4-Flash is already a first-class model in Raven 🐦‍⬛. Connect your DeepSeek API key and switch in one command: /model deepseek-v4-flash --provider deepseek Your tools, skills, working environment, and EverOS-backed memory stay with the agent.
顯示更多
Raven 🐦‍⬛ 每天都在更新,同时还在憋一个大招🤩 v0.1.10 这版没有炫技,解决的是每天的体验问题: • provider 太多怎么选 • 危险命令怎么批 • 模型一轮轮调用怎么查 同时,Raven 的 onboarding 流程也升级了, 小细节都在打磨,我自己每天都在体验 Raven, 看着一步一个脚印在提升,甚是满足。 这感觉类似玩 Dota2 JB 脸在野区刷野,心想: 「你们给老子等着,等我刷个电锤金箍棒,一个大控 5 ,全都得给老子跪」 没错,发育憋大招很上瘾。😏
顯示更多
Raven 🐦‍⬛ v0.1.10 is out. Choose from 21 providers, or search any provider LiteLLM can route to. Recognized deletion commands now ask for one-shot approval in the TUI. Each model call becomes a collapsible episode. Already using Raven? `raven upgrade`
顯示更多
推友们都在看 82.7,我更在意脚注。 V4-Flash-0731 架构和规模没变,只重新做了 post-training;最亮眼的代码 Agent 成绩,却跑在尚未发布的 DeepSeek Harness 上。 模型没有变大,能力却像换了一代。 下一轮竞争,不只发生在模型里,也发生在模型之外。 怪不得前段时间一直看到 DS 在招 Harness 工程师, 原来筹码都放到了 Harness,🤔。
顯示更多
🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We’ve massively upgraded its Agent capabilities—benchmark scores are now far surpassing the V4-Pro-Preview. Check out the massive performance leap below! 👇 🔷 The official V4-Flash now natively supports the Responses API format and is fully adapted for Codex! Check out the configuration details in our official API docs:
顯示更多
0
93
115
3
轉發到社區
最近特别喜欢用 Stage Manager,台前调度这个功能。
众所周知,我们学术很强,这不,新论文来了。 这次讲自进化 Agent 面临一个关键的“评估难题”:真正困难的不是生成新的 Harness 修改方案,而是判断这些修改究竟真的有效,还是仅仅源于运气、过拟合,甚至根本没有被触发。 新论文提出了一套可审计的“诊断—归因”机制: LLM 负责分析失败原因,并针对提示词、知识、运行时、工具和配置提出修改。 确定性程序负责验证修改是否有效触发、是否具有统计显著性,以及能否通过独立的密封测试集。 实验覆盖 7 个领域,其中 6 个通过统计验证的领域在密封测试中提升了 9.0–15.5 个百分点,并保留了 86%–147% 的训练阶段增益。 核心结论是:真正能够迁移的并不是某一套通用 Harness,而是这套持续发现问题、提出修改,并通过严格评估保留有效改进的“诊断—归因循环”。
顯示更多
Our new paper. Self-evolving agents have a measurement problem. The hard part isn’t generating changes to an agent harness. It’s knowing which changes genuinely helped rather than got lucky, overfit, or never activated at all. LLMs diagnose failures and propose changes across prompts, knowledge, runtime, tools, and configuration. But deterministic code owns the credit: validity checks, activation checks, paired significance testing, and a sealed test. Across 7 domains, the evolved harnesses gained +9.0 to +15.5pp on the 6 statistically credited sealed tests, retaining 86–147% of the training gain. What transfers is not one universal harness. It’s the diagnose-and-credit loop.
顯示更多
0
48
93
22
轉發到社區
我们更新很快, 现在 EverOS 只需要一个大模型 key 就能跑起来, 开发者体验 up up!
EverOS 1.2.1 is out. LLM-only startup. Add embeddings and reranking later. Three runtime tiers + everos cascade backfill. Also: bounded cascade retries and a security fix for knowledge uploads. On 1.2.0? Upgrade now: `pip install --upgrade everos`
顯示更多
怎么判断一个 Skill 是真的好用, 而不是只看下载量和主观评分? 我们在做 Raven 🐦‍⬛ 的时候,一直在想这个问题。 下载量只能说明它被安装过,评分只能说明有人喜欢。它们都回答不了一个更重要的问题:Agent 使用这个 Skill 之后,任务到底完成得更好了吗? 所以我们做了 EverMind Skill Hub。 它不只是一个技能目录。我们把 Skill 的判断拆成了三层: 第一,评估 Skill 本身的实用性、鲁棒性和安全性。 第二,判断 Agent 能不能为当前任务找到真正合适的 Skill。 第三,在真实任务上做“使用 Skill”和“不使用 Skill”的对照实验。 我们在 Raven 和 OpenClaw 两套 Agent Harness、多个模型以及四个真实世界 Benchmark 上进行了重复测试。 SkillsBench、Cybench、QwenClawBench 和 GDPVal 全部取得了统计显著提升。 这并不意味着某个 Skill 在任何任务、任何模型上都一定好用。 Skill 的效果仍然取决于任务覆盖、模型能力,以及 Agent Harness 能不能把它真正执行出来。 但至少,我们不再只能靠下载量和主观评分猜测。 我们现在有了一套可复现的方法,去测量 Skill 什么时候有效、效果有多大、边界在哪里,以及接下来应该怎么改进。
顯示更多
0
40
33
4
轉發到社區
你喜欢用 Kimi K3 写前端? 你喜欢用 Fable 写后端? 你喜欢用 Sol High 写全栈? 多个 Agents 之间的上下文管理是不是很混乱? EverMe 可以了解一下。😏
EverMe × Kimi Code @Kimi_Moonshot @KimiDevs Kimi Code now has shared memory. Connect Kimi Code to EverMe Memory with one prompt, carry context across sessions, agents, machines, and operating systems, and turn what it learns into reusable Skills. Less cold start. More continuity. EverMe: Kimi Code:
顯示更多