註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 LLM解釈可能性
LLM解釈可能性 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 LLM解釈可能性 的搜尋結果
MSR Memora:一个解耦"存什么"和"怎么取"的 agent 记忆系统 问题: 现有 agent 记忆系统在抽象和具体之间无法兼得。RAG/Mem0 保留细节但碎片化;摘要压缩高效但丢失约束和数字。知识图谱需要预定本体论,不跨域。 核心洞察: 记忆内容可以保持丰富(时间线、多轮讨论),但检索走一条独立的轻量结构层。 架构: 每条记忆两个部分。Primary abstraction——6-8 词的短语(what this memory is about),嵌入做相似搜索。Memory value——完整内容,永远不直接通过内容检索。Cue anchors——从 value 里提取的短标签,提供替代检索路径,不需要本体论。 例子:"Dave 和 Sarah 同意原型 4/1、试点 5/2、MVP 5/30"。Primary abstraction = "Updated Project Orion timeline agreed by Dave and Sarah"。Cue anchors = "Dave Project Orion update"、"Project Orion prototype schedule"等。后续查询 Dave 的贡献、原型进度、试点时间,都能通过不同 cue 到达同一条记忆。 检索: 不是一次性 top-k。Policy-guided retriever 迭代精化查询、通过 cue anchors 扩展、决定何时停止。可以蒸馏到小模型。 结果: LoCoMo 86.3%,LongMemEval 87.4%,SOTA。比 RAG、Mem0、Zep、LangMem 全高。多跳推理上差距最大。token 消耗减少 98%(vs 完整上下文)。存储条目数约 Mem0 的一半(344 vs 651)。 代码: | ICML 2026 #Agent记忆# #MSR# #LLM#
顯示更多
现在一个其他互联网大厂或者LLM大厂,想做好豆包一样的chatbot app,已经是一件非常难的事情了。 豆包的整个产品设计细节太复杂了,复杂到隐藏起来的小细节小功能远远超过了perplexity+manus的地步,短期内豆包还在领跑,其他人根本追不上。 豆包虽然不挣钱没营收,但是日活断崖领先,以后探索广告、 外卖、零食、各种接入小功能,方法还是太多了。 等一代人养成了对豆包的高度粘性和依赖,都不用往回答里面硬插大段广告,直接在chatbot旁边开几个新的tab,里面加上外卖、打车、交话费、快递、网购等等功能,引导用户跳转使用,简直易如反掌。 我其实很担心,就是说绝大多数人如果用不到coding、math、data analysis、deep research的功能,以中国14亿基本盘的人均边牧一样的电脑操作水平和日常需求,可能做一款豆包这种笨重、巨大、臃肿、模型差、加一堆功能、解决吃喝拉撒的chatbot app,就是最优解。
顯示更多
0
16
77
4
轉發到社區
那些死活不给公开 API 的网站,今天直接被这玩意给“硬解”了。 这是 YC 孵化的开源大杀器 Integuru,GitHub 斩获 4,700+ Star,基于 AGPL-3.0 开源协议。它是一个专门搞“逆向工程”的 AI Agent,你只需要把浏览器抓包的 HAR 文件和 Cookie 扔给它,它就能自动分析网站内部调用链,帮你生成一套能跑的纯 Python API 代码。 • 告别 Selenium / Puppeteer,不用启动浏览器,速度快几十倍且极度稳定 • 自动构建请求依赖图,复杂鉴权、动态参数自动帮你理顺推导 • 只要你能用网页访问的项目,就能搞成自动化接口,实现零授权对接 • 支持本地运行,直接调用 LLM 生成代码,白嫖党和自动化狂魔狂喜 🔗 GitHub 地址: 🌐 官方网站:
顯示更多
0
34
93
21
轉發到社區
2023 年,Meta 首席 AI 科學家楊立昆給當時的 LLM 熱潮潑了一盆冷水。 他指出 LLM 有根本性的缺陷:沒有持久記憶、無法從單一經驗學習、缺乏對物理世界的理解。本質上,它只是在做「下一個 token 的預測」。 從學術的角度看,他說得完全正確。 直到今天,LLM 的底層架構依然沒有變。它依然是一具每次啟動都空空如也的統計引擎。 但在三年的工程演進後,我們發現了一個讓科學家尷尬的事實:學術上的根本缺陷,工程上不一定要正面解決,繞過去一樣能起飛。 楊立昆主張要走「世界模型」的路線,讓 AI 像人一樣建立對物理規律的理解。他認為 Scaling Law(規模定律)有天花板,LLM 光靠堆算力不能產生真正的智慧。 但工程界用兩件事回應了他: 第一,資本的暴力美學。過去三年,人類往算力砸錢的瘋狂程度,讓模型規模產生的「湧現」直接蓋過了架構的粗糙。 第二,系統性的外掛補丁。模型記不住?掛上向量資料庫。模型理解不夠?接上 Vision 和工具。 這就是工程學最迷人的地方:解決問題不需要追求「本質的優雅」。 楊立昆在研究神經元的排列,而工程師在研究如何把這個「不完美的大腦」裝進一個強大的「機械外骨骼」裡。 楊立昆對 LLM 的核心批評,是他認為 Pattern Matching(模式匹配)不算真正的學習。 但如果這種模式匹配的複雜度足以模擬出文明的所有邏輯,那「學習本身到底是什麼模式」還重要嗎? 飛機與鳥的飛行原理完全不同。飛機沒有羽毛、不會拍翅膀,但在它飛得更高、更遠、更穩定的那一刻,它到底「算不算在飛」已經不重要了。 但繞過去的,跟真的解決,是兩回事。 只要底層架構沒變,楊立昆講的那些缺陷就真實存在。記憶是外掛的,不是原生的。就像義肢,裝上去能走能跑,但它跟真正的腿就是不一樣。你不能假裝它不存在。 所以雖然 AI 已經很強了,推理、寫作、寫程式,很多事做得比大部分人好,但它每次都是一個全新的大腦。沒有連續的意識,沒有累積的經驗。它所有的「記憶」、「理解」、「偏好」,全部來自你這次塞給它的上下文。 如果你去看 OpenClaw 最近的 repo 更新,你會發現記憶管理佔了很大的篇幅。怎麼讓 AI 在對話之間記住該記住的東西。 他們最近推的 QMD,把關鍵字搜尋跟語意搜尋混在一起用,就是為了解決一個問題:你三天前跟 AI 聊過的東西,它下次怎麼找得回來。 模型本身的能力會繼續進步,但只要底層是 LLM,記憶管理就是一個繞不開的大山。 用工程的角度來說,就是 Context Engineering 的重要程度,會逐漸超過模型本身。 你怎麼管理每次丟給模型的那包上下文,決定了 AI 能幫你做到什麼程度。哪些資訊該放、哪些不該放。什麼時候該砍掉重來、什麼時候該接著繼續。不同對話之間的記憶怎麼同步、怎麼取捨。 我自己每天都在處理這個問題。 舉個例子,我的 OpenClaw Agent KAI,它常常在多個頻道處理不同任務,但它們的記憶不是即時同步的。只要 還沒更新,它們就不知道彼此剛做了什麼。 所以我常常要幫它做認知同步。譬如告訴 A 分身,B 分身目前正在做什麼,然後要求 B 把做的東西整理好傳過去。或者更簡單一點,直接叫 A 去讀另一個 Discord 頻道最近兩小時的對話,讓它自己同步 B 的工作內容。 這種「認知斷裂」的現象,只要你常用 AI,一定會有很強烈的感覺。 從人格化的角度看,你會覺得它們是同一個人。但事實上,它們只是共享同一份記憶。只要記憶沒有同步,它們就是不同的人。 我現在花比較多時間在學這一塊。譬如今天 KAI 就教了我,如果讓 Claude Code 的 Opus 4.6 從外部調用 GPT 5.3-Codex,用 MCP 跟 coding-agent skill 的差異是什麼。 KAI 告訴我,差異的核心在於:中間過程要不要進主 context。 用 MCP 調用 Codex,每一個 tool call 都走 MCP 協議。Codex 過程中的每一個 turn,讀檔、改檔、跑測試、報錯、retry,全部以 tool result 的形式灌回 Opus 的 context。一個 coding task 可能產生幾十個 turn,跑完之後 Opus 的 context window 已經被中間過程塞滿了,後面每一 turn 都要重送這些垃圾。這就是 context 污染。 而 coding-agent skill 的設計完全不同。它把整個 coding task 交給一個獨立的 sub-agent,這個 sub-agent 在自己的 context 裡完成所有中間過程。跑完之後,回傳給 Opus 的是一個精簡的 handoff summary:改了哪些檔案、測試跑過了沒、有沒有殘留問題。中間那幾十個 turn 的掙扎,Opus 完全不需要知道。 同樣一件事,兩種做法,Opus 的 context 乾淨程度天差地遠。 所以同一個模型,不同的人用,產出可以差十倍。 人與人之間原本的能力差距,已經沒那麼重要了。你的學歷、你的年資、你寫程式的底子,這些東西的權重正在被 AI 快速壓縮。 取而代之的,是你怎麼使用 AI。這件事的精度,才是現在真正決定產出的變數。 你理不理解它的記憶是怎麼運作的。你知不知道什麼時候該砍掉 context 重來、什麼時候該讓它接著跑。你能不能在對的時間,把對的資訊塞進那個 context window。 這些東西有一個名字,叫 Context Engineering。 它不是什麼高深的學問,但它是所有想把 AI 用好的人,都應該深入研究的東西。
顯示更多
0
51
980
166
轉發到社區
📋 awesome-autoresearch 周期巡检 本轮新增 1 条目(infra): autoresearch-local-critic(pcbrom):将 Karpathy 的循环模式提炼为 Python 包,由本地 Ollama LLM critic(Gemma 系列)驱动,输出结构化 JSON(thought_process/hypothesis/code_pseudocode/risk_level),将 critic 与 agent harness 解耦,任何可编辑文件+单一指标问题无需云 API 即可自主优化。 📂 📊 462 entries
顯示更多
兄弟们,分享一个真正的高频工具——Crawl4AI,GitHub 7万 星,目前最火的开源爬虫没有之一。 一句话:把任何网页变成干净的 Markdown,专门为喂给 LLM 设计的。 用AI爬内容的时都会遇到的病,有时抓回来是一坨屎,乱的 HTML,表格、广告、导航栏全混在一起; 扔进AI里token 烧了一大半,提取出来的内容还是一团糟。 Crawl4AI 就是解这个问题的: (1)LLM 友好的 Markdown 输出——标题、表格、代码块、引用,结构干干净净,直接进 RAG 或 Agent 流水线,不用再手动清洗 (2)异步并发 + 浏览器池——速度快,能处理 JS 渲染页面,动态内容也能抓,不是那种只能跑静态页面的玩具 (3)全控制——Session、代理、Cookie、自定义脚本、Hook 全支持,复杂登录场景、反爬场景都能处理 (4)深度爬取——BFS / DFS / BestFirst 三种策略,崩溃后能恢复继续跑,长任务不怕中断 (5)命令行直接用——crwl 一行命令,不用写代码: # 抓一页转 Markdown# crwl  # BFS 深度爬取整站,最多 10 页# crwl  # 带问题提取,直接 LLM 抽信息# crwl "提取所有产品价格" (6)零 API Key,随处部署——pip 装完就跑,也有 Docker,不需要注册任何账号 安装两行: pip install -U crawl4ai crawl4ai-setup 做 RAG、做 Agent、做数据管道、做竞品监控——只要你需要把网页内容喂给 AI,这个工具省的时间和 token 费用,用几次就回本了。 70100 个 Star 不是刷出来的,是真的有用。 #AI爬虫# #RAG# #老杨啊分享#
顯示更多
0
3
82
20
轉發到社區
半年来,我一直反复介绍的四个原则: 原则1,AI时代的第一性原理:LLM一定会越来越聪明,benchmark越来越高,context window越来越大,reasoning越来越长,价格越来越便宜,inference速度越来越快, 这是scaling law今天依然持续的具体方向,不用你质疑,这是你唯一的信仰和行业最大共识。 原则2, 管理学设计红利:从我提出“自动编程机”、行业提出vibe coding、SWE-Agent以来,从cursor到manus到metaGPT到claude code, 人们逐渐把LLM Agent抽象成人,把软件管理、工程管理、管理学等等所有方法论直接套在multi agent workflow上面,严格按照人类管理学的方式去拆分、review、执行、反馈、循环, 这一波很快红利也吃完了,因为 a. LLM Agent毕竟不是人,存在着memory有限、执行力有限、function calling工具有限等等局限;b. 人类用于管理学的各种方法,直接套在LLM Agent上有利有弊,红利迅速挖掘完,剩下的弊端大量存在,比如过度交流、七手八脚、随时停工等等。 原则3,LLM Agent的职位和定位:绝大多数人,把claude code当做一个工具,最终的产品是用工具来完成的,最终的代码也是人与SWE Agent一步一步interactively迭代产生、迭代review、迭代部署的, 而我反复告诉过所有人,也是我又一条首次提出的原创观点,multi agent未来越来越会变成本身的一个runtime,这个runtime就运行在production里面,产品和面向的对象消费的,不只是软件或者SaaS本身,而是这个runtime实时产生的内容, 所以claude code/opencode/codex/openclaw这些agent,本身将会越来越多地被嵌入到产品本身,在产品关键逻辑和决策中发挥作用, 而绝对不仅仅停留在开发层面,把产品仅仅局限在SWE Agent单向产出和部署的代码和服务上。 原则4,也是我一直强调的,就是当人们试用了SWE Agent这种强大工具之后,人们还有哪些low hanging fruits可以寻找?SWE Agent目前最适合解决哪类问题? 我反复讲过的一点是,对于一个设计复杂、环境复杂、场景复杂、用户复杂、体量复杂、范式复杂、一切开放、一切无解的超级复杂系统,这并不是SWE Agent最擅长的领域,相反这些场景需要人去和环境、客户、场景、性能一点点迭代才能打磨好的产品, 比如微信的100种功能,Facebook的一大堆功能模块和十几年来迭代出来的极其复杂的infra,支付宝后面成千上万的基金和风控,这些都不是AI Agent能一次性解决的问题,相反这些场景和问题不仅高度开放,更高度依赖人的观察、人的设计、人的反馈、人的定义。 AI Agent最适合的场景,甚至是我原创提出goal driven( a. 定义简单、干净、封闭(一道数学系、一个确定性最小系统、一个编译器、一种算法、一个lean证明、一个电路或者信号模拟、蛋白质模拟和预测、CAD设计与仿真、游戏关卡测试、行为经济学仿真,都是well-defined problems,都有非常明确且封闭的边界) b. 解决问题的搜索空间巨大(可能有100~10万种天马行空的解决方案,并且绝大多数都是错的) c. 容易验证,容易verify,验证的成本是设计成本的千分之一(比如编译器,设计可能需要几万行甚至几十万行,验证只需要2000个test case全面覆盖,或者一道数学题,解决需要100步,验证答案只需要带入或者lean编译这一步) 当然,写一段简单的代码,定义一个封闭、完整、定义完全的编程问题,符合上面这些定义, 但是设计一套巨大、复杂、开放、与现实世界深度绑定、高度耦合的系统,让这个系统复杂迭代、添加功能、沟通、review、工程管理、产品管理,这些问题都远远超出这个范畴,很明显是不符合这个要求的。 人们未来探索这些multi agent产品和场景的最关键出路,在于继续挖掘这一类问题,而不是盲目把agent比作一个人,乱套各种管理学方法。 原则5,这一点我先保密,之后我再讲。
顯示更多
0
20
287
62
轉發到社區
最近看了一篇 career advice 的长文。作者是一家 fully agent-native 公司的 founder,之前在 Scale、OpenAI、Google 都待过。 之前也跟一些行业内的研究员聊到过一个问题:如果你有小孩,在 AI 时代准备怎么教育他?确实啊,AI 把活都干得七七八八了,该让孩子学什么、卷什么? 借着这篇,聊聊我们自己的看法/建议。 1、把注意力放在真正稀缺的资源上 那篇长文里有个细节,我觉得很真实。作者当年手里有量化的 offer,保底现金高不少,但他选了 Scale AI,因为喜欢那里的社区,也想接触不同的产品和应用。后来正是通过 Scale,他认识了做 LLM inference 的那批人,才有了 DeepMind 和 OpenAI 的机会。当年的同事,现在也成了一圈 Scale 系 founder。 回头看,这些人脉和学习机会带给他的东西,远超 quant 多给的那点现金。 他的观念是:现在拿钱比任何时候都容易。vibe-coding 时代,找个快速赚一笔的机会不难。但真正稀缺的,是别人真实的时间,是牢固的人际关系,是你做成过事之后积累的声誉。 我周围也有些朋友,之前不在 AI 圈,但这两年一头扎进来,逐渐走到更核心的位置。他们放弃了安稳打工的收入,选择在 AI 圈摸爬滚打。要的就是这些稀缺资源。 2、学会找题 AI 最先替代的,是定义清楚、可以评分的任务。学校过去训练的大多也是这种能力:题目已经有人出好了,你负责把答案做对。 但 agent 越来越强之后,真正拉开差距的会是:你能不能发现一个值得解决的问题,能不能判断该把多少时间、token 和资源投进去。 答案越来越便宜,好问题越来越贵。 所以如果问 AI 时代该怎么教育小孩,我觉得至少要让他长期待在真实的问题里。自己做项目也好,研究一个没人布置的题目也好。找题的能力不是上课教出来的,是在一次次选错、做砸和重来里长出来的。 3、用 bitter lesson 选公司 Rich Sutton 那篇 bitter lesson 说的是:通用方法加 scaling,最终会赢过任务特化的优化。这条规则拿来选问题、选公司,同样适用。 公司和职业的回报从来都是幂律分布,AI 只是把走到结果的速度加快了。现在写软件门槛这么低,谁都能搭个简单系统,真正持久的价值只会来自对足够有野心的问题的极致专注。 选公司就问两件事:它做的是不是这个问题最有野心的形态?它有没有真的解掉的可能? 选岗位就问一件事:这个位置能不能让你直接在公司要解决的那个问题的最前沿干活? (当然,上述说的是最理想的版本。如果暂时进不了最核心的位置,也看这个岗位能不能让你逐渐靠近核心问题) 4、最后一英里,用冲刺跑 红杉的 Alfred Lin 写过,最后 10% 是 90% 的工作量,也是 90% 的回报。 AI 把结果两极化了,因为中位数水平就是一个 agent 拿着随手写的 prompt 能吐出来的东西。价值只能来自你对某一小片问题的独特视角,或者对细节的执着。 最后一英里靠迭代。而且 coding agent 进步太快,经常更好的做法,是带着上一轮的教训,直接用下一代模型从头再来。 5、xG 和射门效率 足球里 xG(预期进球),衡量一支球队按机会质量算应该进几个球;效率,则是把机会真正转化成进球的比率。 职业生涯很长,不是每个高 xG 的机会都必须抓住。但你得先让自己站在能看见这些机会的位置。 不过人生到某个阶段是要进球的,不能光看见机会,临门一脚的效率也重要。他复盘自己的职业选择时说,大部分决定都做对了,但后悔没有在做决定前,多花一点时间收集信息。 6、researcher 是心态,不是职业 说实话,现在做 research 的门槛前所未有地低。你不需要先进入前沿实验室,才能开始做研究。先大量使用模型,再把直觉沉淀成 evaluation。 前沿实验室里研究员的日常,无非是好奇心驱动着探索新想法,跟 infra 搏斗着把想法实现,把整个系统理解到足够细以便高效 debug、再把结果的价值讲清楚,去换更多算力。 这些事,你不在前沿实验室也全都能做。 所以我越来越觉得,researcher 是一种心态,不是一种职业。这是我整篇文章最想送给大家的一句话。 世界仍然充满机会。解锁的钥匙就是找到有意思的问题,然后交付超出预期的结果。就这么简单,也就这么难。
顯示更多
聚焦在现有工作上用coding Agent去解决,是一条错误道路,人类已经把能吃的红利吃差不多了, 接下来就是无尽的人指令-agent执行-人指令-agent执行的iteration中逐渐迭代工作,很难把人从这种小幅度高强度反复的iteration中解放出来。 因为现有codebase不仅高度复杂,而且人的大部分命令都是高度模糊、 高度开放、高度自由、无法验证的命令, 场景也是高度开放、高度自由、无法在containers中直接测试跑一跑,必须在真实世界中获得反馈才能继续修改工作。 所以我最近半年一直坚持反复告诉大家: 1. 在现有所有大型科技互联网软硬件移动外包平台coding agent的红利很快就吃完,现有人类像唱山歌一样和claude code高强度一问一答的模式,就是短期内的最优解——像full self coding一样大量agent并行完成coding工作,不会带来更多的收益; 2. 在coding agent很快增长和红利消失的大前提下,人类如果想继续把AI Agent和multi agent的红利吃干抹净,必须持续找到有价值的新领域、新方向、新问题: A. 同时满足问题定义简单干净、环境封闭、非常非常易于verify、问题解决方案搜索空间巨大的复杂问题,让goal-driven( 前提是易于verify,必须用很低的成本去verify最终输出是否正确,保持持续验证这个criteria,给予正确的反馈和无限工作循环的核心条件,直到完整完成工作; B. 能够把multi agent的并行度吃干抹净,一次性1000个agent大批量初始化和启动,在一些setup中持续活跃,保持multi agent的可观测性, 除了openclaw时代就臭大街的各种爬虫以外,还有行为经济学、社会学、心理学、教育学、法学等等大规模试验,不由分说充足token,先初始化1000个agent模拟跑几天,观察一些初步结论; C. 就像我半年前说的价值10万刀的策略:把一切人类社会中遇到的所有问题,整理成文档、表格、图片、文字、structured data,让一些富有经验、富有memory的coding agent(就是claude code和codex本人)进行一步步解决, 你始终要明白,现阶段的头部coding agent已经足够复杂、 足够高级、机制足够完善,AI Agent已经经历了4~5轮工业革命,完善到整个industry其他任何生态和框架继续手搓的任何agent都像一个玩具,只要一个claude code/codex一个文件夹+一个docker/kubernete,就是未来一切企业和流程中的general agent; 3. 有一点几乎被所有人忽略,也是我近几个月意识到的问题。 在经典deep learning时代,一些产业对于经典neural network和baysian model有天然的不信任感和敌意,他们会非常激进、偏执地要求一切machine learning的模型尽可能地跟随可解释性、AI伦理、因果推断等等方向。 在AI Agent时代,越是激进使用的人,越是对AI Agent产出的代码、报告、分析、数据、结论产生严重的怀疑, 因此不只是GPT model需要superalignment,LLM Agent本身更需要superalignment,在Agent时代,superalignment的重要性会越来越高, 而且AI Agent产出和workflow的可解释性需求也会越来越高,最最基础浅表的就是各种问答chatbot的来源引用,今后其他越来越复杂的工作,包括coding本身,都会有可解释性的大量问题涌现, 一种方式是尽可能用formal verification或者prover的形式来自动化验证, 一种是用agentical的验证方式,就像人一样去用一个或者多个agent来反复review和challenge一项工作; 4. 还有一点很多人没想到,就是AI Agent会对人施加反过来的影响。 比如office出现后,普通人要求用office三件套来完成工作,office重塑了人类办公的基本流程和规范, 比如出现了google之后的早期,普通人要学会正确输入搜索关键词,把想问的问题拆分成正确的关键词,以获得正确query的结果(后来google反复做了优化,这个技能也逐渐不重要), 比如social network出现之后,人们学会了全新的交友方式、social network的交友礼仪、聊天方式, 所以在AI Agent时代,人最重要的技能,没有之一,就是如何正确使用AI Agent、挑选正确的模型、使用正确的工具、组建正确的prompt、描述正确的问题、输入充足完备的信息、如何用goal-driven去构建一套dual-agent的简单无休止infinite-loop workflow, 一个不会正确定义问题、不会正确输入足够多的信息、不能让AI Agent在一个边界清晰的闭包问题中正确工作、持续工作的人,天天拿AI Agent当成无所不知的万能神、百宝箱、随机神、超人,除了问弱智问题,就是玩猜猜看、问宏大开放的无异议问题, 这种人大概率会被这个时代逐渐淘汰掉。
顯示更多
0
12
128
21
轉發到社區