我先说一个用 Agent 的人都会撞上、但很少有人把它说清楚的事。
你让它干过的活,它其实都「记得」。会话记了,向量库也存了,上下文窗口再往上拉,上周改过的规则、上个月踩过的坑,搜一下都能翻出来。
可到下一次,它还是会犯一模一样的错。
人不是这样的。一个人处理过 100 次合同,第 101 次会更熟——他记得上次哪个条款被客户挑刺,记得哪位合伙人对风险更敏感,记得三个月前那次修改到底是为什么。Agent 处理过 100 次,第 101 次仍可能从入职第一天重新开始。
入职第 365 天,能力还停在第 1 天。这不是段子,是现在绝大多数 Agent 的真实工作状态。
过去两年行业一直在给它加记忆:更大的向量库、更长的上下文、更全的知识图谱。看起来都在解决「忘事」。可如果你盯得够紧,会发现我们解决的其实是检索,不是记忆,更不是学习。
检索能回答:用户说过什么,某份文件在哪。它回答不了:谁在什么时间、针对什么项目作过什么判断;这个判断后来为什么变了;现在真正有效的状态是什么。
一个特别日常的例子。周一在微信群里说:周五之前发季度总结。周二在飞书评论里改口:指标变了,推迟到下周三。周三又在微信里说:报告已经准备好了。
如果你的记忆系统只是把句子打成向量再召回,周一和周二会一起被塞进 Prompt。Agent 当场就乱了——截止日期到底是周五,还是下周三?
这叫记忆腐烂。它找得到语义相似的历史碎片,拼不出一条仍然有效的时间线。
@Lonely__MH 这篇把这件事拆到了骨头上。一句总纲就够用:
一个 Agent 能找到过去,不代表它能从过去中学习。
别再问 Agent 有没有记忆了,该问的是它学没学会。
后面他讲的 Alloomi,不是又一个「我们做了更好的 RAG」。它把三件过去分散的事塞进同一个闭环:任务层把上下文当成带实体、来源、时效的业务状态来养,而不是一堆可搜的句子;脚手架层用专家锚定和回滚,挡住「越学越歪」;模型层才把筛过的经验压进权重,让下一次交付真的比上一次少犯一次错。
记得住,学得会,做得成。以后看一个数字员工,也许不该只问它今天能干什么,还该问三句:
它能不能找到正确、而且仍然有效的过去? 专家改过的地方,会不会影响下一次交付? 它学偏了,能不能被发现,并且回滚?
我们缺的不是一个越来越大的历史检索系统。我们缺的是一个能把这一次的有效经验,带进下一次工作的 Agent。