deepseek flash确实强啊,来感受一下这个长程能力。agentic能力现在强太多了。
甚至他自己发现了harness里面 agent swarm 的 tool call,并且做好了拆分和安排。
这个是提示词里面没有的,它自己发现并且组合使用subagent swarm模式的。
之前测的时候,flash太蠢了。别说调用复杂工具链进行切分和安排。就是tool call都容易出问题。
截图是Deepseek + maka,
显示更多
史诗级 feature !!! 微信居然支持 .md 了。
微信最终还是打脸了替自己洗地和解释的那些人了。
.md 的支持哪有说的那么的麻烦和破坏面。
做 Agent 有个不成文的默认假设:tool result 很重要,模型要看完原文才能继续推理。
最近发现这个假设可能是错的。
----------------------------------
欢迎 star
----------------------------------
在 maka 里,我们对 tool result 做了激进的 prune——把工具返回的原始数据大幅裁剪,只保留关键摘要,然后跑了完整的任务对比。结论让人意外:推理质量几乎没有变化,近乎无损压缩。
这是为什么?我有几个可能的解释:
第一,信息已经被蒸馏进 Assistant Message
Agent loop 的上下文结构是:
System Prompt → User → Assistant → Tool Use → Tool Result → Assistant → ...
每次 tool result 之后,模型都会输出一段 Assistant Message 来表达它的理解和下一步决策。这是一次语义蒸馏——原始数据被压缩成了推理摘要。
后续轮次的模型,更多是在跟"它自己的理解"对话,而不是在跟 tool result 原文对话。prune 掉原文,相当于删掉了一份已经被读取并转化的档案——信息早就走了,外壳还在而已。
第二,Attention 在长上下文里本来就稀疏
"Lost in the Middle" 那篇研究证明:Transformer 对长上下文中间段的注意力权重会大幅衰减,模型更关注开头(system prompt)和最近几轮。
Tool result 通常在上下文中间位置,而且信息密度极低(500 行代码、终端输出、冗余 JSON)。模型本来就没在认真"读"它。prune 只是把这部分被隐式忽略的内容显式删掉。
第三,决策点已经过去
模型调用工具是因为当时需要那个信息。但 5 轮之后,那个 tool result 早已不是边际信息了——核心内容已被消化进后续推理链,保留原文是"存档",不是"决策输入"。
实测数据:对同一个任务(MIPS interpreter),Maka 的总 token 消耗只有 OpenCode 的 38%,但 output token 是它的 2.7 倍。
这个差距背后,有 DeepSeek cache 命中率 95% 的贡献,也有 tool result prune 的贡献。两者合力,长程任务的 token 经济性出现了量级跃升。
对 Agent 工程的启示:context 里最占体积的部分,不一定是最重要的部分。
与其把精力放在"怎么让 tool result 完整进上下文",不如放在"模型读完之后的 reasoning 质量"上。信息的真正载体不是原文,是理解。
显示更多
OpenCLI App 发布了!🥳🥳
现在不需要 npm 就可以使用 OpenCLI,方便普通用户使用。并且集成了一些其他的方便使用的功能,包括自动刷新登录态等。
欢迎使用,有问题直接dm我或者评论区发我,或者软件内的反馈部分反馈给我。
显示更多
2w followers 了,感谢每一个人。
在推上学到许多,整个过程也希望是自己成长的过程。
以前做的好不好不重要,未来希望自己能够一直变好。
显示更多
第一手信息还是很重要的,很多人说GLM打平了Opus。
我们来看benchmark,实际上打平的只是coding方面,这和我们的体感也确实是相对来说符合的。
所以实际上我们还是得先问是不是,再问为什么。
文档里看完整 benchmark 表:
HLE(综合推理):GLM-5.2 40.5 vs Opus 4.8 49.8,差距很大
GPQA-Diamond:91.2 vs 93.6,落后
SWE-Marathon:13 vs 26,差一半
SWE-bench Pro:62.1 vs 69.2,差 11%
GLM-5.2 没有"全域能力打平"Opus 4.8。真正"打平"的实际上是 FrontierSWE(74.4 vs 75.1,差 1%),这是一个 long-horizon coding benchmark。
显示更多
大时代下的我们和不可抗拒的洪流。
过去的时代已经不在了,缅怀也没有意义,只能向前看。
现在听 杀死那个石家庄人 太唏嘘了了。
“生活在经验里,直到大厦崩塌”
显示更多
OpenCLI 一键打通 Agent 的 Twitter 世界!🚀
发推、回复、引用转推、监控通知、关键词触发自动回 DM、把整条 thread 抓下来总结、批量整理 list、定期备份某个人的所有图和视频——你想到的客户端操作,Agent 都能替你跑。
不需要 X API key。不需要等审批。不用 OAuth 折腾半天。
全部复用浏览器登录态——你能在网页上做的事,Agent 都能做。
OpenCLI 的 Twitter 适配器膨胀到 36 个命令,几乎打穿整个客户端:
读:timeline / search / thread / tweets / likes / followers / following / bookmarks / notifications / trending / article / download
写:post / reply / quote / retweet / like / bookmark / follow / block / hide-reply / delete
DM:reply-dm / accept 关键词自动放行
List:lists / list-tweets / list-add / list-remove
以前 Agent 看 Twitter 只能爬时间线
现在 search → thread 抓完整讨论 → 总结 → quote / reply 发出去,一条流水线串到底
Twitter 是 Agent 的第一个完整生活场景。
显示更多
OpenCLI 现在可以读取微信、Telegram、Discord 的内容了!!!
wx-cli / tg-cli / discord-cli 全部接入。
群消息、聊天记录、朋友圈、收藏夹——全部可以用 CLI 直接拿到。
以前 Agent 只能帮你盯外部资讯网站,现在连你私域的群聊信息也能一起聚合进来。
真正属于你的个人信息流,终于打通了最后一块。
显示更多