註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

卡比卡比
@jakevin7
Building & & AI enthusiast ! Apache Arrow/Datafusion/Doris PMC member jakevingoo@gmail.com
724 正在關注    23K 粉絲
DeepSeek Harness出了官方GUI客户端了!不过它没有对应的浏览器插件。可以使用最近我刚搞完的 OpenCLI-MCP。 应该是做的最好的开源浏览器控制插件了 。 完全的新项目,MCP 2.0 架构,,使用体验打平 codex 插件。 脱胎于OpenCLI,全新的插件,全新的架构和设计。更快的速度。
顯示更多
0
20
108
15
轉發到社區
Step 确实是好起来了。群里和大家聊,大家也觉得体感不错。说实话,做任务设计的时候表现比 Sol 做得还更好,很神奇。 用它做这个射击游戏,当时30分钟直接一次做完,也没调整过,做完就可用,没什么bug。审美也很好。 没有开 goal,然后一次30分钟做了一个完整的任务,说明长程任务表现也很不错。
顯示更多
0
31
44
1
轉發到社區
目前开源的computer use 软件大家有啥推荐的吗。 Maka 开源了 Maka-cu 另外还知道 CUA。 有没有什么真正的最佳实践这种?堪比 codex的实现效果的。
顯示更多
0
13
124
10
轉發到社區
实在是太多人找我要 wx-cli了。再度 public 一下。wx-cli 打一下复活赛。 我主要是做给自己用的。我本地是关了 SIP 的,至于重签名那种是有风险的。风险主要是在第一步解密数据库密钥那一步。 wx-cli的作用就不用多说了吧,限时开放!
顯示更多
0
49
521
56
轉發到社區
来个暴论+干货:A➗根本就不懂 Harness. 在harness上,和OpenAI对比起来,A➗更像一个营销公司。 Codex Desktop 完全领先 Claude Desktop 一个时代。 ●codex desktop 的UI UX被所有同行学习,定义了agent GUI的设计规范 ●扎实优雅的架构设计。真正的技术扎实和设计优雅。老早就大幅度重构,实现了统一 runtime host: V2 使用了 app-server 架构,全端统一使用一个runtime。对比之下,CC 架构到现在还是一个 session 一个 bun,天天堆代码屎山。而codex做到了,甚至你可以用自己的Client连接别人部署的 Codex App Server。 A➗还老吹自己是,Infra工程师特别多。我怎么感觉你根本就是营销公司?你的设计和架构在哪呢? ●各种Agent harness benchmark测试基本都是效果最好的一批,不管是Maka做的Terminal-Bench 测试还是Runta 的 Agent harness 测试,都是最强的那一批。 ●在Astra上更是实现了异步工具调用与后训练,边执行边推理,实现了非阻塞调用,大幅度加快了执行,能明显感觉到现在执行时间短了。 ●Codex老早就实载了服务端侧的上下文压缩,所以Codex虽然上下文要短,但是实际上效果表现却非常好。 在Astra上更是实现了异步工具调用与后训练,边执行边推理,实现了非阻塞调用,大幅度加快了执行,能明显感觉到现在执行时间短了。 ●Responses API 做了 mid-turn steering,实现了动态交互调整,在任务进行中可以插入新指令或中间修改要求,直接把穿插修改放到了底层的 API层。 全球第一的 Computer Use 的的能力更是不用多说了,大家都吹爆了。 ●Codex 还做了上下文管理的前沿探索,Context Windows 也已经实现在Codex里面了。用上下文窗口的滑动,而不是用压缩。这样子就通过可搜索历史主动换窗,让长期的信息能够沉淀,可以被召回。 ●Codex的Memory目前也是越做越好了,基本上是目前实现里面最无感的一家。并且实现了dreaming机制。 ●实装的 PTC / Code Mode 机制配合 astra 强大的后训练能力。让模型的能力大幅度跃升。是真正的Harness和模型相互配合的典范。 ●Claude团队设计 MCP也是埋了不知道多少坑,根本没有借鉴历史很多协议的设计经验和精华。Plan mode也是Claude设计的,现在已经成了历史糟粕了。
顯示更多
0
85
529
43
轉發到社區
Apache 孵化器迎来了第一个 Agent Harness 项目 —— Apache Maka (Incubating) 🎉 Maka 目前是性能最前沿的 agent 之一,持续的打磨了Harness 效果和经济性,在benchmark上取得了顶尖的分数和排名,且报告完全开源可复现。 — Maka 将是一个完全开源&中立,自研 Harness 核心的 Agent 项目。项目由社区协作推,builder群非常活跃,项目推进速度极快。 Maka 的仓库建于今年 5 月 27 日,到 7 月底、10 周时间:71 万行 TypeScript(其中 35 万行是测试,949 个测试文件)、2439 commits、1218 个已合并 PR、合并率 93.8%、PR 合并中位数 33.5 分钟。光 7 月就合了 943 个 PR。 — 为什么要捐给 Apache? 因为 harness 这一层,正在变成各家模型厂的私产。每家都在做自己的官方 CLI,而开放模型的生态里,缺一个不偏袒任何一家、又能把开放模型性能榨到极致的 harness。 Maka 的愿景:做最适配各种开放模型的高性能 Harness。 这次捐献也是我们对 AI Agent 时代开源模式的一次探索 如果你也在做 agent harness,欢迎来 star、提 issue,或者认领一个 good first issue:
顯示更多
0
27
231
42
轉發到社區
deepseek flash确实强啊,来感受一下这个长程能力。agentic能力现在强太多了。 甚至他自己发现了harness里面 agent swarm 的 tool call,并且做好了拆分和安排。 这个是提示词里面没有的,它自己发现并且组合使用subagent swarm模式的。 之前测的时候,flash太蠢了。别说调用复杂工具链进行切分和安排。就是tool call都容易出问题。 截图是Deepseek + maka,
顯示更多
0
82
258
17
轉發到社區
史诗级 feature !!! 微信居然支持 .md 了。 微信最终还是打脸了替自己洗地和解释的那些人了。 .md 的支持哪有说的那么的麻烦和破坏面。
0
66
235
7
轉發到社區
做 Agent 有个不成文的默认假设:tool result 很重要,模型要看完原文才能继续推理。 最近发现这个假设可能是错的。 ---------------------------------- 欢迎 star ---------------------------------- 在 maka 里,我们对 tool result 做了激进的 prune——把工具返回的原始数据大幅裁剪,只保留关键摘要,然后跑了完整的任务对比。结论让人意外:推理质量几乎没有变化,近乎无损压缩。 这是为什么?我有几个可能的解释: 第一,信息已经被蒸馏进 Assistant Message Agent loop 的上下文结构是: System Prompt → User → Assistant → Tool Use → Tool Result → Assistant → ... 每次 tool result 之后,模型都会输出一段 Assistant Message 来表达它的理解和下一步决策。这是一次语义蒸馏——原始数据被压缩成了推理摘要。 后续轮次的模型,更多是在跟"它自己的理解"对话,而不是在跟 tool result 原文对话。prune 掉原文,相当于删掉了一份已经被读取并转化的档案——信息早就走了,外壳还在而已。 第二,Attention 在长上下文里本来就稀疏 "Lost in the Middle" 那篇研究证明:Transformer 对长上下文中间段的注意力权重会大幅衰减,模型更关注开头(system prompt)和最近几轮。 Tool result 通常在上下文中间位置,而且信息密度极低(500 行代码、终端输出、冗余 JSON)。模型本来就没在认真"读"它。prune 只是把这部分被隐式忽略的内容显式删掉。 第三,决策点已经过去 模型调用工具是因为当时需要那个信息。但 5 轮之后,那个 tool result 早已不是边际信息了——核心内容已被消化进后续推理链,保留原文是"存档",不是"决策输入"。 实测数据:对同一个任务(MIPS interpreter),Maka 的总 token 消耗只有 OpenCode 的 38%,但 output token 是它的 2.7 倍。 这个差距背后,有 DeepSeek cache 命中率 95% 的贡献,也有 tool result prune 的贡献。两者合力,长程任务的 token 经济性出现了量级跃升。 对 Agent 工程的启示:context 里最占体积的部分,不一定是最重要的部分。 与其把精力放在"怎么让 tool result 完整进上下文",不如放在"模型读完之后的 reasoning 质量"上。信息的真正载体不是原文,是理解。
顯示更多
0
94
280
22
轉發到社區
OpenCLI App 发布了!🥳🥳 现在不需要 npm 就可以使用 OpenCLI,方便普通用户使用。并且集成了一些其他的方便使用的功能,包括自动刷新登录态等。 欢迎使用,有问题直接dm我或者评论区发我,或者软件内的反馈部分反馈给我。
顯示更多
0
86
252
30
轉發到社區
2w followers 了,感谢每一个人。 在推上学到许多,整个过程也希望是自己成长的过程。 以前做的好不好不重要,未来希望自己能够一直变好。
顯示更多
0
80
178
0
轉發到社區
第一手信息还是很重要的,很多人说GLM打平了Opus。 我们来看benchmark,实际上打平的只是coding方面,这和我们的体感也确实是相对来说符合的。 所以实际上我们还是得先问是不是,再问为什么。 文档里看完整 benchmark 表: HLE(综合推理):GLM-5.2 40.5 vs Opus 4.8 49.8,差距很大 GPQA-Diamond:91.2 vs 93.6,落后 SWE-Marathon:13 vs 26,差一半 SWE-bench Pro:62.1 vs 69.2,差 11% GLM-5.2 没有"全域能力打平"Opus 4.8。真正"打平"的实际上是 FrontierSWE(74.4 vs 75.1,差 1%),这是一个 long-horizon coding benchmark。
顯示更多
0
88
231
12
轉發到社區
大时代下的我们和不可抗拒的洪流。 过去的时代已经不在了,缅怀也没有意义,只能向前看。 现在听 杀死那个石家庄人 太唏嘘了了。 “生活在经验里,直到大厦崩塌”
顯示更多
0
18
112
3
轉發到社區
OpenCLI 一键打通 Agent 的 Twitter 世界!🚀 发推、回复、引用转推、监控通知、关键词触发自动回 DM、把整条 thread 抓下来总结、批量整理 list、定期备份某个人的所有图和视频——你想到的客户端操作,Agent 都能替你跑。 不需要 X API key。不需要等审批。不用 OAuth 折腾半天。 全部复用浏览器登录态——你能在网页上做的事,Agent 都能做。 OpenCLI 的 Twitter 适配器膨胀到 36 个命令,几乎打穿整个客户端: 读:timeline / search / thread / tweets / likes / followers / following / bookmarks / notifications / trending / article / download 写:post / reply / quote / retweet / like / bookmark / follow / block / hide-reply / delete DM:reply-dm / accept 关键词自动放行 List:lists / list-tweets / list-add / list-remove 以前 Agent 看 Twitter 只能爬时间线 现在 search → thread 抓完整讨论 → 总结 → quote / reply 发出去,一条流水线串到底 Twitter 是 Agent 的第一个完整生活场景。
顯示更多
0
18
218
37
轉發到社區
OpenCLI 现在可以读取微信、Telegram、Discord 的内容了!!! wx-cli / tg-cli / discord-cli 全部接入。 群消息、聊天记录、朋友圈、收藏夹——全部可以用 CLI 直接拿到。 以前 Agent 只能帮你盯外部资讯网站,现在连你私域的群聊信息也能一起聚合进来。 真正属于你的个人信息流,终于打通了最后一块。
顯示更多
0
22
292
45
轉發到社區
太生草了。这个网友确实没吹牛逼。