注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 AgenticCoding
AgenticCoding 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 AgenticCoding 的推特
GLM-5.2 刚刚正式发布! 给大家带来实测! 直接说结论本次测试中, 提升最大的是Agent能力, 而且是有质的变化! 测试中GLM-5.2 完全不用搜索附近的位置, 就能直接去想要到达的地方. 这一切竟然是它在一开始把地图背下来了! 这在我测试的20多个模型中之前是没有一个模型能做到的, 比如之前的模型想去换电站, 那么都要搜一下附近有哪些换电站(这就会浪费一次tool_call), 而GLM-5.2直接就知道换电站的位置! 从来没用过搜索函数. 这种一开始就把需要的数据内化到上下文中, 并且能够贯穿整个1M上下文进行推理的能力真的是叹为观止. 除此之外, 本次测试后端代码的 Agentic Coding 能力也有提升, 来到了总榜的第二名. 而本次测试暴露出最大的短板则是空间理解. 其实成也萧何败也萧何, 它虽然把换电站的位置都背下来了, 但是去的换电站却不是最近的, 所以虽然记住了, 但是记住了之后在用之前再根据自己当前所在位置推理一下, 他还是没有做到的, 这也是最大的短板了, 强烈建议官方优化一波. #GLM52# #智谱# #智谱AI# #AgenticCoding# #长上下文能力#
显示更多
0
12
92
5
转发到社区
agentic coding 是很好,但是微信这更新速度和 bug,微信读书这不断自己定时的 bug,真是难受。有时候都不知道是 mac / iphone 的 bug,还是软件的 bug。
State of Agentic Coding #8# with Mario, Armin, and Ben 来自 @YouTube 这个对谈里面对于loop的吐槽我非常赞同
不要用旧的 prompt 思维去套新的 Agentic Coding 我最近越来越强烈地感受到一件事——模型不是瓶颈,人才是 以前模型弱的时候,输出拉胯你可以怪模型 现在 Fable 5 能自主跑几十步长任务,结果不对,问题大概率出在你给它的需求文档上 这个认知转变,可能是 2026 年下半年每个用 AI 干活的人最该搞明白的事 你和 AI 之间,隔着四层信息差(参考anthropic工程师的论文) 我把人和 AI 协作时的信息状态分成四层,搞清楚这个框架,后面所有方法论都能串起来: 第一层:已知的已知 — 你写在 prompt 里的东西,明确告诉 AI 要什么。这是大部分人唯一在做的事 第二层:已知的未知 — 你知道自己还没想清楚的部分,比如“这个交互逻辑我还没定”。至少你知道这里有坑 第三层:未知的已知 — 你觉得理所当然、根本不会写进 prompt 的东西,但 AI 不知道。 比如你的项目从来不用 Redux,你不会特意说“别用 Redux”,但 AI 可能直接给你整一套上来 第四层:未知的未知 — 你压根没意识到的盲区。你不知道自己不知道什么 大部分人只覆盖了第一层。 后面三层,AI 全靠猜 猜对了你觉得 AI 牛逼,猜错了你觉得 AI 垃圾。但问题从来不在模型身上 为什么现在这件事突然变得致命?因为模型能力到了一个临界点 以前模型本身能力有限,你给它一个模糊指令,输出质量的天花板本来就低,你的“信息差”造成的损耗被模型自身的弱鸡能力掩盖了——反正它也做不到多好 现在不一样了。Fable 5 一个 session 可能自主执行几十步决策。 你开头埋下的一个模糊假设,会在后面几十步里像滚雪球一样被放大。 Anthropic 内部研究了大约 40 万个 Claude Code session,覆盖 23.5 万用户,结论是人类主导了 70% 的规划决策 换句话说——你以为你在让 AI 干活,其实你在当产品经理。你的需求文档写得烂,再强的开发也救不了你 这跟我做 PM 那几年的认知完全一致:需求文档写得好的 PM,不是因为文笔好,而是因为他提前把模糊地带都想清楚了 落地 SOP:三个阶段,把你的盲区变成可控变量 阶段一:动手之前——做一次盲区扫描 在你开始让 AI 写代码之前,先问它一句: “我要做 X,但我对这块不太熟。帮我扫一遍我可能没意识到的盲区,找出那些我不知道自己不知道的东西,这样我能更好地给你下指令” 这一步的本质是承认自己不是全知的 大部分人不愿意做这一步,觉得浪费时间 但这恰恰是高手和普通人的分水岭——我观察到最强的那批 Agentic Coder,他们之所以强,不是因为 prompt 写得花哨,而是因为他们对自己要什么有极其清晰的认知,同时永远假设还有未知存在 另外一个我自己常用的方法是让 AI 反向面试你——告诉它你的大致想法,然后让它一个问题一个问题地问你,优先问那些“你的回答会影响整体架构”的问题。 几轮下来,你会发现自己有多少东西是“以为想清楚了其实没有” 阶段二:实现过程中——让 AI 记录它的临场判断 再好的计划也会遇到意外。 我的做法是让 Claude 维护一个 implementation-notes.md 文件,专门记录它在执行过程中遇到的边界情况和临时决策: “维护一个 implementation-notes.md。如果你遇到边界情况需要偏离计划,选保守方案,记录在‘偏离记录’下面,然后继续” 这招的精髓在于——你不需要预见所有问题,你只需要让问题可追溯。 下次迭代的时候,这些记录就是你最好的学习材料。而且它还有一个隐藏好处:当你回头看这些“偏离记录” 你会发现很多都是你第三层和第四层的信息差导致的——这些就是你下次该提前写进 prompt 的东西 阶段三:完成之后——让 AI 考你 这是我觉得最有效的一招 代码写完了,diff 看完了,你觉得自己懂了。 但我现在养成了一个习惯:让 Claude 针对这次改动出一份测验,只有我能答对才算真的理解了这次变更 “我想确认我理解了这次改动的所有内容。给我生成一份报告,包含变更的上下文、直觉解释、具体做了什么,底部附一个测验” 为什么这有效? 因为“看懂了”和“真懂了”之间差着一个数量级。 你不测试自己,你就不知道自己的理解有多少是幻觉。而那些你答不上来的问题,恰恰就是你下一次协作时需要提前澄清的“未知” 底层逻辑:这不是 prompt engineering,是 requirement engineering 把上面三个阶段串起来,你会发现一个规律:你越清楚自己要什么,AI 越能给你想要的 你越能预判 AI 会在哪里困惑,它越不会跑偏 你越愿意承认自己有盲区,AI 越能帮你补盲区 这套逻辑跟写 prompt 没有半毛钱关系 这是需求工程 模型能力的天花板已经高过大部分人的需求表达能力了。 你的下一步不是学更花哨的 prompt 技巧,而是学会问自己一个问题: 我到底有多少东西,是我以为 AI 知道、但其实我从来没告诉过它的? 把这个问题想清楚,比换任何模型都管用
显示更多
💥卧槽,本地模型也能当 Claude Code 的后端跑终端 agentic coding 了 GitHub 5.7 万星,Python 项目,叫 private-gpt 公司代码和数据不让上云,但团队又眼馋 Claude Code 这种终端 agent 干活的效率,这是很多技术团队卡住的地方。 private-gpt 的做法是把 Ollama、llama.cpp、vLLM 里跑的本地模型,包成一层遵循 Claude API 规范的服务。 Claude Code 直接把后端指向它就能用,RAG、工具调用、MCP、text-to-sql 一样不少,连 Claude Desktop、Word/Excel 里的 Claude 插件也能接上。 它自己不跑模型,只负责把你已有的推理服务套进这套 API 规范,还带了个 workbench UI 方便本地测试。 macOS 上 brew install private-gpt,配两个环境变量指向本地模型,就能起服务。
显示更多
到底要不要人工审阅 AI 生成的代码,我是这么看的: - 在 agentic coding 时代,自动化测试变得尤为重要。所有能被自动验证的行为都应该被验证。AI 写单元测试很容易,但对于更复杂的集成测试,仍然需要人去搭建——这些工作很多是一次性的,但也有些需要跟着项目迭代。 - AI code review 能搞定 90% 过往需肉眼检查的内容(语法、注释、边界条件、logging、etc),当然前提是团队提供了严格的代码规范。这并不难。 - 仍然需要人把关的那 10%,是「架构设计」。AI 能写出完全符合代码规范,但是架构一团糟的代码。而「设计」往往项目甚至单个功能相关的,很难被规范化。这里人类的经验就很重要了。 - 如何让人从 AI 生成的巨量代码中快速提炼出架构设计?好的做法是让 AI 往 commit message 里加入「修改了哪些代码」的总结,并提炼出架构图。很多 AI code review 产品已经是这么做的了。人不再需要去看代码,看总结就行了。 - 很多场合下,的确没有必要人工 review:比如一次性脚本、使用成熟框架(Django, React)的项目等等。对于那些复杂且会长久维护的项目,人类 review 是必要的,但并不等于人要去读每一行代码。 - 最好维护一个包含设计选择、代码结构的文档,让 AI 实时更新。这对于人和 AI 都有极大帮助,能减少很多不必要的 turns 和上下文开销。
显示更多
0
56
214
34
转发到社区
Grok 4.5 已在 Cursor 正式上线。 256k 的超长上下文配合 Agentic Coding 模式,目标是解决长时间运行的复杂编程任务。马斯克声称其性能直逼 Claude 3 Opus,但速度更快且成本更低。目前 BridgeBench 测试正在进行中,如果它能在生产环境代码上维持 Opus 水平的逻辑质量,Cursor 的开发体验将迎来质变。
显示更多
吴恩达老师的讲 Claude Code,DeepLearning 的科普课程Claude Code: A Highly Agentic Coding Assistant 虽然定位偏入门,但这个课程仔细听下来,发现还是有一些 "Best Practices" 是我之前忽略的细节,因此对每个章节做了精读笔记,方便更好的记忆和回溯, 一共 8 节,推荐。
显示更多
0
3
125
36
转发到社区
OpenAI 可能在 6 月 23 日发布 GPT-5.6 GPT 5.6 目前流出的信息看起来很猛: • 价格大约比 Fable 便宜 3 倍 • 上下文最高支持 150 万 token • Agentic Coding 工作流更强 • 直接对标 Claude-style 系统 有意思的是这个发布时间: 有人猜测 OpenAI 可能就是在等 6 月 23 日这个节点, 因为那天之后,很多 Fable 用户可能会被迫切到更贵的高级套餐,Fable 的蛮横也许只有 GPT 5.6 能治。
显示更多