这三条也在我的 AGENTS.md 里。我还有第四条,开发期间不要运行全套 e2e,要在结束的时候再执行。
否则它改个标点符号要测试一个多小时。😂
At the top of my AGENTS.md:
- NEVER write unit tests after you write code.
- Highly prefer E2E tests as the sole testing mechanism. Use them to verify complex features work. At the end of E2E tests, produce a verifiable and repeatable artifact.
- If you must test a system in isolation, FIRST write all the ways it could fail, THEN write the code.
顯示更多
复杂任务必须要写方案。
一,建立共识,一句话并不足以讲明白目标,细节才真正影响目标和架构
二,同步背景,ai 会围绕目标收集信息,暴露现有缺陷
三,锁定路径,ai 会在解决具体问题的时候逐渐失去目标,最后再来回返工
四,记录过程,工作文件会在过程中不断更新
顯示更多
这种就是妥妥的骗经费的公司。屏幕都是给领导作秀的。
昨天去了一家做OPC社区的朋友的公司,3000平方,几百台电脑,几乎看不到人。
全是AI在自动跑跨境电商——自动上架、自动卖货、自动管理160个国家的店铺。
站在那里,说实话,有点被震到。
以前我们总觉得出海是拼人、拼钱、拼渠道,现在发现,未来可能只拼一件事:谁先把AI变成自己的员工🧠。
顯示更多
我说一件事吧。最近一周我花了大几十亿 token,一个新功能都没做出来,写的都是你说的没用的代码。
工程师永远不会消失,但是工作方式会变化。工具化永远会进化到 roi 低于人力的边界,然后需要更多的人力来补齐最后的缝隙。
我现在是一遍一遍地重构。刚完成一次大重构,不停机连续跑了三天多。😂
AI 自己写代码,起步都很爽,写到最后就把自己逼到死胡同,开始到处打补丁,最后连补丁都打不上。
好在重构也是 AI 干。哈哈。
顯示更多
像我这样费尽心思一个 bit 一个 bit 去优化软件,而且代码行数经常越写越少的程序员大概快绝迹了
哈哈,worktree 要配合 cow 和自动回收才爽。我现在用 boxsh 开 worktree,干净会话工作区会话关闭五分钟自动回收,恢复会话再 boxsh 秒开出来。
不过状态管理复杂很多,服务器上用起来才划算。个人电脑完全没必要。
顯示更多
我是能不用worktree就不用worktree,要么不同任务用branch分支,要么就直接同一个分支多任务,一般不太用担心冲突,首先只要任务类型不一样冲突可能性较小。
另外现在 Harness 比如说 Claude Code、Codex 都很聪明,遇到冲突会等另一个执行完。
使用 worktree 主要是在做耗时较长的 PoC 场景,只是验证一下,同时要做其他任务,完了就删除目录。
顯示更多
我就转一下评论
去猪八戒(
分享一个真实案例:
有个中文系朋友在猪八戒接了4单策划案,共到手1万
她没有任何技术背景,就用了这三步:
第一步:在猪八戒找 "AI策划/内容方案" 的需求,报价比市场低20%。
第二步:拿到需求文档,扔给Claude + DeepSeek,让它按"目标用户+痛点+执行路径"结构输出初稿。
Prompt模板:「你是一名有10年经验的品牌策划,以下是客户需求:[粘贴需求],请输出一份3000字的完整策划案,包含执行步骤和预算参考。」
第三步:花30分钟加入自己的观察和行业数据,修改语气,交付。
全程不用写代码,不用懂算法。
每单花2-3小时就搞定了
如果你是在校学生,完全可以通过这个积攒自己的经验,好给未来工作铺垫。
顯示更多
下一代出生的人类,会理所当然地认为 ai 腔就代表了人类文明。
我现在开始用 playwright + ai 写软件使用手册。方法是:
一、定义手册覆盖的典型事务
二、使用 playwright 编写每个事务的全流程测试脚本
三、根据手册需要在适当位置自动截图,必要是自动加标记
四、ai 编写手册并插入截图
这样做,既保证主要事务全流程测试覆盖,又确保手册内容与软件随时同步。
顯示更多
开始慢慢取关 ai 发推的账号。
我觉得在评论里 ai 一下,我还能忍,为了流量,挺不容易,我能理解,大不了不看。
但是主推 ai,占了那么大一块时间线,打开以看满嘴沙子,实在受不了。这么起号,既对不起粉丝,还跌份,何必呢?
顯示更多
人有多大胆,code 有多大产。
俺有一个老板朋友,也不懂 Rust,最近让 Codex 用 Rust 重写了 DuckDB,然后据他说上了自己的生产环境。胆儿这么肥,我大为震撼。 BTW 它还用 Rust 重写了 Kafka 和 Neo4j。给我的观感就是大猩猩拿着机关枪疯狂扫射。 Repo ➡️
顯示更多
我觉得 deepseek 把模型分成 flash 和 pro 分开发布,会把其它开源模型逼疯。
这个话题很有趣。git 的工作流用于处理慢速并发是够用的。但是多 agent 的时候,一个不留神,分叉就十万八千里了,到时候再合并就比较费劲。
不过毕竟 agent 还不是个意识主体,我觉得还可以归于善意共识。
顯示更多
一个特别有趣的事情是用分布式领域经典的 CAP 不可能三角去看 git 和 agent team 作为分布式系统的协作模型。
Git 和 CRDT 都是保证 AP 放弃了 C,意味着允许断网期间不同副本状态分叉。
而 agent team 的难点在于多节点如何对同一决策达成一致。这里 Raft 是经典的共识算法,它意味着保证 CP 放弃了 A,即当系统无法确认某个节点仍与权威多数派保持一致时,宁可拒绝它处理请求,也不允许它独立产生新的权威状态。
但标准 Raft 仍然解决不了系统中可能存在恶意或被提示注入的坏 agent 节点的情况,这也就是所谓的拜占庭问题。换句话说,Raft 无法验证 agent 有没有说真话。
所以感觉肯定多少会有拜占庭问题,但还不属于现在主流产品的 major concern 吧。
顯示更多
社区都在呼唤 35b-a3b,qwen 貌似在这个方向上卡住了。
📢Meet Qwen3.8-Max — our most capable model to date.
Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉
Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters:
- Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub:
- Real work, real results: Production-quality deliverables across hundreds of professions.
- Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy.
- Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction.
💰Pricing:
Input: $2.0 / M tokens
Output: $6.0 / M tokens
Implicit Caching: $0.25 / M tokens
Start building with Qwen3.8-Max! 🚀
📖 Blog:
✅ Qwen Studio:
⚡ API:
顯示更多
有点想整个 4bits 的 ds4-flash 玩玩。
说一件疯狂的事情,我发现评论里我关注的推主都出了几十个 agent 了。顺便又关注了几个。😂
如果你是 Agent Harness 相关开源项目的开发者,希望参加 DeepSeek Harness 的内测,可以回复或私信联系我。请附上 GitHub id 以及开源代表作。
先转为敬
我们开源了一个史上最快的模型请求库。比原始sdk快10多倍,核心是deepseek flash这种高速模型请求的序列化与内存开销会越来越恐怖。
整个库还支持了node/java/golang/python/c/swift,/kotlin多语言, 还有各种模态的模型。如果你在build agent,同样不能错过。
顯示更多
哈哈哈哈,人总是喜欢在这些不切实际的领域里寻找希望。大模型在几乎所有自由定位的场景都很难成功,关键是这个方向还没法 harness。包括但不限于以下领域:
ppt,drawio,svg,cad,3d model,等等。。。
顯示更多
🚀用一句话生成了一个3D模型,怎么说呢……
属于是“丑得很精致,差得很稳定”
不过总体雏形还是在的🤣