以前是我盯着 Pi 改代码,现在有人开始让 Pi 自己死磕优化了😂
最近看到一个很值得玩的项目:pi-autoresearch。
它受 Karpathy Autoresearch 启发,直接把这套思路搬进了 Pi里面。
你不需要一步一步告诉它该怎么优化,只需要给一个明确指标。
剩下的事情,它自己来:
想方案 → 修改 → 测试 → 对比结果 → 有提升就留下 → 变差就回滚 → 继续下一轮。
几个点特别有意思的点:
1、目标非常明确
不是让 Agent 模糊地“把代码优化一下”,而是直接盯一个数字,比如测试时间、构建速度、Bundle Size、Lighthouse 分数。到底有没有变好,一眼就能判断。
2、失败成本很低
Pi 可以大胆去试各种方案。效果不好就直接回滚,不需要我一直盯着每一次修改,真正有提升的结果才留下来。
3、可以连续跑很多轮
普通 Agent 改一次基本就结束了,Autoresearch 更像是在做实验。一个方案不行就换下一个,直到慢慢把指标往上推。
4、实验过程可以持续积累
每一轮尝试、结果和改动都会被记录下来。哪怕 Context 后面重置了,也可以接着之前的实验继续跑,而不是重新从零开始猜。
我觉得它最适合解决一种很有意思的问题:
我不知道下一步该怎么优化,但我知道什么结果才算更好。
以前我也用过类似的框架去重复跑,重复迭代,甚至开多个子向前一起跑,然后确定一个最高分的版本。
他这个插件的思路也其实都是一样的,让ai自己去按照你的目标去进化,每一次都打分,一次一次的向最终目标靠近。
如果你最近也在玩 Pi,pi-autoresearch 我很推荐试一下。
显示更多
Pi 和 Oh My Pi,正在把 Agent Harness 推向两个极端🔥
本质上他们都是一个爹妈生的,甚至 Oh My Pi 本身就是从 Pi Fork 出来的,但是后期发展越往对方的极端方向走。
Pi 的思路很简单:核心能精简的尽量精简,额外的功能都交给插件。
默认工具少、系统提示词短,Extension、Skill、Memory、Subagent 这些东西,尽量不替你做决定。
所以 Pi 更像一个毛坯房,东西不多,但结构干净,每一块能力基本都在你的掌控里。
Oh My Pi 刚好反过来:Harness 能做的事情,我尽量都做到里面。
简单对比几个最明显的地方:
1、Pi 默认工具很克制;Oh My Pi 直接塞进 LSP、Debugger、AST、Browser、Subagent、Memory。
2、Pi 更倾向传统的代码编辑方式;Oh My Pi 连 Edit Protocol 都重新做了,用 Hashline 降低修改代码时的定位和冲突问题。
3、Pi 对 Context 保持简单;Oh My Pi 甚至做了 SnapCompact,把历史上下文渲染成图片,再交给视觉模型继续读。
其实两个方向我不会说哪个对哪个错,因为我很多时候会结合对应的群体去考虑。
不是每个人都是极客或者喜欢简洁自由的Agent,更多的其实是小白,他们需要的就是上手可用的方案。
社区多向发展才是我希望的,做完的东西会越来越多。
显示更多