推荐这个工具,autoresearch——一个 Claude Code skill。
把 Karpathy 的 630 行 Python 自主实验脚本泛化成了 14 个命令的通用 agent 循环:你给一个目标和指标,它自主迭代到完成为止。
autoresearch 是一个 Claude Code skill,把 Karpathy 的 autoresearch 概念(一个 630 行的 Python 脚本,能自主跑通宵 ML 实验)泛化到了任意领域。支持 Claude Code、OpenCode 和 OpenAI Codex。MIT 开源。
核心循环
LOOP (N 轮或直到完成):
1. 审视当前状态 + git 历史 + 结果日志
2. 选择下一个改动(基于之前什么有效、什么失败、什么还没试)
3. 做一次聚焦的改动
4. Git commit(验证之前先提交)
5. 运行机械验证(测试、benchmark、分数)
6. 如果改进 → 保留。如果变差 → git revert。如果崩溃 → 修复或跳过。
7. 记录结果
8. 重复
每次改进叠加。每次失败自动回滚。进度记录为 TSV 格式。
v2.2.0 新增:自主编排器
不再需要手动设置 Goal / Metric / Verify。直接输入一个自然语言目标,编排器自动分类目标、推导 Success 谓词、与你确认一次,然后在 14 个子命令之间自主编排,直到完成。
14 个命令
| 命令 | 用途 |
|------|------|
| /autoresearch | 核心迭代循环,或自主编排模式 |
| /autoresearch:plan | 把目标转化为验证过的配置 |
| /autoresearch:debug | 假设驱动的自主 bug 猎手 |
| /autoresearch:fix | 逐个击破错误直到归零 |
| /autoresearch:security | STRIDE + OWASP 安全审计 |
| /autoresearch:ship | 8 阶段通用发布工作流 |
| /autoresearch:scenario | 12 个维度的边缘案例探索 |
| /autoresearch:predict | 5 个专家角色辩论预测 |
| /autoresearch:learn | 自主文档生成引擎 |
| /autoresearch:reason | 对抗性辩论精炼(盲审团裁定) |
| /autoresearch:probe | 8 个角色对抗性需求审问 |
| /autoresearch:improve | 产品改进研究 + PRD 生成 |
| /autoresearch:evals | 结果分析:趋势、平台期、收敛信号 |
| /autoresearch:regression | 稳定性门禁:baseline vs candidate → STABLE/UNSTABLE |
另有 Guard 机制:在优化某个指标时设置"这个命令必须始终通过"的安全网。
安装
npx skills add uditgoenka/autoresearch
然后重启 Claude Code,14 个命令全部可用。通过 /plugin update autoresearch 升级。
v2.1 架构重写
原来的 SKILL.md 是一个 813 行的单体文件,每次调用消耗约 100K token。v2.1 把它拆成了一个 41 行的路由文件 + 12 个自包含命令文件(每个 94-120 行,每次调用约 5-8K token)。相同功能面,token 减少 95%。
9 个安全 hook
默认全部启用,可单独关闭。覆盖:阻止 node_modules 等目录进入上下文、阻止读取 .env/SSH 密钥、阻止 force-push/rm -rf、压缩后重新注入上下文、子 agent 状态感知等。
GitHub:
参考:
#
ClaudeCode# #
Skill# #
AgentLoop#