注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 AgentLoop
AgentLoop 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 AgentLoop 的推特
推荐这个工具,autoresearch——一个 Claude Code skill。 把 Karpathy 的 630 行 Python 自主实验脚本泛化成了 14 个命令的通用 agent 循环:你给一个目标和指标,它自主迭代到完成为止。 核心循环 LOOP (N 轮或直到完成): 1. 审视当前状态 + git 历史 + 结果日志 2. 选择下一个改动(基于之前什么有效、什么失败、什么还没试) 3. 做一次聚焦的改动 4. Git commit(验证之前先提交) 5. 运行机械验证(测试、benchmark、分数) 6. 如果改进 → 保留。如果变差 → git revert。如果崩溃 → 修复或跳过。 7. 记录结果 8. 重复 每次改进叠加。每次失败自动回滚。进度记录为 TSV 格式。 v2.2.0 新增:自主编排器 不再需要手动设置 Goal / Metric / Verify。直接输入一个自然语言目标,编排器自动分类目标、推导 Success 谓词、与你确认一次,然后在 14 个子命令之间自主编排,直到完成。 14 个命令 | 命令 | 用途 | |------|------| | /autoresearch | 核心迭代循环,或自主编排模式 | | /autoresearch:plan | 把目标转化为验证过的配置 | | /autoresearch:debug | 假设驱动的自主 bug 猎手 | | /autoresearch:fix | 逐个击破错误直到归零 | | /autoresearch:security | STRIDE + OWASP 安全审计 | | /autoresearch:ship | 8 阶段通用发布工作流 | | /autoresearch:scenario | 12 个维度的边缘案例探索 | | /autoresearch:predict | 5 个专家角色辩论预测 | | /autoresearch:learn | 自主文档生成引擎 | | /autoresearch:reason | 对抗性辩论精炼(盲审团裁定) | | /autoresearch:probe | 8 个角色对抗性需求审问 | | /autoresearch:improve | 产品改进研究 + PRD 生成 | | /autoresearch:evals | 结果分析:趋势、平台期、收敛信号 | | /autoresearch:regression | 稳定性门禁:baseline vs candidate → STABLE/UNSTABLE | 另有 Guard 机制:在优化某个指标时设置"这个命令必须始终通过"的安全网。 安装 npx skills add uditgoenka/autoresearch 然后重启 Claude Code,14 个命令全部可用。通过 /plugin update autoresearch 升级。 v2.1 架构重写 原来的 SKILL.md 是一个 813 行的单体文件,每次调用消耗约 100K token。v2.1 把它拆成了一个 41 行的路由文件 + 12 个自包含命令文件(每个 94-120 行,每次调用约 5-8K token)。相同功能面,token 减少 95%。 9 个安全 hook 默认全部启用,可单独关闭。覆盖:阻止 node_modules 等目录进入上下文、阻止读取 .env/SSH 密钥、阻止 force-push/rm -rf、压缩后重新注入上下文、子 agent 状态感知等。 GitHub: 参考: #ClaudeCode# #Skill# #AgentLoop#
显示更多
推荐这个工具,autoresearch——一个 Claude Code skill。 把 Karpathy 的 630 行 Python 自主实验脚本泛化成了 14 个命令的通用 agent 循环:你给一个目标和指标,它自主迭代到完成为止。 autoresearch 是一个 Claude Code skill,把 Karpathy 的 autoresearch 概念(一个 630 行的 Python 脚本,能自主跑通宵 ML 实验)泛化到了任意领域。支持 Claude Code、OpenCode 和 OpenAI Codex。MIT 开源。 核心循环 LOOP (N 轮或直到完成): 1. 审视当前状态 + git 历史 + 结果日志 2. 选择下一个改动(基于之前什么有效、什么失败、什么还没试) 3. 做一次聚焦的改动 4. Git commit(验证之前先提交) 5. 运行机械验证(测试、benchmark、分数) 6. 如果改进 → 保留。如果变差 → git revert。如果崩溃 → 修复或跳过。 7. 记录结果 8. 重复 每次改进叠加。每次失败自动回滚。进度记录为 TSV 格式。 v2.2.0 新增:自主编排器 不再需要手动设置 Goal / Metric / Verify。直接输入一个自然语言目标,编排器自动分类目标、推导 Success 谓词、与你确认一次,然后在 14 个子命令之间自主编排,直到完成。 14 个命令 | 命令 | 用途 | |------|------| | /autoresearch | 核心迭代循环,或自主编排模式 | | /autoresearch:plan | 把目标转化为验证过的配置 | | /autoresearch:debug | 假设驱动的自主 bug 猎手 | | /autoresearch:fix | 逐个击破错误直到归零 | | /autoresearch:security | STRIDE + OWASP 安全审计 | | /autoresearch:ship | 8 阶段通用发布工作流 | | /autoresearch:scenario | 12 个维度的边缘案例探索 | | /autoresearch:predict | 5 个专家角色辩论预测 | | /autoresearch:learn | 自主文档生成引擎 | | /autoresearch:reason | 对抗性辩论精炼(盲审团裁定) | | /autoresearch:probe | 8 个角色对抗性需求审问 | | /autoresearch:improve | 产品改进研究 + PRD 生成 | | /autoresearch:evals | 结果分析:趋势、平台期、收敛信号 | | /autoresearch:regression | 稳定性门禁:baseline vs candidate → STABLE/UNSTABLE | 另有 Guard 机制:在优化某个指标时设置"这个命令必须始终通过"的安全网。 安装 npx skills add uditgoenka/autoresearch 然后重启 Claude Code,14 个命令全部可用。通过 /plugin update autoresearch 升级。 v2.1 架构重写 原来的 SKILL.md 是一个 813 行的单体文件,每次调用消耗约 100K token。v2.1 把它拆成了一个 41 行的路由文件 + 12 个自包含命令文件(每个 94-120 行,每次调用约 5-8K token)。相同功能面,token 减少 95%。 9 个安全 hook 默认全部启用,可单独关闭。覆盖:阻止 node_modules 等目录进入上下文、阻止读取 .env/SSH 密钥、阻止 force-push/rm -rf、压缩后重新注入上下文、子 agent 状态感知等。 GitHub: 参考: #ClaudeCode# #Skill# #AgentLoop#
显示更多
给大家带来 Flash 系列模型横评! 各个厂商除了旗舰级别模型, 也都有Flash级别的模型, 而这些模型的定位主要都是多智能体系统的驱动模型和RAG系统的驱动模型. 那么现有这些Flash模型应该怎么选? 给大家带来本篇评测! 本次主要从 Agent Loop 迭代能力, Agent 能力, 前端, 后端, 空间理解, 美学, 性价比等多个角度评测了 Gemini-3.5-Flash, Step-3.7-Flash, DeepSeek-V4-Flash 这三个模型. 从测试来看, Gemini-3.5-Flash 更适合干"漂亮活", 比如前端页面, 建模等. 而 Step-3.7-Flash 则极具性价比, 在Agent测试中取得了比旗舰模型还要高的Token效率(用最少的token干最多的事情). 所以特别适合用在Agent框架中(比如OpenClaw或者Hermes), 或者复杂的Agent系统中用来做驱动模型. DeepSeek-V4-Flash 则后端能力很不错, 很适合用来写脚本, 甚至给服务器安装一个 DeepSeek-V4-Flash 驱动的 ClaudeCode, 用来 AI-Ops. #flash模型# #step37flash# #deepseekv4flash# #gemini35flash# #AgentLoop#
显示更多
Agent 相关词汇 Token 计费单位。 大概一个汉字 1–2 个 token,一个英文单词约 1 个。所有价格都按 token 算。 上下文窗口(context window) 一次调用最多能塞多少 token。比如「1M 上下文」就是最多塞 100 万 token。 工具调用(tool call) 模型不能执行任何东西。它只会吐文字。所以当它要执行命令时,它其实是"说"了一句:「我想执行 ls -la」。 然后是 harness 接住这句话,真的去你机器上执行,把结果贴回对话里,再连同全部历史发给模型。 这一来一回叫一次 tool call。模型负责说,harness 负责做。 Schema(工具说明书) 告诉模型「你有哪些工具可用、每个工具要什么参数」。这份说明书就叫 schema。 Agent Loop(智能体循环) 把上面那个过程转起来: 发请求(全部历史 + 工具说明书) → 模型说「我要调 X 工具」 → harness 真的执行 X → 结果贴回历史 → 再发请求(历史又长了一截) → ...循环,直到模型说「做完了」 这个循环就是 agent 的本体。 压缩(compaction) 对话太长,超过上下文窗口了,就得把老内容摘要掉腾地方。 代价是:前缀变了,缓存归零。 reasoning_content(思考内容) 推理模型回答前会先"想"一大段。这段思考通常直接被丢掉。 MCP 一个统一接口标准,让第三方工具能被任何 agent 调用。类比 USB:以前每个工具要为每个 agent 单独适配,有了 MCP 就是插上就能用。 上面所有这些东西的实现加起来,就是 harness。
显示更多
Agent Loop 里最容易被低估的是 State。 没有外部状态,Agent 每次醒来都像失忆: 昨天忽略过的噪音,今天又处理一遍。 上轮失败的原因,这轮又踩一次。 已经等人工确认的 PR,又被重新改。 所以成熟 loop 一定要有类似 STATE.md 的东西。 它不需要复杂,先记 4 件事就够: 上次运行时间 正在处理什么 哪些暂时忽略 什么情况必须升级给人
显示更多
现在很多人优化 Agent 成本,第一反应是: 换更便宜的模型,或者做 model routing。 但这篇论文提醒了一个更容易被忽略的地方: Agent 真正烧钱的,是整个执行循环。 一次 Agent 任务里,可能包含多轮对话、工具调用、上下文回放、历史压缩、重试、等待、子任务委派。 这些东西怎么组织,决定权大多在 harness / orchestration layer 这一层。 论文把这个现象叫做 token maxing: 模型单 token 价格在下降,但 Agent 为了完成更复杂的任务,会塞进更多上下文、更多工具信息、更多 reasoning trace。最后每个任务消耗的 token 反而越来越多。 实验设计很直接。 作者用 22 个企业 Agent 任务,测试 6 个模型,包括 Claude、Gemini、Qwen、GLM、Palmyra 等。然后只替换 orchestration layer:一边是普通 production agent loop,一边是 Writer Agent Harness。 结果很明显: 换上 Writer Agent Harness 后,平均任务成本从 $0.21 降到 $0.12,token 从 14.2k 降到 8.8k,耗时从 48 秒降到 27 秒;任务质量基本持平,quality per dollar 提升 82%。 这个差异主要来自几个很工程化的设计: 稳定内容放进可缓存 prefix,变化内容放在 tail;旧历史做结构化压缩;大块上下文尽量 offload;等待和重试阶段要有预算控制。 这篇最有意思的地方在于,它把 Agent 成本问题从「选哪个模型」推进到了「怎么组织一次任务执行」。 这对 AI coding、Research Agent、多智能体系统都很关键。 之后做 Agent,不能只盯模型榜单。真正拉开差距的地方,会越来越多地出现在 context engineering、tool exposure、cache discipline、failure governance 和 workflow orchestration 这些层面。 Agent 越复杂,harness 越像基础设施。 模型决定能力上限,harness 决定接近这个上限要花多少钱。 📎 arxiv:
显示更多
0
4
86
19
转发到社区
不要让同一个 Agent 既写代码,又宣布自己写对了。 这是 Agent Loop 里很危险的设计。 更稳的是 Maker / Checker 分离: Maker 负责改代码、补文档、生成方案。 Checker 负责跑测试、查 diff、对照验收标准、挑错。 如果 Checker 不通过,Maker 再修。 如果连续失败 2-3 次,就停下来交给人。 生产自动化的关键不是“更自动”,而是“自检失败时会刹车”。
显示更多
一个适合交给 Agent Loop 的目标,最好满足 4 个条件: 1. 能被机器验证 2. 有明确完成标准 3. 有失败后的处理方式 4. 有不能越界的边界条件 错误的目标: 把这个应用优化一下。 好目标: 让 `test/auth` 全部通过; `tsc --noEmit` 零报错; `npm run lint` 零违规; 不修改数据库 schema。 差别不在模型,差别在你有没有把“做好”翻译成“可验证”。
显示更多
DeepSeek 招 Agent Harness 研究员,能是世界范围内第一次招聘“Harness研究员” ● 招聘岗位:Agent Harness 研究员(实习/全职) ● 工作性质:全职 | 实习 ● 工作地点:浙江·杭州市 / 北京市 ================================ 【团队使命】 Model + Harness = Agent 我们正在把 DeepSeek 的前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。 你将加入 Harness 团队,与研究员、工程师、产品经理紧密协作,探索 Harness 领域的研究前沿,定义 DeepSeek 对 Harness 的理解。 ================================ 【主要职责】 - 前沿创新:与 Harness 团队的研究员与工程师深度沟通、紧密合作,共同定义和实现 Harness 领域基于模型能力的前沿创新,包括但不限于上下文管理、长期记忆、Subagent 与 Multi-Agent、自进化 Agent 等领域。 - 深度适配:与模型训练团队的研究员与工程师深度沟通与合作,实现模型与 Harness 的共同进化,从 Harness 的角度实现 DeepSeek 的 Harness 与模型的深度适配。 - 评测构建:提出 Harness 领域的基准测试与评测方法,构建评测基准数据和制定数据标注策略,从 Harness 的角度研究并优化 Agent 在各领域的智能水平。 - 真实迭代:以真实世界的任务作为 Harness 研究的重要反馈源,设计相关数据与实验,持续迭代 Agent 能力在真实使用场景下的表现。 - 用户优化:基于团队收集到的用户反馈,从 Harness 的角度研究并优化为最广大用户解决真实场景问题的能力。 ================================ 【任职要求】 - 科研背景:硕士学历及以上,2年以上计算机科学或相关领域的科研经验,水平过硬,眼界广阔,有科研品味;在计算机科学领域具有含金量的论文发表(特别优秀候选人可放宽学历及年限要求)。 - 独立推进:面对问题能够独立分析并提出自己的 idea,具备从 0 到 1 推动研究的能力;能够快速将想法转化为可运行的原型,具备高效的实验迭代能力。 - 全栈开发:熟练使用 AI Agent 工具进行软件开发,在软件开发领域具有极强的学习能力;能够在 AI 辅助下,在没有直接经验的领域(如语言、技术、框架等)进行研究目的的编程工作。 - 重度用户:是 Agent 产品的高强度用户,对 Agent Harness 的开发和研究有极大的热情,对模型行为有品味有判断力;深度使用过代码类及通用类 Agent 产品,并将相关产品的使用融入到自己的工作和生活中。 - 知识储备:熟悉 LLM 以及 Agent 基本机制及其技术原理(包括 LLM API、KV Cache、Agent Loop、Tool Use、Reasoning、Planning、Skills、MCP、Memory、Subagent、Multi-Agent 等);对 Prompt Engineering、Context Engineering、Harness Engineering 等课题有深入的理解。 - 沟通能力:具备良好的中文沟通能力。 ================================ 【加分项】 - AI 领域相关科研经验,或 AI 行业的研究员任职经验。 - 拥有个人开源作品,或对开源社区有深度贡献。 - 在计算机科学领域、编程领域、或数据科学领域获得过具有含金量的比赛奖项。 - 其它超乎常人的与此工作相关的才能。
显示更多
0
25
207
37
转发到社区
前两天踩了个坑,使用 Agent Loop时特别要注意 Agent 版本的升级,尤其是时间循环类型的Loop。 我有个美股日报的定时任务,每天早上 8 点自动跑,出一份前一夜的行情加持仓复盘。结果它连着两天没出报告,我一开始压根没发现,因为我手动重试是能够成功的,定时 Loop 没有报错告警,就只是默默执行失败。 排查下来发现根因有点意思,前几天 Claude Code 自动升级到了 2.1.209。升级之后,凡是被 launchd(macOS 管定时任务的那套)拉起来跑的 claude,一启动就崩,直接 EPERM 退出。 最本质的原因就在在有没有 TTY。 TTY 你可以理解成终端。你在 Terminal 里敲命令,背后就连着一个 TTY,程序能感知到有个人正坐在终端前面跟它交互。而 launchd、cron 这种后台把程序拉起来跑的时候是没有 TTY 的,没人盯着,纯自动。 2.1.209 大概在启动时做了个动作,依赖了 TTY 或者某种交互式终端上下文(我从现象反推的)。这个动作在没有 TTY 的后台环境里被系统拒了,报 EPERM,也就是 operation not permitted,操作不被允许,于是还没干正事就先崩了。我手动跑有 TTY,所以根本感觉不到这个坑。 影响面还是挺大的,我所有靠后台无人值守跑 claude 的任务,日报、周报,升级后全中招。而且因为我的兜底逻辑没认出这个新错误码,它是静默失败,没告警、没弹窗,只有哪天想起来看对应的看板,才发现报告已经空了好几天。 修复很简单,把定时任务用的 claude 版本回退到 2.1.208,我自己交互用的还是最新版,不受影响。
显示更多