註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 AgentLoop
AgentLoop 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 AgentLoop 的搜尋結果
推荐这个工具,autoresearch——一个 Claude Code skill。 把 Karpathy 的 630 行 Python 自主实验脚本泛化成了 14 个命令的通用 agent 循环:你给一个目标和指标,它自主迭代到完成为止。 核心循环 LOOP (N 轮或直到完成): 1. 审视当前状态 + git 历史 + 结果日志 2. 选择下一个改动(基于之前什么有效、什么失败、什么还没试) 3. 做一次聚焦的改动 4. Git commit(验证之前先提交) 5. 运行机械验证(测试、benchmark、分数) 6. 如果改进 → 保留。如果变差 → git revert。如果崩溃 → 修复或跳过。 7. 记录结果 8. 重复 每次改进叠加。每次失败自动回滚。进度记录为 TSV 格式。 v2.2.0 新增:自主编排器 不再需要手动设置 Goal / Metric / Verify。直接输入一个自然语言目标,编排器自动分类目标、推导 Success 谓词、与你确认一次,然后在 14 个子命令之间自主编排,直到完成。 14 个命令 | 命令 | 用途 | |------|------| | /autoresearch | 核心迭代循环,或自主编排模式 | | /autoresearch:plan | 把目标转化为验证过的配置 | | /autoresearch:debug | 假设驱动的自主 bug 猎手 | | /autoresearch:fix | 逐个击破错误直到归零 | | /autoresearch:security | STRIDE + OWASP 安全审计 | | /autoresearch:ship | 8 阶段通用发布工作流 | | /autoresearch:scenario | 12 个维度的边缘案例探索 | | /autoresearch:predict | 5 个专家角色辩论预测 | | /autoresearch:learn | 自主文档生成引擎 | | /autoresearch:reason | 对抗性辩论精炼(盲审团裁定) | | /autoresearch:probe | 8 个角色对抗性需求审问 | | /autoresearch:improve | 产品改进研究 + PRD 生成 | | /autoresearch:evals | 结果分析:趋势、平台期、收敛信号 | | /autoresearch:regression | 稳定性门禁:baseline vs candidate → STABLE/UNSTABLE | 另有 Guard 机制:在优化某个指标时设置"这个命令必须始终通过"的安全网。 安装 npx skills add uditgoenka/autoresearch 然后重启 Claude Code,14 个命令全部可用。通过 /plugin update autoresearch 升级。 v2.1 架构重写 原来的 SKILL.md 是一个 813 行的单体文件,每次调用消耗约 100K token。v2.1 把它拆成了一个 41 行的路由文件 + 12 个自包含命令文件(每个 94-120 行,每次调用约 5-8K token)。相同功能面,token 减少 95%。 9 个安全 hook 默认全部启用,可单独关闭。覆盖:阻止 node_modules 等目录进入上下文、阻止读取 .env/SSH 密钥、阻止 force-push/rm -rf、压缩后重新注入上下文、子 agent 状态感知等。 GitHub: 参考: #ClaudeCode# #Skill# #AgentLoop#
顯示更多
推荐这个工具,autoresearch——一个 Claude Code skill。 把 Karpathy 的 630 行 Python 自主实验脚本泛化成了 14 个命令的通用 agent 循环:你给一个目标和指标,它自主迭代到完成为止。 autoresearch 是一个 Claude Code skill,把 Karpathy 的 autoresearch 概念(一个 630 行的 Python 脚本,能自主跑通宵 ML 实验)泛化到了任意领域。支持 Claude Code、OpenCode 和 OpenAI Codex。MIT 开源。 核心循环 LOOP (N 轮或直到完成): 1. 审视当前状态 + git 历史 + 结果日志 2. 选择下一个改动(基于之前什么有效、什么失败、什么还没试) 3. 做一次聚焦的改动 4. Git commit(验证之前先提交) 5. 运行机械验证(测试、benchmark、分数) 6. 如果改进 → 保留。如果变差 → git revert。如果崩溃 → 修复或跳过。 7. 记录结果 8. 重复 每次改进叠加。每次失败自动回滚。进度记录为 TSV 格式。 v2.2.0 新增:自主编排器 不再需要手动设置 Goal / Metric / Verify。直接输入一个自然语言目标,编排器自动分类目标、推导 Success 谓词、与你确认一次,然后在 14 个子命令之间自主编排,直到完成。 14 个命令 | 命令 | 用途 | |------|------| | /autoresearch | 核心迭代循环,或自主编排模式 | | /autoresearch:plan | 把目标转化为验证过的配置 | | /autoresearch:debug | 假设驱动的自主 bug 猎手 | | /autoresearch:fix | 逐个击破错误直到归零 | | /autoresearch:security | STRIDE + OWASP 安全审计 | | /autoresearch:ship | 8 阶段通用发布工作流 | | /autoresearch:scenario | 12 个维度的边缘案例探索 | | /autoresearch:predict | 5 个专家角色辩论预测 | | /autoresearch:learn | 自主文档生成引擎 | | /autoresearch:reason | 对抗性辩论精炼(盲审团裁定) | | /autoresearch:probe | 8 个角色对抗性需求审问 | | /autoresearch:improve | 产品改进研究 + PRD 生成 | | /autoresearch:evals | 结果分析:趋势、平台期、收敛信号 | | /autoresearch:regression | 稳定性门禁:baseline vs candidate → STABLE/UNSTABLE | 另有 Guard 机制:在优化某个指标时设置"这个命令必须始终通过"的安全网。 安装 npx skills add uditgoenka/autoresearch 然后重启 Claude Code,14 个命令全部可用。通过 /plugin update autoresearch 升级。 v2.1 架构重写 原来的 SKILL.md 是一个 813 行的单体文件,每次调用消耗约 100K token。v2.1 把它拆成了一个 41 行的路由文件 + 12 个自包含命令文件(每个 94-120 行,每次调用约 5-8K token)。相同功能面,token 减少 95%。 9 个安全 hook 默认全部启用,可单独关闭。覆盖:阻止 node_modules 等目录进入上下文、阻止读取 .env/SSH 密钥、阻止 force-push/rm -rf、压缩后重新注入上下文、子 agent 状态感知等。 GitHub: 参考: #ClaudeCode# #Skill# #AgentLoop#
顯示更多
给大家带来 Flash 系列模型横评! 各个厂商除了旗舰级别模型, 也都有Flash级别的模型, 而这些模型的定位主要都是多智能体系统的驱动模型和RAG系统的驱动模型. 那么现有这些Flash模型应该怎么选? 给大家带来本篇评测! 本次主要从 Agent Loop 迭代能力, Agent 能力, 前端, 后端, 空间理解, 美学, 性价比等多个角度评测了 Gemini-3.5-Flash, Step-3.7-Flash, DeepSeek-V4-Flash 这三个模型. 从测试来看, Gemini-3.5-Flash 更适合干"漂亮活", 比如前端页面, 建模等. 而 Step-3.7-Flash 则极具性价比, 在Agent测试中取得了比旗舰模型还要高的Token效率(用最少的token干最多的事情). 所以特别适合用在Agent框架中(比如OpenClaw或者Hermes), 或者复杂的Agent系统中用来做驱动模型. DeepSeek-V4-Flash 则后端能力很不错, 很适合用来写脚本, 甚至给服务器安装一个 DeepSeek-V4-Flash 驱动的 ClaudeCode, 用来 AI-Ops. #flash模型# #step37flash# #deepseekv4flash# #gemini35flash# #AgentLoop#
顯示更多
Agent 相关词汇 Token 计费单位。 大概一个汉字 1–2 个 token,一个英文单词约 1 个。所有价格都按 token 算。 上下文窗口(context window) 一次调用最多能塞多少 token。比如「1M 上下文」就是最多塞 100 万 token。 工具调用(tool call) 模型不能执行任何东西。它只会吐文字。所以当它要执行命令时,它其实是"说"了一句:「我想执行 ls -la」。 然后是 harness 接住这句话,真的去你机器上执行,把结果贴回对话里,再连同全部历史发给模型。 这一来一回叫一次 tool call。模型负责说,harness 负责做。 Schema(工具说明书) 告诉模型「你有哪些工具可用、每个工具要什么参数」。这份说明书就叫 schema。 Agent Loop(智能体循环) 把上面那个过程转起来: 发请求(全部历史 + 工具说明书) → 模型说「我要调 X 工具」 → harness 真的执行 X → 结果贴回历史 → 再发请求(历史又长了一截) → ...循环,直到模型说「做完了」 这个循环就是 agent 的本体。 压缩(compaction) 对话太长,超过上下文窗口了,就得把老内容摘要掉腾地方。 代价是:前缀变了,缓存归零。 reasoning_content(思考内容) 推理模型回答前会先"想"一大段。这段思考通常直接被丢掉。 MCP 一个统一接口标准,让第三方工具能被任何 agent 调用。类比 USB:以前每个工具要为每个 agent 单独适配,有了 MCP 就是插上就能用。 上面所有这些东西的实现加起来,就是 harness。
顯示更多
Agent Loop 里最容易被低估的是 State。 没有外部状态,Agent 每次醒来都像失忆: 昨天忽略过的噪音,今天又处理一遍。 上轮失败的原因,这轮又踩一次。 已经等人工确认的 PR,又被重新改。 所以成熟 loop 一定要有类似 STATE.md 的东西。 它不需要复杂,先记 4 件事就够: 上次运行时间 正在处理什么 哪些暂时忽略 什么情况必须升级给人
顯示更多
大师:Agent Loop 怎么写? 我:很简单。 while (true) { const result = await llm(messages) if (result.toolCall) { const output = await executeTool(result.toolCall) messages.push(output) continue } return result } 大师:什么时候停? 我:模型觉得任务完成的时候。 大师:它要是一直觉得差一点呢? 我:…… 大师:跑了 50 轮,烧了 100 万 Token,Tool 没报错,模型也没报错,就是一直在干活呢? 我:那得加 maxTurns。 大师:所以谁拥有最终终止权? 我:Runtime。 大师:对。 模型可以提出: Done。 但 Runtime 还得验证: Really Done? 写代码就跑 Tests。 生成数据就过 Schema。 执行工作流就检查最终 State。 Model completion ≠ Task completion。 我:如果模型一直不说 Done 呢? 大师:Runtime 还有: maxTurns、Timeout、Budget、Cancellation、Policy。 任何一条触发,都可以: Must Stop。 我:不需要模型同意? 大师:你关服务器的时候,还准备先征求模型意见? 我:…… 所以 while (true) 本身没问题? 大师:当然。 真正的问题不是循环。 而是: 模型可以提出结束。 Runtime 验证是不是真的结束。 Runtime 还必须拥有强制结束的权力。 我:哪怕模型觉得再来一轮就好了? 大师看了我一眼。 尤其是这种时候。 我:为什么? 大师: 因为所有失控的 Agent,在最后一轮之前,都觉得自己再来一轮就好了。
顯示更多
现在很多人优化 Agent 成本,第一反应是: 换更便宜的模型,或者做 model routing。 但这篇论文提醒了一个更容易被忽略的地方: Agent 真正烧钱的,是整个执行循环。 一次 Agent 任务里,可能包含多轮对话、工具调用、上下文回放、历史压缩、重试、等待、子任务委派。 这些东西怎么组织,决定权大多在 harness / orchestration layer 这一层。 论文把这个现象叫做 token maxing: 模型单 token 价格在下降,但 Agent 为了完成更复杂的任务,会塞进更多上下文、更多工具信息、更多 reasoning trace。最后每个任务消耗的 token 反而越来越多。 实验设计很直接。 作者用 22 个企业 Agent 任务,测试 6 个模型,包括 Claude、Gemini、Qwen、GLM、Palmyra 等。然后只替换 orchestration layer:一边是普通 production agent loop,一边是 Writer Agent Harness。 结果很明显: 换上 Writer Agent Harness 后,平均任务成本从 $0.21 降到 $0.12,token 从 14.2k 降到 8.8k,耗时从 48 秒降到 27 秒;任务质量基本持平,quality per dollar 提升 82%。 这个差异主要来自几个很工程化的设计: 稳定内容放进可缓存 prefix,变化内容放在 tail;旧历史做结构化压缩;大块上下文尽量 offload;等待和重试阶段要有预算控制。 这篇最有意思的地方在于,它把 Agent 成本问题从「选哪个模型」推进到了「怎么组织一次任务执行」。 这对 AI coding、Research Agent、多智能体系统都很关键。 之后做 Agent,不能只盯模型榜单。真正拉开差距的地方,会越来越多地出现在 context engineering、tool exposure、cache discipline、failure governance 和 workflow orchestration 这些层面。 Agent 越复杂,harness 越像基础设施。 模型决定能力上限,harness 决定接近这个上限要花多少钱。 📎 arxiv:
顯示更多
0
4
86
19
轉發到社區
不要让同一个 Agent 既写代码,又宣布自己写对了。 这是 Agent Loop 里很危险的设计。 更稳的是 Maker / Checker 分离: Maker 负责改代码、补文档、生成方案。 Checker 负责跑测试、查 diff、对照验收标准、挑错。 如果 Checker 不通过,Maker 再修。 如果连续失败 2-3 次,就停下来交给人。 生产自动化的关键不是“更自动”,而是“自检失败时会刹车”。
顯示更多
一个适合交给 Agent Loop 的目标,最好满足 4 个条件: 1. 能被机器验证 2. 有明确完成标准 3. 有失败后的处理方式 4. 有不能越界的边界条件 错误的目标: 把这个应用优化一下。 好目标: 让 `test/auth` 全部通过; `tsc --noEmit` 零报错; `npm run lint` 零违规; 不修改数据库 schema。 差别不在模型,差别在你有没有把“做好”翻译成“可验证”。
顯示更多
DeepSeek 招 Agent Harness 研究员,能是世界范围内第一次招聘“Harness研究员” ● 招聘岗位:Agent Harness 研究员(实习/全职) ● 工作性质:全职 | 实习 ● 工作地点:浙江·杭州市 / 北京市 ================================ 【团队使命】 Model + Harness = Agent 我们正在把 DeepSeek 的前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。 你将加入 Harness 团队,与研究员、工程师、产品经理紧密协作,探索 Harness 领域的研究前沿,定义 DeepSeek 对 Harness 的理解。 ================================ 【主要职责】 - 前沿创新:与 Harness 团队的研究员与工程师深度沟通、紧密合作,共同定义和实现 Harness 领域基于模型能力的前沿创新,包括但不限于上下文管理、长期记忆、Subagent 与 Multi-Agent、自进化 Agent 等领域。 - 深度适配:与模型训练团队的研究员与工程师深度沟通与合作,实现模型与 Harness 的共同进化,从 Harness 的角度实现 DeepSeek 的 Harness 与模型的深度适配。 - 评测构建:提出 Harness 领域的基准测试与评测方法,构建评测基准数据和制定数据标注策略,从 Harness 的角度研究并优化 Agent 在各领域的智能水平。 - 真实迭代:以真实世界的任务作为 Harness 研究的重要反馈源,设计相关数据与实验,持续迭代 Agent 能力在真实使用场景下的表现。 - 用户优化:基于团队收集到的用户反馈,从 Harness 的角度研究并优化为最广大用户解决真实场景问题的能力。 ================================ 【任职要求】 - 科研背景:硕士学历及以上,2年以上计算机科学或相关领域的科研经验,水平过硬,眼界广阔,有科研品味;在计算机科学领域具有含金量的论文发表(特别优秀候选人可放宽学历及年限要求)。 - 独立推进:面对问题能够独立分析并提出自己的 idea,具备从 0 到 1 推动研究的能力;能够快速将想法转化为可运行的原型,具备高效的实验迭代能力。 - 全栈开发:熟练使用 AI Agent 工具进行软件开发,在软件开发领域具有极强的学习能力;能够在 AI 辅助下,在没有直接经验的领域(如语言、技术、框架等)进行研究目的的编程工作。 - 重度用户:是 Agent 产品的高强度用户,对 Agent Harness 的开发和研究有极大的热情,对模型行为有品味有判断力;深度使用过代码类及通用类 Agent 产品,并将相关产品的使用融入到自己的工作和生活中。 - 知识储备:熟悉 LLM 以及 Agent 基本机制及其技术原理(包括 LLM API、KV Cache、Agent Loop、Tool Use、Reasoning、Planning、Skills、MCP、Memory、Subagent、Multi-Agent 等);对 Prompt Engineering、Context Engineering、Harness Engineering 等课题有深入的理解。 - 沟通能力:具备良好的中文沟通能力。 ================================ 【加分项】 - AI 领域相关科研经验,或 AI 行业的研究员任职经验。 - 拥有个人开源作品,或对开源社区有深度贡献。 - 在计算机科学领域、编程领域、或数据科学领域获得过具有含金量的比赛奖项。 - 其它超乎常人的与此工作相关的才能。
顯示更多
0
25
207
37
轉發到社區