註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 agent
agent 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 agent 的搜尋結果
Agent 出错以后,到底该修模型,还是修 harness? Scale AI 这篇《Model or Harness?》专门研究 Agent 的故障定位。 今天的 Agent 已经是一个复杂系统:模型之外,还有 Context、Memory、Tool、Grader、用户和运行环境。最后看到的失败结果相同,背后的原因可能完全不同。 比如 Agent 忽略了一条早期指令。 可能是上下文压缩把它删掉了,需要改 harness;也可能信息一直都在,只是模型没有正确使用,这时才该训练模型。 论文整理了 41 类常见失败,并把每个问题定位到具体的「组件交互 + 责任方」。 这样一次失败就能进一步回答: 该做模型 post-training,改 context / memory / tool,还是重新设计环境和评测。 作者还让不同前沿模型独立给失败案例分类,最好的结果与人工标注达到 Cohen’s κ = 0.76,说明这套分类有一定一致性。 我觉得这篇很适合现在的 Agent 发展阶段。 随着 harness 越做越复杂,「Agent 失败了」这个结论已经太粗了。 真正有用的 debugging,要继续追到第一处无法恢复的错误,再决定到底该修哪一层。 📎 arxiv:
顯示更多
0
83
446
76
轉發到社區
Agent Plugins 是由 OpenAI、AWS、Cursor、GitHub、VS Code 和 Vercel 等厂商共同推动的开放标准,把 Agent Skills 和 MCP 服务器配置打包成一次构建、多个 AI Agent 客户端间通用的可移植插件。
顯示更多
Agent 连续工作几个小时,真正难的是中途失败后,还能准确知道自己做到哪了。 阿里高德团队开源的 LongHorizon-Harness,专门解决长时任务中的状态漂移和错误累积。 它把执行过程拆成 Manage–Execute–Audit 循环: Manager 根据已经验证的进度安排下一步;Executor 在全新上下文中操作桌面、浏览器或命令行;Auditor 再独立检查真实环境。 只有审计确认的结果,才会进入长期任务状态。遇到操作失败、上下文刷新或交付不完整时,Agent 可以保留已完成的部分,从缺口继续推进。 它也不绑定具体模型和后端,可以接入 Claude、GPT、Qwen,以及 Claude Code、Codex CLI、OpenClaw 等工具。 在相同的 Qwen 3.7-Plus 与 Claude Code 配置下,GUI 与 CLI 混合任务通过率从 51.8% 提升到 80.7%;OSWorld 完整完成率从 2.8% 提升到 8.3%;Terminal-Bench 成功率从 69.7% 提升到 77.2%,同时减少了 24% 的 token。 我觉得这篇最有意思的地方在于,它把长时能力的重点,从让一个会话持续运行,推进到了让每段进度都可验证、可恢复,也能可靠地交给下一轮。 模型决定单步能力,harness 决定这些步骤最后能不能拼成一个完整交付。 📎 arxiv:
顯示更多
Agent 记忆最危险的时候,往往是它太相信过去。 很多 Memory Agent 找到相似经验后,会直接把它塞进上下文。但任务相似,不代表当前状态相同,旧经验有时反而会把决策带偏。 这篇论文提出 MemHarness,把 Agent 使用记忆的过程改成三步: 先检索过去经验,再结合当前状态进行判断和重构,最后才生成行动。 有用的部分会被保留,不匹配的内容会被修改或直接丢弃。整个能力通过 GRPO 和任务奖励端到端训练,不需要额外标注重构过程。 基于 Qwen2.5-7B,MemHarness 在 ALFWorld 和 WebShop 上分别达到 85.2% 和 75.6% 的成功率,比纯 GRPO 提升 8.8 和 9.5 个百分点。 在未见过的环境中,它也达到 85.9%,而直接回放原始记忆只有 76.3%。这说明记忆用错了,确实可能比没有记忆更糟。 这篇工作把 Agent Memory 从「保存过去」推进到了「根据现在重新理解过去」。 真正可靠的记忆系统,需要知道哪些经验值得保留,哪些需要改写,哪些应该及时忘掉。 📎 arxiv:
顯示更多
0
42
119
17
轉發到社區
Agent 开发全栈工程师有多抢手😂
Agent 相关词汇 Token 计费单位。 大概一个汉字 1–2 个 token,一个英文单词约 1 个。所有价格都按 token 算。 上下文窗口(context window) 一次调用最多能塞多少 token。比如「1M 上下文」就是最多塞 100 万 token。 工具调用(tool call) 模型不能执行任何东西。它只会吐文字。所以当它要执行命令时,它其实是"说"了一句:「我想执行 ls -la」。 然后是 harness 接住这句话,真的去你机器上执行,把结果贴回对话里,再连同全部历史发给模型。 这一来一回叫一次 tool call。模型负责说,harness 负责做。 Schema(工具说明书) 告诉模型「你有哪些工具可用、每个工具要什么参数」。这份说明书就叫 schema。 Agent Loop(智能体循环) 把上面那个过程转起来: 发请求(全部历史 + 工具说明书) → 模型说「我要调 X 工具」 → harness 真的执行 X → 结果贴回历史 → 再发请求(历史又长了一截) → ...循环,直到模型说「做完了」 这个循环就是 agent 的本体。 压缩(compaction) 对话太长,超过上下文窗口了,就得把老内容摘要掉腾地方。 代价是:前缀变了,缓存归零。 reasoning_content(思考内容) 推理模型回答前会先"想"一大段。这段思考通常直接被丢掉。 MCP 一个统一接口标准,让第三方工具能被任何 agent 调用。类比 USB:以前每个工具要为每个 agent 单独适配,有了 MCP 就是插上就能用。 上面所有这些东西的实现加起来,就是 harness。
顯示更多
agent 训练,也能蒸蒸日上,大幅降低agent训练成本 微软这篇 ReOPD,专治 on-policy 蒸馏太贵 以前每更新一步,学生都得真去环境里跑一遍、再查一次老师,又慢又烧钱 环境越多,钱包越薄 新做法:老师轨迹采一次,存成离线「前缀」池,学生训练直接回放,全程不碰真实环境 一次蒸够,反复用 效果(Qwen3-4B 学 8B): · 数学+Python:45 → 53.7,每步快 4.2 倍 · 搜索:打平 OPD,每步快 9.1 倍 · 学生训练全程零工具调用 蒸的省钱(不是错别字) 🔗 HuggingFace 论文,链接:
顯示更多
Agentic AI带来的应用层爆发式增长,让数据库的需求激增,对超大容量的 RECC 的需求极强 64GDDR4 内存从去年的 1000 涨到现在的 6000,悲剧的是供应端货量近乎枯竭。
顯示更多
Agent 做点可视化工具太舒服了。
agent 会惩罚每一个没有管理能力,却企图让它下一个金蛋的人。 真能给你烧出一个你不想付款的账单啊,淦