同一个模型,换一个Agent Harness,就像换了一个模型?
最近我一直在看 Pi + Qwen3.8 这类本地模型实测,越看越觉得,以前把 Agent 能力都归因到模型本身,可能一开始就想错了。
模型肯定是重要的,但是现在 Harness 在AI的使用当中,起到越来越关键性的作用了。
1、模型每一轮看到的东西,本来就不一样
Pi 默认工具很少,System Prompt 也比较克制,很多能力都是按需加载。
换成另外一个 Harness,可能默认就给模型塞进去十几个 Tool、更多说明、更多状态。
对于云端大模型,这可能只是多一点 Token。
但是对于 Qwen3.8-27B 这种本地模型,额外的 Tool Schema、Context 和选择,本身就有可能改变它的推理方式。
2、工具设计不好,模型再聪明也没用
我看到一个挺有意思的 Qwen 实测,同一个模型,最开始只给 Bash,让它自己用 sed、Python 去改文件,SWE-bench Pro 的 pass
@1 只有 28% 左右。
后面只是把编辑工具换成更适合代码修改的 str_replace,再优化测试方式,成绩直接跑到了 50% 左右。
模型权重一行没变。
变的是它手里的工具。
这其实很像你让同一个人干活,一个人手里只有锤子,另一个人有完整工具箱,最后结果当然会完全不一样。
3、Agent 真正拉开差距的,往往是第一次犯错以后
Tool Call 失败以后返回什么、日志截多少、要不要 Retry、什么时候继续、什么时候停,这些事情模型自己其实控制不了。
Harness 每一次把执行结果重新塞回 Context,本质上都在重新告诉模型:
“你刚才做了什么,现在发生了什么。”
所以 Harness 其实一直在影响模型下一步怎么判断。
4、Context 管理也会直接改变 Agent 能坚持多久
同样 100K 上下文,一个 Harness 可能很早就开始 Compaction,另一个还能继续保留大量原始历史。
一边后面看到的是完整 Tool Result、代码和之前的判断,另一边已经只剩 Summary。
到了这里,即使两边用的是同一个模型,其实也已经不是在解决同一个问题了。
我自己也是一个Agent的重度用户,平时像Codex、Claude Code、Pi Agent、Deepseek-Harness、Hermes这些都有使用过。
但是很多时候同一个模型在不同的Agent里面,我是真的感觉不一样,有的能力更强,有的反而更削弱了。
所以这方面以后会越来越重要。