本地模型+ Pi Agent,才是本地模型正确打开方式🔥
今天看到Pi + 本地 Qwen3.8 模型的测试视频 ,我才发现,对于本地 Agent 来说,上下文的大小可能是成为下一个讨论的热点。
虽然本地模型虽然没有按 Token 收费,但是因为硬件限制,上下文可能只能支持256k,甚至64K。
总结下来:
1、上下文越长,等待时间越久
每次 Agent 调模型,都要先处理前面的上下文。云端可能只是账单变贵,本地模型则很直接,Prompt 越长,Prefill 越慢,你能明显感觉到 Agent 越聊越卡。
2、上下文还会真实占用你的硬件资源
长期 Session、Tool Result、各种插件说明全部塞进去,最后吃的不只是 Token,还有 KV Cache、内存和显存。
尤其本地跑 Qwen3.8-27B 这种模型,本身硬件资源就没有云端那么富裕,Pi 默认 Prompt 短、工具少的优势反而会被放大。
3、插件越多,本地模型反而越容易吃亏
Pi 最开始只有很少的工具,Skill 又是按需加载,这种设计以前看起来只是“极简”。
但是放到本地模型场景,你会发现这些无关的 Tool Schema、日志、网页内容,少一点就意味着模型每一轮少处理一点垃圾数据。
4、省 Token 在本地其实变成了省时间
在本地因为Token免费了,我们更在意的应该是时间的消耗,因为如果运行的太慢,时间消耗就是一种成本了。
以前是:省 Token = 省钱,但是现在本地模型:
省 Token = 更低延迟 + 更少资源占用 + 更大的有效 Context + Agent 可以工作得更久。
所以最近看 Qwen3.8 和 Pi 的时候,我反而越来越理解 Pi 为什么一直在 上下文上做减法。
以前只知道它有极简的设计和高效的缓存,现在回过头来看,这套设计天然就契合本地模型的现实情况。
以后真的到了每家每户都可以自己在家部署自己的大模型,那我们就需要想怎么在有限的算力前提下,越快完成自己的需求越好。
显示更多
Pi 里模型不用多,三档就够。
1、GPT 5.6 Sol
主力。改代码、看结构、排问题、任务稍微绕一点,都先丢给它。它不是最便宜的,但少返工。我现在不会一上来就用免费模型硬刚复杂活,省那点钱,后面改的时间更贵。
2、DeepSeek
日常整理、批量改文件、写清单、重复性活,Flash 就够;要推理、要对齐逻辑,再上 Pro。Pi 的 Context 干净,接 DeepSeek 缓存和账单都更好看。能用这档解决的,就别把 Sol 拉来搬砖。
3、OpenRouter
免费额度和刚出的新模型从这进 Pi。新模型先跑两三个小任务:整理一份纪要、改几个文件名、读一个小仓库。手感对了再进正式项目;不对就换,不心疼。别拿还没验证的模型改你真正在用的代码。
具体建议就一条:先把默认使用好的模型当主力,便宜模型干杂活尤其是重复性高的劳动。
最后保留一个 OpenRouter 来作为兜底和白嫖,防止主力模型不可用不能排查问题,最主要是免费模型量大管饱,测试还是体验都很不错。
显示更多