注册并分享邀请链接,可获得视频播放与邀请奖励。

小墨同学
@xiaomovps
🚀 AI Spark 联合创始人之一,企业+AI 落地 🤖 Hermes Agent 重度玩家,让 Agent 真正融入生活 💰 专注搞钱,月收入破五位数 🌐 传家宝VPS站长 🧠 分享 AI、Agent、VPS 和真实副业实验
加入 September 2022
382 正在关注    8.8K 粉丝
本地模型+ Pi Agent,才是本地模型正确打开方式🔥 今天看到Pi + 本地 Qwen3.8 模型的测试视频 ,我才发现,对于本地 Agent 来说,上下文的大小可能是成为下一个讨论的热点。 虽然本地模型虽然没有按 Token 收费,但是因为硬件限制,上下文可能只能支持256k,甚至64K。 总结下来: 1、上下文越长,等待时间越久 每次 Agent 调模型,都要先处理前面的上下文。云端可能只是账单变贵,本地模型则很直接,Prompt 越长,Prefill 越慢,你能明显感觉到 Agent 越聊越卡。 2、上下文还会真实占用你的硬件资源 长期 Session、Tool Result、各种插件说明全部塞进去,最后吃的不只是 Token,还有 KV Cache、内存和显存。 尤其本地跑 Qwen3.8-27B 这种模型,本身硬件资源就没有云端那么富裕,Pi 默认 Prompt 短、工具少的优势反而会被放大。 3、插件越多,本地模型反而越容易吃亏 Pi 最开始只有很少的工具,Skill 又是按需加载,这种设计以前看起来只是“极简”。 但是放到本地模型场景,你会发现这些无关的 Tool Schema、日志、网页内容,少一点就意味着模型每一轮少处理一点垃圾数据。 4、省 Token 在本地其实变成了省时间 在本地因为Token免费了,我们更在意的应该是时间的消耗,因为如果运行的太慢,时间消耗就是一种成本了。 以前是:省 Token = 省钱,但是现在本地模型: 省 Token = 更低延迟 + 更少资源占用 + 更大的有效 Context + Agent 可以工作得更久。 所以最近看 Qwen3.8 和 Pi 的时候,我反而越来越理解 Pi 为什么一直在 上下文上做减法。 以前只知道它有极简的设计和高效的缓存,现在回过头来看,这套设计天然就契合本地模型的现实情况。 以后真的到了每家每户都可以自己在家部署自己的大模型,那我们就需要想怎么在有限的算力前提下,越快完成自己的需求越好。
显示更多
Pi 里模型不用多,三档就够。 1、GPT 5.6 Sol 主力。改代码、看结构、排问题、任务稍微绕一点,都先丢给它。它不是最便宜的,但少返工。我现在不会一上来就用免费模型硬刚复杂活,省那点钱,后面改的时间更贵。 2、DeepSeek 日常整理、批量改文件、写清单、重复性活,Flash 就够;要推理、要对齐逻辑,再上 Pro。Pi 的 Context 干净,接 DeepSeek 缓存和账单都更好看。能用这档解决的,就别把 Sol 拉来搬砖。 3、OpenRouter 免费额度和刚出的新模型从这进 Pi。新模型先跑两三个小任务:整理一份纪要、改几个文件名、读一个小仓库。手感对了再进正式项目;不对就换,不心疼。别拿还没验证的模型改你真正在用的代码。 具体建议就一条:先把默认使用好的模型当主力,便宜模型干杂活尤其是重复性高的劳动。 最后保留一个 OpenRouter 来作为兜底和白嫖,防止主力模型不可用不能排查问题,最主要是免费模型量大管饱,测试还是体验都很不错。
显示更多