1M 上下文时代,使用 Coding Agent 省钱计划
先说结论,怎么省钱呢,其实就是做好会话管理。、
1M 上下文是什么意思?就是在一次会话(session)里,模型能看见的大概 100 万个 token。最近发布的 GPT-5.5、Claude 4.6/4.7、Qwen 3.6-Plus、DeepSeek V4 等等都是原生支持 1M 上下文,这里面有几个关键的概念:
第一,在 Claude Code 这类 Coding Agent 里,上下文不是一句两句对话,而是一个大杂烩:系统提示词、长期记忆、调用过的工具、工具的输出、读过的代码文件、终端日志、以及你给它的各种指令,统统都会塞进去。模型每回答一次,都是在这一大坨信息里“分配注意力”,决定该看什么、不看什么。
第二,1 百万意味着什么?以前咱们都用 8K、32K、200K 这种上下文窗口,现在是 1M token,像什么呢?原来你桌上摊几份文件几本书就满了,现在你有了一个很大的仓库,全部代码库、长日志、好几轮调试过程,都可以同时装进去,模型一眼看穿,这就是所谓“1M 上下文时代”。
但仓库再大,有两个本质没变:1、大模型会被噪音干扰;2、你的钱会随着大量 Token 流失,达到一种花 Token 如流水的感脚。
很多人用硅谷的顶级模型,没跟人家寒暄几句呢, 5 小时的额度已经用得干干净净,这真是人生最大的悲剧:任务没做完,Token 花完 liao……
顯示更多