同样使用 DeepSeek V4.1 Flash,只换了 DSH 版本:总 Token 多了 2.4%,费用却少了 36.6%。核心是多轮对话动态变更 System Prompt 不再导致 cache 失效。
之前一个多轮会话,中间变更了 system prompt 之后,前缀 cache 就会失效,从而花费较多。现在最新版的 DSH 配合模型,能做到多轮会话中间更新 system prompt 之后,cache 照样能命中,从而降低了花费。
我拿真实旧/新版 Harness,在 5 个固定场景里做了 20 组对比,每组都是相同的六轮任务。新版本缓存命中率从 0% 升到 88.3%; 完整会话的非缓存输入减少了 56.8%;
新版保留了已有请求前缀,让更多输入命中了缓存。
当然 codex 已经有了类似的功能,Deepseek 逐渐赶上了,无论是模型还是 Harness。
具体实验过程在评论。
显示更多