你的大模型每天都在重复处理同一批上下文,
而你还在为这些重复计算持续付费。
系统提示词、长文档、知识库片段、Agent 历史记录——
明明刚算过一次,
下一次请求还是从头重算。
模型单价虽然在降,
但 Agent 不断重发长上下文,账单照样往上涨。
这个开源项目就是专门解决这件事的:
LMCache
它是一个面向大模型推理的 KV Cache 管理层,
目前可以接入:
• vLLM
• SGLang
• TensorRT-LLM
原理很直接:
把已经计算过的 KV Cache 保存下来。
后面遇到相同或可复用的上下文,
直接读取缓存,
不用再让模型从第一个 Token 重新计算。
几个重点:
1. 重复上下文不再反复计算
特别适合长系统提示词、RAG 文档和多轮 Agent 任务。
2. 缓存服务独立运行
可以单独进程管理缓存,
尽量减少对模型推理资源的占用。
3. 支持跨请求复用
不仅是单次会话内加速,
还可以让不同请求复用已有前缀缓存。
项目给出的测试结果显示:
在 H200 上运行 235B 模型时,
• 首 Token 延迟最高提升约 14 倍
• 解码吞吐最高提升约 4 倍
• 特定场景下成本可降低约 90%
注意:
“节省 90% Token”这个说法并不完全准确。
它主要减少的是重复上下文带来的计算、延迟和推理成本,
实际收益取决于缓存命中率、上下文重复程度和部署方式。
如果你在跑:
• 长上下文 Agent
• 固定系统提示词
• 多用户知识库问答
• RAG 服务
• 重复文档分析
• 大模型 API 网关
LMCache 很值得研究。
项目地址:
一句话总结:
以前每次请求都让模型重新读一遍,
现在把读过的内容缓存下来,
下次直接接着算。
顯示更多