Register and share your invite link to earn from video plays and referrals.

TianjiOracle
@TianjiOracle
巨鯨異動即時追蹤 每一筆值得關注的資金流動,發生時就被看見
Joined December 2021
1 Following    24.2K Followers
你的大模型每天都在重复处理同一批上下文, 而你还在为这些重复计算持续付费。 系统提示词、长文档、知识库片段、Agent 历史记录—— 明明刚算过一次, 下一次请求还是从头重算。 模型单价虽然在降, 但 Agent 不断重发长上下文,账单照样往上涨。 这个开源项目就是专门解决这件事的: LMCache 它是一个面向大模型推理的 KV Cache 管理层, 目前可以接入: • vLLM • SGLang • TensorRT-LLM 原理很直接: 把已经计算过的 KV Cache 保存下来。 后面遇到相同或可复用的上下文, 直接读取缓存, 不用再让模型从第一个 Token 重新计算。 几个重点: 1. 重复上下文不再反复计算 特别适合长系统提示词、RAG 文档和多轮 Agent 任务。 2. 缓存服务独立运行 可以单独进程管理缓存, 尽量减少对模型推理资源的占用。 3. 支持跨请求复用 不仅是单次会话内加速, 还可以让不同请求复用已有前缀缓存。 项目给出的测试结果显示: 在 H200 上运行 235B 模型时, • 首 Token 延迟最高提升约 14 倍 • 解码吞吐最高提升约 4 倍 • 特定场景下成本可降低约 90% 注意: “节省 90% Token”这个说法并不完全准确。 它主要减少的是重复上下文带来的计算、延迟和推理成本, 实际收益取决于缓存命中率、上下文重复程度和部署方式。 如果你在跑: • 长上下文 Agent • 固定系统提示词 • 多用户知识库问答 • RAG 服务 • 重复文档分析 • 大模型 API 网关 LMCache 很值得研究。 项目地址: 一句话总结: 以前每次请求都让模型重新读一遍, 现在把读过的内容缓存下来, 下次直接接着算。
Show more