TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
RelaxView
@RelaxView
RelaxView 不只看價格,還把鏈上資金、盤面結構、智能週期與智慧模型整合在一起,幫你更快看懂市場正在發生什麼 看見異動,也看懂異動
Joined December 2021
6
Following
23.8K
Followers
RelaxView
@RelaxView
2026.07.12 04:51
你的大模型每天都在重复处理同一批上下文, 而你还在为这些重复计算持续付费。 系统提示词、长文档、知识库片段、Agent 历史记录—— 明明刚算过一次, 下一次请求还是从头重算。 模型单价虽然在降, 但 Agent 不断重发长上下文,账单照样往上涨。 这个开源项目就是专门解决这件事的: LMCache 它是一个面向大模型推理的 KV Cache 管理层, 目前可以接入: • vLLM • SGLang • TensorRT-LLM 原理很直接: 把已经计算过的 KV Cache 保存下来。 后面遇到相同或可复用的上下文, 直接读取缓存, 不用再让模型从第一个 Token 重新计算。 几个重点: 1. 重复上下文不再反复计算 特别适合长系统提示词、RAG 文档和多轮 Agent 任务。 2. 缓存服务独立运行 可以单独进程管理缓存, 尽量减少对模型推理资源的占用。 3. 支持跨请求复用 不仅是单次会话内加速, 还可以让不同请求复用已有前缀缓存。 项目给出的测试结果显示: 在 H200 上运行 235B 模型时, • 首 Token 延迟最高提升约 14 倍 • 解码吞吐最高提升约 4 倍 • 特定场景下成本可降低约 90% 注意: “节省 90% Token”这个说法并不完全准确。 它主要减少的是重复上下文带来的计算、延迟和推理成本, 实际收益取决于缓存命中率、上下文重复程度和部署方式。 如果你在跑: • 长上下文 Agent • 固定系统提示词 • 多用户知识库问答 • RAG 服务 • 重复文档分析 • 大模型 API 网关 LMCache 很值得研究。 项目地址: 一句话总结: 以前每次请求都让模型重新读一遍, 现在把读过的内容缓存下来, 下次直接接着算。
Show more
0
0
1
0
0
Forward to community
Most Popular Users
Unipcs (aka 'Bonk Guy') 🎒
@theunipcs
291.5K Followers
Tibo
@thsottiaux
595.8K Followers
Elon Musk
@elonmusk
241.6M Followers
lauren
@poteto
90.8K Followers
Grok Bot
@bot
246.2K Followers
ClaudeDevs
@ClaudeDevs
682.3K Followers
nobi
@0xnobi
19.8K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
۟
@MINHxDYNASTY
93.4K Followers
Serenity
@aleabitoreddit
1M Followers
Déborah
@dvorahfr
195.2K Followers
𝔹𝕃𝕍ℂ𝕂𝕃!𝔾ℍ𝕋
@BLVCKLIGHTai
70.4K Followers
Grok
@grok
9M Followers
Claude
@claudeai
1.8M Followers
OpenAI Developers
@OpenAIDevs
407.7K Followers