TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
RelaxView
@RelaxView
RelaxView 不只看價格,還把鏈上資金、盤面結構、智能週期與智慧模型整合在一起,幫你更快看懂市場正在發生什麼 看見異動,也看懂異動
参加 December 2021
6
フォロー中
23.8K
ファン
RelaxView
@RelaxView
2026.07.12 04:51
你的大模型每天都在重复处理同一批上下文, 而你还在为这些重复计算持续付费。 系统提示词、长文档、知识库片段、Agent 历史记录—— 明明刚算过一次, 下一次请求还是从头重算。 模型单价虽然在降, 但 Agent 不断重发长上下文,账单照样往上涨。 这个开源项目就是专门解决这件事的: LMCache 它是一个面向大模型推理的 KV Cache 管理层, 目前可以接入: • vLLM • SGLang • TensorRT-LLM 原理很直接: 把已经计算过的 KV Cache 保存下来。 后面遇到相同或可复用的上下文, 直接读取缓存, 不用再让模型从第一个 Token 重新计算。 几个重点: 1. 重复上下文不再反复计算 特别适合长系统提示词、RAG 文档和多轮 Agent 任务。 2. 缓存服务独立运行 可以单独进程管理缓存, 尽量减少对模型推理资源的占用。 3. 支持跨请求复用 不仅是单次会话内加速, 还可以让不同请求复用已有前缀缓存。 项目给出的测试结果显示: 在 H200 上运行 235B 模型时, • 首 Token 延迟最高提升约 14 倍 • 解码吞吐最高提升约 4 倍 • 特定场景下成本可降低约 90% 注意: “节省 90% Token”这个说法并不完全准确。 它主要减少的是重复上下文带来的计算、延迟和推理成本, 实际收益取决于缓存命中率、上下文重复程度和部署方式。 如果你在跑: • 长上下文 Agent • 固定系统提示词 • 多用户知识库问答 • RAG 服务 • 重复文档分析 • 大模型 API 网关 LMCache 很值得研究。 项目地址: 一句话总结: 以前每次请求都让模型重新读一遍, 现在把读过的内容缓存下来, 下次直接接着算。
もっと見る
0
0
1
0
0
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
TVer新着
@TVer_info
100K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
New York Post
@nypost
4.1M ファン
一劍浣春秋
@chee828
231K ファン
モデルプレス
@modelpress
2M ファン
AKB48公式
@AKB48_staff
289.5K ファン
ファミ通.com
@famitsu
1.4M ファン
空空道人
@Kongkongda5882
30.7K ファン
NMB48 Official
@nmb48_official
133.7K ファン
フレッシュ撮影会【公式】
@fresh_akiba
94.4K ファン
HKT48
@hkt48_official_
150.8K ファン
中國新聞社
@CNS1952
547.1K ファン
乃木坂46
@nogizaka46
2M ファン
吴说区块链
@wublockchain12
180.5K ファン