TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
美研芒格君
@Kay2289123
致力于让模型更聪明、更快、更便宜
参加 May 2026
43
フォロー中
32.7K
ファン
美研芒格君
@Kay2289123
2026.09.11 04:41
分享一份最近收集的 AI Infra 入门阅读清单,建议收藏,慢慢看 AI 已经可以生成很多很好的内容,解释概念、翻译论文、整理资料,都越来越方便。但在这个时代,能静下心来,把一篇好文章认真读完,把没懂的地方再琢磨一遍,我觉得更加难能可贵 这次整理的材料,主要集中在大模型推理这一块。从 KV Cache、显存管理,到请求调度、推理加速,再到怎么判断性能有没有真正变好 做工程的朋友,可以顺着往源码和实验里走。平时看 AI 产业、算力和存储的朋友,也可以先把原理读明白 读文章,挑值得反复读的。 1. 如果只选一篇,我会选 Inside vLLM。 Inside vLLM: Anatomy of a High-Throughput LLM Inference System,作者 Aleksa Gordić 把很多零散的概念串进了一个真实系统:一个请求进来,怎么排队,怎么分配 KV Cache,怎么执行,最后又怎么把结果送回来 PagedAttention、continuous batching、chunked prefill、prefix caching、投机解码、P/D 分离、多卡和性能测试,都能在这条线上找到位置。 这篇适合当主线,后面的材料用来补不懂的地方 2. 想弄懂 continuous batching,先看 Anyscale 这篇。 Continuous Batching 博客 llm用户的回答有长有短,有的已经生成完了,有的还在继续。已经空出来的位置,能不能马上接下一个请求? 这篇用静态批处理和连续批处理的对比图,把这个问题讲得很直观。看完你会理解,GPU 的效率,也取决于请求怎么安排 建议重点看图和机制 3. NVIDIA 的两篇,一篇帮你建立全貌,一篇教你怎么看性能。 Mastering LLM Techniques: Inference Optimization 适合先建立基本认识:处理输入的 prefill 和逐步生成输出的 decode 有什么区别,模型权重和 KV Cache 分别占什么空间,量化、批处理、多卡并行又各自解决什么问题 LLM Inference Benchmarking: Fundamental Concepts 这一篇我也很推荐。用户等多久才看到第一个 token,后面生成得快不快,整个系统一秒能服务多少请求,是不同的问题。TTFT、ITL、TPOT 这些指标,要连着测试口径一起看 4. 想再往下算一层,读 kipply 的 Transformer Inference Arithmetic Transformer Inference Arithmetic 这是一篇 2022 年的文章。它带你从计算量、内存容量、带宽和通信开销出发,估算推理为什么快、为什么慢,以及 batch size 改变后会发生什么 硬件和模型的具体例子有年代了, 作为 optional 选读
もっと見る
0
0
26
858
227
コミュニティへ転送
人気のあるユーザー
GIGA特撮ヒロイン【公式】
@giga_web
63K ファン
New York Post
@nypost
4.2M ファン
オリコンニュース
@oricon
1.9M ファン
TVer新着
@TVer_info
100.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
Reuters
@Reuters
26.4M ファン
First Squawk
@FirstSquawk
569K ファン
billboard
@billboard
16.8M ファン
ファミ通.com
@famitsu
1.4M ファン
Bloomberg
@business
10.5M ファン
モデルプレス
@modelpress
2.1M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K ファン
一劍浣春秋
@chee828
0 ファン
吴说区块链
@wublockchain12
181.5K ファン
zerohedge
@zerohedge
3.4M ファン