註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

美研芒格君
@Kay2289123
致力于让模型更聪明、更快、更便宜
加入 May 2026
43 正在關注    32.7K 粉絲
我知道很多人想转 AI Inference, 但 Day0 怎么开始呢?我在团队内整理了一个 1 小时的学习路径,分享出来,作为 Day0 的阅读和“开智”使用 大家可以通勤路上、上厕所、吃饭的时候,扫上两眼。收藏下来,慢慢品,都是干货请放心使用,希望对你有帮助。 这个学习路径是:AI 模型如何生成 → 哪些计算存储资源可以复用 → GPU 为什么忙不过来 → 高并发请求如何共享资源 → 怎样判断 AI 模型推理用户体验 1. 先理解模型生成和 KV cache|20 分钟 带着一个问题读:模型权重、KV cache、生成的文本,分别是什么东西? 这是后面理解长上下文显存占用、缓存收益的基础 2. 理解 GPU 的两类主要瓶颈|15 分钟 看 GPU Architecture Fundamentals 的结构图,重点读 Understanding Performance 带着一个问题读:为什么换算力更强的卡,AI生成速度不一定按比例变快? 文档里的 GPU 示例比较早,今天学习原理即可 3. 理解不同请求之间怎样复用缓存|10 分钟 读开头、Example workloads、Limits 第一篇讲生成过程中复用旧 K/V;这一篇讲不同请求共享相同前缀时,怎样进一步复用计算 它直接节省的主要是输入处理,也就是 prefill;新答案仍然需要逐步生成。 带着一个问题读:为什么缓存命中率很高,用户仍可能觉得慢? 4. 理解长短请求如何争用同一张 GPU|20 分钟 读 Preemption、Chunked Prefill、Performance Tuning with Chunked Prefill 到这里,你就开始把已有的资源调度、容量和延迟知识,接到 LLM 服务上了 5. 理解性能数字究竟在衡量什么|10 分钟 三个概念:TTFT 看第一段输出等多久;ITL 看流式输出的间隔;TPOT 看除首 token 外,平均每个输出 token 的耗时 5. 最后把这些概念接回数据|5 分钟 读 Workloads 和 Trace Format,看懂到达时间、输入长度、输出长度、前缀块 hash 四项。 带着一个问题读:这些记录能描述哪些负载特征,哪些东西仍然必须在真实 GPU 服务里测? 6. 读完后思考 10 分钟 一个长请求进来以后,短请求为什么可能变慢?开启缓存以后,哪些成本减少了,哪些等待仍然存在? 如果你能通俗易懂地解释了,说明这一个小时没白过 这一个小时的教程是我为投研团队成员准备的。他是我在@meta 的前同事,和我一起合作了很多 Marvell 的分析 他现在是在硅谷某个大厂的 SDE,对 AI infra 一窍不通,我在督促他建立一个 X 的账号,让他分享起来。从 Day One 开始,分享他从普通 SDE 转到 AI 的学习路径,相信会对很多人有帮助,坚持下来,大家的水平应该可以拉齐
顯示更多
最近很多朋友问我,怎么从 SDE(Software Engineer)转到做 AI Infra 和大模型相关的工作? 或者普通人想做 Pro 级别的 AI 投资者,零基础怎么扫盲,怎么搞懂这么多术语?给大家推荐两个免费的入门友好的 AI 相关学习网站(课) 如果你要做基本的 AI 投资,看完第一个 Stanford CS336 课程也就差不多了。如果想专攻某个领域,可以看看第二个的公开课? 1. Stanford s开课 Stanford CS336 Language Modeling from Scratch 2. @AndrewYNg 创办的学习平台, 里面的课程非常多,点开你就使劲学吧,从 pre-training 到 post-training,从训练到推理,全都涵盖 链接⬇️ 不知道我的 follower 中有多少对这些感兴趣的。可能和投资不直接相关,但我觉得都是很好的认知提升课程。 有时间还是要多看教程、多看课、多读书,武装自己的大脑 如果有朋友感兴趣,我后续可以分享更多
顯示更多
0
25
540
131
轉發到社區