가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

美研芒格君
@Kay2289123
致力于让模型更聪明、更快、更便宜
가입 May 2026
43 팔로잉 중    32.7K 팬
我知道很多人想转 AI Inference, 但 Day0 怎么开始呢?我在团队内整理了一个 1 小时的学习路径,分享出来,作为 Day0 的阅读和“开智”使用 大家可以通勤路上、上厕所、吃饭的时候,扫上两眼。收藏下来,慢慢品,都是干货请放心使用,希望对你有帮助。 这个学习路径是:AI 模型如何生成 → 哪些计算存储资源可以复用 → GPU 为什么忙不过来 → 高并发请求如何共享资源 → 怎样判断 AI 模型推理用户体验 1. 先理解模型生成和 KV cache|20 分钟 带着一个问题读:模型权重、KV cache、生成的文本,分别是什么东西? 这是后面理解长上下文显存占用、缓存收益的基础 2. 理解 GPU 的两类主要瓶颈|15 分钟 看 GPU Architecture Fundamentals 的结构图,重点读 Understanding Performance 带着一个问题读:为什么换算力更强的卡,AI生成速度不一定按比例变快? 文档里的 GPU 示例比较早,今天学习原理即可 3. 理解不同请求之间怎样复用缓存|10 分钟 读开头、Example workloads、Limits 第一篇讲生成过程中复用旧 K/V;这一篇讲不同请求共享相同前缀时,怎样进一步复用计算 它直接节省的主要是输入处理,也就是 prefill;新答案仍然需要逐步生成。 带着一个问题读:为什么缓存命中率很高,用户仍可能觉得慢? 4. 理解长短请求如何争用同一张 GPU|20 分钟 读 Preemption、Chunked Prefill、Performance Tuning with Chunked Prefill 到这里,你就开始把已有的资源调度、容量和延迟知识,接到 LLM 服务上了 5. 理解性能数字究竟在衡量什么|10 分钟 三个概念:TTFT 看第一段输出等多久;ITL 看流式输出的间隔;TPOT 看除首 token 外,平均每个输出 token 的耗时 5. 最后把这些概念接回数据|5 分钟 读 Workloads 和 Trace Format,看懂到达时间、输入长度、输出长度、前缀块 hash 四项。 带着一个问题读:这些记录能描述哪些负载特征,哪些东西仍然必须在真实 GPU 服务里测? 6. 读完后思考 10 分钟 一个长请求进来以后,短请求为什么可能变慢?开启缓存以后,哪些成本减少了,哪些等待仍然存在? 如果你能通俗易懂地解释了,说明这一个小时没白过 这一个小时的教程是我为投研团队成员准备的。他是我在@meta 的前同事,和我一起合作了很多 Marvell 的分析 他现在是在硅谷某个大厂的 SDE,对 AI infra 一窍不通,我在督促他建立一个 X 的账号,让他分享起来。从 Day One 开始,分享他从普通 SDE 转到 AI 的学习路径,相信会对很多人有帮助,坚持下来,大家的水平应该可以拉齐
더 보기
最近很多朋友问我,怎么从 SDE(Software Engineer)转到做 AI Infra 和大模型相关的工作? 或者普通人想做 Pro 级别的 AI 投资者,零基础怎么扫盲,怎么搞懂这么多术语?给大家推荐两个免费的入门友好的 AI 相关学习网站(课) 如果你要做基本的 AI 投资,看完第一个 Stanford CS336 课程也就差不多了。如果想专攻某个领域,可以看看第二个的公开课? 1. Stanford s开课 Stanford CS336 Language Modeling from Scratch 2. @AndrewYNg 创办的学习平台, 里面的课程非常多,点开你就使劲学吧,从 pre-training 到 post-training,从训练到推理,全都涵盖 链接⬇️ 不知道我的 follower 中有多少对这些感兴趣的。可能和投资不直接相关,但我觉得都是很好的认知提升课程。 有时间还是要多看教程、多看课、多读书,武装自己的大脑 如果有朋友感兴趣,我后续可以分享更多
더 보기