註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 ITL
ITL 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 ITL 的搜尋結果
机器人都不敢这么连轴转
姐姐决定不再低调了😂
chudai💦💦 直播间通道1v1线下:
0
0
666
137
轉發到社區
本部关键词:弟弟同学 完整版:
我草,以太坊怎么又涨了,我昨天做多它跌,今天做空又涨,哎,空单又被套了
0
10
10
0
轉發到社區
VPN还有两个小时到期了😂,快帮帮我,让我邀请点人,加点免费时长😂
0
13
27
1
轉發到社區
此《寒窗十咏图》册为清大扬州八怪之一高翔所绘。全册共十开:枯荷、疏桐、寒藤、冬兰、衰柳、败蕉、晚桂、残菊、苍杉、早梅。其所表现大多为生长期过后的衰败之态,既无细节描摹,亦不施颜彩。虽衰败,却表露出孤芳自赏的傲岸气质。此册现藏香港中文大学文物馆。介绍下载:
顯示更多
#意淫# #羞辱# #母狗# #骚货# #反差婊# #肉便器# #美腿# #自慰# #丝袜# #妓女# #婊子# #文爱# #辱骂# #凌辱# #女神# #调教# #高潮# #性瘾# #淫荡# #粗口# #反差# #女m# #肉便器# #性幻想# 最近是怎么了?晚上睡不着,以为开学就不会失眠,就不会有那么多胡思乱想,可到了晚上脑子里就会冒出奇奇怪怪幻想,就想上推来看看…
顯示更多
分享一份最近收集的 AI Infra 入门阅读清单,建议收藏,慢慢看 AI 已经可以生成很多很好的内容,解释概念、翻译论文、整理资料,都越来越方便。但在这个时代,能静下心来,把一篇好文章认真读完,把没懂的地方再琢磨一遍,我觉得更加难能可贵 这次整理的材料,主要集中在大模型推理这一块。从 KV Cache、显存管理,到请求调度、推理加速,再到怎么判断性能有没有真正变好 做工程的朋友,可以顺着往源码和实验里走。平时看 AI 产业、算力和存储的朋友,也可以先把原理读明白 读文章,挑值得反复读的。 1. 如果只选一篇,我会选 Inside vLLM。 Inside vLLM: Anatomy of a High-Throughput LLM Inference System,作者 Aleksa Gordić 把很多零散的概念串进了一个真实系统:一个请求进来,怎么排队,怎么分配 KV Cache,怎么执行,最后又怎么把结果送回来 PagedAttention、continuous batching、chunked prefill、prefix caching、投机解码、P/D 分离、多卡和性能测试,都能在这条线上找到位置。 这篇适合当主线,后面的材料用来补不懂的地方 2. 想弄懂 continuous batching,先看 Anyscale 这篇。 Continuous Batching 博客 llm用户的回答有长有短,有的已经生成完了,有的还在继续。已经空出来的位置,能不能马上接下一个请求? 这篇用静态批处理和连续批处理的对比图,把这个问题讲得很直观。看完你会理解,GPU 的效率,也取决于请求怎么安排 建议重点看图和机制 3. NVIDIA 的两篇,一篇帮你建立全貌,一篇教你怎么看性能。 Mastering LLM Techniques: Inference Optimization 适合先建立基本认识:处理输入的 prefill 和逐步生成输出的 decode 有什么区别,模型权重和 KV Cache 分别占什么空间,量化、批处理、多卡并行又各自解决什么问题 LLM Inference Benchmarking: Fundamental Concepts 这一篇我也很推荐。用户等多久才看到第一个 token,后面生成得快不快,整个系统一秒能服务多少请求,是不同的问题。TTFT、ITL、TPOT 这些指标,要连着测试口径一起看 4. 想再往下算一层,读 kipply 的 Transformer Inference Arithmetic Transformer Inference Arithmetic 这是一篇 2022 年的文章。它带你从计算量、内存容量、带宽和通信开销出发,估算推理为什么快、为什么慢,以及 batch size 改变后会发生什么 硬件和模型的具体例子有年代了, 作为 optional 选读
顯示更多
0
26
858
227
轉發到社區