TwiScan
熱門
社區
帳號集合
登入
註冊
English
日本語
한국의
简体中文
繁体中文
註冊並分享邀請連結,可獲得影片播放與邀請獎勵。
立即註冊
檢索結果
ITL
ITL 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含
ITL
的搜尋結果
小萌不萌
@xiaomengmvm
2026.07.09 22:59
起床看脚脚了
0
0
1
268
11
轉發到社區
Sam liu
@samliu0105
2026.06.24 14:09
机器人都不敢这么连轴转
0
0
0
2
0
轉發到社區
美庭组长
@yunmei09
2026.05.24 04:12
姐姐决定不再低调了😂
0
0
0
0
1
轉發到社區
瓜瓜大王
@ltav777
2026.06.28 13:46
chudai💦💦 直播间通道1v1线下:
0
0
0
666
137
轉發到社區
小鱼冻干
@TrainsDes
2026.05.22 06:40
本部关键词:弟弟同学 完整版:
0
0
0
1
0
轉發到社區
我不是冥灯
@horatio_don
2026.05.13 02:28
我草,以太坊怎么又涨了,我昨天做多它跌,今天做空又涨,哎,空单又被套了
0
0
10
10
0
轉發到社區
憨憨
@fancha_Amy
2021.08.27 14:06
VPN还有两个小时到期了😂,快帮帮我,让我邀请点人,加点免费时长😂
0
0
13
27
1
轉發到社區
書格
@shugeorg
2022.07.03 09:44
此《寒窗十咏图》册为清大扬州八怪之一高翔所绘。全册共十开:枯荷、疏桐、寒藤、冬兰、衰柳、败蕉、晚桂、残菊、苍杉、早梅。其所表现大多为生长期过后的衰败之态,既无细节描摹,亦不施颜彩。虽衰败,却表露出孤芳自赏的傲岸气质。此册现藏香港中文大学文物馆。介绍下载:
顯示更多
0
0
1
40
9
轉發到社區
反差舞蹈生少女
@MDANCINGM
2021.09.16 18:25
#
意淫
# #
羞辱
# #
母狗
# #
骚货
# #
反差婊
# #
肉便器
# #
美腿
# #
自慰
# #
丝袜
# #
妓女
# #
婊子
# #
文爱
# #
辱骂
# #
凌辱
# #
女神
# #
调教
# #
高潮
# #
性瘾
# #
淫荡
# #
粗口
# #
反差
# #
女m
# #
肉便器
# #
性幻想
# 最近是怎么了?晚上睡不着,以为开学就不会失眠,就不会有那么多胡思乱想,可到了晚上脑子里就会冒出奇奇怪怪幻想,就想上推来看看…
顯示更多
0
0
8
57
0
轉發到社區
美研芒格君
@Kay2289123
2026.09.11 04:41
分享一份最近收集的 AI Infra 入门阅读清单,建议收藏,慢慢看 AI 已经可以生成很多很好的内容,解释概念、翻译论文、整理资料,都越来越方便。但在这个时代,能静下心来,把一篇好文章认真读完,把没懂的地方再琢磨一遍,我觉得更加难能可贵 这次整理的材料,主要集中在大模型推理这一块。从 KV Cache、显存管理,到请求调度、推理加速,再到怎么判断性能有没有真正变好 做工程的朋友,可以顺着往源码和实验里走。平时看 AI 产业、算力和存储的朋友,也可以先把原理读明白 读文章,挑值得反复读的。 1. 如果只选一篇,我会选 Inside vLLM。 Inside vLLM: Anatomy of a High-Throughput LLM Inference System,作者 Aleksa Gordić 把很多零散的概念串进了一个真实系统:一个请求进来,怎么排队,怎么分配 KV Cache,怎么执行,最后又怎么把结果送回来 PagedAttention、continuous batching、chunked prefill、prefix caching、投机解码、P/D 分离、多卡和性能测试,都能在这条线上找到位置。 这篇适合当主线,后面的材料用来补不懂的地方 2. 想弄懂 continuous batching,先看 Anyscale 这篇。 Continuous Batching 博客 llm用户的回答有长有短,有的已经生成完了,有的还在继续。已经空出来的位置,能不能马上接下一个请求? 这篇用静态批处理和连续批处理的对比图,把这个问题讲得很直观。看完你会理解,GPU 的效率,也取决于请求怎么安排 建议重点看图和机制 3. NVIDIA 的两篇,一篇帮你建立全貌,一篇教你怎么看性能。 Mastering LLM Techniques: Inference Optimization 适合先建立基本认识:处理输入的 prefill 和逐步生成输出的 decode 有什么区别,模型权重和 KV Cache 分别占什么空间,量化、批处理、多卡并行又各自解决什么问题 LLM Inference Benchmarking: Fundamental Concepts 这一篇我也很推荐。用户等多久才看到第一个 token,后面生成得快不快,整个系统一秒能服务多少请求,是不同的问题。TTFT、ITL、TPOT 这些指标,要连着测试口径一起看 4. 想再往下算一层,读 kipply 的 Transformer Inference Arithmetic Transformer Inference Arithmetic 这是一篇 2022 年的文章。它带你从计算量、内存容量、带宽和通信开销出发,估算推理为什么快、为什么慢,以及 batch size 改变后会发生什么 硬件和模型的具体例子有年代了, 作为 optional 选读
顯示更多
0
0
26
858
227
轉發到社區
載入中...