Register and share your invite link to earn from video plays and referrals.

Wei
@wei_wang
13y mobile vet | $100M EM | Building ecom brands with China supplier network | AI tools & cross-border ecom 🇺🇸 13年移动端老兵 | 美国电商创业 | 分享AI工具 & 出海实操
Joined April 2022
359 Following    5.4K Followers
在 LinkedIn 点赞了一篇 vLLM Semantic Router 的帖子,结果算法开始接二连三给我推荐 Model Router。我只能说继续学习,虽然感觉已经快看不懂了🫤 简单理解,vLLM 就像一家高并发餐厅: 应用层是顾客,API Gateway 是服务员,Foundation Model 是厨师,GPU 是炉子,Semantic Router 负责判断每道菜应该交给哪个厨师。 Continuous Batching:把不断进来的多个请求动态拼在一起处理,尽量别让 GPU 闲着。 PagedAttention:把 KV Cache 分页管理。KV Cache 就是模型推理时用来“记住前面已经算过的信息”的缓存,这样请求可以随时加入和退出,也不会因为连续内存分配浪费大量显存。 Semantic Router:根据请求的内容、难度、成本和延迟要求,把任务分配给最合适的模型。 以前是所有问题都找同一个大模型,现在是简单问题给便宜模型,复杂问题再找顶级模型。AI 基础设施已经开始进入精细化运营阶段了。
Show more