注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 APIGateway
APIGateway 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 APIGateway 的推特
在 LinkedIn 点赞了一篇 vLLM Semantic Router 的帖子,结果算法开始接二连三给我推荐 Model Router。我只能说继续学习,虽然感觉已经快看不懂了🫤 简单理解,vLLM 就像一家高并发餐厅: 应用层是顾客,API Gateway 是服务员,Foundation Model 是厨师,GPU 是炉子,Semantic Router 负责判断每道菜应该交给哪个厨师。 Continuous Batching:把不断进来的多个请求动态拼在一起处理,尽量别让 GPU 闲着。 PagedAttention:把 KV Cache 分页管理。KV Cache 就是模型推理时用来“记住前面已经算过的信息”的缓存,这样请求可以随时加入和退出,也不会因为连续内存分配浪费大量显存。 Semantic Router:根据请求的内容、难度、成本和延迟要求,把任务分配给最合适的模型。 以前是所有问题都找同一个大模型,现在是简单问题给便宜模型,复杂问题再找顶级模型。AI 基础设施已经开始进入精细化运营阶段了。
显示更多
我很建议去做中转站 因为我发现未来大家不会训练模型的 只有一条路 就是卖token 未来 foundation model 市场可能越来越像云计算产业:绝大多数公司没有办法也没有必要生产基础模型,只能消费基础模型。 最终整个产业都在想办法把frontier模型能力卖出去。 模型公司直接卖 API,是直接卖模型;中转站/API Gateway 是代理卖模型;AI Agent/SaaS 则是把模型包装成结果,属于间接卖模型;GEO、AI marketing、渠道合作,本质上是在帮助模型获得更多消费量。 如果你没办法完成token的生产,你只能参与到token的分发,无论是卖给B端客户,还是卖给C端客户。 因为模型本身会越来越强、越来越多、越来越便宜。如果你既没有 frontier model 的研发能力,也不拥有 GPU,那么更现实的资产是 distribution。 你控制了多少 downstream token consumption,你就在这个产业链上当一条大鱼,要么做流量,要么做渠道,最终大家都会来卖token。
显示更多
0
29
52
3
转发到社区