注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 SGLang
SGLang 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 SGLang 的推特
SGLang 的 DSpark 实测数据在PR里放出了, 几个测试场景基本都能达到预测3个token, 其中数学类prompt是3.37个, 日常对话是3个, 代码是3.52个(果然代码是废token比较多的). 最亮眼的是加速比了, 在1K长度prompt下加速比来到了1.81倍. 测试使用的是8卡B200, 速度来到了 297 token/s. 而不使用DSpark 则是 164 token/s. 另外作者还测试了不同并发情况下的加速比, 目前来看单并发提升是最高的, 而超过8并发则只有1.2-1.3倍的提速了, 主要还是把GPU打满了. 另外比较震惊的数据时 DSpark 的 TPOT (每个输出 Token 的耗时) 只有2.9-5.2ms, 说明了这个DSpark内置的神经网络层运行得特别快. DSpark带来的延迟基本可以忽略不计了. 注意这个PR还没合并, 如果想尝试可以单独Fork这个PR29538.
显示更多
感觉我也可以魔改 sglang 、 vllm ,用于调试 DSpark 这类新能力, 看看效果是不是和吹的一样好。 现在租用一个 GPU又不贵。 大模型预训练需要烧很多钱,烧很多数据才能验证, 大模型推理看起来门槛并没那么高,小成本也可以验证/验收能力。
显示更多
在最近的开源热潮中,SGLang和vLLM等开源推理引擎成为算力优化的核心技术。DeepSeek、Kimi等模型一上线就实现Day-0支持,昨天Google Cloud TPU也官宣引入SGLang。 这背后是AI Infra的千亿级市场和需求:当推理成为AI的主战场,GPU看似满载,却仍把大量时间耗在重复计算、缓存搬运和任务等待上。AI Infra深处,一场围绕调度与系统优化的效率革命已经开始。为什么最昂贵的GPU仍会“又忙又闲”?AI Infra还能榨出多少藏在“硅”里的性能?当算力增长不再只靠堆卡,AI竞争的尺度会被怎样改写?这期视频,我们与推理引擎开源社区SGLang孵化出的RadixArk团队一起,深入探讨这场算力效率变革。
显示更多
0
60
72
7
转发到社区
MiniMax H3:租显卡还是买显卡?两种自建方案对比 想自己部署 MiniMax H3,真正需要解决的不是软件,而是 GPU。SGLang、ComfyUI 和模型代码基本都能免费使用,但 H3 视频生成需要大量显存和算力。 目前主要有两条路:租云显卡,或者自己买显卡。 方案一:租云显卡 租一台带 RTX 5090 的云服务器,按小时开机,用完关机。 以当前云平台公开价格估算: • RTX 5090 32GB:约 $0.99/小时,折合约 ¥7/小时 • 使用 20 小时:约 ¥143 • 使用 100 小时:约 ¥713 • 使用 300 小时:约 ¥2,140 • 连续开一个月:约 ¥5,130 • 另外还要算磁盘、流量和模型存储费用 我在某鱼看了一下RTX 5090 32GB 一小时也要5元 ,现在模型很火商家坐地起价也很正常 优点: • 不用一次性买显卡 • 不用处理散热、供电和驱动 • 按小时计费,用多少算多少 • 可以先测试 H3 到底适不适合自己 • 需要批量生成时,可以临时升级多卡服务器 缺点: • 长期使用会越来越贵 • 云服务器网络和硬盘可能额外收费 • 机器库存、地区和价格会变化 • 需要自己配置 Linux、驱动和运行环境 • 单张 5090 主要适合测试和个人使用,速度不会像官方云服务那么快 适合的人: 偶尔做视频、刚开始研究 H3、暂时不确定使用量的人。 方案二:自己买显卡 购买一张 RTX 5090 32GB,装到自己的台式机里,在本地部署 H3。 粗略预算如下:按照当下某鱼我看到的最新价格算 • RTX 5090 显卡:约 ¥15,000~35,000(闲鱼15000的5090很多是钓鱼/故障卡,实际靠谱可成交,大多要1.7万以上) • 64GB 内存:约 ¥1,300~2,000 • 1TB 以上 NVMe:约 ¥500~1,000(H3本地部署,硬盘建议直接2TB,模型+缓存会吃掉很大空间,1TB会很快爆满) • 电源、主板、CPU、机箱和散热:约 ¥4,000~8,000(电源别省!5090功耗很高,最低850W金牌以上,优先选1000W更稳妥) • 整机大约:¥20,000~45,000 实际价格看品牌、行情和你已有的配件。只买显卡、不配整机的话,成本会低一些。 RTX5090不是跑H3的最低门槛,4090(24G)量化后也能跑,只是分辨率、时长受限。(这是已5090为例 至少要玩的舒服一些 ) 后续主要是电费: • 整机满载大约 0.7~1 度电/小时 • 按每度电 ¥0.6~1 计算 • 每运行 100 小时电费约 ¥40~100 • 每月运行 300 小时,电费约 ¥120~300 优点: • 买下来后不用按小时交租金 • 文件和模型都在自己电脑里 • 没有云平台停机、封号和库存问题 • 可以长期运行,也能部署其他 AI 模型 • 大量使用时,单次生成成本更低 缺点: • 前期投入高 • 需要自己处理驱动、CUDA、散热和系统故障 • 显卡会折旧,满载运行也有噪音和耗电 • 5090 32GB 仍然属于单卡测试档,H3 需要 offload,速度有限 • 想做多人服务或批量生产,单卡不够,还要上 4 卡服务器 两种方案怎么选?简单看使用时间: • 每月使用 20~100 小时:租显卡更划算 • 每月使用约 300 小时:开始接近买显卡的合理区间 • 每月长期超过 500 小时:买显卡更合适 • 要多人同时使用:直接考虑多卡服务器,不要买一张 5090 硬扛 按租赁价格计算,一台 ¥20,000 左右的 5090 整机,理论上运行约 3,000 小时可以抵掉租金。考虑显卡折旧、维护、断电和闲置时间,实际回本周期大约 10~18 个月。 最推荐的路线 如果只是个人做视频: 先租一张 RTX 5090,花 ¥200 左右测试 20 小时,跑通 MiniMax H3-Base 的 768p 生成。确认速度、画质和使用频率都能接受后,再考虑买整机。 如果已经确定每天都要生成,或者每月使用超过 300 小时: 买一张 RTX 5090 本地部署更合适。系统建议 Ubuntu,内存 64GB,NVMe 至少 200GB,使用 ComfyUI 或 SGLang。 如果是商业批量生产: 考虑 4 张 A100/H100 级别显卡,用 SGLang 部署。成本会明显上升,不适合个人刚开始就投入。 还要注意一点:本地 H3 主要能跑 H3-Base 的 768p 流程,官方 H3-Context-IR 和 H3-Regenerate-2K 目前没有完全开源。想复现完整 2K 效果,需要调用官方 API。 总结: 不确定用多少,先租;确定长期高频使用,再买。先花 ¥200 验证,比直接花两三万买机器稳得多。
显示更多
0
99
38
0
转发到社区
阿里平头哥把真武AI芯片的整套软件栈开源了。 开发者可以直接获取底层驱动,编译器,算子库和调试工具,不用只靠芯片厂商内部适配。 这套软件栈叫T-Head SAIL,已经适配PyTorch,TensorFlow,vLLM和SGLang等260多个训练与推理框架。平头哥称,主流推理框架的平均适配时间可以压到7天以内。 公司同时披露,真武AI芯片截至今年4月累计出货超过56万片,覆盖400多家客户。
显示更多
小米 给每个人送 820亿token ... 原因是: 推理技术优化说明 本次价格调整背后,离不开小米技术团队在推理系统上的持续优化。 我们基于 SGLang HiCache 完整支持 SWA(Sliding Window Attention),将 KV Cache 在 GPU 显存、CPU 内存、SSD 等多级存储之间的数据搬运量降低至优化前的近 1/7,并将可缓存 token 数量提升至优化前的近 5 倍,显著提升了缓存命中率和推理效率。 同时,我们通过优化专家并行方案、输入长度分桶策略等,进一步提升了集群输入吞吐能力,从而在保障服务质量的前提下持续降低单位 token 服务成本。
显示更多
🖌️ 百度把自家的文生图模型开源了,权重直接放出来 80 亿参数的单流扩散 Transformer,GenEval 总分 0.8856 国内能拿到开放权重的文生图模型本来就不多,能把中文长文本渲染好的更少。想在图里放一句中文标语,出来经常是缺笔画的字符。 ERNIE-Image 在这块的成绩不错,LongTextBench 中英文平均分拿到 0.9733。它放了两个版本:标准版推理 50 步、CFG 4.0,追求质量;Turbo 版经过 DMD 和强化学习优化,8 步、CFG 1.0 就能出图,快得多。 生态接得也够全:Diffusers 和 SGLang 支持调用部署,ComfyUI 有 Turbo 版工作流模板,Unsloth 能构建 GGUF 权重,AI-Toolkit 支持微调。Apache 2.0 协议。 模型开源这件事上,权重放出来才算数。 GitHub:
显示更多
推荐这篇文章,Together AI 的 ThunderAgent(ICML 2026 Spotlight)。 把 agent 工作流当成一个"程序"来调度,而非一系列无关的请求——单节点吞吐翻倍,8 节点近线性扩展。 Together AI 在 7 月 29 日发布了 ThunderAgent——一个面向 agentic 推理的高吞吐调度系统。ICML 2026 Spotlight 论文。核心贡献:把 agent workflow 抽象为"程序"而非"一系列不相关的请求"。 问题:KV Cache Thrashing Agent 工作流在两个阶段之间交替:GPU 密集的推理阶段和 GPU 空闲的等待工具返回阶段。当数百个 agent 并发运行时,各自的 KV cache 在每轮不断增长,竞争有限的 GPU 内存。 传统推理引擎(vLLM、SGLang、TensorRT-LLM)按请求级别调度——agent A 暂停等待工具调用时,它的 KV cache 被 LRU 淘汰腾出空间给 agent B 的 prefill。当 A 的工具返回,引擎必须从头重算 A 的整段对话历史,这又淘汰了 C 的 cache。高并发下,这种淘汰和重算的级联反应导致严重的吞吐量和延迟退化——论文称之为 KV cache thrashing。 能通过加 GPU 节点解决吗?不完全。现有多节点路由器(如 SGLang Gateway)把每个 agent 钉在固定节点上以保留 cache 局部性——但 agent 的上下文长度不可预测增长,某些节点被赋予长上下文 agent 导致内存耗尽,其他节点闲置。 能通过 KV cache offloading 解决吗?也解决不了。LMCache 和 HiCache 把 KV cache 卸载到 CPU 内存或磁盘,扩大了总容量但只是延迟 thrasthing。当并发 agent 的工作集超过所有存储层级时,淘汰恢复,同一个恶性循环重现。 ThunderAgent 的解法 ThunderAgent 在 agentic 客户端和推理后端之间插入一个轻量调度层。它将每个 agent 工作流抽象为一个可调度程序(program),追踪其执行阶段、KV cache 占用和节点位置。 Program-level admission control:监控每个节点的内存压力,选择性暂停低优先级工作流,减少竞争 cache 的程序数量。当被暂停的工作流准备恢复时,通过全局等待队列路由到容量最充足的节点。 多节点部署:用全局等待队列替代了基于 session 的静态节点绑定。暂停的工作流恢复时被路由到可用容量最多的节点,在 KV cache 局部性和多节点负载均衡之间取得平衡。 评测 集成在 Together AI 自己的合成数据生成管道里——就是产生 CoderForge 等数据集的那套基础设施。对比 SGLang 默认调度器: 单节点 8×H100(HiCache offloading),batch size 192: • SGLang:吞吐 390 token/s,平均延迟 65s • ThunderAgent:吞吐 803 token/s,平均延迟 10.6s 多节点(2→8 节点): • 近线性扩展,16 GPU 到 64 GPU 吞吐从 671 增长到 2248 steps/min • 加速比随集群规模增大:2 节点 1.79× → 8 节点 2.39× 使用 一个 program_id 字段,OpenAI 兼容 API,直接适配现成的 offloading 和 speculative decoding。已被 SkyRL 和 NVIDIA Dynamo 集成。 GitHub: 论文: #AgentInference# #KVcache# #ThunderAgent#
显示更多
你的大模型每天都在重复处理同一批上下文, 而你还在为这些重复计算持续付费。 系统提示词、长文档、知识库片段、Agent 历史记录—— 明明刚算过一次, 下一次请求还是从头重算。 模型单价虽然在降, 但 Agent 不断重发长上下文,账单照样往上涨。 这个开源项目就是专门解决这件事的: LMCache 它是一个面向大模型推理的 KV Cache 管理层, 目前可以接入: • vLLM • SGLang • TensorRT-LLM 原理很直接: 把已经计算过的 KV Cache 保存下来。 后面遇到相同或可复用的上下文, 直接读取缓存, 不用再让模型从第一个 Token 重新计算。 几个重点: 1. 重复上下文不再反复计算 特别适合长系统提示词、RAG 文档和多轮 Agent 任务。 2. 缓存服务独立运行 可以单独进程管理缓存, 尽量减少对模型推理资源的占用。 3. 支持跨请求复用 不仅是单次会话内加速, 还可以让不同请求复用已有前缀缓存。 项目给出的测试结果显示: 在 H200 上运行 235B 模型时, • 首 Token 延迟最高提升约 14 倍 • 解码吞吐最高提升约 4 倍 • 特定场景下成本可降低约 90% 注意: “节省 90% Token”这个说法并不完全准确。 它主要减少的是重复上下文带来的计算、延迟和推理成本, 实际收益取决于缓存命中率、上下文重复程度和部署方式。 如果你在跑: • 长上下文 Agent • 固定系统提示词 • 多用户知识库问答 • RAG 服务 • 重复文档分析 • 大模型 API 网关 LMCache 很值得研究。 项目地址: 一句话总结: 以前每次请求都让模型重新读一遍, 现在把读过的内容缓存下来, 下次直接接着算。
显示更多
腾讯混元 v3 的代码主要在 GitHub 的 Tencent-Hunyuan/Hy3-preview 仓库查看。 主要链接: GitHub 仓库(包含代码、推理脚本、训练文档等): 模型权重下载(Hugging Face 等平台):Hugging Face: tencent/Hy3-preview(以及 Base 版本) ModelScope: Tencent-Hunyuan/Hy3-preview GitCode: 对应仓库也有镜像 其他信息: Hy3-preview 是腾讯混元(Hunyuan)发布的开源 MoE 模型(总参数 295B,激活 21B + MTP 层),支持 vLLM、SGLang 等推理框架。
显示更多