註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 SGLang
SGLang 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 SGLang 的搜尋結果
SGLang 的 DSpark 实测数据在PR里放出了, 几个测试场景基本都能达到预测3个token, 其中数学类prompt是3.37个, 日常对话是3个, 代码是3.52个(果然代码是废token比较多的). 最亮眼的是加速比了, 在1K长度prompt下加速比来到了1.81倍. 测试使用的是8卡B200, 速度来到了 297 token/s. 而不使用DSpark 则是 164 token/s. 另外作者还测试了不同并发情况下的加速比, 目前来看单并发提升是最高的, 而超过8并发则只有1.2-1.3倍的提速了, 主要还是把GPU打满了. 另外比较震惊的数据时 DSpark 的 TPOT (每个输出 Token 的耗时) 只有2.9-5.2ms, 说明了这个DSpark内置的神经网络层运行得特别快. DSpark带来的延迟基本可以忽略不计了. 注意这个PR还没合并, 如果想尝试可以单独Fork这个PR29538.
顯示更多
感觉我也可以魔改 sglang 、 vllm ,用于调试 DSpark 这类新能力, 看看效果是不是和吹的一样好。 现在租用一个 GPU又不贵。 大模型预训练需要烧很多钱,烧很多数据才能验证, 大模型推理看起来门槛并没那么高,小成本也可以验证/验收能力。
顯示更多
在最近的开源热潮中,SGLang和vLLM等开源推理引擎成为算力优化的核心技术。DeepSeek、Kimi等模型一上线就实现Day-0支持,昨天Google Cloud TPU也官宣引入SGLang。 这背后是AI Infra的千亿级市场和需求:当推理成为AI的主战场,GPU看似满载,却仍把大量时间耗在重复计算、缓存搬运和任务等待上。AI Infra深处,一场围绕调度与系统优化的效率革命已经开始。为什么最昂贵的GPU仍会“又忙又闲”?AI Infra还能榨出多少藏在“硅”里的性能?当算力增长不再只靠堆卡,AI竞争的尺度会被怎样改写?这期视频,我们与推理引擎开源社区SGLang孵化出的RadixArk团队一起,深入探讨这场算力效率变革。
顯示更多
0
60
72
7
轉發到社區
🎉GLM-5.3-Flash 实测也来了,依然是上次的 4 张 141 GB H20配置,分别跑通 SGLang 和 vLLM,使用官方 FP8 权重、BF16 KV Cache、近 1M 上下文的实测 1. 短请求测试:SGLang 1 并发 74.7 token/s,32 并发 847.1 token/s;vLLM 分别为 107.7、1156.9 token/s 2. 运行环境:SGLang 功能验证更加完整,已接入 OpenWebUI;vLLM 使用专用预览镜像,测试时主仓支持尚未合入。本轮均关闭 MTP 3. 官方 FP8 权重 62 个分片,合计约 328 GB,每卡权重显存约 75 GiB;SGLang 权重加载耗时 130.59 秒,vLLM 最慢 Rank 耗时 365.69 秒 4. 两套引擎均通过近 1M 上下文请求和大海捞针测试,104 万 Token 输入的冷缓存首 Token 延迟分别为 167.69 秒、160.96 秒;本次没有复现 SGLang 社区 262K 边界崩溃的问题
顯示更多
DeepSeek-V4.1-Flash 八卡H20 实测来了,一起看下552B 参数加 196B Engram 参数的模型在SGLang运行结果 启动参数: sglang serve --model-path /model --served-model-name deepseek-v41-flash --tp 8 --ep-size 8 --context-length 32768 --max-running-requests 32 --mem-fraction-static 0.85 --attention-backend dsv4 --moe-runner-backend flashinfer_mxfp4 --reasoning-parser auto --tool-call-parser auto --enable-metrics --disable-radix-cache --host 0.0.0.0 --port 30000 测试方法: 核心矩阵为 1,024/128、8,192/128、1,024/512、24,576/128 Token,各测 C1、C8、C32,每组单独预热后正式重复三轮。各轮请求数分别为 8、16、64。C 是客户端并发上限,服务端最大运行序列也是 32 和历史V4测试对比结果: DeepSeek-V4.1-Flash 结果稍快一点,但开始回答之后,输出速度比 DeepSeek-V4-Flash 慢,整体吞吐也更低,实际token/s 速度达不到DeepSeek API 中V4.1三倍提升的效果🤣
顯示更多
MiniMax H3:租显卡还是买显卡?两种自建方案对比 想自己部署 MiniMax H3,真正需要解决的不是软件,而是 GPU。SGLang、ComfyUI 和模型代码基本都能免费使用,但 H3 视频生成需要大量显存和算力。 目前主要有两条路:租云显卡,或者自己买显卡。 方案一:租云显卡 租一台带 RTX 5090 的云服务器,按小时开机,用完关机。 以当前云平台公开价格估算: • RTX 5090 32GB:约 $0.99/小时,折合约 ¥7/小时 • 使用 20 小时:约 ¥143 • 使用 100 小时:约 ¥713 • 使用 300 小时:约 ¥2,140 • 连续开一个月:约 ¥5,130 • 另外还要算磁盘、流量和模型存储费用 我在某鱼看了一下RTX 5090 32GB 一小时也要5元 ,现在模型很火商家坐地起价也很正常 优点: • 不用一次性买显卡 • 不用处理散热、供电和驱动 • 按小时计费,用多少算多少 • 可以先测试 H3 到底适不适合自己 • 需要批量生成时,可以临时升级多卡服务器 缺点: • 长期使用会越来越贵 • 云服务器网络和硬盘可能额外收费 • 机器库存、地区和价格会变化 • 需要自己配置 Linux、驱动和运行环境 • 单张 5090 主要适合测试和个人使用,速度不会像官方云服务那么快 适合的人: 偶尔做视频、刚开始研究 H3、暂时不确定使用量的人。 方案二:自己买显卡 购买一张 RTX 5090 32GB,装到自己的台式机里,在本地部署 H3。 粗略预算如下:按照当下某鱼我看到的最新价格算 • RTX 5090 显卡:约 ¥15,000~35,000(闲鱼15000的5090很多是钓鱼/故障卡,实际靠谱可成交,大多要1.7万以上) • 64GB 内存:约 ¥1,300~2,000 • 1TB 以上 NVMe:约 ¥500~1,000(H3本地部署,硬盘建议直接2TB,模型+缓存会吃掉很大空间,1TB会很快爆满) • 电源、主板、CPU、机箱和散热:约 ¥4,000~8,000(电源别省!5090功耗很高,最低850W金牌以上,优先选1000W更稳妥) • 整机大约:¥20,000~45,000 实际价格看品牌、行情和你已有的配件。只买显卡、不配整机的话,成本会低一些。 RTX5090不是跑H3的最低门槛,4090(24G)量化后也能跑,只是分辨率、时长受限。(这是已5090为例 至少要玩的舒服一些 ) 后续主要是电费: • 整机满载大约 0.7~1 度电/小时 • 按每度电 ¥0.6~1 计算 • 每运行 100 小时电费约 ¥40~100 • 每月运行 300 小时,电费约 ¥120~300 优点: • 买下来后不用按小时交租金 • 文件和模型都在自己电脑里 • 没有云平台停机、封号和库存问题 • 可以长期运行,也能部署其他 AI 模型 • 大量使用时,单次生成成本更低 缺点: • 前期投入高 • 需要自己处理驱动、CUDA、散热和系统故障 • 显卡会折旧,满载运行也有噪音和耗电 • 5090 32GB 仍然属于单卡测试档,H3 需要 offload,速度有限 • 想做多人服务或批量生产,单卡不够,还要上 4 卡服务器 两种方案怎么选?简单看使用时间: • 每月使用 20~100 小时:租显卡更划算 • 每月使用约 300 小时:开始接近买显卡的合理区间 • 每月长期超过 500 小时:买显卡更合适 • 要多人同时使用:直接考虑多卡服务器,不要买一张 5090 硬扛 按租赁价格计算,一台 ¥20,000 左右的 5090 整机,理论上运行约 3,000 小时可以抵掉租金。考虑显卡折旧、维护、断电和闲置时间,实际回本周期大约 10~18 个月。 最推荐的路线 如果只是个人做视频: 先租一张 RTX 5090,花 ¥200 左右测试 20 小时,跑通 MiniMax H3-Base 的 768p 生成。确认速度、画质和使用频率都能接受后,再考虑买整机。 如果已经确定每天都要生成,或者每月使用超过 300 小时: 买一张 RTX 5090 本地部署更合适。系统建议 Ubuntu,内存 64GB,NVMe 至少 200GB,使用 ComfyUI 或 SGLang。 如果是商业批量生产: 考虑 4 张 A100/H100 级别显卡,用 SGLang 部署。成本会明显上升,不适合个人刚开始就投入。 还要注意一点:本地 H3 主要能跑 H3-Base 的 768p 流程,官方 H3-Context-IR 和 H3-Regenerate-2K 目前没有完全开源。想复现完整 2K 效果,需要调用官方 API。 总结: 不确定用多少,先租;确定长期高频使用,再买。先花 ¥200 验证,比直接花两三万买机器稳得多。
顯示更多
0
99
38
0
轉發到社區
阿里平头哥把真武AI芯片的整套软件栈开源了。 开发者可以直接获取底层驱动,编译器,算子库和调试工具,不用只靠芯片厂商内部适配。 这套软件栈叫T-Head SAIL,已经适配PyTorch,TensorFlow,vLLM和SGLang等260多个训练与推理框架。平头哥称,主流推理框架的平均适配时间可以压到7天以内。 公司同时披露,真武AI芯片截至今年4月累计出货超过56万片,覆盖400多家客户。
顯示更多
小米 给每个人送 820亿token ... 原因是: 推理技术优化说明 本次价格调整背后,离不开小米技术团队在推理系统上的持续优化。 我们基于 SGLang HiCache 完整支持 SWA(Sliding Window Attention),将 KV Cache 在 GPU 显存、CPU 内存、SSD 等多级存储之间的数据搬运量降低至优化前的近 1/7,并将可缓存 token 数量提升至优化前的近 5 倍,显著提升了缓存命中率和推理效率。 同时,我们通过优化专家并行方案、输入长度分桶策略等,进一步提升了集群输入吞吐能力,从而在保障服务质量的前提下持续降低单位 token 服务成本。
顯示更多
今天结束了,看完发布会,这次 Qwen 发布了不少新模型,但更值得关注的是,它正在形成一套从模型训练、推理优化到芯片协同的完整研发体系。 其中一个重点是 RSI,也就是模型递归自我进化。Qwen3.8-Max 在较少人工干预的情况下,连续运行一个多月,完成了 33 轮有效迭代。 几个现场公布的数据很直观: - Qwen 自主适配新的硬件环境并优化 SGLang,单实例吞吐提升 96% - 在芯片设计实验中连续运行 60 多个小时,调用 EDA 工具超过 1 万次,最终将物理实现面积减少 42% -Qwen3.8-Flash 缓存命中的输入,每百万 Token 低至 0.1 元 - Qwen3.8-27B 用消费级显卡的电脑就能运行,被开发者称为本地版 Opus 4.6 这次发布的 Qwen3.8-Omni-Flash 也很值得关注。它将文本、图像、音频和视频放进统一的理解框架,支持 1M 上下文和最长 1 小时的音视频输入。在价格上,四种模态统一计费,输入每百万 Token 0.8 元,缓存命中只要 0.1 元。相比上一代模型,输入价格下降约九成。 从现场释放的信息来看,Qwen 的方向已经比较清楚,继续提高模型能力,同时降低运行成本,并让模型更深入地参与训练、推理和芯片设计流程。此外,Qwen 还在继续押注 Scaling 和统一多模态。采用新一代架构的 Qwen4 已经开始训练,后续 Qwen4.5、Qwen5 计划将总参数量扩展到 5 万亿至 10 万亿。阿里在现场还提到,未来三年可能会出现原生的全模态统一模型,模型体验将不再受文本、图像、音频和视频之间的边界限制。 与此同时,Qwen 的开源生态也在快速扩大。目前阿里已经开源 460 多个 Qwen 模型,累计下载量超过 30 亿次,衍生模型超过 30 万个。Qwen3.8-27B 也超过 DeepSeek-R1 和 Llama 3.1,成为 Hugging Face 历史上获赞最多的开源大模型。 对开发者来说,最直接的变化就是模型更强了,本地运行门槛更低了,音视频处理也更便宜了。
顯示更多
0
21
12
0
轉發到社區
🔬 RadixArk 开源了一个专门干大模型后训练的强化学习框架 Miles,几千张卡的任务中途挂了也不用从头再来 GitHub 上两千六百多 star、四百多个 fork,v0.1 是今年 8 月刚发的。 做过大规模后训练的都知道最肉疼的是哪一下:一个任务连着跑好几天,推理引擎中间抽风一次,整个作业就得重启,几十小时的卡时直接打水漂。Miles 把这件事按住了,SGLang 引擎出问题时能原地恢复接着跑,不重启任务。 它的分工是 SGLang 扛高吞吐 rollout、Megatron-LM 扛可扩展训练,想轻装上阵也有一套基于 PyTorch FSDP2 的后端。中间那些隐形损耗它也一并收拾了:rollout 和训练之间不再来回 detokenize 和 retokenize,token 进 token 出;MoE 老大难的路由不一致,用 Rollout Routing Replay 压了下去。 再往上,MXFP8 和 NVFP4 这类低精度训练它支持,硬件从 NVIDIA 的 GB300、B200 一路吃到 AMD 的 MI355X,DeepSeek-V4、Kimi-K3、GLM-5.2 这些模型是发布当天就能训。项目本身是从 slime fork 出来的,LoRA 训完的适配器能直接扔给 SGLang 做 rollout,不用中间那道转换。 训大模型最贵的从来不是算力,是重跑一遍的那几天。 GitHub:
顯示更多