SGLang 的 DSpark 实测数据在PR里放出了, 几个测试场景基本都能达到预测3个token, 其中数学类prompt是3.37个, 日常对话是3个, 代码是3.52个(果然代码是废token比较多的).
最亮眼的是加速比了, 在1K长度prompt下加速比来到了1.81倍. 测试使用的是8卡B200, 速度来到了 297 token/s. 而不使用DSpark 则是 164 token/s.
另外作者还测试了不同并发情况下的加速比, 目前来看单并发提升是最高的, 而超过8并发则只有1.2-1.3倍的提速了, 主要还是把GPU打满了.
另外比较震惊的数据时 DSpark 的 TPOT (每个输出 Token 的耗时) 只有2.9-5.2ms, 说明了这个DSpark内置的神经网络层运行得特别快. DSpark带来的延迟基本可以忽略不计了.
注意这个PR还没合并, 如果想尝试可以单独Fork这个PR29538.
显示更多
感觉我也可以魔改 sglang 、 vllm ,用于调试 DSpark 这类新能力, 看看效果是不是和吹的一样好。
现在租用一个 GPU又不贵。
大模型预训练需要烧很多钱,烧很多数据才能验证,
大模型推理看起来门槛并没那么高,小成本也可以验证/验收能力。
显示更多
在最近的开源热潮中,SGLang和vLLM等开源推理引擎成为算力优化的核心技术。DeepSeek、Kimi等模型一上线就实现Day-0支持,昨天Google Cloud TPU也官宣引入SGLang。
这背后是AI Infra的千亿级市场和需求:当推理成为AI的主战场,GPU看似满载,却仍把大量时间耗在重复计算、缓存搬运和任务等待上。AI Infra深处,一场围绕调度与系统优化的效率革命已经开始。为什么最昂贵的GPU仍会“又忙又闲”?AI Infra还能榨出多少藏在“硅”里的性能?当算力增长不再只靠堆卡,AI竞争的尺度会被怎样改写?这期视频,我们与推理引擎开源社区SGLang孵化出的RadixArk团队一起,深入探讨这场算力效率变革。
显示更多
MiniMax H3:租显卡还是买显卡?两种自建方案对比
想自己部署 MiniMax H3,真正需要解决的不是软件,而是 GPU。SGLang、ComfyUI 和模型代码基本都能免费使用,但 H3 视频生成需要大量显存和算力。
目前主要有两条路:租云显卡,或者自己买显卡。
方案一:租云显卡
租一台带 RTX 5090 的云服务器,按小时开机,用完关机。
以当前云平台公开价格估算:
• RTX 5090 32GB:约 $0.99/小时,折合约 ¥7/小时
• 使用 20 小时:约 ¥143
• 使用 100 小时:约 ¥713
• 使用 300 小时:约 ¥2,140
• 连续开一个月:约 ¥5,130
• 另外还要算磁盘、流量和模型存储费用
我在某鱼看了一下RTX 5090 32GB 一小时也要5元 ,现在模型很火商家坐地起价也很正常
优点:
• 不用一次性买显卡
• 不用处理散热、供电和驱动
• 按小时计费,用多少算多少
• 可以先测试 H3 到底适不适合自己
• 需要批量生成时,可以临时升级多卡服务器
缺点:
• 长期使用会越来越贵
• 云服务器网络和硬盘可能额外收费
• 机器库存、地区和价格会变化
• 需要自己配置 Linux、驱动和运行环境
• 单张 5090 主要适合测试和个人使用,速度不会像官方云服务那么快
适合的人:
偶尔做视频、刚开始研究 H3、暂时不确定使用量的人。
方案二:自己买显卡
购买一张 RTX 5090 32GB,装到自己的台式机里,在本地部署 H3。
粗略预算如下:按照当下某鱼我看到的最新价格算
• RTX 5090 显卡:约 ¥15,000~35,000(闲鱼15000的5090很多是钓鱼/故障卡,实际靠谱可成交,大多要1.7万以上)
• 64GB 内存:约 ¥1,300~2,000
• 1TB 以上 NVMe:约 ¥500~1,000(H3本地部署,硬盘建议直接2TB,模型+缓存会吃掉很大空间,1TB会很快爆满)
• 电源、主板、CPU、机箱和散热:约 ¥4,000~8,000(电源别省!5090功耗很高,最低850W金牌以上,优先选1000W更稳妥)
• 整机大约:¥20,000~45,000
实际价格看品牌、行情和你已有的配件。只买显卡、不配整机的话,成本会低一些。
RTX5090不是跑H3的最低门槛,4090(24G)量化后也能跑,只是分辨率、时长受限。(这是已5090为例 至少要玩的舒服一些 )
后续主要是电费:
• 整机满载大约 0.7~1 度电/小时
• 按每度电 ¥0.6~1 计算
• 每运行 100 小时电费约 ¥40~100
• 每月运行 300 小时,电费约 ¥120~300
优点:
• 买下来后不用按小时交租金
• 文件和模型都在自己电脑里
• 没有云平台停机、封号和库存问题
• 可以长期运行,也能部署其他 AI 模型
• 大量使用时,单次生成成本更低
缺点:
• 前期投入高
• 需要自己处理驱动、CUDA、散热和系统故障
• 显卡会折旧,满载运行也有噪音和耗电
• 5090 32GB 仍然属于单卡测试档,H3 需要 offload,速度有限
• 想做多人服务或批量生产,单卡不够,还要上 4 卡服务器
两种方案怎么选?简单看使用时间:
• 每月使用 20~100 小时:租显卡更划算
• 每月使用约 300 小时:开始接近买显卡的合理区间
• 每月长期超过 500 小时:买显卡更合适
• 要多人同时使用:直接考虑多卡服务器,不要买一张 5090 硬扛
按租赁价格计算,一台 ¥20,000 左右的 5090 整机,理论上运行约 3,000 小时可以抵掉租金。考虑显卡折旧、维护、断电和闲置时间,实际回本周期大约 10~18 个月。
最推荐的路线 如果只是个人做视频:
先租一张 RTX 5090,花 ¥200 左右测试 20 小时,跑通 MiniMax H3-Base 的 768p 生成。确认速度、画质和使用频率都能接受后,再考虑买整机。
如果已经确定每天都要生成,或者每月使用超过 300 小时:
买一张 RTX 5090 本地部署更合适。系统建议 Ubuntu,内存 64GB,NVMe 至少 200GB,使用 ComfyUI 或 SGLang。
如果是商业批量生产:
考虑 4 张 A100/H100 级别显卡,用 SGLang 部署。成本会明显上升,不适合个人刚开始就投入。
还要注意一点:本地 H3 主要能跑 H3-Base 的 768p 流程,官方 H3-Context-IR 和 H3-Regenerate-2K 目前没有完全开源。想复现完整 2K 效果,需要调用官方 API。
总结:
不确定用多少,先租;确定长期高频使用,再买。先花 ¥200 验证,比直接花两三万买机器稳得多。
显示更多
阿里平头哥把真武AI芯片的整套软件栈开源了。
开发者可以直接获取底层驱动,编译器,算子库和调试工具,不用只靠芯片厂商内部适配。
这套软件栈叫T-Head SAIL,已经适配PyTorch,TensorFlow,vLLM和SGLang等260多个训练与推理框架。平头哥称,主流推理框架的平均适配时间可以压到7天以内。
公司同时披露,真武AI芯片截至今年4月累计出货超过56万片,覆盖400多家客户。
显示更多
小米 给每个人送 820亿token ...
原因是:
推理技术优化说明
本次价格调整背后,离不开小米技术团队在推理系统上的持续优化。
我们基于 SGLang HiCache 完整支持 SWA(Sliding Window Attention),将 KV Cache 在 GPU 显存、CPU 内存、SSD 等多级存储之间的数据搬运量降低至优化前的近 1/7,并将可缓存 token 数量提升至优化前的近 5 倍,显著提升了缓存命中率和推理效率。
同时,我们通过优化专家并行方案、输入长度分桶策略等,进一步提升了集群输入吞吐能力,从而在保障服务质量的前提下持续降低单位 token 服务成本。
显示更多
🖌️ 百度把自家的文生图模型开源了,权重直接放出来
80 亿参数的单流扩散 Transformer,GenEval 总分 0.8856
国内能拿到开放权重的文生图模型本来就不多,能把中文长文本渲染好的更少。想在图里放一句中文标语,出来经常是缺笔画的字符。
ERNIE-Image 在这块的成绩不错,LongTextBench 中英文平均分拿到 0.9733。它放了两个版本:标准版推理 50 步、CFG 4.0,追求质量;Turbo 版经过 DMD 和强化学习优化,8 步、CFG 1.0 就能出图,快得多。
生态接得也够全:Diffusers 和 SGLang 支持调用部署,ComfyUI 有 Turbo 版工作流模板,Unsloth 能构建 GGUF 权重,AI-Toolkit 支持微调。Apache 2.0 协议。
模型开源这件事上,权重放出来才算数。
GitHub:
显示更多
推荐这篇文章,Together AI 的 ThunderAgent(ICML 2026 Spotlight)。
把 agent 工作流当成一个"程序"来调度,而非一系列无关的请求——单节点吞吐翻倍,8 节点近线性扩展。
Together AI 在 7 月 29 日发布了 ThunderAgent——一个面向 agentic 推理的高吞吐调度系统。ICML 2026 Spotlight 论文。核心贡献:把 agent workflow 抽象为"程序"而非"一系列不相关的请求"。
问题:KV Cache Thrashing
Agent 工作流在两个阶段之间交替:GPU 密集的推理阶段和 GPU 空闲的等待工具返回阶段。当数百个 agent 并发运行时,各自的 KV cache 在每轮不断增长,竞争有限的 GPU 内存。
传统推理引擎(vLLM、SGLang、TensorRT-LLM)按请求级别调度——agent A 暂停等待工具调用时,它的 KV cache 被 LRU 淘汰腾出空间给 agent B 的 prefill。当 A 的工具返回,引擎必须从头重算 A 的整段对话历史,这又淘汰了 C 的 cache。高并发下,这种淘汰和重算的级联反应导致严重的吞吐量和延迟退化——论文称之为 KV cache thrashing。
能通过加 GPU 节点解决吗?不完全。现有多节点路由器(如 SGLang Gateway)把每个 agent 钉在固定节点上以保留 cache 局部性——但 agent 的上下文长度不可预测增长,某些节点被赋予长上下文 agent 导致内存耗尽,其他节点闲置。
能通过 KV cache offloading 解决吗?也解决不了。LMCache 和 HiCache 把 KV cache 卸载到 CPU 内存或磁盘,扩大了总容量但只是延迟 thrasthing。当并发 agent 的工作集超过所有存储层级时,淘汰恢复,同一个恶性循环重现。
ThunderAgent 的解法
ThunderAgent 在 agentic 客户端和推理后端之间插入一个轻量调度层。它将每个 agent 工作流抽象为一个可调度程序(program),追踪其执行阶段、KV cache 占用和节点位置。
Program-level admission control:监控每个节点的内存压力,选择性暂停低优先级工作流,减少竞争 cache 的程序数量。当被暂停的工作流准备恢复时,通过全局等待队列路由到容量最充足的节点。
多节点部署:用全局等待队列替代了基于 session 的静态节点绑定。暂停的工作流恢复时被路由到可用容量最多的节点,在 KV cache 局部性和多节点负载均衡之间取得平衡。
评测
集成在 Together AI 自己的合成数据生成管道里——就是产生 CoderForge 等数据集的那套基础设施。对比 SGLang 默认调度器:
单节点 8×H100(HiCache offloading),batch size 192:
• SGLang:吞吐 390 token/s,平均延迟 65s
• ThunderAgent:吞吐 803 token/s,平均延迟 10.6s
多节点(2→8 节点):
• 近线性扩展,16 GPU 到 64 GPU 吞吐从 671 增长到 2248 steps/min
• 加速比随集群规模增大:2 节点 1.79× → 8 节点 2.39×
使用
一个 program_id 字段,OpenAI 兼容 API,直接适配现成的 offloading 和 speculative decoding。已被 SkyRL 和 NVIDIA Dynamo 集成。
GitHub:
论文:
#
AgentInference# #
KVcache# #
ThunderAgent#
显示更多
你的大模型每天都在重复处理同一批上下文,
而你还在为这些重复计算持续付费。
系统提示词、长文档、知识库片段、Agent 历史记录——
明明刚算过一次,
下一次请求还是从头重算。
模型单价虽然在降,
但 Agent 不断重发长上下文,账单照样往上涨。
这个开源项目就是专门解决这件事的:
LMCache
它是一个面向大模型推理的 KV Cache 管理层,
目前可以接入:
• vLLM
• SGLang
• TensorRT-LLM
原理很直接:
把已经计算过的 KV Cache 保存下来。
后面遇到相同或可复用的上下文,
直接读取缓存,
不用再让模型从第一个 Token 重新计算。
几个重点:
1. 重复上下文不再反复计算
特别适合长系统提示词、RAG 文档和多轮 Agent 任务。
2. 缓存服务独立运行
可以单独进程管理缓存,
尽量减少对模型推理资源的占用。
3. 支持跨请求复用
不仅是单次会话内加速,
还可以让不同请求复用已有前缀缓存。
项目给出的测试结果显示:
在 H200 上运行 235B 模型时,
• 首 Token 延迟最高提升约 14 倍
• 解码吞吐最高提升约 4 倍
• 特定场景下成本可降低约 90%
注意:
“节省 90% Token”这个说法并不完全准确。
它主要减少的是重复上下文带来的计算、延迟和推理成本,
实际收益取决于缓存命中率、上下文重复程度和部署方式。
如果你在跑:
• 长上下文 Agent
• 固定系统提示词
• 多用户知识库问答
• RAG 服务
• 重复文档分析
• 大模型 API 网关
LMCache 很值得研究。
项目地址:
一句话总结:
以前每次请求都让模型重新读一遍,
现在把读过的内容缓存下来,
下次直接接着算。
显示更多
腾讯混元 v3 的代码主要在 GitHub 的 Tencent-Hunyuan/Hy3-preview 仓库查看。
主要链接:
GitHub 仓库(包含代码、推理脚本、训练文档等):
模型权重下载(Hugging Face 等平台):Hugging Face: tencent/Hy3-preview(以及 Base 版本)
ModelScope: Tencent-Hunyuan/Hy3-preview
GitCode: 对应仓库也有镜像
其他信息:
Hy3-preview 是腾讯混元(Hunyuan)发布的开源 MoE 模型(总参数 295B,激活 21B + MTP 层),支持 vLLM、SGLang 等推理框架。
显示更多