⚡ 震惊,有人为了让 Qwen3.8-27B 在单张 RTX 5090 上跑得更快,硬是把 vLLM 改了七轮,成果就是 Qwen3.8-Inference-MetaZenith 这个分支。
效果是拿数据说话的:基线版和优化后的 R107 版跑了 18 组对比,生成吞吐的几何平均从 51.9 提到 84.9,涨了 63.5%;上下文拉到 65536、并发为 1 的那一档,涨幅直接到 310%。
自己编译 vLLM 折腾过 Blackwell 卡的应该有体会:装 CUDA Toolkit、对着编译目标一个个试,编出来还不一定比官方版快多少。
Qwen3.8-Inference-MetaZenith 把调好的结果整个端出来了。它基于 vLLM v0.27.1,动了 24 个上游文件,加了三千三百多行,七个阶段挨个啃——解码调度、输出投影、精确解码内核、批量预填充调度、预填充融合,重点都压在 TurboQuant 和 Gated Delta Network 这两条执行路径上。预编译好的 wheel 也放出来了,装 wheel 这条路不需要 CUDA Toolkit 和 nvcc,驱动对得上就行。
说清楚适用范围:它是给 sm_120 的 RTX 5090 加特定模型做的专用分支,换卡换模型就不是这个故事了。
这么窄的一个场景居然有人认真调了七轮,属实硬核。
GitHub:
顯示更多