TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Ren
@Ryrenz
参加 March 2025
0
フォロー中
0
ファン
Ren
@Ryrenz
2026.09.10 09:05
⚡ 震惊,有人为了让 Qwen3.8-27B 在单张 RTX 5090 上跑得更快,硬是把 vLLM 改了七轮,成果就是 Qwen3.8-Inference-MetaZenith 这个分支。 效果是拿数据说话的:基线版和优化后的 R107 版跑了 18 组对比,生成吞吐的几何平均从 51.9 提到 84.9,涨了 63.5%;上下文拉到 65536、并发为 1 的那一档,涨幅直接到 310%。 自己编译 vLLM 折腾过 Blackwell 卡的应该有体会:装 CUDA Toolkit、对着编译目标一个个试,编出来还不一定比官方版快多少。 Qwen3.8-Inference-MetaZenith 把调好的结果整个端出来了。它基于 vLLM v0.27.1,动了 24 个上游文件,加了三千三百多行,七个阶段挨个啃——解码调度、输出投影、精确解码内核、批量预填充调度、预填充融合,重点都压在 TurboQuant 和 Gated Delta Network 这两条执行路径上。预编译好的 wheel 也放出来了,装 wheel 这条路不需要 CUDA Toolkit 和 nvcc,驱动对得上就行。 说清楚适用范围:它是给 sm_120 的 RTX 5090 加特定模型做的专用分支,换卡换模型就不是这个故事了。 这么窄的一个场景居然有人认真调了七轮,属实硬核。 GitHub:
もっと見る
0
0
4
74
5
コミュニティへ転送
人気のあるユーザー
GIGA特撮ヒロイン【公式】
@giga_web
63K ファン
New York Post
@nypost
4.2M ファン
オリコンニュース
@oricon
1.9M ファン
TVer新着
@TVer_info
100.8K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
Reuters
@Reuters
26.4M ファン
First Squawk
@FirstSquawk
569K ファン
billboard
@billboard
16.8M ファン
ファミ通.com
@famitsu
1.4M ファン
モデルプレス
@modelpress
2.1M ファン
Bloomberg
@business
10.5M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K ファン
一劍浣春秋
@chee828
231.9K ファン
吴说区块链
@wublockchain12
181.5K ファン
空空道人
@Kongkongda5882
34.1K ファン