TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
Joined March 2025
678
Following
10.8K
Followers
Ren
@Ryrenz
2026.09.10 09:05
⚡ 震惊,有人为了让 Qwen3.8-27B 在单张 RTX 5090 上跑得更快,硬是把 vLLM 改了七轮,成果就是 Qwen3.8-Inference-MetaZenith 这个分支。 效果是拿数据说话的:基线版和优化后的 R107 版跑了 18 组对比,生成吞吐的几何平均从 51.9 提到 84.9,涨了 63.5%;上下文拉到 65536、并发为 1 的那一档,涨幅直接到 310%。 自己编译 vLLM 折腾过 Blackwell 卡的应该有体会:装 CUDA Toolkit、对着编译目标一个个试,编出来还不一定比官方版快多少。 Qwen3.8-Inference-MetaZenith 把调好的结果整个端出来了。它基于 vLLM v0.27.1,动了 24 个上游文件,加了三千三百多行,七个阶段挨个啃——解码调度、输出投影、精确解码内核、批量预填充调度、预填充融合,重点都压在 TurboQuant 和 Gated Delta Network 这两条执行路径上。预编译好的 wheel 也放出来了,装 wheel 这条路不需要 CUDA Toolkit 和 nvcc,驱动对得上就行。 说清楚适用范围:它是给 sm_120 的 RTX 5090 加特定模型做的专用分支,换卡换模型就不是这个故事了。 这么窄的一个场景居然有人认真调了七轮,属实硬核。 GitHub:
Show more
0
0
4
74
5
Forward to community
Most Popular Users
Tibo
@thsottiaux
767.7K Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Serenity
@aleabitoreddit
1M Followers
Elon Musk
@elonmusk
241.7M Followers
Sam Altman
@sama
6.3M Followers
zerohedge
@zerohedge
3.4M Followers
Wall St Engine
@wallstengine
197.3K Followers
New York Post
@nypost
4.2M Followers
OpenAI
@OpenAI
5.4M Followers
Polymarket
@Polymarket
2M Followers
Kalshi
@Kalshi
471.9K Followers
Bitcoin Archive
@BitcoinArchive
1.8M Followers
SpaceXAI
@SpaceXAI
2.1M Followers
First Squawk
@FirstSquawk
569K Followers
Anthropic
@AnthropicAI
1.8M Followers