TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
가입 March 2025
678
팔로잉 중
10.8K
팬
Ren
@Ryrenz
2026.09.10 09:05
⚡ 震惊,有人为了让 Qwen3.8-27B 在单张 RTX 5090 上跑得更快,硬是把 vLLM 改了七轮,成果就是 Qwen3.8-Inference-MetaZenith 这个分支。 效果是拿数据说话的:基线版和优化后的 R107 版跑了 18 组对比,生成吞吐的几何平均从 51.9 提到 84.9,涨了 63.5%;上下文拉到 65536、并发为 1 的那一档,涨幅直接到 310%。 自己编译 vLLM 折腾过 Blackwell 卡的应该有体会:装 CUDA Toolkit、对着编译目标一个个试,编出来还不一定比官方版快多少。 Qwen3.8-Inference-MetaZenith 把调好的结果整个端出来了。它基于 vLLM v0.27.1,动了 24 个上游文件,加了三千三百多行,七个阶段挨个啃——解码调度、输出投影、精确解码内核、批量预填充调度、预填充融合,重点都压在 TurboQuant 和 Gated Delta Network 这两条执行路径上。预编译好的 wheel 也放出来了,装 wheel 这条路不需要 CUDA Toolkit 和 nvcc,驱动对得上就行。 说清楚适用范围:它是给 sm_120 的 RTX 5090 加特定模型做的专用分支,换卡换模型就不是这个故事了。 这么窄的一个场景居然有人认真调了七轮,属实硬核。 GitHub:
더 보기
0
0
4
74
5
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
Reuters
@Reuters
26.4M 팬
First Squawk
@FirstSquawk
569K 팬
TVer新着
@TVer_info
100.9K 팬
billboard
@billboard
16.8M 팬
Bloomberg
@business
10.5M 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 팬
吴说区块链
@wublockchain12
181.5K 팬
zerohedge
@zerohedge
3.4M 팬
空空道人
@Kongkongda5882
34.1K 팬
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K 팬
몬스타엑스_MONSTA X
@OfficialMONSTAX
4.8M 팬
中國新聞社
@CNS1952
547.4K 팬
一劍浣春秋
@chee828
0 팬