TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
实践哥 Li
@MinLiBuilds
AI Builder 超级个体。实践哥Li不做概念党,只聊 AI 实战。分享Claude,Codex,Grok,Gemini, 开源大模型各种一手折腾心得。
Joined July 2023
2.1K
Following
18.5K
Followers
实践哥 Li
@MinLiBuilds
2026.08.26 00:48
🔥 终于有人把我想做的测试先做了。 同一台 DGX Spark,同一个 Qwen3.8-27B,用类似的 4-bit 量化级别: SGLang / vLLM / llama.cpp 三个 Runtime Pk 跑一轮。 先看单路 Coding + DFlash2: SGLang:36.59 tok/s vLLM:32.01 tok/s llama.cpp:30.02 tok/s SGLang 最快。 🔥结果到了 Agent Tool Calling,反转了 SGLang:54.99 tok/s,16/18 成功 vLLM:47.41 tok/s,18/18 全过 最后跑 Tool-heavy Agent,反而推荐 vLLM + DFlash2。 这里说明一下:这不是三个 Runtime 共用完全相同的模型文件。 SGLang 和 vLLM 都是 NVFP4,但量化/转换产物不同;llama.cpp 用的是 GGUF Q4_K_M。 所以更准确地说,这是: 同模型、同机器、类似量化级别,不同完整部署栈的实战横评。 这个结果我觉得特别有意思。 以前测 Runtime,大家狠狠干 tok/s。 到了 Agent 时代,最快的 Runtime,不一定是最好的 Agent Runtime。 Parser、Tool Calling、长任务稳定性,都得一起测。 不然 55 tok/s 跑得飞快。 最后工具没调出来 😂
Show more
实践哥 Li
@MinLiBuilds
2026.08.17 10:28
单卡 DGX Spark 跑 Qwen3.8-27B FP8 + DSpark k=14 投机解码:改代码该文章 30~45+ tok/s,但闲聊只有 ~8 tok/s 投机解码只对照抄型输出有效。 不适合多人并发。 我觉得DGX Spark 不适合部署 Qwen ,273 GB/s带宽下 27B dense 现编就是 ~10 tok/s 顶天。 可以再观望一下社区的优化。
Show more
0
0
48
10
3
Forward to community
Most Popular Users
Tibo
@thsottiaux
752.3K Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Serenity
@aleabitoreddit
1M Followers
Elon Musk
@elonmusk
241.7M Followers
Sam Altman
@sama
6.3M Followers
zerohedge
@zerohedge
3.4M Followers
Wall St Engine
@wallstengine
196.5K Followers
OpenAI
@OpenAI
5.4M Followers
New York Post
@nypost
4.2M Followers
Polymarket
@Polymarket
2M Followers
Kalshi
@Kalshi
471.2K Followers
Bitcoin Archive
@BitcoinArchive
1.8M Followers
Gavin Baker
@GavinSBaker
349K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
First Squawk
@FirstSquawk
568.7K Followers