🔥 终于有人把我想做的测试先做了。
同一台 DGX Spark,同一个 Qwen3.8-27B,用类似的 4-bit 量化级别:
SGLang / vLLM / llama.cpp 三个 Runtime Pk 跑一轮。
先看单路 Coding + DFlash2:
SGLang:36.59 tok/s
vLLM:32.01 tok/s
llama.cpp:30.02 tok/s
SGLang 最快。
🔥结果到了 Agent Tool Calling,反转了
SGLang:54.99 tok/s,16/18 成功
vLLM:47.41 tok/s,18/18 全过
最后跑 Tool-heavy Agent,反而推荐 vLLM + DFlash2。
这里说明一下:这不是三个 Runtime 共用完全相同的模型文件。
SGLang 和 vLLM 都是 NVFP4,但量化/转换产物不同;llama.cpp 用的是 GGUF Q4_K_M。
所以更准确地说,这是:
同模型、同机器、类似量化级别,不同完整部署栈的实战横评。
这个结果我觉得特别有意思。
以前测 Runtime,大家狠狠干 tok/s。
到了 Agent 时代,最快的 Runtime,不一定是最好的 Agent Runtime。
Parser、Tool Calling、长任务稳定性,都得一起测。
不然 55 tok/s 跑得飞快。
最后工具没调出来 😂
顯示更多
单卡 DGX Spark 跑 Qwen3.8-27B FP8 + DSpark k=14 投机解码:改代码该文章 30~45+ tok/s,但闲聊只有 ~8
tok/s
投机解码只对照抄型输出有效。
不适合多人并发。
我觉得DGX Spark 不适合部署 Qwen ,273 GB/s带宽下 27B dense 现编就是 ~10 tok/s 顶天。
可以再观望一下社区的优化。
顯示更多