🎉GLM-5.3-Flash 实测也来了,依然是上次的 4 张 141 GB H20配置,分别跑通 SGLang 和 vLLM,使用官方 FP8 权重、BF16 KV Cache、近 1M 上下文的实测
1. 短请求测试:SGLang 1 并发 74.7 token/s,32 并发 847.1 token/s;vLLM 分别为 107.7、1156.9 token/s
2. 运行环境:SGLang 功能验证更加完整,已接入 OpenWebUI;vLLM 使用专用预览镜像,测试时主仓支持尚未合入。本轮均关闭 MTP
3. 官方 FP8 权重 62 个分片,合计约 328 GB,每卡权重显存约 75 GiB;SGLang 权重加载耗时 130.59 秒,vLLM 最慢 Rank 耗时 365.69 秒
4. 两套引擎均通过近 1M 上下文请求和大海捞针测试,104 万 Token 输入的冷缓存首 Token 延迟分别为 167.69 秒、160.96 秒;本次没有复现 SGLang 社区 262K 边界崩溃的问题
显示更多