註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

雪瑜
@xueyu1125
🤖 AI Builder | 程序员 | AI 工具实践 🎮 游戏服务器开发 | Steam游戏收集控 🚀 专注美股 | 纳斯达克信仰者 🥳 热爱生活 | 偶尔写段子
加入 September 2014
3.5K 正在關注    6K 粉絲
DeepSeek-V4.1-Flash 八卡H20 实测来了,一起看下552B 参数加 196B Engram 参数的模型在SGLang运行结果 启动参数: sglang serve --model-path /model --served-model-name deepseek-v41-flash --tp 8 --ep-size 8 --context-length 32768 --max-running-requests 32 --mem-fraction-static 0.85 --attention-backend dsv4 --moe-runner-backend flashinfer_mxfp4 --reasoning-parser auto --tool-call-parser auto --enable-metrics --disable-radix-cache --host 0.0.0.0 --port 30000 测试方法: 核心矩阵为 1,024/128、8,192/128、1,024/512、24,576/128 Token,各测 C1、C8、C32,每组单独预热后正式重复三轮。各轮请求数分别为 8、16、64。C 是客户端并发上限,服务端最大运行序列也是 32 和历史V4测试对比结果: DeepSeek-V4.1-Flash 结果稍快一点,但开始回答之后,输出速度比 DeepSeek-V4-Flash 慢,整体吞吐也更低,实际token/s 速度达不到DeepSeek API 中V4.1三倍提升的效果🤣
顯示更多