🧑🔬 兄弟们,手里有 AMD MI300X 卡的看这个,deepseek-v4-flash-mi300x 把单卡跑 DeepSeek V4 Flash 的整套生产配置摊开了。
作者给的不是「理论上可行」,是实测数字:没命中缓存的预填充稳定在 11.69K tok/s,是原始配置 5.26K 的 2.19 倍;64 路并发压测聚合吞吐到 1278 tok/s,没爆显存也没有引擎报错;384K 上下文实测可用。
在 AMD 卡上把大模型跑进生产,难点从来不在显存够不够,MI300X 有 192GB HBM3,装下 156.67 GiB 的权重不用额外量化。难的是一路踩坑:路由精度、FP8 索引字节、分页注意力的偏移、稀疏 top-k 的确定性,哪个没对上,输出就开始冒奇怪的字符。deepseek-v4-flash-mi300x 把这些修复一条条记下来了,还附上跟上游的参考 diff、校验过的文件覆盖层、gfx942 的即时编译内核源码和调优表,照着能复现。
最能说明问题的是那组回归测试:6.14 万 token、120 个种子,修复之后异常跳过标记 0 次、乱码字符 0 次,而之前的版本 120 次响应里有 3 次会出。
把坑和补丁一起公开的仓库,比一句「我跑通了」值钱得多。
GitHub:
顯示更多