가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
가입 March 2025
677 팔로잉 중    10.9K 팬
🧑‍🔬 兄弟们,手里有 AMD MI300X 卡的看这个,deepseek-v4-flash-mi300x 把单卡跑 DeepSeek V4 Flash 的整套生产配置摊开了。 作者给的不是「理论上可行」,是实测数字:没命中缓存的预填充稳定在 11.69K tok/s,是原始配置 5.26K 的 2.19 倍;64 路并发压测聚合吞吐到 1278 tok/s,没爆显存也没有引擎报错;384K 上下文实测可用。 在 AMD 卡上把大模型跑进生产,难点从来不在显存够不够,MI300X 有 192GB HBM3,装下 156.67 GiB 的权重不用额外量化。难的是一路踩坑:路由精度、FP8 索引字节、分页注意力的偏移、稀疏 top-k 的确定性,哪个没对上,输出就开始冒奇怪的字符。deepseek-v4-flash-mi300x 把这些修复一条条记下来了,还附上跟上游的参考 diff、校验过的文件覆盖层、gfx942 的即时编译内核源码和调优表,照着能复现。 最能说明问题的是那组回归测试:6.14 万 token、120 个种子,修复之后异常跳过标记 0 次、乱码字符 0 次,而之前的版本 120 次响应里有 3 次会出。 把坑和补丁一起公开的仓库,比一句「我跑通了」值钱得多。 GitHub:
더 보기