5090 这次要吃亏了。显存不够。😂
如果社区扒出来的参数最后是真的:
125B MoE,A6B
+ 51B N-gram Embeddings
总参数大约 176B。
🔥而且 Unsloth 已经明确回复了:
“Yes we are working day zero support for it.”
但这次最有意思的,Qwen4 附带了一个大词表。
以前的 Qwen 当然也有词表,也有 Embedding。
比如 Qwen3.8-27B 这种普通 Dense 模型,也要先把 Token 映射成 embedding vector,再送进 Transformer 里算。
区别是:
以前这种 Token Embedding 只是模型入口的一小部分。
这次传闻里的 51B N-gram Embeddings,如果属实,就完全不是一个量级了。
如果这 51B 能独立量化、放系统内存或者统一内存,GPU 按需 lookup,那一个看着 176B 的模型,实际 GPU 部署门槛可能低很多。
🔥硬件版图也突然变得很有意思:
BF16 → M5 Ultra 512G
FP8 → 双 DGX Spark
4bit → 单 Spark / PRO 6000 96G / 双 48G 4090
然后最尴尬的来了:
双 5090。
算力很猛。
两张卡加起来才 64GB 显存。
这次可能真要被显存卡死。👇
显示更多