今晚中国开源模型圈双响炮。
Qwen3.8-Flash-Next:Qwen4 新架构预览,今晚开权重。
Ox Alpha:智谱已向彭埠社确认,就是 GLM 系列新版本,今晚也放权重。
我准备第一时间把,Qwen 部署上。
最期待的还是唐总出来一句:
“对,牛来就是我。” 😂
最近智谱股价也够刺激。
8 月 24 日单日跌了 10.81%,前一周还出现过 -13.3% 的一天。
这时候真的需要来头牛了。
牛来。
牛来。
快涨啊 😂
显示更多
5090 这次要吃亏了。显存不够。😂
如果社区扒出来的参数最后是真的:
125B MoE,A6B
+ 51B N-gram Embeddings
总参数大约 176B。
🔥而且 Unsloth 已经明确回复了:
“Yes we are working day zero support for it.”
但这次最有意思的,Qwen4 附带了一个大词表。
以前的 Qwen 当然也有词表,也有 Embedding。
比如 Qwen3.8-27B 这种普通 Dense 模型,也要先把 Token 映射成 embedding vector,再送进 Transformer 里算。
区别是:
以前这种 Token Embedding 只是模型入口的一小部分。
这次传闻里的 51B N-gram Embeddings,如果属实,就完全不是一个量级了。
如果这 51B 能独立量化、放系统内存或者统一内存,GPU 按需 lookup,那一个看着 176B 的模型,实际 GPU 部署门槛可能低很多。
🔥硬件版图也突然变得很有意思:
BF16 → M5 Ultra 512G
FP8 → 双 DGX Spark
4bit → 单 Spark / PRO 6000 96G / 双 48G 4090
然后最尴尬的来了:
双 5090。
算力很猛。
两张卡加起来才 64GB 显存。
这次可能真要被显存卡死。👇
显示更多