🔥你能想象吗?现在手机上就能跑 Qwen3.8 的蒸馏模型,而且最小仅 1.3GB!
果然不能只在 Hugging Face 首页瞎逛
今天用
@Apodex_AI 的 Deep Research 做深度检索时,意外挖到了一个最近刚火起来的小模型:Qwen3.8-2B-Distill-GGUF
它的思路很有意思:作者将 Qwen3.8(2.4T) 的推理能力,通过全参数蒸馏塞进了 Qwen3.5-2B 架构
蒸馏后的数据提升相当明显:
📈 MMLU 0.283 → 0.548
📊 GSM8K(数学)0.330 → 0.640
GGUF 版量化后最小只有 1.31GB (Q4),手机和普通笔记本 CPU 就能流畅运行,且自带
思考链块。
部署也比较友好:
支持 llama.cpp / Ollama / vLLM 一键部署,具体如何操作,见视频👇🏻