推荐这个测试,Unsloth 对 Kimi K3 的极端量化。
一个 2.8T 参数的模型,压到几百 GB 仍保留大部分准确率。
Unsloth 团队在 7 月 29 日发布了 Kimi K3 的 GGUF 量化版本,并给出了 1-bit 和 2-bit 量化的实测数据。这是目前第一个对 2.8T 参数模型做极端量化的公开结果。
量化效果
| 精度 | 大小 | 准确率 | 对比全精度 |
|------|------|--------|-----------|
| 全精度 (MXFP4) | 1.56 TB | 100% | — |
| Q8 | ~1.6 TB | lossless | — |
| Q4 | ~1.1 TB | — | — |
| Dynamic 2-bit | 861 GB | ~90% | 45% 更小 |
| Dynamic 1-bit | 594 GB | ~78.9% | 62% 更小 |
关键数字:Dynamic 2-bit 在 861 GB 下达到约 90% 准确率,比全精度小了 45%。 即使压到 1-bit(594 GB),仍保留约 78.9% top-1 准确率。
实际意义
594 GB 意味着什么?NVIDIA DGX Station 或多台 Mac Studio 串联 128GB RAM 设备可以运行。Unsloth 团队还在尝试把 1-bit 版本压到 512 GB 以下。
通过 Unsloth Studio 或 llama.cpp 直接加载。
Benchmark 对比
Unsloth 同时给出了官方 benchmark 数据作为参考系:Kimi K3 的 Terminal-Bench 2.1 (88.3) 与 GPT-5.6 Sol (88.8) 几乎持平,BrowseComp (91.2) 超过 Fable 5 (88.0) 和 Sol (90.4)。GPQA Diamond (93.5) 仅次于 Sol (94.1)。
模型:
文档:
#
KimiK3# #
Quantization# #
GGUF#