注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Quantization
Quantization 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Quantization 的推特
推荐这个测试,Unsloth 对 Kimi K3 的极端量化。 一个 2.8T 参数的模型,压到几百 GB 仍保留大部分准确率。 Unsloth 团队在 7 月 29 日发布了 Kimi K3 的 GGUF 量化版本,并给出了 1-bit 和 2-bit 量化的实测数据。这是目前第一个对 2.8T 参数模型做极端量化的公开结果。 量化效果 | 精度 | 大小 | 准确率 | 对比全精度 | |------|------|--------|-----------| | 全精度 (MXFP4) | 1.56 TB | 100% | — | | Q8 | ~1.6 TB | lossless | — | | Q4 | ~1.1 TB | — | — | | Dynamic 2-bit | 861 GB | ~90% | 45% 更小 | | Dynamic 1-bit | 594 GB | ~78.9% | 62% 更小 | 关键数字:Dynamic 2-bit 在 861 GB 下达到约 90% 准确率,比全精度小了 45%。 即使压到 1-bit(594 GB),仍保留约 78.9% top-1 准确率。 实际意义 594 GB 意味着什么?NVIDIA DGX Station 或多台 Mac Studio 串联 128GB RAM 设备可以运行。Unsloth 团队还在尝试把 1-bit 版本压到 512 GB 以下。 通过 Unsloth Studio 或 llama.cpp 直接加载。 Benchmark 对比 Unsloth 同时给出了官方 benchmark 数据作为参考系:Kimi K3 的 Terminal-Bench 2.1 (88.3) 与 GPT-5.6 Sol (88.8) 几乎持平,BrowseComp (91.2) 超过 Fable 5 (88.0) 和 Sol (90.4)。GPQA Diamond (93.5) 仅次于 Sol (94.1)。 模型: 文档: #KimiK3# #Quantization# #GGUF#
显示更多