注册并分享邀请链接,可获得视频播放与邀请奖励。

雪瑜
@xueyu1125
🤖 AI Builder | 程序员 | AI 工具实践 🎮 游戏服务器开发 | Steam游戏收集控 🚀 专注美股 | 纳斯达克信仰者 🥳 热爱生活 | 偶尔写段子
加入 September 2014
2.6K 正在关注    4.2K 粉丝
Qwen3.8-27B发现有不少人想在16G统一内存/显存下部署,我这里也整理下可行的开源权重,HuggingFace下载: 1. tooltd/Qwen3.8-27B-IQ4-XS-16GB-VRAM-GGUF 权重大小12.79G,16GB显存综合首选,兼顾质量、MTP与长上下文 2. hitsfmdj/Qwen3.8-27B-GGUF-4.2BPW-16GB 权重大小只有11.88 GiB,显存余量大,部署方便,缺点是使用的较新的定制量化,目前验证少 3. jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller 权重大小12.61 GiB,缺点是FFN使用 IQ3_S精度降低 4. unsloth/Qwen3.8-27B-GGUF,权重大小13.27 GiB,它不是显存效率最好的版本,属于官方生态。如果不想使用较新的第三方混合量化,追求稳定选这个。 5. cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF, 权重大小13.75 GiB,需要使用ik_llama.cpp专用推理框架,报告支持 105K 上下文 不过都没有DFlash2的优化,有点可惜🤔
显示更多
QWen3.8-27B在不同内存配置的Mac Silicon 应该部署哪个社区版,昨天很多朋友咨询,我这里整理下: 1. 16G的建议不要考虑QWen3.8-27B,tps太低,任务跑不动 2. 24G优先选越狱版本 orcarouter/Qwen3.8-27B-Uncensored-MLX(4-bit ),次选mlx-community/Qwen3.8-27B-MTP-4bit MTP优化版本,tps有提升(DFlash2有点勉强) 3. 48G优先选择 incoai/Qwen3.8-27B-DFlash2 DFlash2草稿模型优化版本,tps提升巨大,次选越狱版本 orcarouter/Qwen3.8-27B-Uncensored-MLX(4-bit) 4. 64G 及以上,优先考虑8bit BF16搭配 DFlash2提升tps,次选对应精度的越狱版本 追求最快就用 DFlash2版本 追求越狱就考虑Uncensored 版本,但是越狱版本没有官方配套 DFlash2 草稿 🤣
显示更多