註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 GGUF
GGUF 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 GGUF 的搜尋結果
在本地 Mac Studio M3 Ultra 上,1-bit GLM-5.2 GGUF 以约 21.6 tok/s 的速度运行,表现出色。我们将其与 Claude 4.8 Opus 和 GPT-5.5 进行了同样的提示对比,一探三者在一轮输出中的差异。 各自的优劣势如何,你更倾向于哪款模型的输出?
顯示更多
想把 LLM 也放到本地,可以先启动 llama.cpp: llama-server -hf ggml-org/gemma-4-E4B-it-GGUF -np 2 -c 65536 -fa on --swa-full 然后把 speech-to-speech 的 LLM 地址指向: 这样才算比较完整的本地语音 Agent
顯示更多
推荐这个测试,Unsloth 对 Kimi K3 的极端量化。 一个 2.8T 参数的模型,压到几百 GB 仍保留大部分准确率。 Unsloth 团队在 7 月 29 日发布了 Kimi K3 的 GGUF 量化版本,并给出了 1-bit 和 2-bit 量化的实测数据。这是目前第一个对 2.8T 参数模型做极端量化的公开结果。 量化效果 | 精度 | 大小 | 准确率 | 对比全精度 | |------|------|--------|-----------| | 全精度 (MXFP4) | 1.56 TB | 100% | — | | Q8 | ~1.6 TB | lossless | — | | Q4 | ~1.1 TB | — | — | | Dynamic 2-bit | 861 GB | ~90% | 45% 更小 | | Dynamic 1-bit | 594 GB | ~78.9% | 62% 更小 | 关键数字:Dynamic 2-bit 在 861 GB 下达到约 90% 准确率,比全精度小了 45%。 即使压到 1-bit(594 GB),仍保留约 78.9% top-1 准确率。 实际意义 594 GB 意味着什么?NVIDIA DGX Station 或多台 Mac Studio 串联 128GB RAM 设备可以运行。Unsloth 团队还在尝试把 1-bit 版本压到 512 GB 以下。 通过 Unsloth Studio 或 llama.cpp 直接加载。 Benchmark 对比 Unsloth 同时给出了官方 benchmark 数据作为参考系:Kimi K3 的 Terminal-Bench 2.1 (88.3) 与 GPT-5.6 Sol (88.8) 几乎持平,BrowseComp (91.2) 超过 Fable 5 (88.0) 和 Sol (90.4)。GPQA Diamond (93.5) 仅次于 Sol (94.1)。 模型: 文档: #KimiK3# #Quantization# #GGUF#
顯示更多
🖌️ 百度把自家的文生图模型开源了,权重直接放出来 80 亿参数的单流扩散 Transformer,GenEval 总分 0.8856 国内能拿到开放权重的文生图模型本来就不多,能把中文长文本渲染好的更少。想在图里放一句中文标语,出来经常是缺笔画的字符。 ERNIE-Image 在这块的成绩不错,LongTextBench 中英文平均分拿到 0.9733。它放了两个版本:标准版推理 50 步、CFG 4.0,追求质量;Turbo 版经过 DMD 和强化学习优化,8 步、CFG 1.0 就能出图,快得多。 生态接得也够全:Diffusers 和 SGLang 支持调用部署,ComfyUI 有 Turbo 版工作流模板,Unsloth 能构建 GGUF 权重,AI-Toolkit 支持微调。Apache 2.0 协议。 模型开源这件事上,权重放出来才算数。 GitHub:
顯示更多
既然 Kimi K3 已经把开放 Agent 模型带到 2.8T 参数这个规模,@Meta 为什么还发布一个 30B 的 Muse Glimmer? Kimi K3 代表的是一条很明确的路线:继续扩大开放模型的能力边界—— 2.8T 参数、1M context、视觉理解,面向长程 coding、知识工作和深度推理。Kimi 官方还建议用 64+ accelerators 的 supernode 部署它。它更接近在回答: 开放模型还能承载多复杂的 Agent 任务? Glimmer 选择的是另一种部署尺度。 30B 多模态、Apache 2.0 开放权重。 HuggingFace在发布说明里直接写了本地 coding、文档分析、个人助手,以及 “Claw- or Hermes-like setups”;发布当天还提供 transformers、llama.cpp、vLLM 接入,并展示了 GGUF 量化和 OpenAI-compatible endpoint 的本地运行路径。 Llama 早就能接进 Agent,Glimmer 的变化不在于第一次具备这项能力。我认为重点是: 这次发布把模型的使用语境更明确地放到了自行部署 Agent 的开发者场景里。 当然,本地不等于轻量。HF 给出的 BF16 推理参考仍是 1×80GB H100,这不是普通人能部署的;量化后的性能、硬件门槛和长期运维成本,还需要真实使用验证。 所以 Meta 发 Glimmer,并不是拿 30B 去打压 2.8T。 K3 把开放模型推向更大的能力规模;Glimmer 则把多模态、开放权重、量化路径和本地 Agent 工作流结合在一起。 Meta 这次关注的可能是另一类需求:开发者是否能把模型部署、修改,再接进自己的文件、工具和工作流。 出处:
顯示更多
0
47
45
1
轉發到社區
想在本地跑 Qwen、Llama、DeepSeek,但不确定电脑能不能带得动?🥲 Can I Run AI :一个本地大模型硬件检测网页工具 可以通过浏览器识别 CPU、GPU、内存信息,再匹配不同模型的显存需求、量化方案和运行等级 适合在下载 Ollama / LM Studio / GGUF 模型之前,先判断一下: 8G 显存适合跑什么? Mac 统一内存能不能撑住 14B? 32B 模型是不是已经超出当前设备范围? 不能替代真实跑分,但很适合用来排除明显不合适的模型,少走一些下载完才发现跑不动的弯路
顯示更多
🦞 如何 免費使用 AI ? Qwen3.6 27B 模型直接在 MacBook Pro 上用 llama.cpp + Pi coding agent 完全本地運行,飛航模式、零網路!😱😱 這樣本地跑(llama.cpp + Pi coding agent),你就完全不用花錢 subscribe 任何雲端 AI了! • 不用 Claude Pro、ChatGPT Plus、Grok Premium 之類的月費 • Qwen3.6 27B GGUF 模型從 Hugging Face 一次下載就永久免費使用 • Pi coding agent 本身也是完全開源 MIT 免費(npm 安裝就行) • 之後不管跑多少次、做多少 coding 任務,都零 API 費用 唯一的小成本只有: ✅ MacBook 要夠力(推薦 32GB+ 記憶體,M 系列 Metal 加速最順) ✅ 第一次下載模型花一點時間跟硬碟空間 ✅ 跑的時候電費會多一點點 但之後就是真正零月費、無限使用的本地 AI coding 神器! 隱私還 100% 保障,飛航模式也能跑,超爽👍 處理 Hugging Face 真實程式碼庫的複雜任務,表現幾乎追平 Claude Opus! 這就是 AI「第二革命」——強大本地模型正式實用化! 隱私、安全、資料主權一次到位,早鳥直接起飛 💨 👉🏻👉🏻 想自己馬上開始裝嗎?超簡單上手(Mac 適用): 1. 安裝並啟動 llama.cpp server(下載 Qwen3.6 27B GGUF 模型,推薦 Q4_K_M 量化,Mac 用 Metal 加速) 2. npm install -g @mariozechner/pi-coding-agent 3. 編輯 ~/.pi/agent/models.json 指向本地 llama.cpp(baseUrl: http://localhost:8080/v1) 4. 在你的專案資料夾直接執行 pi 指令就起飛! 詳細文件: (或 Pi GitHub: 開源本地 AI,真的要改變遊戲規則了!誰來一起玩?🔥 推薦用 etherfi卡 買MacBook 能省3~4%
顯示更多
This is where we are right now. And i’m not gonna lie it feels pretty magical 🧚‍♀️ Qwen3.6 27B running inside of Pi coding agent via Llama.cpp on the MacBook Pro For non-trivial tasks on the @huggingface codebases, this feels very, very close to hitting the latest Opus in Claude Code, or whatever shiny monopolistic closed source API of the day is. In full airplane mode. Most people haven’t realized this yet. If you have, it means you have a huge headstart to what I call the second revolution of AI. Powerful local models for efficiency, security, privacy, sovereignty 🔥
顯示更多