注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 llamacpp
llamacpp 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 llamacpp 的推特
Llama.cpp的新MTP支持使本地模型速度翻倍!在A10G上,Qwen3.6-27B生成速度从每秒25个token提升至45个,增幅78%。确保系统支持MTP,更新Llama.cpp至最新版本,运行模型,享受加速带来的便捷。这一进步显著提升工作效率,值得尝试!
显示更多
终于 speculative decoding(先支持 dflash) 在 llama cpp 合并了
想把 LLM 也放到本地,可以先启动 llama.cpp: llama-server -hf ggml-org/gemma-4-E4B-it-GGUF -np 2 -c 65536 -fa on --swa-full 然后把 speech-to-speech 的 LLM 地址指向: 这样才算比较完整的本地语音 Agent
显示更多
本地跑大模型的工具越来越多,光推理引擎就有 Ollama、llama.cpp、vLLM,还没算模型和界面。 LLMs-local 把本地跑大模型相关的资源整理到了一起,推理引擎、模型、硬件、教程都有。 推理引擎收录了 Ollama、llama.cpp、vLLM 这些,界面有 Open WebUI、Lobe Chat,模型按用途分好了类。 GitHub: 还收录了微调工具、Agent 框架、训练教程和硬件选购建议,一份清单基本能摸清整个生态。 打算在自己机器上跑模型的朋友,可以先翻翻这份合集找找方向。
显示更多
0
51
49
16
转发到社区
🦞 如何 免費使用 AI ? Qwen3.6 27B 模型直接在 MacBook Pro 上用 llama.cpp + Pi coding agent 完全本地運行,飛航模式、零網路!😱😱 這樣本地跑(llama.cpp + Pi coding agent),你就完全不用花錢 subscribe 任何雲端 AI了! • 不用 Claude Pro、ChatGPT Plus、Grok Premium 之類的月費 • Qwen3.6 27B GGUF 模型從 Hugging Face 一次下載就永久免費使用 • Pi coding agent 本身也是完全開源 MIT 免費(npm 安裝就行) • 之後不管跑多少次、做多少 coding 任務,都零 API 費用 唯一的小成本只有: ✅ MacBook 要夠力(推薦 32GB+ 記憶體,M 系列 Metal 加速最順) ✅ 第一次下載模型花一點時間跟硬碟空間 ✅ 跑的時候電費會多一點點 但之後就是真正零月費、無限使用的本地 AI coding 神器! 隱私還 100% 保障,飛航模式也能跑,超爽👍 處理 Hugging Face 真實程式碼庫的複雜任務,表現幾乎追平 Claude Opus! 這就是 AI「第二革命」——強大本地模型正式實用化! 隱私、安全、資料主權一次到位,早鳥直接起飛 💨 👉🏻👉🏻 想自己馬上開始裝嗎?超簡單上手(Mac 適用): 1. 安裝並啟動 llama.cpp server(下載 Qwen3.6 27B GGUF 模型,推薦 Q4_K_M 量化,Mac 用 Metal 加速) 2. npm install -g @mariozechner/pi-coding-agent 3. 編輯 ~/.pi/agent/models.json 指向本地 llama.cpp(baseUrl: http://localhost:8080/v1) 4. 在你的專案資料夾直接執行 pi 指令就起飛! 詳細文件: (或 Pi GitHub: 開源本地 AI,真的要改變遊戲規則了!誰來一起玩?🔥 推薦用 etherfi卡 買MacBook 能省3~4%
显示更多
This is where we are right now. And i’m not gonna lie it feels pretty magical 🧚‍♀️ Qwen3.6 27B running inside of Pi coding agent via Llama.cpp on the MacBook Pro For non-trivial tasks on the @huggingface codebases, this feels very, very close to hitting the latest Opus in Claude Code, or whatever shiny monopolistic closed source API of the day is. In full airplane mode. Most people haven’t realized this yet. If you have, it means you have a huge headstart to what I call the second revolution of AI. Powerful local models for efficiency, security, privacy, sovereignty 🔥
显示更多
默认组合大致是: Silero:判断用户有没有说话 Parakeet TDT:语音转文字 OpenAI-compatible API:生成回答 Qwen3-TTS:把回答读出来 STT 和 TTS 可以在本地运行。 LLM 也能换成 llama.cpp、vLLM 或其他兼容接口。
显示更多
在自己电脑上白嫖大模型,不花一分钱、数据绝对安全 这 5 个工具助你白嫖到底: 1、Ollama(174k star) 本地跑模型的标准。 一行命令拉一个模型下来就能用,Llama、Qwen、DeepSeek 都支持,还给别的程序留了接口。 2、LM Studio 不想碰命令行就用它。图形界面里下载模型、点一下开聊,还能开成本地 API 给别的软件用。 3、Jan(43k star) 开源版的 ChatGPT 桌面端,全程离线,界面干净,适合当日常本地助手。 4、Open WebUI(141k star) 给 Ollama 套一个网页界面,多人、多模型、带知识库问答,体感跟 ChatGPT 一样,自己部署。 5、llama.cpp(116k star) 最底层那块基石,上面那些工具很多都靠它,能把大模型压到普通笔记本甚至手机上跑。 模型在自己机器上,才算真的是你的。
显示更多
0
34
102
24
转发到社区
既然 Kimi K3 已经把开放 Agent 模型带到 2.8T 参数这个规模,@Meta 为什么还发布一个 30B 的 Muse Glimmer? Kimi K3 代表的是一条很明确的路线:继续扩大开放模型的能力边界—— 2.8T 参数、1M context、视觉理解,面向长程 coding、知识工作和深度推理。Kimi 官方还建议用 64+ accelerators 的 supernode 部署它。它更接近在回答: 开放模型还能承载多复杂的 Agent 任务? Glimmer 选择的是另一种部署尺度。 30B 多模态、Apache 2.0 开放权重。 HuggingFace在发布说明里直接写了本地 coding、文档分析、个人助手,以及 “Claw- or Hermes-like setups”;发布当天还提供 transformers、llama.cpp、vLLM 接入,并展示了 GGUF 量化和 OpenAI-compatible endpoint 的本地运行路径。 Llama 早就能接进 Agent,Glimmer 的变化不在于第一次具备这项能力。我认为重点是: 这次发布把模型的使用语境更明确地放到了自行部署 Agent 的开发者场景里。 当然,本地不等于轻量。HF 给出的 BF16 推理参考仍是 1×80GB H100,这不是普通人能部署的;量化后的性能、硬件门槛和长期运维成本,还需要真实使用验证。 所以 Meta 发 Glimmer,并不是拿 30B 去打压 2.8T。 K3 把开放模型推向更大的能力规模;Glimmer 则把多模态、开放权重、量化路径和本地 Agent 工作流结合在一起。 Meta 这次关注的可能是另一类需求:开发者是否能把模型部署、修改,再接进自己的文件、工具和工作流。 出处:
显示更多
0
47
45
1
转发到社区
💥卧槽,本地模型也能当 Claude Code 的后端跑终端 agentic coding 了 GitHub 5.7 万星,Python 项目,叫 private-gpt 公司代码和数据不让上云,但团队又眼馋 Claude Code 这种终端 agent 干活的效率,这是很多技术团队卡住的地方。 private-gpt 的做法是把 Ollama、llama.cpp、vLLM 里跑的本地模型,包成一层遵循 Claude API 规范的服务。 Claude Code 直接把后端指向它就能用,RAG、工具调用、MCP、text-to-sql 一样不少,连 Claude Desktop、Word/Excel 里的 Claude 插件也能接上。 它自己不跑模型,只负责把你已有的推理服务套进这套 API 规范,还带了个 workbench UI 方便本地测试。 macOS 上 brew install private-gpt,配两个环境变量指向本地模型,就能起服务。
显示更多
本地用vLLM部署GLM-5.2的速度终于上来了! 好消息终于轮到本地部署 GLM-5.2 了! 大家都知道 GLM-5.2 这次是自带了MTP头的, 可以进行推测性解码. 但是, 这个只适用于bf16原始精度的GLM-5.2, 而这玩意原始精度要到1.5TB, 本地跑的很少有富到这个程度的, 所以大家都用各种量化版本, 毕竟4bit量化就只要430GB了. 问题这就来了, 由于 GLM-5.2 的 MTP 采用了非常特殊的 DSA (动态稀疏注意力), 导致目前几个推理引擎 (llama.cpp, vLLM, mlx) 都无法支持. 其中 llama.cpp, mlx 是完全没办法开 MTP, vLLM 只支持FP8精度的. 而SGLang 没事哈, SGLang 架构比较屌上来就支持同一个计算流使用混合精度. 所以直接用 GLM-5.2-W4AFP8 就行. 所以回到这几个不支持的推理引擎, 大部分的量化版本 GLM-5.2 开了 MTP 反而会掉速度. 甚至有的量化版本直接把MTP部分给砍了(mlx). 而社区作者dnhkng搞了个缝合方法, 最终搞出了 GLM-5.2-AWQ-INT4-FP8-MTP-delta, 即 底座用 INT4(走 Marlin 算子)+ MTP 用 FP8(保持精度)同时还能让vLLM 支持. 速度从原来的 2 token/s 直接飙升到了 43.39 token/s (绑定NUMA+MTP-3) 所以目前位置 SGLang 和 vLLM (魔改版)都能直接火力全开跑带MTP的 GLM-5.2了. 而 llama.cpp和mlx用户还需要再等等. 社区还在弄. 这个作者的blog (过程极其精彩, 有不少优化技巧): #glm52# #mtp# #dsa#
显示更多
0
66
208
30
转发到社区