註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 本地大模型
本地大模型 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 本地大模型 的搜尋結果
本地大模型的显存壁垒,今天被正式宣告物理终结了, 单张 24G 的 RTX 4090,竟然真把 125B 的 Qwen 3.8 Flash Next 给跑起来了, 而且上下文直接拉到了 25 万,解码速度稳在每秒 21 个词 以前跑这种百亿千亿级的巨无霸,动辄要租几张 A100 数据中心集群, 但这次海外极客在 Ubuntu 上用一张普通 4090 加 110G 白菜价 DDR4 内存, 硬生生跑出了生产级的速度: 预填充每秒 364 词,解码每秒 21 词, 最狠的是没开 MTP、没开 dflash,连 KV 缓存都没做任何量化 很多人好奇 24G 显存怎么塞得下 125B 还带 25 万上下文, 核心全靠 llama.cpp 最新分支里一个叫 -cmoe 的物理外挂: 它把 512 个专家层全部扔给廉价的系统内存, 把最吃计算的注意力机制留在 4090 显存里, 显存占用瞬间从 24G 暴跌到 11.6G,而且解码速度几乎毫无损耗 空出来的整整 12G 显存,全被拿去放上下文, 直接把窗口一路顶到了 250,000 的绝对上限,跑完甚至还剩 5 个多 G 的显存余量 再加上把 batch 设到 4096,提示词处理速度直接翻倍狂飙, 以前大家觉得消费级显卡只能跑跑 7B 到 27B 的小模型, 现在 MoE 架构加上内存卸载,直接把数据中心级别的智能焊死在了家用电脑里 本地折腾私有大模型和超长 Agent 的时代, 真的被这套组合拳给彻底砸开大门了啊
顯示更多
0
55
503
77
轉發到社區
当你要用本地大模型做视频的时候 现在摆在你面前的选择,只有CUDA生态 要么买DGX Spark,要么买N卡
⚡ 一个二进制文件跑本地大模型,还给你 OpenAI 风格的接口 GitHub 上 5.7K stars,Rust 写的 本地跑模型最劝退的是环境:装 Python、配 CUDA、编译推理后端,一套下来两小时,换台机器再来一遍。 Shimmy 把这些压成一个单二进制:直接加载 GGUF 模型文件,起来就是 OpenAI 风格的 API 端点,原本调云端的代码改个地址就能用。2.0 版本把 llama.cpp 后端移除了,改用自研的 Airframe WebGPU 推理引擎,Rust 加 WGSL 实现。 模型覆盖上,项目列了 11 个模型家族和 25 种已认证的模型与量化组合,Q4_0、Q4_K_M、Q5_K_M、Q6_K 这些常见量化格式都在。还支持 YaRN RoPE 扩展上下文和 INT4 KV 缓存量化,显存紧张的机器能多撑一会儿。 本地推理这件事,越简单的方案活得越久。 GitHub:
顯示更多
高考严禁携带通讯工具入场,那么能不能带个本地大模型呢?
0
113
258
2
轉發到社區
Can I Run AI:检测电脑能不能运行本地大模型的网页工具 👉
把 27B 模型压到 4GB 跑在手机上:Bonsai 1-bit 可以运行在iPhone 17Pro上的本地大模型
想买Mac运行大模型? 这是劝退贴 其实估算方法很简单, 现在买 MacStudio 哪怕运行 Qwen3.6-27B 4bit 量化版本, 然后开 DFlash 使用Qwen的内置投机解码, 也就飙到 65token/s. 而现在普遍大模型都能跑到 40 token/s. 如果专门买 MacStudio M3 Ultra 96G 运行大模型, 如果把设备售价 (32999) 换算成使用API, 以 GLM-5.2 为例, 每百万token 28块, 一台 MacStudio 的价格大概能买到 32999/28 = 1178M token. 而为了输出这些token, 买到的 MacStudio 运行 Qwen3.6-27B 要持续运行 209天. 也就是说回本周期至少是200天不间断运行. 然后运行模型才是纯赚. 这还是没算电费和不直接买API而是买套餐的情况.而且, 最重要的是这还是在运行一个只有27B的小模型. 如果真的买512G的 MacStudio (108749, 而且好像已经断货了), 然后运行量化版本的 GLM-5.2, 速度就会跌到只有 17 token/s, 回本周期大概在 7 年左右... 对于现在1.5个月模型就发新版本的情况下, 普通用户自用是绝对不划算的. 所以大部分用户买 coding plan 会更划算, 如果像我一样要测新模型, 直接租卡也会比直接买划算很多. 当然, 如果你本身就有Mac或者显卡, 那么空闲的时候(比如睡觉的时候)让它跑大模型运行任务, 反而是划算的. #本地大模型# #mac# #qwen36# #glm52#
顯示更多
0
110
149
11
轉發到社區
⚡ 我去,这个开源项目把你的 Mac 变成了一台本地大模型服务器,跑 Claude Code 这类工具又稳又快。 GitHub 狂揽 1.7 万+ Star,作者是个独立开发者,被现有工具气到自己动手做的。 他的原话是,试过的每个 LLM server 都让他在「方便」和「可控」之间二选一。Mac 用户跑本地模型都懂这种痛:长对话每次重新算上下文,又慢又烫,本地模型只能跑跑 demo,干不了真活。 oMLX 的思路是把历史上下文缓存到内存加 SSD 两层,接着聊不用重算;常用模型钉在内存,大模型按需自动换入换出;所有管理在菜单栏点一下就完事。API 兼容 OpenAI,Claude Code、Codex 这些工具直接接本地模型干活。 装它也简单,brew install 一行,或者直接拖个 dmg 进应用程序。 本地模型以前只能跑 demo,现在能干真活了。 GitHub:
顯示更多
大家的Mac Studio M3 Ultra 512GB内存都跑的什么本地大模型啊? 我现在本地跑两个 `Qwen3.5-397B-A17B-6bit MLX`,实测大约 **21 tokens/s**; 日常快模型 `Qwen3.6-35B-A3B-4bit` 大约 **52 tokens/s**。 内存占用350gb左右 给openclaw接本地api对话速度也满意。 请问老哥这个大模型是最优选择么? 有没有能榨干它的推荐,谢谢🙏
顯示更多
0
41
24
0
轉發到社區
上个月最火的是🦞 这个月就成了本地大模型 但最关键的问题是 赚钱的机会在哪里
Gentle reminder that all you need to start with local AI is: - 2x RTX 3090s (pick them up for $700-$900 a piece on r/hardwareswap) - Qwen 3.6 27B - Your favorite agent (Claude Code / OpenCode / etc) - Self-hosted SearXNG for web access And you got yourself Opus 4.5 at home
顯示更多