註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 本地大模型
本地大模型 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 本地大模型 的搜尋結果
⚡ 一个二进制文件跑本地大模型,还给你 OpenAI 风格的接口 GitHub 上 5.7K stars,Rust 写的 本地跑模型最劝退的是环境:装 Python、配 CUDA、编译推理后端,一套下来两小时,换台机器再来一遍。 Shimmy 把这些压成一个单二进制:直接加载 GGUF 模型文件,起来就是 OpenAI 风格的 API 端点,原本调云端的代码改个地址就能用。2.0 版本把 llama.cpp 后端移除了,改用自研的 Airframe WebGPU 推理引擎,Rust 加 WGSL 实现。 模型覆盖上,项目列了 11 个模型家族和 25 种已认证的模型与量化组合,Q4_0、Q4_K_M、Q5_K_M、Q6_K 这些常见量化格式都在。还支持 YaRN RoPE 扩展上下文和 INT4 KV 缓存量化,显存紧张的机器能多撑一会儿。 本地推理这件事,越简单的方案活得越久。 GitHub:
顯示更多
高考严禁携带通讯工具入场,那么能不能带个本地大模型呢?
0
113
258
2
轉發到社區
Can I Run AI:检测电脑能不能运行本地大模型的网页工具 👉
把 27B 模型压到 4GB 跑在手机上:Bonsai 1-bit 可以运行在iPhone 17Pro上的本地大模型
想买Mac运行大模型? 这是劝退贴 其实估算方法很简单, 现在买 MacStudio 哪怕运行 Qwen3.6-27B 4bit 量化版本, 然后开 DFlash 使用Qwen的内置投机解码, 也就飙到 65token/s. 而现在普遍大模型都能跑到 40 token/s. 如果专门买 MacStudio M3 Ultra 96G 运行大模型, 如果把设备售价 (32999) 换算成使用API, 以 GLM-5.2 为例, 每百万token 28块, 一台 MacStudio 的价格大概能买到 32999/28 = 1178M token. 而为了输出这些token, 买到的 MacStudio 运行 Qwen3.6-27B 要持续运行 209天. 也就是说回本周期至少是200天不间断运行. 然后运行模型才是纯赚. 这还是没算电费和不直接买API而是买套餐的情况.而且, 最重要的是这还是在运行一个只有27B的小模型. 如果真的买512G的 MacStudio (108749, 而且好像已经断货了), 然后运行量化版本的 GLM-5.2, 速度就会跌到只有 17 token/s, 回本周期大概在 7 年左右... 对于现在1.5个月模型就发新版本的情况下, 普通用户自用是绝对不划算的. 所以大部分用户买 coding plan 会更划算, 如果像我一样要测新模型, 直接租卡也会比直接买划算很多. 当然, 如果你本身就有Mac或者显卡, 那么空闲的时候(比如睡觉的时候)让它跑大模型运行任务, 反而是划算的. #本地大模型# #mac# #qwen36# #glm52#
顯示更多
0
110
149
11
轉發到社區
⚡ 我去,这个开源项目把你的 Mac 变成了一台本地大模型服务器,跑 Claude Code 这类工具又稳又快。 GitHub 狂揽 1.7 万+ Star,作者是个独立开发者,被现有工具气到自己动手做的。 他的原话是,试过的每个 LLM server 都让他在「方便」和「可控」之间二选一。Mac 用户跑本地模型都懂这种痛:长对话每次重新算上下文,又慢又烫,本地模型只能跑跑 demo,干不了真活。 oMLX 的思路是把历史上下文缓存到内存加 SSD 两层,接着聊不用重算;常用模型钉在内存,大模型按需自动换入换出;所有管理在菜单栏点一下就完事。API 兼容 OpenAI,Claude Code、Codex 这些工具直接接本地模型干活。 装它也简单,brew install 一行,或者直接拖个 dmg 进应用程序。 本地模型以前只能跑 demo,现在能干真活了。 GitHub:
顯示更多
大家的Mac Studio M3 Ultra 512GB内存都跑的什么本地大模型啊? 我现在本地跑两个 `Qwen3.5-397B-A17B-6bit MLX`,实测大约 **21 tokens/s**; 日常快模型 `Qwen3.6-35B-A3B-4bit` 大约 **52 tokens/s**。 内存占用350gb左右 给openclaw接本地api对话速度也满意。 请问老哥这个大模型是最优选择么? 有没有能榨干它的推荐,谢谢🙏
顯示更多
0
41
24
0
轉發到社區
上个月最火的是🦞 这个月就成了本地大模型 但最关键的问题是 赚钱的机会在哪里
Gentle reminder that all you need to start with local AI is: - 2x RTX 3090s (pick them up for $700-$900 a piece on r/hardwareswap) - Qwen 3.6 27B - Your favorite agent (Claude Code / OpenCode / etc) - Self-hosted SearXNG for web access And you got yourself Opus 4.5 at home
顯示更多
一直以来都觉得视频生成模型的商用空间最大,但是最大的问题是seedance的token计费成本太高 随着各种本地大模型的更新,感觉未来与seedance的差距会越来越小,基于降本的目标近期一直在优化造物纪的商业模式,通过算力租赁加本地大模型部署的模式可以很大的降低成本,更新接入了minimax h3 独享算力 ¥9.9/小时,无限生成 共享算力 ¥0.39/秒,用多少付多少 没有会员费,没有套路。
顯示更多
0
80
44
5
轉發到社區
想在本地跑 Qwen、Llama、DeepSeek,但不确定电脑能不能带得动?🥲 Can I Run AI :一个本地大模型硬件检测网页工具 可以通过浏览器识别 CPU、GPU、内存信息,再匹配不同模型的显存需求、量化方案和运行等级 适合在下载 Ollama / LM Studio / GGUF 模型之前,先判断一下: 8G 显存适合跑什么? Mac 统一内存能不能撑住 14B? 32B 模型是不是已经超出当前设备范围? 不能替代真实跑分,但很适合用来排除明显不合适的模型,少走一些下载完才发现跑不动的弯路
顯示更多