가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
가입 March 2025
678 팔로잉 중    10.8K 팬
🏎️ 太顶了,手头那台大内存 Mac 现在能在本地直接跑 DeepSeek V4,靠的是 DwarfStar 这个新的推理引擎。 GitHub 上 2.2 万 star,仓库今年 5 月才建,四个多月涨到这个数,2205 个 fork、740 个 issue 还开着。项目由 Redis Labs 的 Salvatore Sanfilippo 主导。 本地跑大模型,卡住人的往往不是算力而是内存。想试完整版的 GLM 5.x,一看要求就放弃;换通用的 GGUF 运行器,为了兼容一大堆模型,什么都能跑但什么都不够顺。DwarfStar 反着来:范围故意收窄,只伺候少数几个模型——DeepSeek V4 Flash 和 V4.1 Flash、V4 PRO,GLM 5.2、5.3 和 5.3 Flash,还有 Qwen3.8 Flash Next,代码自成一体,也只认自己生成的 GGUF 文件。 省下来的力气全花在把硬件榨干上。96GB 以上的 Mac 是主要目标,CUDA 那边主打 DGX Spark,还照顾了一些别的后端搞不定的多卡机器;内存不够就走 SSD 流式加载,128GB 的机子靠这招能跑完整版的 GLM 5.x;两台 128GB 的 Mac 用 RDMA 连起来还能张量并行跑 4-bit 的 DeepSeek Flash。八张 L40S 的配置上,16 个会话一起压,跑出了大约 126 t/s 的聚合生成速度。 还有个细节有意思:这引擎本身是作者带着 AI 编程 agent 写出来的,人负责定思路、测试和调试。目前还是 beta 质量,版本变得很快,每次发布前作者会跑一轮比较大的 QA,但不稳定和回归仍然可能出现,上正事之前自己先测一轮。 自己家里那台机器,头一回有资格谈“跑得起旗舰模型”。 GitHub:
더 보기