我认真算了一笔账:
3 台 M2 Max 96GB"无头骑士",和 1 台 M5 Ultra,谁才是本地 AI 最优解?
结论:
3 万元可以买一支 AI 团队,10 万元可以买一颗超级大脑。
单台无头骑士约 1 万元,拥有 96GB 统一内存和 400GB/s 带宽。
买 3 台就是 288GB 总内存、1.2TB/s 总带宽,纸面参数几乎追平 9.8 万元的 M5 Ultra。
但有个大坑:
3 台 96GB,不等于一块 288GB 超级显存。
多台 Mac 不会自动合并内存。强行切分一个 DeepSeek 模型,会受到跨机通信和部署复杂度拖累。
正确玩法,是让它们各自成为 AI 员工:
节点 A:推理、规划、审核
节点 B:写代码、测试、修 Bug
节点 C:视觉、语音、RAG
前面放一个 AI 调度器,根据任务自动分配。
这样三个模型可以同时在线、并行工作,成本只有 M5 Ultra 的三分之一。
但如果目标是单机运行 DeepSeek V4 Flash INT4 这类百 GB 级模型,就别折腾,直接买 M5 Ultra。
256GB 统一内存和 1.2TB/s 内部带宽,不用跨机通信,也不用维护三套系统。
所以选择很简单:
1 万元:个人本地 AI
3 万元:无头骑士 AI 集群
9.8 万元:单机完整 DeepSeek
12.8 万元:高精度、多模型和未来余量
无头骑士的优势是分工,M5 Ultra 的优势是统一。
穷人组内阁,土豪买大脑。
顯示更多
我突然想到一个很骚的本地 AI 方案:
去闲鱼淘一台 “无头骑士” Mac。
不要屏幕,不追新款,只盯两个东西:
Apple Silicon Max 芯片 + 大内存。
比如:
M1 Max 64GB。
然后在里面塞一套:
Qwen3.8-27B + MLX/MTPLX + 社区 Uncensored 版本。
直接把它改造成一台 24 小时在线的本地 AI 服务器。
为什么我觉得这事可能很香?
因为本地大模型现在的购买逻辑,已经和买普通电脑完全不一样了。
你不需要好屏幕。
不需要最新 CPU。
甚至不需要完整的 MacBook。
你真正买的是:
统一内存 + 内存带宽。
M1 Max 虽然老,但有 400GB/s 内存带宽,64GB 统一内存跑 27B 量化模型正好进入舒适区。
于是一个很有意思的组合出现了:
闲鱼残血 Mac
+
Qwen3.8-27B
+
本地 API
+
Coding Agent / OpenCode / Qwen Code / 各种 Agent
以后很多任务不需要再一刀一刀地烧 API Token。
代码阅读、资料整理、Sub-agent、长文本分析、自动化任务……
全扔给本地模型。
真正困难的任务,再调用 Claude / GPT 这类顶级云模型。
等于自己搭了一个:
“廉价 Token 发电厂”。
更有意思的是,你甚至可以同时部署两个 Qwen:
一个官方版,负责 Coding、Agent 和日常工作。
一个社区 Uncensored / Abliterated 版本,负责一些限制更少的实验和创作(你懂的)
按任务自动路由。
这才是我觉得本地模型真正有价值的地方:
以前大家问:
“我的 Mac 能不能跑大模型?”
现在应该换一个问题:
“我能不能花几千块收一台别人不要的残血 Mac,给自己造一台每天随便烧几十万、几百万 Token 的私人 AI 服务器?”
如果答案是可以,
那“无头骑士 Mac”这种原本很小众的二手设备,
可能突然变成了一种非常奇怪的——
AI 矿机。
我准备真去闲鱼研究一下。
如果能淘到价格合适的 M1 Max 64G / M2 Max 96G / M1 Ultra 128G,
这事可能比买一台新 Mac 有意思多了。
顯示更多