新的斩杀线已出现Qwen3.8-27B。
AA指数 52.0 分,能力上屠杀榜上 108/137 的模型。
如果价格比他们更便宜,就地斩杀线。
本地成本公式就一行:
🔥每 Token 成本 =(整机价 + 三年电费)÷ 三年总产出 Token
三年总产出 Token = 26280 小时 × 利用率 × 3600 秒 × 每秒吞吐。
真正决定成本的只有一个变量:利用率。
🚩成本固定,干的越多越便宜。
🔥以下数字纯 YY,按照社区可能追踪达到的数值来推演,不影响观看效果。
拿一台 RTX 5090 算:
整机 3.5 万人民币,27B 4bit 量化,高并发总吞吐按 800 tok/s,电价 6 毛,三年折旧。
每天只干 2.4 小时,也就是 10% 利用率:
产出的 Token 相当于 $0.697 / 百万 Token。
假设 Opus 4.6 还在,参考 Opus 5 的价格。
比 Opus 4.6 便宜 36 倍。
每天干 4.8 小时:
$0.356 / 百万 Token。
便宜 70 倍。
重点来了。
如果把 5090 当服务跑,利用率拉到 70%:
三年能吐 530 亿 Token,总成本约 4.2 万人民币。
如果不看没 KV Cache 的并发限制,也没算 Context 变长以后 Batch 下降带来的吞吐损失。
按同档最便宜的云端模型价格卖,理论毛利率 91%,满载约 72 天回本。
当然,这只是理论值。
所以再狠一点:
每天只干 2.4 小时,本地跑依然比 Opus 4.6 便宜约 18 倍。
这才是 27B Dense 真正恐怖的地方:
它已经够强了。
但 Token 成本,开始不是一个数量级了。
Thread2 里有更多的参数对比。
🔥DGX Spark 上,体验完全是另一回事。
一个任务发出去,你可能要盯着空屏幕发呆很久,才能看到第一个答案字符。
整个任务跑完也要很久。
这已经不是交互式推理了,更像批处理。
所以 DGX Spark 这种统一内存大、但带宽相对有限的机器,反而更适合 Ling-3-Flash 这类 MoE 模型。
总参数可以很大,但每个 Token 真正激活的参数少得多。
Dense 模型能塞进去,不代表适合跑。
能跑,和跑得爽,是两回事。
如果你想看怎么在本地一步一步部署 MoE 或者 Dense 模型,以及接入 Claude Code 详细步骤,可以看下文。👇
顯示更多