TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
实践哥 Li
@MinLiBuilds
AI Builder 超级个体。实践哥Li不做概念党,只聊 AI 实战。分享Claude,Codex,Grok,Gemini, 开源大模型各种一手折腾心得。
가입 July 2023
2.1K
팔로잉 중
18.5K
팬
实践哥 Li
@MinLiBuilds
2026.08.18 12:50
新的斩杀线已出现Qwen3.8-27B。 AA指数 52.0 分,能力上屠杀榜上 108/137 的模型。 如果价格比他们更便宜,就地斩杀线。 本地成本公式就一行: 🔥每 Token 成本 =(整机价 + 三年电费)÷ 三年总产出 Token 三年总产出 Token = 26280 小时 × 利用率 × 3600 秒 × 每秒吞吐。 真正决定成本的只有一个变量:利用率。 🚩成本固定,干的越多越便宜。 🔥以下数字纯 YY,按照社区可能追踪达到的数值来推演,不影响观看效果。 拿一台 RTX 5090 算: 整机 3.5 万人民币,27B 4bit 量化,高并发总吞吐按 800 tok/s,电价 6 毛,三年折旧。 每天只干 2.4 小时,也就是 10% 利用率: 产出的 Token 相当于 $0.697 / 百万 Token。 假设 Opus 4.6 还在,参考 Opus 5 的价格。 比 Opus 4.6 便宜 36 倍。 每天干 4.8 小时: $0.356 / 百万 Token。 便宜 70 倍。 重点来了。 如果把 5090 当服务跑,利用率拉到 70%: 三年能吐 530 亿 Token,总成本约 4.2 万人民币。 如果不看没 KV Cache 的并发限制,也没算 Context 变长以后 Batch 下降带来的吞吐损失。 按同档最便宜的云端模型价格卖,理论毛利率 91%,满载约 72 天回本。 当然,这只是理论值。 所以再狠一点: 每天只干 2.4 小时,本地跑依然比 Opus 4.6 便宜约 18 倍。 这才是 27B Dense 真正恐怖的地方: 它已经够强了。 但 Token 成本,开始不是一个数量级了。 Thread2 里有更多的参数对比。 🔥DGX Spark 上,体验完全是另一回事。 一个任务发出去,你可能要盯着空屏幕发呆很久,才能看到第一个答案字符。 整个任务跑完也要很久。 这已经不是交互式推理了,更像批处理。 所以 DGX Spark 这种统一内存大、但带宽相对有限的机器,反而更适合 Ling-3-Flash 这类 MoE 模型。 总参数可以很大,但每个 Token 真正激活的参数少得多。 Dense 模型能塞进去,不代表适合跑。 能跑,和跑得爽,是两回事。 如果你想看怎么在本地一步一步部署 MoE 或者 Dense 模型,以及接入 Claude Code 详细步骤,可以看下文。👇
더 보기
0
0
19
111
13
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
Reuters
@Reuters
26.4M 팬
First Squawk
@FirstSquawk
568.7K 팬
TVer新着
@TVer_info
100.8K 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.7K 팬
吴说区块链
@wublockchain12
181.4K 팬
空空道人
@Kongkongda5882
34K 팬
zerohedge
@zerohedge
3.4M 팬
中國新聞社
@CNS1952
547.4K 팬
billboard
@billboard
16.8M 팬
モデルプレス
@modelpress
2.1M 팬
몬스타엑스_MONSTA X
@OfficialMONSTAX
4.8M 팬
Bloomberg
@business
10.5M 팬
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K 팬