TwiScan
熱門
社區
帳號集合
登入
註冊
English
日本語
한국의
简体中文
繁体中文
註冊並分享邀請連結,可獲得影片播放與邀請獎勵。
立即註冊
AI最严厉的父亲
@dashen_wang
马斯克研究所合作伙伴
@MuskPapa_x
@razzhood
当AGI睁开眼睛的那一刻,人类的存在便失去了所有意义 构架散人。 反编译 / 站群 / 量化 / Agent,二十年自学。 现在只带 Agent 干活,不雇人。
加入 February 2024
731
正在關注
29.1K
粉絲
AI最严厉的父亲
@dashen_wang
2026.08.15 20:02
可能很多人对27B模型没什么概念。 27B听起来好像也没多大啊,现在普通玩家128G内存都开始普及了。 但我讲几个冷知识。 Google训练Gemma 3 27B的时候,预训练数据是14万亿Token。 不是140亿,也不是1400亿。 是14万亿。 训练它的集群用了6144颗TPU v5p。 而27B这个数字,只代表它有大约270亿个参数。 光把BF16原始权重放进内存,大概就是54GB。 32K上下文跑起来,加上KV Cache,大概72.7GB。 注意,这还只是推理。 真正训练的时候还要塞梯度,优化器状态,激活值,各种通信Buffer。 所以你看到一个27B模型只有几十GB,很容易产生一种错觉。 这玩意我电脑都装得下,我是不是也能训练。 完全是两回事。 还有一个更离谱的地方。 14万亿Token是什么概念。 假如一个人一天非常夸张地读10万个Token,而且一天不休息。 读完这些训练数据,大概需要38万年。 而机器要做的也不只是把这些字读一遍。 它要一层一层做矩阵运算,算损失,反向传播,再一点一点修改270亿个参数。 所以我现在越来越觉得,本地能跑27B,甚至70B,是一件非常牛逼的事情。 不是因为我们的电脑已经可以训练它们了。 而是因为人类把一个需要几千颗AI芯片训练出来的东西,压缩,量化,优化之后,居然可以塞进一台桌子下面的小电脑里。 这个过程本身就挺赛博朋克的。
顯示更多
0
0
73
876
81
轉發到社區
熱門用戶
New York Post
@nypost
4.2M 粉絲
オリコンニュース
@oricon
1.9M 粉絲
Reuters
@Reuters
26.4M 粉絲
First Squawk
@FirstSquawk
569K 粉絲
吴说区块链
@wublockchain12
181.5K 粉絲
空空道人
@Kongkongda5882
34.1K 粉絲
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 粉絲
币安Binance华语
@binancezh
464.5K 粉絲
中國新聞社
@CNS1952
547.4K 粉絲
TVer新着
@TVer_info
100.8K 粉絲
zerohedge
@zerohedge
3.4M 粉絲
billboard
@billboard
16.8M 粉絲
看中國
@kanzhongguo
348.8K 粉絲
一劍浣春秋
@chee828
231.9K 粉絲
モデルプレス
@modelpress
2.1M 粉絲