註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Tiezhen WANG
@Xianbao_QIAN
Helping ecosystem to grow on vLLM, ex-Head of APAC ecosystem @huggingface. Ex-Googler on TFLite/micro. Ideas on my own. Interested in future tech. DM open
加入 November 2022
2.9K 正在關注    12.9K 粉絲
On that: 27B dense is actually big: Kimi K3 - 2.8T A104B DeepSeek V4 Pro - 1.6T A49B GLM 5.2 - 743B A39B --- MiniMax M3 - 427B A26B DeepSeek V4 Flash - 284B A19B so in terms of compute, the new Qwen 3.8 27B model is heavier than DeepSeek V4 Flash and is comparable with MiniMax M3. 27B is not a small model. But we're able to run it on consumer hardware - That's a great thing thanks for all the hardware and infra evolution in the last few years!
顯示更多
可能很多人对27B模型没什么概念。 27B听起来好像也没多大啊,现在普通玩家128G内存都开始普及了。 但我讲几个冷知识。 Google训练Gemma 3 27B的时候,预训练数据是14万亿Token。 不是140亿,也不是1400亿。 是14万亿。 训练它的集群用了6144颗TPU v5p。 而27B这个数字,只代表它有大约270亿个参数。 光把BF16原始权重放进内存,大概就是54GB。 32K上下文跑起来,加上KV Cache,大概72.7GB。 注意,这还只是推理。 真正训练的时候还要塞梯度,优化器状态,激活值,各种通信Buffer。 所以你看到一个27B模型只有几十GB,很容易产生一种错觉。 这玩意我电脑都装得下,我是不是也能训练。 完全是两回事。 还有一个更离谱的地方。 14万亿Token是什么概念。 假如一个人一天非常夸张地读10万个Token,而且一天不休息。 读完这些训练数据,大概需要38万年。 而机器要做的也不只是把这些字读一遍。 它要一层一层做矩阵运算,算损失,反向传播,再一点一点修改270亿个参数。 所以我现在越来越觉得,本地能跑27B,甚至70B,是一件非常牛逼的事情。 不是因为我们的电脑已经可以训练它们了。 而是因为人类把一个需要几千颗AI芯片训练出来的东西,压缩,量化,优化之后,居然可以塞进一台桌子下面的小电脑里。 这个过程本身就挺赛博朋克的。
顯示更多
0
6
149
4
轉發到社區