註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

zhengyun
@zhengyun
历任禧云集团CTO、云纵CTO、窝窝团研发副总裁。曾任玩聚网创始人和CEO,中国语义应用探索者。公众号老兵笔记。
69 正在關注    17.8K 粉絲
#IT那些事儿# “Scaling law原作曝bug,万亿算力全白烧”,是不是很耸人听闻。 Scaling law这个BUG是不是今天才发现? 不是。 事实上整个行业2022年就已经知道了。因为Chinchilla论文一出来,几乎所有大模型训练策略都改了。OpenAI、Anthropic、Google DeepMind、Meta基本全部改成小一点模型、更多Token、更长训练。GPT-4时代已经基本没人再按GPT-3的方法训练了。所以这个bug并没有持续误导行业五年。真正持续时间大概2020到2022两年左右。后面的训练体系早就变了。 Diogo 这篇《Scaling Laws, Honestly》更像是一篇历史回顾,而不是宣布新发现。 更有意思的是在 Diogo 原文下面评论里有一句话:Scaling laws are English scaling laws. 即 Scaling Law 是否本质上具有语言依赖性。 他的意思是以往几乎所有 Scaling 论文训练主体都是英语,行业默认“Loss-Token-Compute”的关系具有普适性,但是可能真正成立的是“Loss-English Token-Compute”关系 ,法语、德语、中文、阿拉伯语、日语、韩语等由于 Tokenizer 不同、平均 token 长度不同、信息密度不同、词法复杂度不同、熵不同,最佳 Scaling 指数可能都不一样。他原话是“在相同的硬件配置下,法语的训练效率大约是英语的 50 到 100 倍”。 英语词形变化少、格变化少、动词变化少,于是很多语法关系不能靠词尾表达,只能依赖上下文。Transformer 必须读前后几十个 token 才能知道,而其他语言可能早就知道了。即对于 Morphological Richness(形态丰富度)不同的语言,同样 100 亿 token 包含的信息量可能根本不是 100 亿 token,它们不能代表相同的信息量或学习难度。 很有可能你作为一个美国程序员,你烧 10 万亿英语 Token,跟一位中国程序员烧 1 万亿中文 Token,效果差不多。
顯示更多
大学教授已经不知道何去何从了。孩子们已经变异了,未来已来,一地鸡毛。
0
243
1.1K
133
轉發到社區