#
IT那些事儿# “Scaling law原作曝bug,万亿算力全白烧”,是不是很耸人听闻。
Scaling law这个BUG是不是今天才发现?
不是。
事实上整个行业2022年就已经知道了。因为Chinchilla论文一出来,几乎所有大模型训练策略都改了。OpenAI、Anthropic、Google DeepMind、Meta基本全部改成小一点模型、更多Token、更长训练。GPT-4时代已经基本没人再按GPT-3的方法训练了。所以这个bug并没有持续误导行业五年。真正持续时间大概2020到2022两年左右。后面的训练体系早就变了。
Diogo 这篇《Scaling Laws, Honestly》更像是一篇历史回顾,而不是宣布新发现。
更有意思的是在 Diogo 原文下面评论里有一句话:Scaling laws are English scaling laws. 即 Scaling Law 是否本质上具有语言依赖性。
他的意思是以往几乎所有 Scaling 论文训练主体都是英语,行业默认“Loss-Token-Compute”的关系具有普适性,但是可能真正成立的是“Loss-English Token-Compute”关系 ,法语、德语、中文、阿拉伯语、日语、韩语等由于 Tokenizer 不同、平均 token 长度不同、信息密度不同、词法复杂度不同、熵不同,最佳 Scaling 指数可能都不一样。他原话是“在相同的硬件配置下,法语的训练效率大约是英语的 50 到 100 倍”。
英语词形变化少、格变化少、动词变化少,于是很多语法关系不能靠词尾表达,只能依赖上下文。Transformer 必须读前后几十个 token 才能知道,而其他语言可能早就知道了。即对于 Morphological Richness(形态丰富度)不同的语言,同样 100 亿 token 包含的信息量可能根本不是 100 亿 token,它们不能代表相同的信息量或学习难度。
很有可能你作为一个美国程序员,你烧 10 万亿英语 Token,跟一位中国程序员烧 1 万亿中文 Token,效果差不多。