註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 LiXian
LiXian 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 LiXian 的搜尋結果
@lixinbao_X 那样靠自己的主页不是很乱吗?
@lixinbao_X 以前解冻快,现在AI审核很难通过
Lilian Weng 这两天更了一篇新 blog,《Scaling Laws, Carefully》。话说想当一个优秀的 researcher,真得会起标题啊😆这个 Carefully 就很妙,一看就不是来吹 scaling law 的,而是来给它祛魅的。 过去几年,AI 圈对 scaling law 的理解,多少有点简单粗暴:模型越大,数据越多,算力越多,能力就会沿着一条漂亮曲线往上走。于是大家很容易把它理解成一句话: 继续堆,就会继续赢。 (虽然这句话好像也没错) 但 Lilian 这篇其实在提醒大家,scaling law 没那么神。它不是宇宙真理,更像一套很贵的实验会计学。 她举了两个例子。 Kaplan 2020 把 scaling law 带进 LLM 时代。当时的结论是:“有钱先堆参数,数据少喂点”。这话行业信了两年。 结果 2022 年 Chinchilla 直接掀翻,同样的算力,70B 的模型多喂 4 倍数据,把 280B 的 Gopher 全面碾压。结论反过来了:参数和数据该差不多一比一同步涨。(就像我们前两天写的,技术圈的潮流真是一个回旋镖)。 同一套规律,两个顶尖团队,给出几乎相反的答案。其实两边都同意 scaling 有效,真正吵的只是同一笔算力该怎么分。那为什么会差这么多?后来 Pearce & Song(2024)把账算清了:Kaplan 主要在小模型上做实验,Chinchilla 玩的规模大十倍以上,加上两家连“模型有多大”都没按同一个口径数(算不算那块管词表的参数)。就这点采样范围和口径上的差别,往大尺度一外推,被放大成了相反的结论。 更骚的在后面。Besiroglu(2024)去复现 Chinchilla,发现它自己三套方法里,第三套居然跟前两套对不齐,挖出来的原因离谱到好笑:无非是算账时该求和的地方取了平均、关键数字只保留了两位小数这种手滑。就这,能让一条决定全行业往哪烧钱的曲线,看起来偏掉。 所以 Lilian 这篇的潜台词是:scaling law不是写死的物理定律,是一条得小心伺候的经验账。你在几个便宜小模型上画条线,拿去赌几十亿的训练,中间任何一个看着无所谓的小数点,推到那个尺度都可能差出一座数据中心。 P.S. Lilian 还在文末放了个可以自己拖的小组件,比任何解释都直观,建议去原文拖两下。 Scaling law 没有失效,但它也不应该被当成信仰。它更像一把尺子,而且是一把很挑剔的尺子。 但如果你量错了东西,最后只会得到一个很贵的错误(这也是为什么搞AI大模型的算法值钱,之前的经验,可以少浪费多少算力)
顯示更多
@lixinbao_X 关键是完成度咋样啊 可以编程吗
@lixinbao_X 因为小白喜欢博一个得到kol的关注
@liliangzhu 你从来不看新闻?他针对的是超级富豪。 你在纽约有第二套房子?还超过五百万!