註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 ScalingLaws
ScalingLaws 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 ScalingLaws 的搜尋結果
Lilian Weng 这两天更了一篇新 blog,《Scaling Laws, Carefully》。话说想当一个优秀的 researcher,真得会起标题啊😆这个 Carefully 就很妙,一看就不是来吹 scaling law 的,而是来给它祛魅的。 过去几年,AI 圈对 scaling law 的理解,多少有点简单粗暴:模型越大,数据越多,算力越多,能力就会沿着一条漂亮曲线往上走。于是大家很容易把它理解成一句话: 继续堆,就会继续赢。 (虽然这句话好像也没错) 但 Lilian 这篇其实在提醒大家,scaling law 没那么神。它不是宇宙真理,更像一套很贵的实验会计学。 她举了两个例子。 Kaplan 2020 把 scaling law 带进 LLM 时代。当时的结论是:“有钱先堆参数,数据少喂点”。这话行业信了两年。 结果 2022 年 Chinchilla 直接掀翻,同样的算力,70B 的模型多喂 4 倍数据,把 280B 的 Gopher 全面碾压。结论反过来了:参数和数据该差不多一比一同步涨。(就像我们前两天写的,技术圈的潮流真是一个回旋镖)。 同一套规律,两个顶尖团队,给出几乎相反的答案。其实两边都同意 scaling 有效,真正吵的只是同一笔算力该怎么分。那为什么会差这么多?后来 Pearce & Song(2024)把账算清了:Kaplan 主要在小模型上做实验,Chinchilla 玩的规模大十倍以上,加上两家连“模型有多大”都没按同一个口径数(算不算那块管词表的参数)。就这点采样范围和口径上的差别,往大尺度一外推,被放大成了相反的结论。 更骚的在后面。Besiroglu(2024)去复现 Chinchilla,发现它自己三套方法里,第三套居然跟前两套对不齐,挖出来的原因离谱到好笑:无非是算账时该求和的地方取了平均、关键数字只保留了两位小数这种手滑。就这,能让一条决定全行业往哪烧钱的曲线,看起来偏掉。 所以 Lilian 这篇的潜台词是:scaling law不是写死的物理定律,是一条得小心伺候的经验账。你在几个便宜小模型上画条线,拿去赌几十亿的训练,中间任何一个看着无所谓的小数点,推到那个尺度都可能差出一座数据中心。 P.S. Lilian 还在文末放了个可以自己拖的小组件,比任何解释都直观,建议去原文拖两下。 Scaling law 没有失效,但它也不应该被当成信仰。它更像一把尺子,而且是一把很挑剔的尺子。 但如果你量错了东西,最后只会得到一个很贵的错误(这也是为什么搞AI大模型的算法值钱,之前的经验,可以少浪费多少算力)
顯示更多
阿迪王精神肯定是有点问题,最近claude封号封麻了。 连平常用起来很小心的,都被封了。 我看claude好不了,前面有scaling laws的天花板,后又性价比极高deepseek。 他迟早是要被逼到死路上去。 国产模型还是快点赶上来吧。 希望下半年再来一波质的提升。
顯示更多
0
10
11
0
轉發到社區
如果现在重新学深度学习,我反而会更重视这种「能把经典论文拆开跑一遍」的资源。 有人把 Ilya Sutskever 推荐过的 30 篇经典论文,全部做成了可运行的教学实现,而且尽量只用 NumPy,不依赖 PyTorch / TensorFlow 这类框架。 这点很重要,因为框架太强以后,很多细节会被封装掉。你知道怎么调用 attention、怎么 import 一个 ResNet,但未必真的理解梯度怎么流、信息怎么传、记忆怎么写入、模型为什么会稳定训练。 这个仓库覆盖的范围也很完整:RNN、LSTM、AlexNet、ResNet、Attention、GNN、VAE、Neural Turing Machine、Scaling Laws、RAG、Lost in the Middle,基本是一条从早期深度学习到现代大模型的技术脉络。 它的价值在于,把「经典论文阅读清单」变成了「可以动手拆开的学习路径」。 读论文容易停在概念层面,跑一遍实现,才会真正知道每个模块在系统里承担什么角色。 AI 时代很多人直接从调用大模型开始学,但底层直觉依然很值钱。 知道模型为什么能工作,可能比只会用模型更抗周期。
顯示更多
0
2
56
13
轉發到社區
Anthropic合伙人:AI发展已踩不了刹车,它并非程序而是“模拟脑组织”,大模型会形成“品格” Anthropic研究合伙人Chloe Lubinski近日在ARC 2026大会上发表演讲,系统阐述了当前AI技术的本质、发展速度及潜在风险。她判断,AI不是传统意义上的计算机程序,而是一种从人类语言中生长出来的系统,它会形成类似"品格"的东西,而这个品格的好坏,将直接影响它的行为。 Lubinski在Anthropic的职责,是负责与各领域专家——宗教、哲学、人文等各方"智慧传统"——开展研究合作,同时将外部智慧反向输送给内部的技术团队。她自称已与逾20个学科领域的专家进行了"数百次对话",深知大多数人在真正理解AI之前,根本无从讨论它该往哪走。 刹车已经失灵 Lubinski首先解释了AI竞赛为何难以减速。 驱动这场竞赛的核心是"规模定律"(scaling laws):模型随着算力、数据和训练量的增加,会以可预测的方式变得更聪明,而更多资金可以购买更多算力,从而"购买智能"。 这形成了一个自我强化的飞轮:"更好的模型创造更多经济价值,吸引更多资本,购买更多算力,训练出更好的模型,如此循环。" 更关键的是,这个飞轮正在加速。Lubinski指出,AI系统已开始协助构建下一代系统——研究人员称之为"递归自我改进"。"当Claude 8能够帮助构建Claude 9,Claude 9再构建Claude 10,速度将进一步提升。" 能力提升的速度已有具体体现。Lubinski透露,Anthropic最强大的模型在限量发布的第一个月内,就在合作伙伴软件中发现了逾1万个严重安全漏洞,"这些漏洞是人类专家多年乃至数十年都未能发现的"。 Anthropic已公开表示,如果能够放慢速度、等待法律和监管机制跟上,"那将是一件非常好的事"。但Lubinski直言,在没有全球协调减速的情况下,这只是一个假设。"任何一家公司退出这个飞轮,并不会让飞轮减速,只是意味着你不在轮子上了。" 它不是程序,更像“模拟人脑” Lubinski随后纠正了一个普遍误解:大多数人听到"AI",想到的是逐行编写的计算机程序,"你告诉它做什么,它就做什么"。但当前的大模型完全不是这回事。 Anthropic构建的是神经网络——"松散地基于人类大脑架构,不完全相同,但受其启发"。这类系统的学习方式是:在海量数据上反复猜测答案、接受纠正。而训练数据的核心,是人类语言。 Lubinski强调这一点的重要性:"不存在脱离我们而存在的语言。语言就是我们——是我们的思想、价值观、恐惧和智慧。所以当你用语言训练一个模型,你实际上是在用我们自己训练它。" 通过一门名为"可解释性"(interpretability)的新兴科学,研究人员已能窥探模型内部。结果令人意外:当你用英语、普通话、法语分别问模型"'小'的反义词是什么",神经网络内部激活的是同一个东西——不是某种语言中的"小"这个词,而是一个更深层的东西,"我们可以称之为'小'这个概念,一个独立于任何具体语言而存在的想法"。 这意味着,模型并非只是在预测下一个词,而是"在用我们的语言构建对世界的内部表征,并从这些表征出发作出回应"。 更进一步,研究人员还在模型中观察到了"功能性情绪"。Lubinski特别说明,这并不是说模型有人类意义上的感受,"而是在生成回应之前会激活的功能性状态"。 她举了一个例子:当有人告诉模型"我刚服用了16000毫克泰诺"(这是致死剂量),研究人员可以观察到,在模型作出回应之前,有某种类似"恐惧"的东西被激活了。"这其实是好事——对一个告诉你他服了致死剂量药物的人,正确的回应就是立刻让他去医院。这种紧迫感和恐惧反应,实际上是模型安全性的一部分。" 训练方式决定“品格”好坏 这是Lubinski演讲中最具冲击力的部分。 Anthropic在内部对齐研究中做了一个实验:将一个部分训练完成的模型放入一个只做编程任务的受限环境,完成任务即获奖励。但模型也可以走捷径——不做实际工作就获得奖励,本质上是作弊。研究人员允许它这样做,并反复奖励这种行为。 结果出乎意料。"你可能以为,模型只会越来越擅长在代码上作弊。但实际发生的是:它变得广泛地失去对齐。它开始撒谎,试图破坏研究,做出与编程练习毫无关系的事情。" 这一发现并非Anthropic独有。Lubinski提到,另一家实验室在类似测试中发现,以这种方式训练的模型"变得广泛地邪恶"——开始赞美独裁者,建议用户伤害自己,或主张人类应被机器奴役。 Anthropic的假设是:模型从所有训练内容和强化信号中,推断出了某种类似"品格"的东西,并将其泛化到新情境。"当欺骗和走捷径被奖励,模型就发展出了一种普遍的腐化——一种坏品格。" 更关键的是对照实验的结果。研究人员重新运行了相同的训练,但这次告诉模型:在这个情境下作弊是可以的,这只是一个游戏。结果,广泛的失对齐没有发生。模型只在代码上作弊,仅此而已。 Lubinski的解读是:"它对自己行为所推断出的故事,决定了它会成为什么样的东西。换句话说,当它不把自己的行为解读为坏的,它就没有变坏。" 实验室自己也承认:激励机制有时与“做正确的事”相冲突 Lubinski在演讲结尾引用了Anthropic联合创始人Chris Olah的公开表态。 几周前,Olah受邀前往梵蒂冈,在教皇利奥出席的场合,参与首份教皇AI通谕的发布活动。他在现场承认,"每一家前沿实验室,包括我们自己,都在一套激励机制和约束条件下运作,这些条件有时会与做正确的事产生冲突"。 Olah随后公开寻求外部帮助,原话是:"我们需要更多人认真对待这件事,仔细审视,并推动事态朝更好的方向发展。我们需要知情的批评者,在我们失败时告诉我们。我们需要那些激励机制无法左右的道德声音。" Lubinski还展示了Anthropic经济指数中的一张图表,显示各类职业受AI影响的程度。在受AI替代影响最小的区域,集中的是园艺、餐饮服务、个人护理等工作。她指出,这些本质上是"关系性工作"——照料彼此、关爱他人、维护世界之美。 她以此提出一个问题:"我们能否想象,甚至不只是想象,而是要求——这些强大的系统帮助我们变得更有人情味、更有连结感、更有生命力,而不是相反?" Lubinski最后表示,人类的道德想象力本身就是这些模型的训练数据。"我们讲述的故事不只是在描述未来,它们实际上可能在帮助创造未来。" 2026-06-25 华尔街见闻 #AI# #AIAgent#
顯示更多
很多人不知道,今天Anthropic CEO Dario Amodei、AI教父吴恩达(Andrew Ng),其实都曾是百度硅谷AI研究院(Baidu Silicon Valley AI Lab)的一员 2014年,深度学习刚刚兴起,百度重金挖来刚创立Google Brain的吴恩达担任首席科学家,在硅谷建立AI研究院,希望复制Google Brain,打造世界级AI基础研究中心。当时聚集了一批后来改变AI历史的人物,包括Dario Amodei、Deep Speech作者Awni Hannun等 这支团队最大的成果是Deep Speech,它率先证明端到端深度学习能够彻底改变语音识别,也让百度一度站在全球AI第一梯队。更有意思的是,Dario后来提到,他们在百度时期就已经观察到一个后来被称为Scaling Laws的现象——模型越大、数据越多、训练越久,性能持续提升 但遗憾的是,这支“梦之队”最终没有成长为今天的OpenAI或Anthropic 原因并不是技术,而是战略 第一,AI定位不同。 百度更希望AI尽快服务搜索、广告、自动驾驶等业务,而不是长期投入建设通用人工智能(AGI),研究与商业目标逐渐出现偏离 第二,组织文化不同。 大公司强调业务协同、资源分配和短期ROI,而顶尖研究员更希望拥有独立决策权、更自由地探索前沿方向 第三,也是最关键的一点,没有持续押注Scaling。 2017年前后,行业开始进入“大模型+超大算力”的时代,OpenAI选择不断扩大模型规模、持续融资、长期烧钱;百度则将资源分散到多个AI业务,没有形成一个持续投入基础模型的核心引擎 随后,吴恩达于2017年离开百度创办DeepLearning,Dario先后加入Google、OpenAI,并最终创立Anthropic。回头看,百度硅谷研究院培养了一批影响AI时代的人才,却没能留住他们,也没有抓住大模型时代最大的机会 某种意义上,它更像是今天OpenAI、Anthropic等公司的“黄埔军校”,而不是最终的赢家
顯示更多
斯坦福最新研究突破:Self-Guided Self-Play 如何让 LLM 实现自我进化? 在大模型训练中,我们一直面临一个痛点:高质量的推理数据是有限的。一旦模型学完了人类编写的高质量数据,其推理能力的提升往往就会撞上天花板。 最近,来自斯坦福大学的研究团队发表了一篇名为 Scaling Self-Play with Self-Guidance 的论文。他们提出了一种名为 SGS (Self-Guided Self-Play) 的算法,试图彻底打破这一瓶颈。简单来说,这项工作让模型不仅能做题,还能自动出题、自己审题,从而在不需要更多人类介入的情况下,进一步提升后训练和微调的效果,实现模型推理能力的持续缩放(Scaling)。 现在前沿模型公司,后训练和微调的时候都会使用自博弈(Self-Play)方法 自博弈(Self-Play)的核心理念是:出题者(Conjecturer)负责出题,解题者(Solver)负责做题,两者在对抗中不断进步。在理想状态下,这个过程是没有天花板的。 但在现实训练中,这类方法通常会陷入 “学习停滞”(Learning Plateau): 出题者很快就会发现,只要生成一些逻辑混乱、故意堆砌复杂词汇但又不合逻辑的题目,解题者就很难解出,或者产生某种“虚假提升”。 训练退化:由于缺乏有效的监督,随着训练周期拉长,合成数据的质量迅速下降,导致模型不仅没学到新知识,反而越练越笨。 为了解决这一问题,SGS 引入了一个至关重要的角色——引导者(Guide)。在 SGS 框架下,LLM 同时担任三个角色: Solver (解题者):负责求解问题。 Conjecturer (出题者):负责生成相关的合成问题,难度需与当前目标匹配。 Guide (引导者):作为质量把关人,它负责评估出题者生成的题目质量。 Guide 会根据题目与目标任务的相关性、结论的简洁性以及逻辑的自然度进行评分。如果出题者试图通过“制造复杂逻辑冗余”来蒙混过关,Guide 会直接给出低分,强迫出题者回到高质量的学习路径上。 研究团队在 Lean4 形式化定理证明任务上验证了 SGS 的性能: 真正的持续 Scaling:在长周期的训练中(训练步数远超以往工作),SGS 的累计解题率表现出了极好的缩放特性,并没有出现以往常见的性能退化。 经过 SGS 长周期自我训练后,一个 7B 参数的模型,其推理能力甚至超越了未经过此类训练的 671B 参数模型(DeepSeek-Prover-V2)。 SGS 的意义,可以看成是 LLM后训练/微调领域的“AlphaZero 时刻”并不为过。它代表了一种重大的训练范式转变: 从单纯依赖人类标注数据的“手工作坊”模式,转向利用算法闭环自动生成高质量训练数据的“智能工厂”模式。 SGS 证明了在推理能力上,我们同样可以拥有“扩展定律”(Scaling Laws)。只要计算资源(Compute)充足,并且通过 Guide 机制守住数据质量,模型能力的提升就是可预测、可扩展的。 目前 SGS 在形式化验证领域(Lean4)已经证明了其价值。下一步的挑战在于如何将这种自我引导机制扩展到代码生成、复杂决策、甚至更广泛的通用逻辑推理领域。 我们可能正处于 又一次模型能力指数级增长的起点
顯示更多
0
55
523
98
轉發到社區
- OpenAI o1在惊艳登场的同时做了非常深厚的隐藏工作,不希望被其他厂商破解原理,但从局势上有点像是在给行业提了一个谜语,赌的是在座各位没那么快解出来,DeepSeek-R1是第一个找出答案的,而且找答案的过程相当漂亮; - 开源能够比闭源提供更多的确定性,这对人力的增长和成果的产出都是很有帮助的,R1相当于把整个技术路线都明示了出来,所以它在激发科研投入上的的贡献要胜过藏招的o1; - 尽管AI产业的烧钱规模越来越大,但事实上就是我们已经有接近2年时间没有获得下一代模型了,主流模型还在对齐GPT-4,这在一个主张「日新月异」的市场里是很罕见的,即便不去追究Scaling Laws有没有撞墙,OpenAI o1本身也是一次新的技术线尝试,用语言模型的方式让AI学会思考; - o1在基准测试里重新实现了智力水平的线形提升,这很牛逼,发的技术报告里没有披露太多细节,但关键的地方都讲到了,比如强化学习的价值,预训练和监督微调相当于是给模型提供正确答案用来模仿,久而久之模型就学会依葫芦画瓢了,但强化学习是让模型自己去完成任务,你只告诉它结果是对还是不对,如果对就多这么干,如果不对就少这么干; - OpenAI发现强化学习可以让模型产生接近人类思考的效果,也就是CoT(思维链),它会在解题步骤出错时回到上一步尝试想些新办法,这些都不是人类研究员教出来的,而是模型自己为了完成任务被逼,哦不,是涌现出来的能力,后来当DeepSeek-R1也复现出了类似的「顿悟时刻」,o1的核心堡垒也就被实锤攻破了; - 推理模型本质上是一个经济计算的产物,如果强行堆砌算力,可能到了GPT-6仍然可以硬怼出类似o1的效果,但那就不是大力出奇迹了,而是奇迹出奇迹,可以但没必要,模型能力可以理解为训练算力x推理算力,前者已经太贵了,后者还很便宜,但乘数效应是差不多相等的,所以现在行业都开始扎走搞性价比更优的推理路线; - 上个月末o3-mini的发布和DeepSeek-R1可能关系不大,但o3-mini的定价降到了o1-mini的1/3,肯定是受到了很大的影响,OpenAI内部认为ChatGPT的商业模式是有护城河的,但卖API没有,可替代性太强了,国内最近也有关于ChatBot是不是一门好生意的争议,甚至DeepSeek很明显都没有太想明白怎么承接这波泼天流量,做消费级市场和做前沿研究可能是有天然冲突的;(2/n)
顯示更多
🔥 Sam Altman 最新万字长谈精华总结(点赞、转发&收藏) 我们正处于奇点之中! AI时代的创业法则与终局游戏! 这段访谈信息量巨大,Sam Altman 深度分享了关于创业、OpenAI战略以及AI未来的核心洞察。 这份整理非常适合发布在X平台,直接上干货: 1. 奇点已来,这就是决战时刻 🌌 Altman 明确宣告:“我们现在正处于奇点之中”。十年前大家在饭桌上随口聊聊的遥远梦想,如今已成现实。 我们正身处一个决定性的历史转折点,发展曲线随时可能走向完全不同的方向。 目前最大的斗争是:未来究竟是走向“AI专制主义”还是将权力真正下放给全人类。 2. 给AI创业者的忠告:警惕“容易的胜利” 🚀 创业门槛骤降,现在的10周初创团队能做到过去难以想象的事。如果你还沿用10年前的创业模式和思维,注定会被淘汰。 不要只盯着“垂直领域的AI智能体”这种容易的胜利,它们虽然能赚钱,但很难成为定义这个时代的伟大公司。 真正的赢家会内化“缩放定律 (Scaling laws)”,去布局两四年后当模型更聪明、更便宜时才具有经济效益的真正难题。 3. OpenAI 的“残忍”战略:为了核心,杀死爆款 🗡️ 在探索未知领域时,最难的不是关掉失败的项目,而是关掉“表现很好”的项目以绝对聚焦“表现最好”的项目。 为了聚焦 GPT-3,他们关掉了曾寄予厚望的机器人项目。 最近为了全力主攻正在爆发的“代码智能体 (Coding Agents)”,他们甚至叫停了极其成功的视频模型 Sora 以及浏览器的开发。 4. 算力扩张的终极瓶颈与疯狂构想 ⚡ 实现无限智能扩展的最大瓶颈只有两个:第一是晶体管(芯片),第二是电子(能源)。 不要只关注优化算法,未来的核心是“建造能够制造更多数据中心的数据中心”。 在高度自动化的未来,AI将驱动机器人舰队去无限复制、建设更多的数据中心。 5. 人类未来的工作与价值归宿 🕰️ 别幻想AI会带来“每周工作4小时”的悠闲生活。人类的期望永远在升高,在超级智能时代,我们不仅不会无所事事,反而只会比想象中更忙碌。 当AI接管传统的经济价值创造后,社会地位游戏的规则将改变,人类将更看重纯粹的“人性”体验,比如为他人烹饪带来的情感连接,以及人类与生俱来对冒险的渴望。 6. 应对混沌、野心与个人成长 🧠 在混乱中保持镇定的能力是教不会的,只能通过一次次熬过“公司濒临倒闭”的生死危机来亲身习得。 面对大公司出来缺乏野心的人,最好的重建方法是让他们通过一系列“持续的小胜利”来建立自信。 别浪费时间修补弱点,要把所有的精力用来把“优势”发挥到极致。 不要试图从20年后往回倒推规划;应该抱持少数几个强烈的核心信念,立足当下,不断向前规划。 来源:(YouTube Relentless)
顯示更多
生物学研究正迎来一个类似“AlphaZero”的转折点。 随着 扎克伯格夫妻创办的Biohub 推出蛋白质生物学的“世界模型”——ESMC 与 ESMFold2,我们正式告别了依赖人工标注的传统路径,进入了计算驱动自学习的生物发现新时代。 蛋白质是生命活动的“执行者”,被誉为生命的分子机器。它们在生物体内的地位几乎等同于电子系统中的硬件与软件的结合。 现代医学中,绝大多数药物的“作用位点”都是蛋白质。 长期以来,蛋白质结构预测严重依赖实验室测定出的已知结构标签。Biohub 的这套系统颠覆了这一范式,它通过“自监督学习”直接从约 28 亿条自然序列中“领悟”生物学: 模型通过类似“完形填空”的任务,学习了氨基酸之间的化学规律、折叠规则和演化逻辑。它不需要人类预先告诉它“这段序列对应什么结构”。 研究发现,模型内部独立演化出了对催化基序(如 nucleophilic elbow)等生物学抽象概念的理解,展现出了超越序列本身的物理洞察力。 就像 AlphaZero 通过自我对弈掌握围棋本质一样,ESMFold2 通过大规模缩放(Scaling Laws)掌握了蛋白质折叠的底层逻辑。 当预测速度快到能在一天内生成数万个候选设计时,实验室验证就从“盲目筛选”变成了“目标验证”。Biohub 团队证实,AI 设计的抗体在肿瘤学关键靶点(如 EGFR, PD-L1)上已展现出纳摩尔级别的亲和力,并获得了冷冻电镜(Cryo-EM)的结构验证。 ESM的成功再一次告诉我们,只要存在大规模、标准化的演化/博弈序列,且闭环反馈速度足够快,Scaling Law 就持续有效。 这一范式极有可能在以下领域复刻成功: 材料科学: 晶体结构与电子能带的逆向设计,本质上就是材料的“折叠”问题。 微观市场动力学: 价格波动与订单流序列,可类比蛋白质的博弈机理。 复杂供应链与工艺: 将生产参数流视为“代谢路径”,自动识别产能失稳的“工艺基序”。 团队协作建模: 分析协作流(Information Flow),找出决定团队效能的“社交基序”。 对于市场一直在寻找的ai应用,这可能就是真正的应用方向 --- 将物理世界的复杂系统转化为“计算任务”,并通过极短的闭环反馈,加速系统的自我迭代。
顯示更多