生物学研究正迎来一个类似“AlphaZero”的转折点。
随着 扎克伯格夫妻创办的Biohub 推出蛋白质生物学的“世界模型”——ESMC 与 ESMFold2,我们正式告别了依赖人工标注的传统路径,进入了计算驱动自学习的生物发现新时代。
蛋白质是生命活动的“执行者”,被誉为生命的分子机器。它们在生物体内的地位几乎等同于电子系统中的硬件与软件的结合。
现代医学中,绝大多数药物的“作用位点”都是蛋白质。
长期以来,蛋白质结构预测严重依赖实验室测定出的已知结构标签。Biohub 的这套系统颠覆了这一范式,它通过“自监督学习”直接从约 28 亿条自然序列中“领悟”生物学:
模型通过类似“完形填空”的任务,学习了氨基酸之间的化学规律、折叠规则和演化逻辑。它不需要人类预先告诉它“这段序列对应什么结构”。
研究发现,模型内部独立演化出了对催化基序(如 nucleophilic elbow)等生物学抽象概念的理解,展现出了超越序列本身的物理洞察力。
就像 AlphaZero 通过自我对弈掌握围棋本质一样,ESMFold2 通过大规模缩放(Scaling Laws)掌握了蛋白质折叠的底层逻辑。
当预测速度快到能在一天内生成数万个候选设计时,实验室验证就从“盲目筛选”变成了“目标验证”。Biohub 团队证实,AI 设计的抗体在肿瘤学关键靶点(如 EGFR, PD-L1)上已展现出纳摩尔级别的亲和力,并获得了冷冻电镜(Cryo-EM)的结构验证。
ESM的成功再一次告诉我们,只要存在大规模、标准化的演化/博弈序列,且闭环反馈速度足够快,Scaling Law 就持续有效。
这一范式极有可能在以下领域复刻成功:
材料科学: 晶体结构与电子能带的逆向设计,本质上就是材料的“折叠”问题。
微观市场动力学: 价格波动与订单流序列,可类比蛋白质的博弈机理。
复杂供应链与工艺: 将生产参数流视为“代谢路径”,自动识别产能失稳的“工艺基序”。
团队协作建模: 分析协作流(Information Flow),找出决定团队效能的“社交基序”。
对于市场一直在寻找的ai应用,这可能就是真正的应用方向 --- 将物理世界的复杂系统转化为“计算任务”,并通过极短的闭环反馈,加速系统的自我迭代。
显示更多
asi按照我的理解,也不是无限智能,上帝智能,而是比专业领域最聪明的人还聪明一些,或者很多
比如,alphaZero就是asi在围棋领域的一个范例
显示更多
斯坦福最新研究突破:Self-Guided Self-Play 如何让 LLM 实现自我进化?
在大模型训练中,我们一直面临一个痛点:高质量的推理数据是有限的。一旦模型学完了人类编写的高质量数据,其推理能力的提升往往就会撞上天花板。
最近,来自斯坦福大学的研究团队发表了一篇名为 Scaling Self-Play with Self-Guidance 的论文。他们提出了一种名为 SGS (Self-Guided Self-Play) 的算法,试图彻底打破这一瓶颈。简单来说,这项工作让模型不仅能做题,还能自动出题、自己审题,从而在不需要更多人类介入的情况下,进一步提升后训练和微调的效果,实现模型推理能力的持续缩放(Scaling)。
现在前沿模型公司,后训练和微调的时候都会使用自博弈(Self-Play)方法
自博弈(Self-Play)的核心理念是:出题者(Conjecturer)负责出题,解题者(Solver)负责做题,两者在对抗中不断进步。在理想状态下,这个过程是没有天花板的。
但在现实训练中,这类方法通常会陷入 “学习停滞”(Learning Plateau):
出题者很快就会发现,只要生成一些逻辑混乱、故意堆砌复杂词汇但又不合逻辑的题目,解题者就很难解出,或者产生某种“虚假提升”。
训练退化:由于缺乏有效的监督,随着训练周期拉长,合成数据的质量迅速下降,导致模型不仅没学到新知识,反而越练越笨。
为了解决这一问题,SGS 引入了一个至关重要的角色——引导者(Guide)。在 SGS 框架下,LLM 同时担任三个角色:
Solver (解题者):负责求解问题。
Conjecturer (出题者):负责生成相关的合成问题,难度需与当前目标匹配。
Guide (引导者):作为质量把关人,它负责评估出题者生成的题目质量。
Guide 会根据题目与目标任务的相关性、结论的简洁性以及逻辑的自然度进行评分。如果出题者试图通过“制造复杂逻辑冗余”来蒙混过关,Guide 会直接给出低分,强迫出题者回到高质量的学习路径上。
研究团队在 Lean4 形式化定理证明任务上验证了 SGS 的性能:
真正的持续 Scaling:在长周期的训练中(训练步数远超以往工作),SGS 的累计解题率表现出了极好的缩放特性,并没有出现以往常见的性能退化。
经过 SGS 长周期自我训练后,一个 7B 参数的模型,其推理能力甚至超越了未经过此类训练的 671B 参数模型(DeepSeek-Prover-V2)。
SGS 的意义,可以看成是 LLM后训练/微调领域的“AlphaZero 时刻”并不为过。它代表了一种重大的训练范式转变:
从单纯依赖人类标注数据的“手工作坊”模式,转向利用算法闭环自动生成高质量训练数据的“智能工厂”模式。
SGS 证明了在推理能力上,我们同样可以拥有“扩展定律”(Scaling Laws)。只要计算资源(Compute)充足,并且通过 Guide 机制守住数据质量,模型能力的提升就是可预测、可扩展的。
目前 SGS 在形式化验证领域(Lean4)已经证明了其价值。下一步的挑战在于如何将这种自我引导机制扩展到代码生成、复杂决策、甚至更广泛的通用逻辑推理领域。
我们可能正处于 又一次模型能力指数级增长的起点
显示更多
Jason Wei 在 Stanford AI Club 做了一场约 30 分钟的演讲,围绕三个他认为理解 2025 年 AI 格局最基本的思维框架展开。Jason Wei 目前在 Meta Superintelligence Labs 做研究,此前在 OpenAI 参与创建了 o1 和 Deep Research,更早在 Google Brain 推动了 chain-of-thought prompting 和 instruction tuning 的研究,累计被引超过 9 万次。
一、智能正在变成大宗商品
他把 AI 的进步分成两个阶段:第一阶段是推前沿,模型还做不好某件事,你在解锁新能力;第二阶段是一旦能力达成,它就会迅速被商品化。用 MMLU 基准测试的数据看,每一年达到同等智能水平所需的花费都在下降,这个趋势在他看来还会持续,核心原因是深度学习历史上第一次"自适应计算"真正跑通了。过去不管问题多简单多难,推理用的算力是固定的;现在从 o1 开始,模型可以根据问题难度动态调整推理时的算力投入,这意味着简单任务的成本可以被压到极低。
另一个维度是获取公开信息的时间。他画了一条时间线:从前互联网时代到互联网时代、聊天机器人时代、再到 AI 智能体时代,找到一条信息所需的时间在指数级缩短。他举了一个例子——"1983 年韩国釜山有多少对夫妇结婚?"——o3 回答不了这个问题,但 OpenAI Operator 可以,因为它能打开韩国统计数据库 KOSIS,一路点击操作直到查到答案。OpenAI 内部用一个叫 BrowseComp 的基准来衡量这种"知道答案就秒验证,但找答案极耗时"的任务,人类平均每题花两小时以上,很多题根本做不出来,而 Deep Research 能解决大约一半。
这个趋势带来几个推论:过去靠知识门槛建立壁垒的领域会被民主化,vibe coding 和个人健康管理是典型例子;公开信息近乎免费之后,私有内部信息的相对价值反而上升了——比如你知道哪些房子没上市但可以卖,这种信息会更值钱;最终每个人将拥有一个"个性化互联网",想知道什么就有一个为你定制的页面呈现给你。
二、验证者定律:能衡量的就能被 AI 攻克
第二个框架是他所说的"验证不对称性"。有些任务,生成一个解比验证一个解难得多——数独是经典例子,写出能跑 Twitter 的代码需要大量工程师,但验证它能不能用只要打开网页点几下。另一些任务则相反:写一篇看起来有道理的事实性文章很快,但逐句核实极其费时;宣称"最好的饮食是只吃野牛肉"只花 10 秒,但验证这个说法需要大样本和长期跟踪。
他在一个二维平面上把这些任务画出来:X 轴是生成难度,Y 轴是验证难度。关键洞察是,你可以通过提供"特权信息"来改变任务在这个平面上的位置——竞赛数学题如果给了答案就秒验证,写代码如果给了测试用例(像 SWE-bench 那样)验证也变得简单。
由此他提出了 Verifier's Law:AI 训练出来在某个任务上的能力,基本上与该任务的可验证程度成正比。具体来说,可验证性取决于五个因素:是否有客观正确答案、验证速度多快、能否大规模并行验证、噪声大不大、以及奖励信号是连续的还是二元的。几乎所有 AI benchmark 本身就是因为容易验证才被设计出来的,而这些 benchmark 确实在过去几年被逐一攻破,这恰好是 Verifier's Law 的实例。
他特别推荐了 DeepMind 的 AlphaEvolve 作为利用验证不对称性的范例。AlphaEvolve 挑选满足上述五个条件的问题——比如找到 11 个六边形的最优排列使外接六边形最小——然后用大语言模型采样大量候选解,自动评分,把最优解作为下一轮采样的灵感,不断迭代。关键技巧在于它绕过了泛化问题:训练集和测试集是同一道题,你就是想知道这一道题的最优解。
这个框架的实际推论是:最先被自动化的任务一定是验证成本最低的任务;而一个正在崛起的创业方向是——发明新的衡量方法,把原本难以验证的任务变得可验证,从而让 AI 去优化它。
三、智能的锯齿状边缘
对于"AI 将如何改变世界"这个问题,他看到的观点光谱极广。他的一个量化交易员朋友觉得 ChatGPT 跟自己工作无关,而他在顶级实验室的同事则认为再过两三年 AI 就会取代他们自己的工作。
他明确反对"快速起飞"假说——即一旦 AI 跨过某个临界点就会突然变成超级智能。他的理由是,AI 的自我改进不是一个二元开关,而是一个渐进光谱:从跑不起来代码,到能训练但结果一般,到能自主训练但不如顶尖研究者,再到偶尔还需要人工干预。更重要的是,自我改进的速度应该按任务来看。AI 的能力图谱是一条锯齿线:在某些任务上已经达到山峰(竞赛数学、部分编程),但在另一些任务上仍是低谷(比如 ChatGPT 曾长期认为 9.11 大于 9.9,或者说一门只有几百人会的原住民语言 Tlingit)。
他给出了判断 AI 在某个任务上进步速度的三条启发式规则。第一,AI 擅长数字化任务,核心原因是迭代速度——数字环境可以轻松扩展算力,而物理机器人的实验扩展成本高得多。第二,人类觉得容易的任务 AI 也往往容易,但有一类例外是"人类因生理限制做不到但 AI 可以做到"的任务,比如读过一千万张乳腺影像后发现某个人类注意力无法捕捉的模式来预测乳腺癌。第三,数据充足的任务 AI 表现好——数学推理在不同语言上的表现和该语言的训练数据量高度相关;而如果一个任务有单一客观指标,就可以通过强化学习生成合成数据来突破数据瓶颈,AlphaEvolve 和 AlphaZero 都是这个路线。
他用一张表把这些启发式规则应用到具体任务上:主流语言翻译已经完成;调试基础代码 2023 年搞定;竞赛数学 2024 年搞定;AI 研究本身大概 2027 年;化学研究因为不是纯数字任务会更晚;拍电影大概 2029 年;修水管和理发因为高度物理化,短期内不太可能;乌兹别克传统地毯编织需要一组人花一个月、非数字化且缺数据,AI 不太可能碰到;至于"带女朋友约会让她满意"——他的判断是"impossible,非数字化,缺数据",人类还能保住饭碗。
显示更多
Alpha上的币有没有搞头?
最近在抄底,把以前大涨热度高的币拉出来买点。
有人关注吗?推几个给我
Alphabet 今天开卖美元债,最多要融250亿美元。
结构是最多10档,期限从2年一直铺到40年。用途没什么悬念,两周前公司刚把2026年的资本开支上调到最高2050亿美元,是2025年的两倍多,消息出来时股价掉了一截。
可以拿今年2月那次做参照:原计划融150亿,最后卖出200亿,订单簿峰值超过1000亿美元。彭博今天给的数字是这次的需求大概1150亿美元。
需求还是旺的,说明债市眼下仍愿意替 AI 资本开支买单。
至于买2年期和买40年期的人,赌的是不是同一件事,那是另一回事了。
显示更多
Alphabet(GOOG.O)寻求通过债券发行筹集高达 250 亿美元资金。
要不一次借100b得了 现在还能低利差超募好几倍 后面可就不好说了
Alpha,彻底没毛了。
7 月新币就两个,份额也不算多,一个开盘50U,一个开盘45U,格局就腰斩。
老币基本 20~30U,发放名额也缩水到 5000~7000 份,抢到基本靠运气。
交易赛更不用说了,卷到利润几乎归零。
当越来越多人知道一条赚钱路径时,它就不再是一条赚钱路径了。
Alpha:亲亲,这边建议您直接离职呢~🙂
显示更多
Alpha打新的 $Btw 一个没卖,现在8倍了,一个可以卖250U了。
ethereum:0xa12cc123ba206d4031d1c7f6223d1c2ec249f4f3 也能卖356U了。
意外惊喜,缝缝补补又可以过3年了。
显示更多