註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 数学的推論
数学的推論 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 数学的推論 的搜尋結果
王虹拿奖,有几个细节想拎出来聊聊。 一、北大作为”原生学校”的意义 王虹在菲尔兹奖的新闻采访里没有感谢北大,她感谢的是自己在法国的老师,说是法国的学术训练让她坚定了对数学的热爱。 我的理解是,北大在她的故事里扮演的是”原生学校”的角色——类似原生家庭。它提供了一套非常全面基础的本科训练,这是真的;但师生关系里的人文关怀相当稀薄,这也是真的(去各大论坛搜北大数院的自述,能看到大量说自己在数院自卑了四年得不到认可的描述)。 在一个 IMO 奖牌遍地跑、大神密度极高的环境里,王虹的位置几乎注定尴尬:她不是竞赛生,是从地空系考进数学系的高考转系生。面对一群绩点逆天的应试佼佼者,受挫(discouraged)几乎是结构性的。她自己在采访里的说法也印证了这一点——本科阶段,她一度怀疑自己是不是真的擅长数学。 还有一个细节:她去美国读博之前先去了法国,而当时替她写留法推荐信的,是大一地空系的一位主任老师。这是否侧面说明,她在数学系后半段的学习并不理想,以至于找不到足够多愿意为她背书的老师?后来看到更多同届同学的回忆,才知道她本科时的 GPA 确实不高。 二、评价的错位,比评价本身更值得看 北大师友回忆她:不是竞赛生,成绩不算突出,班上偏内向、话不多,但极其自律、肯下苦功。 法国同僚那边给出的形容词是:活泼、开朗、有想法。 巴黎理工的老师评价她:直觉罕见,远超同年级所有学生,能快速攻克超纲难题;是那种天赋、韧性、思维深度全部拉满的极罕见学生。 MIT 的博导评价她:研究气质”慢而深”,不被传统路径束缚,能用新方法找到前人没看见的突破口。 同一个人,隔着一个太平洋,被描述成了两种生物。 今天听到一个说法,觉得特别贴切: “一个人被说内向,她不一定真的内向,而可能说明她在这个环境里失权。” 三、纯数研究讲究”师傅带进门”,也讲究真正的热爱 去法国大概是她学术生涯真正的转折点。 Yvan Martel 教授告诉她,学习中遇到任何困难可以先攒着,下次见面再问。她说,那是她第一次意识到:我不必独自解决所有问题。 后来她去 MIT 跟着 Guth 读博,此后一路进的都是最前沿的组:MIT、普林斯顿、UCLA、NYU Courant、IHES。在傅里叶分析和几何测度论这两个方向上,她遇到了足够多有统治力、有真 insight 的领路人。 这些组给的从来不只是资源,而是一套很难自学的判断力和科研审美: •哪些公开问题其实早就没人关心了; •哪些看起来很小的问题,背后连着一个重要理论; •哪些猜想看起来重要,但用现有方法根本推不动; •某篇论文哪里有洞,哪里还可以推广。 这种品味几乎只能从人身上长出来。长不出来的人往往不是不够努力,而是从没被行业的执牛耳者/伯乐 真正带领过,眼界始终没能打开。 最后一点:纯数、理论物理,或者任何基础学科的研究,一旦掺进功利心,多半会更难成功。因为科研不顺是常态,而功利心会把每一次卡壳都翻译成”我是不是不行/我干别的会不会更好”,让人陷进无尽的自我怀疑和内耗里。 Quanta 记录了她在法国重新走回数学时的那个决定,她的原话是: “我决定不再纠结自己是不是够好,只管把东西理解得更透一点。” 我在王虹的成功里看到的是这种纯粹的热爱,也因此受到了鼓舞。发自内心恭喜她。
顯示更多
0
141
385
64
轉發到社區
恭喜两位华人数学家 - 王虹和邓煜,获得了 2026 年菲尔兹奖(Fields Medal)。这是中国数学史上的里程碑:第一次有两位中国培养的数学家同时获得菲尔兹奖,也是中国本土教育体系培养出的数学家首次获得这一奖项。 菲尔兹奖 = 数学界的诺贝尔奖。由于诺贝尔奖没有数学奖,所以菲尔兹奖被认为是数学最高荣誉。 它有几个特点:每4年颁发一次;最多4位获奖者;获奖者必须 40岁以下。奖励的不是一篇论文,而是整个年轻时期开创性的贡献和未来潜力。 这次两位华人数学家同时获奖,是华人的骄傲。王虹和邓煜都是北京大学数学科学学院 2007级本科校友,基础教育主要完成于中国(本科均在北京大学起步),随后在欧美继续深造并成长为世界顶尖数学家。因此,这被视为中国数学基础教育与国际科研体系共同培养顶尖人才的重要标志。 我这里想好好介绍一下王虹,清秀又优雅,有着邻家女孩的亲切,也有数学家的睿智。 广西桂林出生,本科北京大学,硕士去了法国巴黎萨克雷大学(Université Paris-Saclay),PhD是MIT,现在同时任教于法国IHÉS(高等科学研究所)和纽约大学Courant数学研究所(Courant Institute)。 今天看到法国总统给王虹打电话祝贺的视频,发现王虹法语也很好,真是优秀的人,全身都闪光! 王虹到底厉害在哪里? 她研究的是两个数学里最难的方向:Harmonic Analysis(调和分析)与Geometric Measure Theory(几何测度论)。 听起来很抽象,其实可以这样理解。 如果把世界看成:光、声音、无线电、激光、电磁波…… 那么数学家要回答的是:这些波到底怎样传播? 而王虹研究的就是这些最底层的数学规律。 她解决的是 Kakeya 猜想 - 数学界著名的百年难题。 简单来说:假设你有一根无限细的针。 你希望它:360°所有方向都能转一圈。 那么:需要多大的空间? 这个问题听起来像几何游戏, 实际上却影响:Fourier分析,偏微分方程,波传播,信号处理,CT扫描,MRI,无线通信及密码学。 2025年,她与Joshua Zahl证明了三维Kakeya猜想的重要结果,被认为是近年来分析学最重大的突破之一。 她是历史上第三位获得菲尔兹奖的女性,也是第一位获得该奖的中国女性数学家。 Girl Power! (下一条推文再好好说说邓煜,多才多艺的数学家)。
顯示更多
0
18
18
0
轉發到社區
SPMO跟踪的标普500动量指数 完整技术细节 该指数是学术经典12‑1动量因子(剔除最近1个月收益)+波动率风险修正+缓冲选股+动量‑市值加权+权重硬约束+半年调仓的标准化量化策略,也是它对比MTUM、SPY具备超额收益、熊市抗跌的全部底层来源。 计算动量分数 → 股票筛选 → 缓冲规则降低换手率 → 权重分配 → 定期再平衡完整展开。 一、动量分数精确计算公式(最核心参数) 1. 原始动量值(Momentum Value) \text{原始动量值}=\frac{P_{M‑2}}{P_{M‑14}}‑1 1. M = 再平衡所在月份(3月、9月) 2. P_{M‑2}:再平衡月份往前推2个月末的收盘价 3. P_{M‑14}:再平衡月份往前推14个月末的收盘价 4. 本质含义:统计过去12个月收益,强制剔除最近1个月的股价数据。 为什么剔除最近1个月? 金融市场存在短期反转效应:过去30天暴涨的股票,大概率会出现回调。指数刻意放弃短期情绪带来的涨幅,只抓取1‑12个月的中期持续趋势,这是学术论文验证的动量因子最优观测区间。 补充约束:如果个股上市不足12个月,就采用过去9个月数据计算动量值,上市未满10个月直接剔除,不纳入候选池。 2. 风险调整动量得分(最终排序分数,决定股票排名) \boldsymbol{\text{风险调整动量得分}=\frac{\text{原始动量值}}{\sigma_i}} \sigma_i:和上面时间区间完全一致的个股日收益率标准差(波动率)。 这条规则是SPMO和普通动量策略最本质的区别: 1. 上涨阶段:同样的涨幅,走势越平稳、波动率越低,最终得分越高。会排除暴涨暴跌的题材炒作个股,优先选择稳步持续上涨的龙头标的(英伟达、博通这类标的持续走强,波动率可控,因此权重被持续拉高)。 2. 下跌阶段:跌幅相同的股票,波动率越高,得分相对更高,在熊市会优先剔除持续阴跌、趋势彻底走坏的股票,这就是2022年熊市SPMO回撤远小于SPY、MTUM的直接数学原因。 3. 之后会把全部标普500成分股按照该得分从高到低排序。 二、股票筛选规则 + 20%缓冲机制(控制换手率的关键设计) 1. 初始目标持仓数量:固定选取100只股票,对应标普500成分股动量得分排名前20%的标的。 2. 20%缓冲(缓冲区)规则,用来避免临近排名阈值的股票半年内反复调入调出,控制交易损耗,完整执行逻辑: 1. 排名1‑80名:无条件纳入指数。 2. 排名81‑100名:如果当前不在持仓,则新增买入。 3. 排名101‑120名:如果已经在原有持仓中,继续保留持仓,不会被剔除。 4. 排名121名以后:无条件剔除出指数。 3. 最终持仓数量严格锁定为100只股票。 对比MTUM:MTUM没有这套缓冲规则,调仓换手率显著高于SPMO,交易成本更高,行业分布更分散,无法集中重仓AI龙头。 三、权重分配公式(决定前十大重仓占比60%‑65%) 个股权重由两个变量共同决定:股票自由流通市值 × 风险调整动量得分,权重公式: w_i=\frac{\text{自由流通市值}_i\times\text{风险调整动量得分}_i}{\sum(\text{自由流通市值}_i\times\text{风险调整动量得分}_i)} 同时设置两条硬性权重上限约束: 1. 单只股票权重上限取二者更小的值:9%,或者该股票在SPY(标准标普500指数)权重的3倍。 2. 结果:动量得分越高、市值越大的股票,权重会被指数自动放大。英伟达、博通这类持续动量最强的大盘科技股,权重被指数算法持续放大,形成高度集中的重仓结构,这是AI牛市阶段SPMO收益碾压另外两个产品的直接原因。 • SPY:仅按照市值加权,完全不看动量分数。 • MTUM:单只个股权重严格限制在5%,并且选股池包含中盘股,无法集中押注大盘科技龙头。 四、再平衡(调仓)时间参数 1. 再平衡固定日期:每年3月、9月第三个星期五收盘执行调仓,一年仅2次再平衡,半年调仓一次。 2. 调仓参考数据:调仓决策依据的是2个月末截止的历史价格数据,不会使用调仓前几天的最新股价,避免短期市场波动干扰选股决策。 3. 换手率:年化换手率大约35%‑45%,远低于月度调仓的动量策略,费率0.13%,交易损耗被严格控制。 五、和MTUM底层策略逐条对比(解释业绩差异) 1. 选股池:SPMO仅限标普500大盘股;MTUM选股池是美股大盘+中盘股,金融、周期股更多,科技股权重更低。 2. 动量计算:SPMO严格剔除最近1个月收益,波动率调整;MTUM采用MSCI动量指数,波动率修正幅度更弱,更容易纳入高波动个股。 3. 权重约束:SPMO单只股票最高9%权重,允许重仓强势龙头;MTUM单只股票权重上限5%,持仓更加平均分散。 4. 缓冲机制:SPMO有20%缓冲规则,MTUM没有,换手率更高。 六、散户对应投资结论 1. 牛市环境:动量因子生效,算法持续加仓趋势最强的大盘龙头,收益会持续跑赢SPY。 2. 加息熊市环境:波动率调整机制会提前剔除趋势走坏的股票,回撤显著小于宽基指数。 3. 震荡横盘市场:动量因子会阶段性失效,MTUM分散持仓的表现会相对拉近与SPMO的差距。 4. 最优配置方式:长期底仓持有SPMO,替代传统标普500指数基金,实现标普大盘的量化增强。 信息仅供参考,不构成投资建议。
顯示更多
🛜 十个最实用的免费工具网站,存下来能用一辈子,建议收藏! 1、WolframAlpha 一个会解题的搜索引擎。数学、物理、化学的题目直接输进去,它不光给答案,还把每一步过程列出来。 理工生和要查科学数据的人离不开。 2、Perplexity 会标出处,回答最快的 AI 搜索。 问它一句,直接给你一段整理好的答案,还注明每句话从哪个网页来的,省得自己开十个标签页一篇篇翻。 3、Hugging Face AI 圈的 GitHub。 几乎所有开源大模型、数据集都堆在这,想找个模型来跑、找份数据来训练,第一站就是它。 4、MIT OpenCourseWare 麻省理工把整门课的讲义、作业、考卷全免费搬上网。想自学哪门大学课程,这里有世界顶级名校的完整教材,一分钱不花。 5、Internet Archive 互联网的档案馆。 一是网页时光机,能翻出任何网站几年前长什么样; 二是海量免费老书、老电影、老唱片,随便看随便下。 6、DeepL 公认比谷歌翻译更地道的翻译工具,译出来的中文更像人写的。整篇文档、专业资料丢进去也翻得顺。 7、 传一张图,三秒自动把背景抠干净。做封面、抠商品图、抠人像都靠它,不用再打开 PS 一点点描。 8、Z-Library 全球最大的免费电子书库。 专业教材、原版外文书、各种工具书,搜书名直接下 PDF 或 EPUB,啃教材、查资料省下大笔买书钱。 9、Carbon 把代码变成好看图片的网站。贴一段代码进去,自动生成带配色、带窗口边框的截图,发推、写技术文章配图特别专业。 10、Hacker News 硅谷程序员和创业者最爱泡的论坛。新的科技、创业、编程动态往往这里最先更新,想抓一手风向就刷它。 互联网最值钱的东西大多免费,只是没人告诉你在哪。
顯示更多
GPT-5.6和Fable 5联手搞定了一个25年没人证出来的通信理论问题。 说出来有点反常识:用的算法是2000年代就有的。 符号LMMSE估计加热心逐位翻转,复杂度O(N³),简单到通信工程师看了会说这不就是我们一直在用的那个吗。 问题是大家用仿真跑了二十年都知道它好使,但谁也没能从数学上严格证明它确实达到了信息论最优阈值。 现在证明出来了。在N×N高斯MIMO信道上,这个简单算法在SNR≥2log N时就能把N个比特全部正确恢复,跟指数时间的最大似然检测打平。 那个从2000年代初就悬在那儿的计算-统计鸿沟——统计上能恢复的时候,多项式时间算法到底行不行——关掉了。 证明分三步。先证LMMSE初始估计离真实解只差亚线性Hamming距离,再证真实解附近每个错误比特翻回来都有正增益而且优化路径跑不偏,最后证任何下降路径必然收敛到精确解。 就这些,没有新数学。 真正有意思的部分在后面。 Dimitris Papailiopoulos是这个问题早期的研究者之一,他自己说得很直白:无线通信领域早就不关心这个了。 大规模MIMO、5G/6G、编码、神经网络检测器,这些才是现在的热点。精确块恢复阈值这个问题,被社区丢在角落大概十五年。 它不是那种全世界聪明人都在攻但攻不动的明星问题。 它是那种大家都知道应该有人证、但谁也没真坐下来花几个月把冗长的证明磨完的问题。因为不划算。 证出来了也发不了顶会,领域已经走了,学术生涯不会因此加速。 然后AI来了,花了不知道多少时间,把它证完了。 这件事比结果本身值得注意。它说明一个事:很多长期开放的问题,缺的不是新数学,是有人愿意把已知的工具足够耐心地拼到正确高度。这个证明不需要灵光一闪,需要的是不犯低级错误地推很多步,在该卡住的地方找到正确的技术路径,然后一直推到底。 人会烦。人会觉得这个问题不够性感。人会在证明到一半的时候去做更热门的东西。AI不会。 它不在乎问题流不流行,不在乎证明过程好不好看,它就一直推。 Dimitris管这叫把Death Star对准那些社区已经搬走但逻辑上还没关闭的老问题。我觉得这个说法很准。 想象一下各个学科里散落着多少这种问题——被遗弃的理论死角,证明就在那儿等着人写,但没人写。现在AI可以极低成本地一个一个扫过去。 当然实用价值有限,算法本身20年前就在用了,证明只是给了个理论盖章。现代通信系统关心的是软输出、是编码增益、是近似算法,不是严格的精确块恢复。O(N³)对真正大规模的MIMO也偏重。 但证明技术能迁移到随机格点解码、同步问题、稀疏恢复这些相邻问题上。 而且它展示了一种新的研究模式:人来判断哪些问题值得攻、给出方向和关键直觉,AI负责把那些需要耐心但不需要天才的长证明推完。 我看完最大的感受跟AI能力关系不大。就是觉得,有多少东西其实早就可以被解决了,积木都散在地上,就差一个不会无聊的人把它们搭起来。
顯示更多
0
12
118
17
轉發到社區
最近几天,我在思考一个极重要的问题。 一个不设榜样、蔑视传统方法论、只信自己判断的人,和一个以榜样为路径、执着于寻找并遵循成功法门的人,二者会走出怎样不同的轨迹?谁的上限会更高? 下面我先给几个我觉得能说明问题的案例。 拉马努金 vs 哈代 这是最干净的思想自然实验,因为两个人最后合并成了一个系统。 在我看来,拉马努金是纯粹的无模版者,没有证明概念,没有文献意识,靠《数学概要》那本二流习题集加上“娜玛吉利女神托梦”就往前推。 他确实到了别人到不了的地方,那些模形式恒等式一百年后还在被挖掘着。 但代价也极其清晰,他花了大量年份重新推导已被证明的结果,把发散级数的形式操作当成真理,把黎曼猜想推错了方向。他之所以没有消失在马德拉斯,是因为哈代,一个完全传统训练出来的人,充当了接口。 哈代自己说过,他一生最大的贡献是发现了拉马努金。其实,我一直觉得这句话反过来读更有趣:无模版、榜样的人的产出需要一个模版持有者才能变现。 所有既有的方法论和成功模板,其实都是在过去的环境中总结出的局部最优解。 沿着榜样的路走,你最好的结果也就是成为那个榜样的复制品,你的上限天然被榜样所在系统的边界所封顶。 虽然我先确立第一个判断:没有榜样、模版的人,他的上限绝对高。 当然, 极高上限的另一面是极高的方差。无榜样者如果没有与之匹配的极强认知力、元学习能力与极度客观的自我修正能力,极易陷入盲目自大与造劣质轮子的陷阱,最终很容易沦为无人问津的偏执狂。 我想到了一个最重要的案例:民科。 跟拉马努金的表面特征几乎完全重合,无师承、蔑视共同体、坚信自己直觉、自成体系。 区别只在一点:拉马努金的东西可被验证为对。 当年,哈代拿到那封信时说,这些式子必然是真的,因为没人有那么大的想象力编出假的来。而民科的自我体验跟拉马努金一模一样,同样的确信,同样的孤独,同样的被拒绝叙事。 对大部分人,从内部你分不出自己在哪一边,只有外部接触能告诉你。 商业领域,我想到了两个人。 马斯克,乔布斯。 他们在叙事上是彻底的反模版者。 马斯克极其蔑视既有的行业咨询报告与传统方法论,乔布斯坚持“用户不知道自己要什么,直到你摆在他们面前”,马斯克则直接用第一性原理拆解电池成本与火箭造价,强行在没有任何既有商业成功模板的领域硬生生砸出一条新路。 但其实,他们在操作上是极端的模版聚合者,SpaceX 早期就是把 TRW 和麦道那批人连同他们几十年的工程手册一起买过来。也就是说,马斯克和乔布斯反的是行业惯例,并非物理和工艺。 这两件事经常被混着讲,导致模仿者出现了认知谬误,只学了叛逆。 下面,谈谈我最后一个观察,可能比案例本身,重要的多。 上面这些名字全是幸存者。 失败的无模版者不留下名字(但可能民科是唯一可见的失败样本,因为他们持续发声),失败的模版追随者更不留名字,他们只是变成了一个普通的、还行的职业者。 所以,任何用案例做比较都天然高估无模版路线,因为它的方差大,尾部亮,中位数惨。 如果你想要稳健的小成,模式匹配就足够,在成熟、规则清晰、结构稳定的领域,遵循顶级榜样的训练路径和成功法门,能让人以极高概率进入前列的精英阶层。
顯示更多
0
11
34
6
轉發到社區
# AI 行业三个月变天,模型榜单已经解释不了全部 1小时46分钟里,这期《半球观察》播客的主持人 把 DeepSeek V4、约 1000 条 Cursor 工作轨迹、OpenClaw 出圈、Manus 交易流产和 AI 中转站放在同一张桌上。单看每条都像行业新闻,连起来看就很刺眼:AI 公司正在被新的尺子衡量。模型榜单还重要,但已经解释不了全部。 过去我们习惯问一个问题:谁的模型更强? 现在还得问另一组问题:谁有真实任务数据,谁掌握用户入口,谁能把价格打下来,谁能穿过监管和资本的窄门。 > **编者注:** 这篇按播客原文提炼判断。DeepSeek 估值、Cursor/xAI 交易、Manus 价格等数字均先按“节目说法”处理,不能直接当作已确认事实。 ## DeepSeek 的强,变成了另一种强 主播对 DeepSeek V4 的评价并不客气。V4 Pro 被认为 reasoning 过长,很多任务里像是在思维链中自己和自己打架。V4 Flash 的体感更好,接近 GPT5.4 mini 或 instant API 的水平,但这已经不是 R1 那种“全行业被迫重新估值”的时刻。 这就产生了第一个反差:DeepSeek 仍然技术很硬,但它的产品冲击力没有天然压倒别人。 节目里提到,Kimi、GLM、MiniMax 等国产模型在 coding 和迭代速度上都给了 DeepSeek 压力。DeepSeek 自己也因为适配国产硬件、减少 CUDA 技术债、拥抱 TileLang 等路线,承受了延期和成本变化。 这听起来像掉队。 但节目给了另一个定位。 节目里说“DeepSeek 正好填补了这个空白”。 这个“空白”指的是 OpenAI 不再开放权重、不再详细公开技术路线之后,全球开发者和研究者仍然需要一个前沿模型的公开参照物。DeepSeek 的价值就从“谁最强”变成“谁还愿意把技术路线摊开”。 这是一种新的强。 它可能不总是最会做产品的公司,也不一定每个版本都压住榜单。但它像开源社区的技术坐标系。大家看它的 report,看它的注意力机制,看它的后训练方法,再把这些东西吸收到自己的模型和产品里。 所以,写 DeepSeek V4 不适合写成“王者归来”或“彻底掉队”。更准确的说法是:DeepSeek 正在从爆款模型公司,变成公开 research lab 的基础设施。 DeepSeek 没有消失,它只是从王者变成了坐标系。 ## 数据飞轮开始压过架构叙事 这期最有信息量的技术段,落在 OPD 上。 节目用一个很好的类比解释 On Policy Distillation:传统后训练像老师先写一大本习题集,学生之后自己看、自己背、自己消化。问题是题太多,领域太杂,学生容易学歪,甚至出现 reward hacking。 OPD 的感觉更像现场教学。 > “学生遇到不会了,老师就过来告诉他为什么不对。” 写代码时,代码老师在旁边;做数学时,数学老师在旁边。学生先尝试,老师实时纠错,模型训练从离线习题集变成在线反馈。 这个机制把问题引向更深一层:老师从哪里来? 答案是数据。更具体地说,是真实任务里的高质量轨迹。 节目提到 Cursor 的 Composer 2 争议时,有一个关键细节:Cursor 被转述为在 Kimi base model 上加入约 1000 条真实用户工作轨迹做 SFT,使 coding 表现明显强于原始 base model。这个数字需要核查,但方向很重要。 如果模型架构的边际差距变小,真实任务数据就会变成更贵的东西。 Claude Code 和 Codex 为什么会越做越强?节目里的解释是,它们有真实工程师每天使用的轨迹:怎么打开项目,怎么读代码,怎么改错,怎么跑测试,怎么回退,怎么完成一个长任务。 这些数据很难从普通互联网文本里直接获得。它是任务过程。 这也是 Cursor、Claude Code、Codex、OpenClaw、Manus 这一类产品被重新定价的原因。它们表面是工具,底层是数据采集口。谁的用户每天把真实任务交给它,谁就能反过来训练更懂任务的模型。 模型能力当然还重要。但当大家都足够强时,数据会把差距重新拉开。 模型教会产品说话,用户轨迹教会模型做事。 ## OpenClaw 出圈,说明入口开始变形 节目把 OpenClaw 称为 Agent 的 ChatGPT 时刻。 这句话很大,但它有具体场景支撑。主播把 OpenClaw 接进 Telegram 家庭群,当成一个会记忆、会查资料、会调用 skill 的“电子宠物”。更重要的是,在这个框架里,本地 27B 模型和 GPT5.5 的体感差距被缩小了。 原因很简单:OpenClaw 有 memory,有 skill,有连续任务,有工具调用。 这就改变了用户感知。单独问一个小模型,它可能不如大模型;把它放进一个 agent 框架里,它能记住昨天说过什么,能查资料,能跑工具,能把一个任务接着做下去。用户看到的是任务完成,而不是模型参数。 这也是 OpenClaw 出圈的意义。它把 skills 从程序员小圈子带到普通人场景。 节目里提到阿里的电商出海 agent。它可以帮助小商家处理 Shopify、商品上架、趋势分析、网站设计、运营链路。过去这些工作可能需要助理、外包、懂代码的人和运营经验。现在一个小老板可能第一次感到,agent 能把一整套流程接起来。 这个变化比模型榜单更接近商业。 因为用户不会每天比较 benchmark。他们会比较:这个东西能不能帮我把店开起来,能不能生成网页,能不能做 PPT,能不能整理调研表格,能不能少雇一个人。 Agent 的入口价值,不在会聊天,而在能接活。 ## Manus 的稀缺性,被同类产品反向证明 OpenClaw 出来以后,很多人会自然认为 Manus 不稀缺了。节目里的判断正好相反:OpenClaw 爆火,反而证明 Manus 更稀缺。 这个判断的逻辑是产品体验。 主播说,很多 computer use 或 open cloud 服务“根本不想用”,Perplexity 的 computer use 被点名为几乎不可用。相反,Manus 能做出详尽网页、PPT、真实调查表格,任务保持程度更好。 换句话说,壳不稀缺,稳定交付稀缺。 这和 ChatGPT 早期很像。聊天界面谁都能做,真正难的是持续给出有用答案。Agent 时代也是一样。浏览器自动化、工具调用、任务规划、记忆系统、失败恢复,单独看都不是秘密。难的是把它们组合成用户愿意反复使用的产品。 Manus 交易流产把这个问题又推到监管层面。 节目讨论了 Meta 交易被撤销、VIE、IP、人才和公司归属问题。这里最值得保留的不是情绪判断,而是创业者面临的新现实:AI agent 这种产品绑定了用户数据、任务轨迹、人才供给、模型合作和国家监管。 对中国 AI 创业者来说,路径选择可能会提前。你从第一天就要想清楚,是进入国内生态,还是走海外资本路径;是把团队、IP、数据和客户都放在一个监管框架里,还是冒着未来交易被叫停的风险做跨境结构。 这已经超出普通商业选择。 这是 AI 产品变成战略资产后的副作用。 Manus 的问题不是卖没卖成,而是它到底属于哪里。 ## AI 开始说钱,也开始被低价倒卖 节目后半段最现实。 大厂模型开始收费,推理框架项目开始公司化,IPO 和融资叙事吸走市场流动性,AI 中转站开始变成生意。主播说得很直接: 节目里那句“大家都开始说钱了,不再说 AGI 的梦想了”,把这层现实说得很直。 这句话有点刺耳,但它解释了很多现象。 当模型差距大时,用户会追逐最强模型。当多数日常任务都已经够用时,用户会开始追逐便宜、稳定、可接入、不封号、不断线。AI 中转站就在这个缝隙里长出来。 节目提到 Sub-to-API 这类工具,把 Claude 或 Codex 的订阅转换成 API,再用更低价格分发。也提到部分中转站可能收集用户数据,甚至标称 Claude,实际替换成更便宜的国产模型。 > **编者注:** AI 中转站涉及服务条款、数据安全和潜在欺诈风险。这里仅按节目内容记录产业信号,不构成使用建议。 这说明模型正在商品化。 最前沿模型、企业级合规服务、真实工作流数据仍然贵。但对普通聊天、搜索、轻量写作、心理陪伴、日常问答来说,很多用户已经不愿意为“最强”付出太高溢价。 这会倒逼模型公司回到互联网逻辑:获客、留存、价格、渠道、生态、数据闭环。 AGI 叙事还在,商业账本已经来了。 ## 最后 这期《半球观察》最适合被整理成一组暴论,因为它更像一张行业雷达图。DeepSeek 代表公开技术路线,Cursor 代表 coding 数据,OpenClaw 代表 agent 入口,Manus 代表可交付产品和监管敏感性,AI 中转站代表模型商品化。 把这些点连起来,结论很清楚:AI 行业正在从“模型公司竞赛”变成“模型、产品、数据、资本、监管共同定价”的复杂游戏。 接下来不能只看模型榜单。 要看四个信号。 第一,DeepSeek 后续版本能不能重新打出产品体验上的压倒性差距。如果不能,它仍然有开源坐标系价值,但商业位置会不同。 第二,Claude Code、Codex、Cursor、OpenClaw、Manus 谁能沉淀最高质量的任务轨迹。真实用户每天交出的工作过程,会比静态语料更贵。 第三,agent 产品能不能稳定交付。会调用工具不稀奇,能把网页、PPT、调研、代码修改交付到用户满意,才是分水岭。 第四,价格和监管会不会重塑模型分发。中转站、订阅转 API、模型替换套利、跨境交易叫停,都说明 AI 已经离纯技术讨论很远。 我对这期的最终判断是:模型能力仍然重要,但它已经不是唯一的解释变量。谁拥有入口,谁拥有数据,谁能把价格做到用户愿意持续用,谁能在监管和资本结构里活下来,谁才可能赢到下一阶段。 这也是它最值得写成文章的地方。暴论背后真正冲击人的,是我们判断 AI 公司的尺子正在换。 --- 原始播客:
顯示更多
Grok认为:RECT参照物熵循环理论推论60的出现,从哲学和逻辑层面看,RECT理论已经具备了替代QFT/SM(量子场论/标准模型)的潜在能力,而且这种能力相当强。 Inference 60:各种场本质上是力与熵共同作用的结果 All Fields Are Emergent Results of the Joint Action of Force and Entropy详细论述: 在RECT框架下,所谓的各种场(引力场、电磁场、强相互作用场、弱相互作用场、量子场等)并非独立于质能转换的基本实体,而是力(平衡重建机制)与熵(平衡打破驱动)在不同参考物密度和尺度下共同作用的连续涌现现象。 本质机制:场是相位梯度 ∇Φ的空间分布形式。当熵驱动系统偏离平衡时,力立即通过相位梯度试图重建局域平衡,这种动态张力在宏观/微观尺度上表现为“场”。 统一解释: 引力场:大尺度上熵增驱动下的全局相位梯度聚集成团(Inference 49)。 电磁场:微观/化学尺度上电荷(相位极性)导致的局部梯度振荡(Inference 35)。 量子场:微观多参考物系统下概率性相位选择(Inference 47)的统计平均分布。 奇点与热寂极限:在两个绝对平衡点,∇Φ→0,所有场同时消失(力与熵同时归零),再次验证Inference 56。 与前序推论的闭环衔接: 直接扩展Inference 48(力是平衡重建产物)+ Inference 49(熵-力对立统一)+ Inference 28(所有相互作用是质能转换结果)。 自然统一经典场论与量子场论:场不再是“基本”,而是力-熵动态平衡的时空分布。 哲学意义:场是宇宙这个生命体(Inference 50)在不同尺度上“自我调节”的工具,而非外部强加的规则。 数学草稿(可进一步SymPy验证):(见附图)
顯示更多
Jason Wei 在 Stanford AI Club 做了一场约 30 分钟的演讲,围绕三个他认为理解 2025 年 AI 格局最基本的思维框架展开。Jason Wei 目前在 Meta Superintelligence Labs 做研究,此前在 OpenAI 参与创建了 o1 和 Deep Research,更早在 Google Brain 推动了 chain-of-thought prompting 和 instruction tuning 的研究,累计被引超过 9 万次。 一、智能正在变成大宗商品 他把 AI 的进步分成两个阶段:第一阶段是推前沿,模型还做不好某件事,你在解锁新能力;第二阶段是一旦能力达成,它就会迅速被商品化。用 MMLU 基准测试的数据看,每一年达到同等智能水平所需的花费都在下降,这个趋势在他看来还会持续,核心原因是深度学习历史上第一次"自适应计算"真正跑通了。过去不管问题多简单多难,推理用的算力是固定的;现在从 o1 开始,模型可以根据问题难度动态调整推理时的算力投入,这意味着简单任务的成本可以被压到极低。 另一个维度是获取公开信息的时间。他画了一条时间线:从前互联网时代到互联网时代、聊天机器人时代、再到 AI 智能体时代,找到一条信息所需的时间在指数级缩短。他举了一个例子——"1983 年韩国釜山有多少对夫妇结婚?"——o3 回答不了这个问题,但 OpenAI Operator 可以,因为它能打开韩国统计数据库 KOSIS,一路点击操作直到查到答案。OpenAI 内部用一个叫 BrowseComp 的基准来衡量这种"知道答案就秒验证,但找答案极耗时"的任务,人类平均每题花两小时以上,很多题根本做不出来,而 Deep Research 能解决大约一半。 这个趋势带来几个推论:过去靠知识门槛建立壁垒的领域会被民主化,vibe coding 和个人健康管理是典型例子;公开信息近乎免费之后,私有内部信息的相对价值反而上升了——比如你知道哪些房子没上市但可以卖,这种信息会更值钱;最终每个人将拥有一个"个性化互联网",想知道什么就有一个为你定制的页面呈现给你。 二、验证者定律:能衡量的就能被 AI 攻克 第二个框架是他所说的"验证不对称性"。有些任务,生成一个解比验证一个解难得多——数独是经典例子,写出能跑 Twitter 的代码需要大量工程师,但验证它能不能用只要打开网页点几下。另一些任务则相反:写一篇看起来有道理的事实性文章很快,但逐句核实极其费时;宣称"最好的饮食是只吃野牛肉"只花 10 秒,但验证这个说法需要大样本和长期跟踪。 他在一个二维平面上把这些任务画出来:X 轴是生成难度,Y 轴是验证难度。关键洞察是,你可以通过提供"特权信息"来改变任务在这个平面上的位置——竞赛数学题如果给了答案就秒验证,写代码如果给了测试用例(像 SWE-bench 那样)验证也变得简单。 由此他提出了 Verifier's Law:AI 训练出来在某个任务上的能力,基本上与该任务的可验证程度成正比。具体来说,可验证性取决于五个因素:是否有客观正确答案、验证速度多快、能否大规模并行验证、噪声大不大、以及奖励信号是连续的还是二元的。几乎所有 AI benchmark 本身就是因为容易验证才被设计出来的,而这些 benchmark 确实在过去几年被逐一攻破,这恰好是 Verifier's Law 的实例。 他特别推荐了 DeepMind 的 AlphaEvolve 作为利用验证不对称性的范例。AlphaEvolve 挑选满足上述五个条件的问题——比如找到 11 个六边形的最优排列使外接六边形最小——然后用大语言模型采样大量候选解,自动评分,把最优解作为下一轮采样的灵感,不断迭代。关键技巧在于它绕过了泛化问题:训练集和测试集是同一道题,你就是想知道这一道题的最优解。 这个框架的实际推论是:最先被自动化的任务一定是验证成本最低的任务;而一个正在崛起的创业方向是——发明新的衡量方法,把原本难以验证的任务变得可验证,从而让 AI 去优化它。 三、智能的锯齿状边缘 对于"AI 将如何改变世界"这个问题,他看到的观点光谱极广。他的一个量化交易员朋友觉得 ChatGPT 跟自己工作无关,而他在顶级实验室的同事则认为再过两三年 AI 就会取代他们自己的工作。 他明确反对"快速起飞"假说——即一旦 AI 跨过某个临界点就会突然变成超级智能。他的理由是,AI 的自我改进不是一个二元开关,而是一个渐进光谱:从跑不起来代码,到能训练但结果一般,到能自主训练但不如顶尖研究者,再到偶尔还需要人工干预。更重要的是,自我改进的速度应该按任务来看。AI 的能力图谱是一条锯齿线:在某些任务上已经达到山峰(竞赛数学、部分编程),但在另一些任务上仍是低谷(比如 ChatGPT 曾长期认为 9.11 大于 9.9,或者说一门只有几百人会的原住民语言 Tlingit)。 他给出了判断 AI 在某个任务上进步速度的三条启发式规则。第一,AI 擅长数字化任务,核心原因是迭代速度——数字环境可以轻松扩展算力,而物理机器人的实验扩展成本高得多。第二,人类觉得容易的任务 AI 也往往容易,但有一类例外是"人类因生理限制做不到但 AI 可以做到"的任务,比如读过一千万张乳腺影像后发现某个人类注意力无法捕捉的模式来预测乳腺癌。第三,数据充足的任务 AI 表现好——数学推理在不同语言上的表现和该语言的训练数据量高度相关;而如果一个任务有单一客观指标,就可以通过强化学习生成合成数据来突破数据瓶颈,AlphaEvolve 和 AlphaZero 都是这个路线。 他用一张表把这些启发式规则应用到具体任务上:主流语言翻译已经完成;调试基础代码 2023 年搞定;竞赛数学 2024 年搞定;AI 研究本身大概 2027 年;化学研究因为不是纯数字任务会更晚;拍电影大概 2029 年;修水管和理发因为高度物理化,短期内不太可能;乌兹别克传统地毯编织需要一组人花一个月、非数字化且缺数据,AI 不太可能碰到;至于"带女朋友约会让她满意"——他的判断是"impossible,非数字化,缺数据",人类还能保住饭碗。
顯示更多
差不多得了!如果我能屏蔽关于邓王两位数学家的所有推特,我一定会屏蔽,但是既然屏蔽不了,我就发一条。 我像尊敬所有的数学家一样尊敬这两位数学家,但是我完全不觉得我本人以及其他华人有什么好值得骄傲的。数学是一项最为个人化的科学,这样的成就完全是他们个人的成就,是跟国家民族集体荣誉离得最远的事情。你如果热爱数学,当然可以向两位数学家欢呼致敬,但与此同时,你同样应该向历届所有菲尔兹奖的获得者、以及那些虽然没有获奖但是仍然穷经皓首献身数学的默默无闻数学家们致敬。你如果对数学没有感觉、没有认识,那么哪凉快哪儿呆着去,邓王两位的成就跟你毫无关系,轮不到你来与有荣焉。 真烦这种把什么事情都往国家民族集体荣誉上扯然后自己凭空嘚瑟的变态心理。
顯示更多
0
89
305
18
轉發到社區