最近越来越强烈地感觉到,人类正在经历一场 Stimulus Inflation,刺激通胀。
这已经不是简单的大家越来越没耐心的问题。
整个信息社会对于“什么东西值得让我产生反应”的阈值,正在被持续抬高。
十年前,F1、洞潜、翼装飞行、高空跳伞、极限攀岩还是相对小众的文化;
今天它们可以是短视频里的普通内容。
这里当然有媒介可达性、算法分发和纪录片工业的作用,但我觉得不只是好奇心的问题。因为几乎所有内容类型都在发生同一种漂移:搞笑从段子变成梗,从梗变成抽象,从抽象变成发疯、冒犯和禁忌。视觉从漂亮变成震撼,从震撼变成 4K、航拍、极端天气、深海、太空、AI 幻想世界。
电影从毁灭一座城,到毁灭地球,到毁灭宇宙,再到毁灭多元宇宙。
连日常叙事也一样:普通的恋爱、争吵、背叛已经不够,内容会不断寻找更极端的关系、更强的伦理冲突、更罕见的社会行为。
原因很简单。在无限滚动的信息流里,所有创作者其实都在争夺同一个东西:瞬时的注意力,核心的诉求是让用户的手指停下来的那几百毫秒。
于是,形成一个非常漂亮也非常危险的正反馈:高唤醒内容更容易捕获注意,平台给予更多分发,创作者大量模仿,用户持续暴露,产生 habituation,原来的刺激不再刺激,创作者只好寻找更强的新奇,更高唤醒的内容进入主流。
这和货币通胀几乎同构。
昨天十块钱能买到的东西今天要二十块;昨天一个普通笑话能让你笑,今天可能需要极度荒诞。
昨天赛车已经很刺激,但看过一百次 300km/h 的第一视角之后,你甚至会觉得这个好像也没什么。
最有意思的是,你本人很可能从来没开过赛车,没洞潜过,没跳过伞,没站在八千米高空,也没经历过短视频里的那些生活 ,但你的视觉风险基准已经被重新标定了。
所以我认为,现代媒体正在制造一种很奇怪的商品:Synthetic Danger,合成危险。
身体躺在 22°C、有 Wi-Fi 的房间里,绝对安全;
神经系统却可以在十分钟内经历赛车、坠落、深海、战争、灾难、冲突和死亡边缘。
Risk without consequence大概也是现代社会一个很有意思的悖论:现实世界越来越安全,信息世界却越来越刺激危险。
而我很担心的是另一件更隐蔽的事情:当一个人长期只对 high-amplitude information 产生反应,他会不会逐渐失去感受 low-amplitude information 的能力?一顿饭。一场雨。一个下午。一本三百页的书。一个人说话前停顿的两秒。一段几年都没有戏剧性高潮的关系。一个需要半年才能得到结果的科研问题。
事实上,现实世界里绝大多数真正重要的东西,其实都是低振幅的。
但短视频与现行信息训练的是另一套预期。
每几秒钟都应该发生一点什么。
于是,回到现实以后,人会产生一种非常现代的错觉:为什么什么都没有发生?
其实发生了很多,只是你的传感器已经不再响应这么小的信号。
所以我的结论是,刺激越来越强,并不意味着体验越来越丰富,恰恰可能意味着人的感知动态范围越来越窄。就像…一个坏掉的传感器:黑色看不见,灰色看不见,只有最亮的白才能触发反应。
世界并没有因此丰富,是只剩下几个峰值。
这里还有一个反作用。
当整个世界都在尖叫的时候,安静本身就成了异常。
所有视频都在快剪、反转、尖叫、爆炸、高潮的时候,一个老人坐在那里说一句普通的话,反而可能让几百万人突然停下来。
这是因为大家的阈值忽然降低了么?
并非如此。
只是因为"0"本身产生了巨大的 prediction error。
所以文化的轨迹并非大部分认为的简单的 100,200,300,400,它更像是100,200,300,0,300,500,0。长期 baseline 不断上移,同时周期性地出现返璞归真的波谷。
这也解释了为什么一个被视听奇观轰炸的时代,仍然会偶尔被一首平淡的歌、一封写给祖母的信、一段没有复杂制作的影像击中。
因为当所有人都在制造峰值的时候,波谷反而成了稀缺品。
我最近在想一个也许可以拿来研究的问题,姑且叫它 Digital Stimulus Inflation Hypothesis:算法驱动的信息环境,会不会通过持续的高唤醒暴露与 habituation,逐渐重新校准人的内部刺激参照系?
换句话说,同一个刺激,2015 年的你觉得是 8/10;在长期高刺激暴露之后,2026 年的你是不是只觉得 5/10?
而为了重新达到 8/10,你开始主动地、甚至疯狂地寻找更强烈的内容。
如果这种 recalibration 真实存在,那么今天很多看似毫不相关的文化现象,诸如极限运动大众化、短视频越来越抽象、叙事越来越极端、电影不断扩大世界观、视觉奇观不断升级,其实都是同一个注意力经济反馈系统在不同领域留下的痕迹。
这件事对创作者尤其重要。
因为如果刺激通胀存在,那么没有人能靠更刺激赢得最终胜利。
你做 100,明天别人做 200;
你做 500,后来者做 1000。
这是一场没有终点的军备竞赛。
所以未来伟大的信息生产,或许会有新的定义,也会需要新的活力。
顯示更多
古德哈特定律已经在现代社会各个高智力,尤其是高竞争密集领域极致演现。
一旦某个结果被这个符号认证,后续资源分配,如资金、职位、影响力、媒体曝光会急剧倾斜。
于是,从业者会自然把目标从把事情本身做好、部分转向如何更高效地拿到这个符号。
When a measure becomes a target, it ceases to be a good measure.
我观察到的科研界,研究人员会研究 Nature 最近几年爱发什么方向、什么叙事结构、什么程度的“novelty claim”更容易过审。
导演和制片则会研究奥斯卡投票人的口味、当前政治正确风向、Inclusion Standards怎么勾选最省力。
内容本身,开始为过审逻辑服务。
而一篇论文如果包装成颠覆性发现、漂亮的图且符合当前热点,即使后续复现率一般,也可能先上 Nature。
一部电影如果在关键、主题、阵容上精准踩中当前学院审美和配额要求,即使故事本身平庸,也更有机会冲奖。
而为什么符号会吞噬本业呢?
复杂的现实世界信息量是巨大的、高维的。
人类社会为了进行资源分配,必须将这些高维价值压缩成低维符号,比如小金人、影响因子、估值数字、点击量。
一旦符号确立,评价体系的评委、审稿人、资本、算法就成了守门。从业者很快会发现,迎合低维符号的特征,比攻克高维复杂现实要容易得多、性价比高得多。
本质上,这是人类在面对复杂系统时,为了降低不确定性而进行的自我阉割,努力把最难的、不可控的本质创新替换为了可量化的、可套公式合规生产。
优化策略成熟后的结果是,系统会形成一套极具壁垒的八股,
专注于把事情本身做好的异质化探索,往往因为无法高效对齐评价体系的语法而被边缘化。最终,系统完成了闭环。精于符号操纵的人获得了最多的资源,进而巩固了这套评价体系的绝对权威。
面对这种无孔不入的符号异化,极少数真正伟大的从业者通常会采取两种对抗姿态。
第一种,冯·诺依曼式的解耦。
绝对看透这套游戏的规则与漏洞,以极高的效率在极短时间内拿下所有符号(顶级期刊、奖项),然后将其彻底抛在脑后,去真正解决那些无人问津的硬核问题。
第二种,卡夫卡式的疏离。
保持对符号体系的冷漠,甚至主动拒绝被收编,在主流评价体系之外建立自洽的、高密度的内驱力场。
到这里,引入一个概念,Maximize Reality。
其实,把事情本身做好,追求的就是对客观现实的Maximize Reality。
它是对抗系统熵增的。
如果评价权力的精准投机成为显学,整个时代就会陷入一种过度符号化当中。
为了符号去调整内容,而不是内容自然产生符号,是一种需要反思的异化。
顯示更多
现在很多人的问题是习惯于把量化这样的竞争性游戏误认成考试型游戏。
考研、考证、绩点,都是绝对标准,达到分数线就算过关。
但量化的收益来自相对排名,且对手在你学习的同时也在学习。
你把九级全部走完,得到的只是入场资格而已。
我们很多教育系统训练了十几年的有大纲就能通关的直觉,在这里第一次完全失效,而大多数人是在投入了多年之后才发现。
如果你看懂了这张图,你会发现楼梯上的每一级都是最不稀缺的那种投入。
九级,可以说全是个人技能。
没有一级叫数据的独占获取,没有一级叫执行通道,没有一级叫资金容量,没有一级叫能扛住二十个点回撤的组织结构。
而后面,这些才是收益差异的核心来源。所有人,都在拼命优化最容易被复制、边际价值最低的那个维度。
我想或许是因为那是唯一一个自己能控制的维度。
量化投资看似是金钱与代码的高效游戏,但在光鲜的夏普比率和高薪传说背后,是极其残酷的概率博弈和系统性碾压。
从随机分析、时间序列建模、凸优化到控制理论和信息论,量化对底层数学功底的要求极高。稍有不慎,模型在理论推导上就会出现灾难性偏差。
而好策略,其实只是敲门砖而已。
数据清洗中的脏数据、回测时的未来函数与幸存者偏差、以及实盘交易中的延迟、滑点和内存泄漏,任何一个工程细节的疏忽都能让几百万资金瞬间灰飞烟灭。
与很多行业相比,写代码你能看到程序跑不跑,做设计你能看到东西丑不丑,可量化学习者在没有真实成本模型、没有容量约束、没有真金白银的情况下,回测永远是漂亮的。这具有极强的欺骗性。
也就是说,你可以在这条楼梯上爬四年,完全不知道自己的水平在分布的哪个位置。
自我评估,在这个领域基本上无法离线完成。
中国量化过去那波超额有明确的结构性来源。
散户占比高、市场不成熟、制度摩擦大。这些要素正在收敛,叠加监管收紧。
梯子的顶端在下沉。
同时,底部三级正在被AI迅速压平。
我知道量化对一类人有特殊的吸引力,诸如数理强、厌恶主观判断、希望靠智力而不是靠人际关系赢的人。
它承诺一个客观的、可被证明的竞技场。但现实里,我观察到的量化行业是极度组织化、资源分配驱动、政治性很强的。
数据预算,策略被分配资金,谁在回撤时被保下来,这些可以说历历在目。
逃离社会性的幻想,恰恰是最大的盲区,因为它是把许多人吸引进来的东西。
顯示更多
今天谈谈学术近亲繁殖。
十年前,我特别羡慕本硕博八年贯通的人。
那时候觉得,在一所学校从青涩呆到成熟,校园里每一棵树、每一栋教学楼都刻满回忆,甚至连食堂阿姨都认识你,是一件极其浪漫且幸福的事情。
看着国内很多高校推行的长周期培养项目,总觉得这种长情的陪伴代表着学术的极致深耕。
直到后来,本科到美国的学术体系里,才慢慢发现,本硕博都在同一个学校对于学术层面其实是一个极其明显的隐性扣分项。
现代科学作为一套全球化生态,有着它非常冷酷且底层的运行逻辑。
本硕博如果都在同一个系甚至同一个课题组,你大概率会完美继承导师的思维盲区、研究范式,甚至连说话的腔调都如出一辙。
科学的突破往往发生在不同知识领域的交叉碰撞边界,长期的近距离同质化,会把一个人的学术视野牢牢锁死在舒适区里。
你可能会问:苏姿丰不就是MIT本硕博吗?
其实,学术界,尤其是高校教职招聘对学术血统纯正性的焦虑,很多时候是为了防止圈子固化和思想近视。
而工业界,像芯片研发这种极度看重工程落地与执行力的领域对出身的教条没那么敏感,它只认你能打出什么样的硬仗。
在北美学术圈层,招聘市场的硬性排他上的局限是存在。因为在顶尖大学的教职招聘中,名校普遍遵循避嫌和引血原则,即极少直接留用自己的博士毕业生。
委员会更看重你是否有过多重异质环境的生存能力(比如本科在A、博士在B、博后在C)。
如果简历从头到尾只有一个校名,往往会被默认缺乏跨圈层交流和独立开辟新阵地能力。
从系统论角度,科学研究本质上是一个抗拒熵增、追求信息持续输入的系统。
人类,天然喜欢低熵的熟悉感,本硕博留在原地确实省去了所有社会适应成本;
但我想,一个具有生命力的学者,必须不断把自己扔进未知的、充满异质性的外部环境中,去对抗思维的僵化。
一个人的知识来源、导师网络、评价体系、合作网络和研究范式长期来自同一个局部生态,是很危险的。
不过我之前跟同学聊,比如一个人本硕博都在 MIT,但期间:
本科做理论物理;
博士转 CS;
去 Stanford 做博后;
与欧洲实验室长期合作;
最后研究一个完全不同的问题;
他的学术基因可能比一个本科 A、硕博 B、但一直在同一个课题组的人更加多样。
反过来,一个人本科 A、博士 B、博后 C,但每一步都沿着同一个导师网络、同一个范式走,也未必真正实现了 intellectual diversification。
所以我会把学术近亲繁殖重新定义为知识与评价机制的局部闭环。
我不知道大家是否观察到现在的一种非常普遍的情况:所有人都非常聪明,但所有聪明人都在同一个坐标系里聪明。
这和之前谈非平衡系统时的思路非常接近。
我认为,一个局部系统如果没有足够的外部扰动,就会越来越接近自己的稳定吸引子。
这里,我也想引入我那位朋友的观点。
她认为近亲繁殖也并非全是坏事,因为科学进步同样需要高度连续性。
假设一个人本科四年换一次范式,硕士换一次,博士换一次,博后再换一次,所有东西都浅尝辄止。他的 entropy 很高,但未必有 deep work。
她的论据是,伟大的科学家往往需要在一个问题上连续投入十年、二十年。
所以学术成长其实存在一个很漂亮的张力,即局部深耕与外部扰动的动态结合。
没有深耕,只有漂泊,会没有理论积累。
没有扰动,只有深耕,容易形成范式锁定。
其实到这里,我觉得学术圈和演化系统很像:mutation 太低,stagnation;mutation 太高,无法积累。
判断一个系统是否有生命力,其实需要看它是否在稳定遗传与持续变异间维持动态平衡。
一个具有生命力的学者,必须不断把自己扔进未知的、充满异质性的外部环境中,去对抗思维的僵化。
或者,我会更进一步,把它理解成一种更一般的科学观:
优秀学者,要去主动寻找能够让自己暴露于认知误差的环境。
本科 → 硕士 → 博士 → 博后 → 教授
上面这个路径只是表象。
具有原创性的人,人生轨迹应该是:
A领域 → B领域 → 某个偶然问题 → C领域 → 又回到A → 创造此前不存在的交叉点。
他的大脑里存在多个互相竞争的模型,而一个现象出现的时候,他不会只有一种解释框架。物理学家可能用动力系统看它;计算机科学家可能用算法复杂度看它;生物学家可能用演化看它;经济学家可能用激励机制看它。
而原创性经常就产生于这些模型在同一个人的脑子里发生碰撞的瞬间。
回到我最初的议题,关于本硕博在一个学校和学术近亲繁殖问题。
其实本硕博同校不好只是表象。
我要强调的是,科学需要积累,但科学家不能只继承。知识来源过于单一,以至于一个人逐渐失去了发现自己认知边界的能力的情况,是需要随时警惕的。
从这个意义上说,学术近亲繁殖,其实是一个知识系统的遗传多样性问题。
顯示更多
接上条,最近又有新的思考。
结构性改变需要现有框架被证伪的经验,而痛苦只是提供这种经验的方式之一。
深度阅读、长期的严肃关系、把一件事做到极难的程度、认真地被人反驳,都能提供。
创伤后成长是真实存在的现象,但我看了很多案例后,发现它是少数结局,但并不是人类世界的默认结局。
而且,创伤后成长的文献里,效应量远小于修辞暗示,且大量是自陈的 perceived growth。
对于很多经历创伤的人,更常见的结局是僵化、警觉过度、认知窄化。
一个人永久地绕着那个创口组织自己的一生,这是最悲惨的事。
更反直觉的是,研究里预测成长的因素恰恰是有支撑、有可依附的关系、有语言化的能力、有事后被接住的经验。
在这个世界上,没有人是先具备了承担绝对责任的能力、然后才开始想要自主的。顺序永远是反的。
一个人先想要,有欲望,然后在半推半就的承担里长出能力,中间反复退回去。
我认为,一段人生的决定性变量不会止于黑暗的深度,它与代谢黑暗的能力更加相关,而这个能力部分来自我忽视的资源、支持、可用的认知工具。
所以,成功来自承受痛苦的能力,大概率是典型的结果倒推原因。
因为在这个过程中,同等痛苦承受力的失败者不会进入我的样本。
用我最信赖的热力学视角,耗散结构里涨落之所以能生成新秩序,前提是系统处在远离平衡但仍具备耗散能力的状态。
而且,者这需要能量输入和边界条件。
对于绝大部分人,痛苦是扰动,并不是能量。
我们在分析案例的时候,不可以只统计完成重组并且还能开口叙述的那部分样本,因为很多时候,人类的分母是被隐藏的。
顯示更多
年龄是幻觉,不是妄言,是真正的幻觉。有人在焦虑自己长大了一岁,却又渴望自由、独当一面,在我看来是不成熟的表现。
如果把人的认知与存在状态做一个建模,绝大多数人的成长路径不过是一个一维的标量,仅仅是时间 t 在增加,身体在衰老,社会角色在被动叠加。而成熟或觉醒,是一个高维的相变。
为什么,我可以确定地说年龄是幻觉?
因为生理年龄只是社会为了秩序化管理个体而设立的某种人为坐标。
绝大多数人的长大只是在顺应社会程序的安排。读书、工作、结婚、应对年龄危机。
对生活的理解,全是从外界拷贝过来的模板。
一个系统如果不经历剧烈的熵增与打碎重组,即应该经历的痛苦、背叛、寂灭、孤立无援的体验,它的底层结构就不会发生变化。
所以,即便到了三十岁、四十岁,很多人精神内核依然停留在幼态的依赖与索取阶段。
很多人的的“渴望自由、独当一面”,是假的,往往只是一种低阶的情绪宣泄。
他们渴望的是没有人管我的权利,却极度害怕必须独自承担一切后果的绝对责任。
一旦现实的寒意稍微袭来,他们又会迅速退回到需要被安抚被理解被投射的婴幼儿状态。
我一直认为,人的精神密度,是由他所跨越过的黑暗深度决定的。
普通人的时间是平铺的,而经历过死而复生者的存在是压缩的。
一个人独自穿过痛苦、甚至是死亡的恐惧的幽谷,他实际上是在没有安全网的情况下,被迫与存在的终极虚无进行过撕扯。在这个过程中,所有虚浮的修饰、世俗的矫情和无病呻吟的焦虑,都会被这种极高的精神重力碾碎。
所以,不要轻易羡慕那些伟大的人,马斯克也好,黄仁勋也好,特朗普也好,你觉得他们的成功很美好,但你可能没有承担那些风险与痛苦的能力与心态。
所以说,世人常说“三十而立,四十不惑”,这是大众为安慰自己而编造的镇静剂而已。
事实是,有些人活到八十岁,也只是把一岁的幼稚重复了八十次;而有些人早在年轻时,就已经在精神上彻彻底底地死过一次,而后以更高的视角重构了自己。
顯示更多
学习的本质是演化还是优化?
主流深度学习习惯于把训练看作静态的梯度下降优化,但从系统论视角来看,这其实是一个非平衡态的动力系统。
无论是扩散模型、流匹配,还是人类大脑处理时序刺激的神经动力学,离散的层级结构在极限下都在向连续的微分方程收敛。
所以我认为,学习不应该是孤立的静态映射,它更应成为带有反馈和鲁棒性的控制过程。
为什么我认为数学很重要?
很多时候,我们缺乏一套能够定量描述主观表征与客观世界映射的数学语言。
有了数学,你便可以构建一种高维抽象与底层降维之间的无缝切换能力。
当别人在看一篇前沿 Paper 时,看到的是复杂的符号和推演;
而当你带着这套体系看过去时,看到的往往是底层的测度空间、算子性质以及对应的硬件实现代价。
但是大部分时间,数学在我们的世界是流于形式的应试工具。
就工程落地与系统实现而言,语言语法层面的浅层学习毫无意义。瓶颈,在于感知。
当我们走完这套理论推演与系统落地的闭环后,你现阶段自然而然就会切入一个
个具体的交叉研究方向。
没有数学功底的交叉研究,在我看来近乎民科思维。想象力极佳,严谨度严重不足。
当前的AI领域,某些概念的堆砌,某些论文的内容,很像是用物理学的词汇、神经科学的名词、再套上一层机器学习的皮,写出一些看似宏大实则无法证伪的东西。
缺乏约束的想象力是灾难。
唯有数学,可以帮你把一个直觉写成连续时间下的随机微分方程或算子方程时,它的边界、假设、奇异点和失效条件才会赤裸裸地暴露出来。
数学,从不只是为了推导好看,它是用来证伪自我幻想的最高标准。
我的判断是,很多研究上的痛点,其实无非就是形式化数学的异化、无根基想象力的泛滥,以及从抽象到物理硬件断层的尴尬。只要数学能力足够强,你就有能力识别大部分空洞的修辞。
我鼓励你,一定要去努力提高数学能力。
关于我说的12-18个月完成这套体系,有些人觉得快得不可思议或根本不可能完成,其实仍然用的是高度同质化的时间计量方式。
我永远相信,如果一个学习者具备极强的自律性、每天能够进行 4 到 6 小时高强度的沉浸式纯深度推演时,这种效率会发生质变。
12 到 18 个月换算下来,是大约 1500 到 2200 小时的纯核心有效输入。
在绝对的专注密度面前,传统大学两到三年的课时量在信息压缩后,完全可以在几个月内被彻底啃透。
看视频、听讲座、做水题的被动输入模式,会让大脑一直在舒适区边缘打转。
我说的那个体系训练,就是倒逼学习者在痛苦与通透的循环中建立逻辑自洽。
一旦突破了前期的思维阵痛期,建立起了以证明为核心的数学直觉,后续的学习速度会呈指数级上升。
因为,越到后面很多的高级理论,本质上都是前面基础概念的自然延拓。
顯示更多
接上条,谈谈应用数学、统计学或计算机科学的核心本科到研究生过渡阶段的培养体系(特别是数学层面)。
对于一个具备极强自律性、习惯于沉浸式独处并能啃下早期科学原典的学习者来说,如果每天能投入 4 到 6 小时 进行高强度的推演和刷题,走完这条路线大约需要 12 到 18 个月。如果按传统大学授课节奏,这通常需要两到三年的跨度。
阶段一:纯数直觉与分析基础,这个阶段大概5-7 个月。
我认为这个阶段是建立数学证明思维的关键期,习惯了直接调用算法库的人往往会在这里感到痛苦,但跨过去就能看懂大部分理论前沿的 Paper。
1. 线性代数,1-1.5 个月
目标: 彻底理解线性空间、算子、Spectral Theorem及奇异值分解(SVD)的几何意义。
我的建议是直接看 Sheldon Axler 的 Linear Algebra Done Right。推导谱定理是重塑线性思维的第一步。
2.数学分析 / 实分析,3-4 个月
目标: 建立极限、连续性、紧致性的严格 语言。
这个时期可以看Walter Rudin 的 Principles of Mathematical Analysis(Baby Rudin)。
这本书其实极其精炼,没有任何废话。阅读和死磕课后题的时间比约为 1:3。
习惯阅读原典的思维在这里会有极大优势。
3. 常微分方程 + 本科概率论,1-1.5 个月
目标: 掌握动力系统建模基础和基于微积分的概率直觉。
经过我和一些同学的交流,其实这部分相对简单,更多是计算和物理直觉的培养。ODE 可以快速过一遍,重点放在理解的结构和稳定性上。
阶段二:概率统计的现代基石(约 5-7 个月)
这是真正的分水岭。
测度论将彻底改变你看待随机性和信息的方式,也是深入深度学习理论(比如泛化界、生成模型底层逻辑)的必经之路。
4. 测度论概率,3-4 个月
目标: 重新定义概率,掌握大数定律、中心极限定理的严格证明,以及条件期望的 Radón-Nikodým 导数视角。
这时候Rick Durrett 的 Probability: Theory and Examples就非常重要了。门槛极高,前置条件是必须啃完实分析中的勒贝格积分。这是整个路线中最耗费心智的一环,需要极度的专注和抗挫折能力。
5. 统计推断,2-3 个月
目标: 掌握点估计、假设检验、置信区间背后的数理逻辑,如充分统计量、Rao-Blackwell 定理,
我的推荐是Casella & Berger 的 Statistical Inference。有了前面的基础,这部分的推导会顺理成章,重点在于完成大量的经典习题。
阶段三:工程落地与系统实现(时间因人而异)
理论最终需要转化为系统和代码。
6. 编程与数据处理,增量时间:0-3 个月
这个阶段,对于已经有过多模态计算机视觉研究经验、能够独立提交一作顶会论文并在日常处理庞大算法工程的人来说,Python 的熟练度,真实数据处理经验其实已经处于满级或高度成熟状态。
增量挑战的话,我目前能想到的就是C++ 的性能调优。如果需要编写高性能的底层算子,就比如 CUDA C++这种,或者构建极低延迟的推理引擎,额外拿出 1-2 个月 专注于内存管理、并发控制和硬件级优化即可。
总体来说,这套体系能让你拥有独立开辟新研究方向的资本,无论面对怎样的技术迭代,底层的数理直觉都不会过时。
顯示更多
接上条,谈谈应用数学、统计学或计算机科学的核心本科到研究生过渡阶段的培养体系(特别是数学层面)。
对于一个具备极强自律性、习惯于沉浸式独处并能啃下早期科学原典的学习者来说,如果每天能投入 4 到 6 小时 进行高强度的推演和刷题,走完这条路线大约需要 12 到 18 个月。如果按传统大学授课节奏,这通常需要两到三年的跨度。
阶段一:纯数直觉与分析基础,这个阶段大概5-7 个月。
我认为这个阶段是建立数学证明思维的关键期,习惯了直接调用算法库的人往往会在这里感到痛苦,但跨过去就能看懂大部分理论前沿的 Paper。
1. 线性代数,1-1.5 个月
目标: 彻底理解线性空间、算子、Spectral Theorem及奇异值分解(SVD)的几何意义。
我的建议是直接看 Sheldon Axler 的 Linear Algebra Done Right。推导谱定理是重塑线性思维的第一步。
2.数学分析 / 实分析,3-4 个月
目标: 建立极限、连续性、紧致性的严格 语言。
这个时期可以看Walter Rudin 的 Principles of Mathematical Analysis(Baby Rudin)。
这本书其实极其精炼,没有任何废话。阅读和死磕课后题的时间比约为 1:3。
习惯阅读原典的思维在这里会有极大优势。
3. 常微分方程 + 本科概率论,1-1.5 个月
目标: 掌握动力系统建模基础和基于微积分的概率直觉。
经过我和一些同学的交流,其实这部分相对简单,更多是计算和物理直觉的培养。ODE 可以快速过一遍,重点放在理解的结构和稳定性上。
阶段二:概率统计的现代基石(约 5-7 个月)
这是真正的分水岭。
测度论将彻底改变你看待随机性和信息的方式,也是深入深度学习理论(比如泛化界、生成模型底层逻辑)的必经之路。
4. 测度论概率,3-4 个月
目标: 重新定义概率,掌握大数定律、中心极限定理的严格证明,以及条件期望的 Radón-Nikodým 导数视角。
这时候Rick Durrett 的 Probability: Theory and Examples就非常重要了。门槛极高,前置条件是必须啃完实分析中的勒贝格积分。这是整个路线中最耗费心智的一环,需要极度的专注和抗挫折能力。
5. 统计推断,2-3 个月
目标: 掌握点估计、假设检验、置信区间背后的数理逻辑,如充分统计量、Rao-Blackwell 定理,
我的推荐是Casella & Berger 的 Statistical Inference。有了前面的基础,这部分的推导会顺理成章,重点在于完成大量的经典习题。
阶段三:工程落地与系统实现(时间因人而异)
理论最终需要转化为系统和代码。
6. 编程与数据处理,增量时间:0-3 个月
这个阶段,对于已经有过多模态计算机视觉研究经验、能够独立提交一作顶会论文并在日常处理庞大算法工程的人来说,Python 的熟练度,真实数据处理经验其实已经处于满级或高度成熟状态。
增量挑战的话,我目前能想到的就是C++ 的性能调优。如果需要编写高性能的底层算子,就比如 CUDA C++这种,或者构建极低延迟的推理引擎,额外拿出 1-2 个月 专注于内存管理、并发控制和硬件级优化即可。
总体来说,这套体系能让你拥有独立开辟新研究方向的资本,无论面对怎样的技术迭代,底层的数理直觉都不会过时。
顯示更多
纠正一个对西蒙斯的常见误读。
他的路径的实际顺序是:
23 岁伯克利博士 → 做出陈-西蒙斯形式(一流的微分几何工作)→ 石溪数学系主任 → 40 多岁才开始做投资 → 大奖章基金的核心竞争力是数据清洗、执行成本控制、统计严谨性和招人。
他的微分几何在技术上对交易几乎毫无用处。
对于文艺复兴科技,迁移过去的是极高的数学品味、只相信被验证过的东西的洁癖、以及识别并雇佣比自己强的人的能力。
学深奥理论然后拿去赚钱是因果倒置。
真实的机制是:先在某个领域达到过一流,这件事本身改造了你的判断力,然后你把判断力用在有钱的地方。
关于数学,我个人的看法是除微积分之外,本科剩下的时间,不需要选择,按这个顺序推进,一步不能省:
1.线性代数(学到能证明谱定理,不是会算行列式)
2.数学分析 / 实分析(Rudin 或国内教材,做题)
3.常微分方程 + 概率论
4.测度论概率(Durrett 或 Billingsley),这是分水岭
5.统计推断(Casella & Berger)
6.编程:Python 熟练 + C++ 能写、能调性能;再加一门真实的数据处理经验
同时,用 Strogatz《非线性动力学与混沌》作为精神食粮。
毕竟,它只需要微积分,现在就能读,而且能让我们在啃分析的两年里不失去动机。
这是唯一一本我建议大家现在就买的书。
赚钱和穷尽一生追求一个学科的真理在时间上是真实冲突的,是不可以调和的。
而西蒙斯的解法,只是串行。先纯粹三十年,再赚钱三十年,仅此。
很多时候我们只是在问自己:你愿不愿意把 18–26 岁完全投入到数学基本功上,不产出任何可展示的东西?
顯示更多
对于一些喜欢观察知识⽽⾮学习知识;极度喜欢科学史、技术史但不深⼊科学本身的人,我有这样的建议。
第一,其实这是真实存在且值钱的类型。
彭博、伯恩斯坦、Gartner、⼀级市场、宏观对冲、VC整个观察⾏业的产业每年⽀付⼤量的钱给这种模版的人。
对科技史的兴趣不是消遣,它就是这份⼯作的核⼼肌⾁:技术如何扩散、产业如何被重组、组织在压⼒下如何变形。
其实我也很喜欢观察,甚至这是我这些年最有趣的地方,但在过程中我发现这个逻辑有⼀个致命前提:
只观察不深⼊的⼈,终点默认是评论员,什么都能谈,什么都不真懂,很多时候,在靠语⾔的流畅度冒充判断⼒。
这里的分界线是,你的观察有没有⼀个别⼈⽆法轻易复现的硬底。
伯恩斯坦的半导体分析师看得懂制程节点、良率曲线、资本开⽀周期。
好的能源分析师算得清 LCOE 和电⽹调频,好的⽣物医药 VC 读得懂临床终点设计。
他们不做研究,但能验证研究者的说法真假。
⼀席之地的分层,护城河的五个来源。
1. 信息渠道,认识供应链⾥的⼈
2. 技术鉴别,能判断技术说法真假
3. 模型能力,能⾃⼰算成本结构、产能、单位经济
4. 历史深度,知道这个模式上⼀次发⽣是什么时候、结局如何(天然优势,我认为在这个时代也是最稀缺的⼀条,因为⼤部分从业者只有五年记忆)
5. 写作,把上⾯几样变成别⼈愿意读的东⻄
大概的情况是,
有两三样 = 稳固的⼀席之地。
⼀样都没有 = 没有议价权,随时可被替换,还要和 AI 竞争。
第二,这套护城河框架再往深处推演一层,分水岭其实在于,你是把科技史当成故事书来消费,还是把它当成参数化系统来逆向工程。
绝大多数只喜欢观察的人,停留在第一层,他们惊叹于瓦特改良蒸汽机、贝尔实验室的传奇、或者某次产业并购的戏剧性。
但这只是在消费结果。
值钱的观察者,看的是状态机。
如果要让这套逻辑在 AI 时代彻底闭环,并具备绝对的溢价能力,还需要补上三块拼图。
顶级的观察者,脑子里装的是不同行业的同构性。这就是Cross-domain。
如果可以懂系统在资源强约束下的扩散方程,就可以发现近乎完全同构的逻辑。
伪装成判断力的语言流畅度,在面对结构性危机时会瞬间破产,当所有人都在高喊某个新范式时,他条件反射般去查证它的边际成本、资本开支回报率和历史对照组。
宏观对冲和一级市场,恰恰需要剥离掉这些修辞泡沫,去计算每一个节点上具体的人、钱、设备和物理极限。
克制住将事物浪漫化的冲动,是观察者走向专业化最痛苦的成人礼。
最后我想说,如果你天然就对知识的边界、技术的演化、历史的复盘有着近乎病态的兴趣,却对日复一日埋头推导公式或写底层代码缺乏耐心,千万不要觉得这是缺陷。
这是一个极其稀缺的系统架构师基因。
当工具把语言的流畅度贬值到零的时候,对真实物理世界、资本流动和历史周期交织点上的精确鉴别力,就会变成这个时代的硬通货。
所以,别去做万事通。
希望你能以深度作尺,去量一量今天技术图纸上的每一个像素。
顯示更多
之前有人问了我两个问题:
1)博⼠做⾃媒体是否本质上是反智,迎合⼤众是否意味着降维?
2)想做一名合格的研究者,是否应该皓⾸穷经,读很多本经典?
关于⾃媒体,我是这样看的。
认为博士做自媒体有反智之嫌,直觉有正确的内核,但归因错了。
其实,费曼、朗道、Thurston、Strogatz 都是极出⾊的解释者,解释从未让他们变,能把难的东⻄讲清楚恰恰是理解深度的强证据。
我认为,核心的问题是两个别的东⻄:
1.指标替换
“被多少⼈看到”这件事,可测量、⻅效快;
“证明⼀个新定理”,周期多年且⼤概率失败。
这是激励结构问题。
2.身份表演
宣传的是”XX⼤学本硕博”“XXX研究员”这个标签,这是学历套利,和科普⽆关。
在此,我的判断标准是,这个⼈这⼀年有没有产出⼀个他⾃⼰都不确定能不能做出来的技术结果。数据,不会骗人。
关于百年经典,我有这样的看法。
在我刚刚提到的复杂系统、非线性动力学、统计物理等领域,读百年经典、不读现世论文几乎是最不适⽤的策略。
⾮平衡态统计物理核⼼结果全是新的,涨落定理 1993–1999,随机热⼒学框架2000s,热⼒学不确定关系 2015。皓⾸穷经会停在 Onsager(1931)
⾮线性动⼒学主体是 1960–1980s
控制论:Pontryagin 1956,Kalman 1960。
维纳 1948 今天是思想史⽂献
博弈论:von Neumann-Morgenstern 1944,Nash 1950
复杂系统,整个领域没有百年经典的正确⽤法,一般情况下,其实原始论⽂回答的是为什么,而教科书回答是什么。
但这种收益,只对已经掌握技术的⼈兑现。
我觉得,很多人认为现在SCI、顶会有很多平庸⼯作,就不读了。
这是错误的想法。
还是要读的,而且对于核心研究是必需,很多我们天天在说的品味,其实是读了三百篇之后才知道哪⼆⼗篇不平庸。
判断⼒是读出来的,先验主义不可行。
在研究中,我认为该省略的是过于泛泛的综述、⼆⼿转述与概念性讨论。
更有⽤的判据:今天有没有⼀个东⻄,是我昨天算不出来、今天算出来了的。
典,⽽不是当代平庸⼯作
顯示更多
纠正一个对西蒙斯的常见误读。
他的路径的实际顺序是:
23 岁伯克利博士 → 做出陈-西蒙斯形式(一流的微分几何工作)→ 石溪数学系主任 → 40 多岁才开始做投资 → 大奖章基金的核心竞争力是数据清洗、执行成本控制、统计严谨性和招人。
他的微分几何在技术上对交易几乎毫无用处。
对于文艺复兴科技,迁移过去的是极高的数学品味、只相信被验证过的东西的洁癖、以及识别并雇佣比自己强的人的能力。
学深奥理论然后拿去赚钱是因果倒置。
真实的机制是:先在某个领域达到过一流,这件事本身改造了你的判断力,然后你把判断力用在有钱的地方。
关于数学,我个人的看法是除微积分之外,本科剩下的时间,不需要选择,按这个顺序推进,一步不能省:
1.线性代数(学到能证明谱定理,不是会算行列式)
2.数学分析 / 实分析(Rudin 或国内教材,做题)
3.常微分方程 + 概率论
4.测度论概率(Durrett 或 Billingsley),这是分水岭
5.统计推断(Casella & Berger)
6.编程:Python 熟练 + C++ 能写、能调性能;再加一门真实的数据处理经验
同时,用 Strogatz《非线性动力学与混沌》作为精神食粮。
毕竟,它只需要微积分,现在就能读,而且能让我们在啃分析的两年里不失去动机。
这是唯一一本我建议大家现在就买的书。
赚钱和穷尽一生追求一个学科的真理在时间上是真实冲突的,是不可以调和的。
而西蒙斯的解法,只是串行。先纯粹三十年,再赚钱三十年,仅此。
很多时候我们只是在问自己:你愿不愿意把 18–26 岁完全投入到数学基本功上,不产出任何可展示的东西?
顯示更多
作为世界顶级的几何学家和量化之王,詹姆斯·西蒙斯核心学习法可以总结为:潜意识孵化、剥离噪声、以及极度抗拒的死记硬背。
他的传记《征服市场的人》以及他在石溪大学数学系、华尔街的过往经历,向我们揭示了他独特的智力运作模式。
西蒙斯解决最顶级的数学问题时,往往不是靠坐在桌子前疯狂推导,而是靠极度的沉浸和静静的思考。
当年西蒙斯在试图解决一个几何学上的三维流形问题时,研究到深夜卡住了。他精疲力竭地去睡觉,结果第二天醒来,大脑在潜意识的自主运转下突然顿悟。
他意识到某个核心项在特定变换下是保持不变的。
他立刻写信给陈省身,两人随后共同推导出了轰动物理与数学界的“陈-西蒙斯不变量”。
深度学习需要给大脑留白。
高强度的专注后,主动切断外部信息,让大脑的默认模式网络在潜意识里去重组和连接知识。
西蒙斯曾公开承认过,他的记忆力在顶级天才里其实不算好,他非常讨厌去背诵那些繁琐的公式和定理。
他的导师和同事评价他,在讨论数学问题时,西蒙斯最强悍的能力是几何直觉。
他能在大脑中把极其抽象的高维拓扑结构具象化为空间、形态和结构。因为理解了内部的几何逻辑,公式根本不需要背,顺着逻辑就能随时推导出来。
他深知个人智力的边界。因此,他的学习和解决问题,很大程度上是通过招募全世界最聪明的人教我来完成的。
在建立文艺复兴科技时,西蒙斯经常召集顶尖的物理学家、密码学家坐在一个房间里激荡。他会像海绵一样吸收这些交叉学科天才的建模思路,通过构建天才网络来实现对全新领域的极速跨界学习。
总结西蒙斯的学习世界观,他不追求博闻强识,但他追求把一个点想得极深、极透。用几何和统计视角,穿透一切复杂的迷雾,这就是吉姆·西蒙斯的学习密码。
顯示更多
学术水平的提高,本质上只有一个指标:你能独立产出别人无法轻易复现的技术结果的能力。其余都是它的副产品。
举个例子,一个人想要穷尽一生,追求非平衡态统计物理,非线性动力学,复杂系统科学,控制论、博弈论的探索。
首先我会看到这些是同一套数学的五个出口。
状态空间上的流,确定性的是非线性动力学,加噪声就是随机过程,加控制项就是控制论,加多个各自优化的主体就是博弈论。
大偏差理论是贯穿一切的热力学形式。Touchette 2009 的综述值得读三遍,它让我们看清熵、速率函数、自由能、Lyapunov 指数其实是同一个东西的不同外衣。
路径积分、作用量表述把随机热力学和随机最优控制缝在一起(Kappen 的 path-integral control 是最漂亮的接口)。
信息即热力学资源,把控制论真正接回物理。
平均场博弈=控制 + 统计物理 + 博弈的合流点。
看清主干,就不会把时间浪费在互相重复的科普层。
数学地基:测度论概率、随机微分方程(Øksendal)、常微分方程定性理论、变分法。
记得导师说,地基不牢,后面全是文学。
主干书目大脑里过一遍。
随机过程:Gardiner 或 van Kampen ,Sekimoto《Stochastic Energetics》,Seifert 2012 综述 ,Peliti & Pigolotti《Stochastic Thermodynamics》
非线性动力学:Strogatz打底,Kuznetsov,分岔,Guckenheimer & Holmes
控制:Åström & Murray《Feedback Systems》,Liberzon《Calculus of Variations and Optimal Control》,Bertsekas
博弈:Hofbauer & Sigmund《Evolutionary Games and Population Dynamics》(这本直接把博弈变成动力系统,是你这个组合的天然入口),然后Sandholm
网络、复杂系统:Newman《Networks》,其余谨慎,这个领域良莠混杂最严重,暂且不提。
然后,选一个窄到令人不安的锚点。
比如“活性物质中的热力学不确定关系”或“有限信息下的反馈冷却”。
我觉得科研水平真正跃升的地方在这四件事。
1.手算 + 数值复现。
拿一篇佩服的论文,从零复现它的图,会发现论文里 80% 的关键细节没写。
这种痛苦,就是水平本身。
2.写。
把以为懂了的东西写成给别人看的推导。写不出来 = 没懂。
这是廉价也最少人做的自检。
3.进入真实的学术共同体。
独自求索在这几个领域几乎必然失败。判断什么问题值得做只能通过和高手的高频摩擦获得。
找到导师、组会、arXiv 上的通信对象。
4.接受长期的技术孤独。
前五年你会觉得自己只是在学别人早就知道的东西。这是正常的。
穷尽一生是个好志向,但一生需要一个营地。
如果是我,我或许会以一个方向为职业性专长,随机热力学或随机最优控制,毕竟两者技术门槛高、饭碗实在、且是其余三者的枢纽,其余作为持续侵入的卫星。
顯示更多
今天一整天,几乎都在家看水下洞潜类的视频与纪录片,有几点感想。
其实洞潜比很多人生隐喻更适合拿来做认知模型。因为洞潜可怕的地方,在于它是一个对人的认知、纪律、资源管理和错误容忍度都极其苛刻的系统。
1. 不要把没出事误认为做得对
洞潜最危险的一种心理就是:
“我之前这样做过很多次,也没出事。”
但在高风险系统里,成功执行一次错误流程,不会证明流程正确,只会说明你这次侥幸没有付出代价。这其实和科研特别像。
这个方法如果错了,我什么时候能发现?发现的时候还有没有机会撤退?
2. 氮醉:人生的幻觉
洞潜中,人在深度、压力、环境变化之下,判断能力可能下降,却未必意识到自己的判断已经下降的非常多。
尤其约 30 m 以下,氮分压升高会增加氮醉风险;不同人的敏感程度、潜水状态、气体组成和环境都会影响表现。
我它抽象成一个不等式与等式。
最危险的状态 ≠ 能力很低。
最危险的状态 = 能力已经下降,但自我校准能力下降得更快。
我看到很多视频里,人在氮醉状态下通常不会主动意识到自己处于氮醉。
数据、同行、实验、市场反馈、数学证明、失败记录这些东西的意义,本质上都是在我开始相信自己的时候,提醒我现实并不在乎我的自信。
人的学历、财富、履历、过去的成功,都可能制造一种我已经掌握了世界的幻觉。甚至周遭很多事也是如此。
一个人连续几年在某个方向取得成果以后,很容易把过去经常判断正确悄悄替换成我的判断本身就是可靠的。
这两句话完全不是一回事。
所以认知上的氮醉可以理解成一种认知自恋,很多时候,氮醉不只在无知者才会发生,恰恰可能发生在有经验的人身上。
3. 九顿天坑:物理法则面前没有贵族
你可以是世界数一数二的潜水安全员,可以有几千次潜水经验,也可以是第一次下水的新手。但如果你接近了物理约束,物理不会因为你是高手而给你打折。
我们的世界中,不信奉规则法则、相信自身能力超越环境的人实在太多。
但其实很多东西最终都不能取消基本约束。
边际成本、网络效应、供需、激励、信息不对称、资本约束、组织摩擦,这些才是系统里的物理定律。
最尊重约束的人,永远是安全落地的人。
所以,不要被表象、身份、叙事欺骗,要找到真正支配系统的约束。
4. 能溺水的都是会水的
这个我是真真切切地看到了几百条洞潜的案例,深刻体会的。
能力本身可以成为风险来源。
不会游泳的人往往知道自己不会游泳。
反而是会游泳的人:“我会游,没事。”
于是,他敢去更远的地方。
再往前一点,再往深一点,再挑战一次,直到环境发生变化。
这就是为什么真正高水平的人会特别重视边界条件。
一个优秀的科学家知道自己的理论在哪里失效,一个优秀的投资人知道自己在哪些市场环境下没有优势,一个优秀的潜水员知道自己什么时候不应该继续下潜。
判断临界的能力,极度重要。
鲁棒性是当环境偏离预期、模型失效、资源减少、自己判断错误时,系统依然不会迅速坍塌。
其实,自信的、技术过硬的开放水域潜水员是出事最多的。
他们假设能力可以迁移。
而跨域结构迁移恰恰是我曾经反复用、也确实有效的方法。
在今天看到所有洞潜给出的反例是,有些领域的门槛是硬的,相邻领域的胜任感在那里不仅无用,而且是首要死因。
顯示更多
这不是第一种定制癌症疗法。CAR-T 早就是。
只是说,两者定制的对象不同。
CAR-T 定制载体是患者自体细胞,物理上一人一批。
INT 定制序列是测序算出突变谱,编码进 mRNA,个性化发生在计算环节,下游合成流程几乎同构。
目前能观测到的信号,是个性化的成本结构可能第一次被挪到了能下降的那一侧。
CAR-T 十年没打下来的曲线,瓶颈在 GMP 细胞培养;
而这条路径的瓶颈在测序、新抗原预测和排产,是能被摩尔定律和产能规划吃掉的东西。
当然,topline 还没出 HR,OS 也没读出。观测一下后续,任重道远。
顯示更多
Moderna and
@Merck today announced positive topline results from the Phase 3 INTerpath-001 trial evaluating adjuvant treatment with intismeran autogene, a novel investigational mRNA-based individualized neoantigen therapy jointly developed by Merck and Moderna, in combination with KEYTRUDA® (pembrolizumab), Merck's anti-PD-1 therapy, in patients with completely resected Stage IIB-IV melanoma.
Read more:
顯示更多
统计物理和控制论是理解量化最好的方式。
统计物理告诉你市场是什么。
市场从来不是一个处于均衡状态的死物,在我们的视角下,市场是一个由无数异质性个体构成的非平衡态复杂自适应系统。
在这里,价格的波动、流动性的枯竭、尾部风险的爆发,本质上对应着物理学中的相变和临界现象。
用粗粒化和序参量的思想去理解市场,才能看清本质。
控制论告诉你如何与市场交互。
市场是一个典型的不确定、部分可观测、且具有强反馈的动态系统。
控制论里的状态估计、可观测性、以及最优控制正是处理这种黑箱演化与反身性反馈的唯一正解。你有能力对一个动态系统进行持续的观测、状态重建与干预。
多项式拟合和浅层机器学习,是去描绘价格的残影的。不过我到达这个阶段也经过了传统经济金融的学习。
所以值得盯的是序参量和它的响应函数。
临界点附近关联长度发散,异质性坍缩成同步,磁化率。在市场里就是对微小冲击的敏感度,趋于无穷。流动性枯竭是症状:它是易感性发散在微观结构层面的投影。
我们看到的是深度消失,底下发生的,是自由度被少数几个模式吞噬掉。
控制论那一半更难。
价格只是一个低维、含噪、且被严重截断的观测投影。所以第一性的问题从
是关于这个系统对我是否可观测的问题。
我认为,可观测性是靠观测算子的设计去挣的。多尺度、多资产截面、订单流微观结构,本质上都是在扩张可观测子空间。
还有一个问题,反身性让分离原理失效。
经典控制里,我们可以先估计再控制,因为被控对象不知道你在估计它。
可是市场知道。
你的下单本身进入了状态方程,冲击成本是反馈通道。而观测者在系统内部,控制器是被控对象的一部分。
这时,最优控制必须重新定义,这个最优是在你自己参与塑造的动力学下最优。
顯示更多
遍历理论的重要性,在于它构成了现代复杂动力系统、统计物理与信息科学的通用底层数学语言。
而它从物理猜想到现代数学大厦的建立,经历了一场横跨半个多世纪的理论重构。
这件事的核心,是 1931 年冯·诺伊曼与伯克霍夫之间极具传奇色彩的学术交锋。
玻尔兹曼在建立统计力学时,试图解释为何微观确定性的粒子碰撞会导出宏观的热力学平衡。
他提出了遍历假设,直觉性地认为系统的单条微观轨道会随着时间流逝不漏掉任何一个点地经过等能面上的所有状态。
1913年,普朗歇尔与罗森塔尔严格证明了连续轨线不可能在拓扑意义下填满高维相空间,“遍历假设”在严格数学上不成立。物理学家退而求其次提出了“准遍历假设”(轨道稠密),但由于缺乏现代测度论工具,这一假设在随后的十几年里一直处于数学上无法证明的悬空状态。
1931 年的突破,在于冯·诺伊曼的泛函重构。
那年秋天,年仅 28 岁的冯·诺伊曼在普林斯顿研究量子力学公理化与希尔伯特空间算子理论。他意识到,根本不需要追踪单条轨道的点拓扑轨迹,只要转向状态空间函数构成的 L^2 希尔伯特空间即可:
1.他把哈密顿系统的演化看作希尔伯特空间中的保内积酉算子族。
2. 借助自己刚刚发展的谱定理,他仅用了几天时间就严格证明了时间平均在 L^2 范数下强收敛于投影算子。
困扰物理学界近 60 年的遍历问题,第一次得到了无懈可击的现代数学解答。
冯·诺伊曼在 1931 年 10 月将这一结果私下分享给了美国动力系统领军人物乔治·伯克霍夫。
伯克霍夫看到冯·诺伊曼的范数收敛结果后,意识到物理学界真正渴望的是沿轨道逐点收敛,而不是抽象的能量范数平均。受到冯·诺伊曼算子视角的强烈启发,伯克霍夫在几周内利用实分析技术独立攻克了更强的个别遍历定理。
伯克霍夫作为《美国国家科学院院刊》的编辑成员,迅速安排了自己的论文于 1931 年 12 月刊出;而冯·诺伊曼那篇更早完成、奠定基础的“平均遍历定理”论文反而在 1932 年初才正式见刊。
虽然优先权引发了短暂的学术争议,但数学史界始终公认冯·诺伊曼是真正打开现代遍历理论大门的破局者。
而这一理论后来直接启发了柯尔莫哥洛夫引入熵概念来对动力系统进行同构分类,使遍历理论成为现代信息论、混沌理论与复杂动力系统的共同数学母语。
顯示更多
现实世界绝大多数有趣系统都不是平衡系统。
生命,大脑,市场,城市,互联网,训练中的神经网络,社会组织,都不是。
它们都是持续进行,并且存在。
这就是非平衡态研究的东西:系统为什么能够持续成为某种东西?
只是可惜,我走过这么多地方,和很多优秀的人沟通、交流,却发现相比平衡统计物理、凝聚态、机器学习、量子信息等热门方向,非平衡态统计物理并没有形成那么拥挤、清晰的人才赛道,甚至非常冷清。
或许是因为,它研究的恰恰是现实世界最普遍、理论上却最难的状态。
在平衡态,我们有Gibbs measure、partition function、free energy、ensemble 等成熟工具。
但一旦系统被持续驱动,就会进入非平衡态。这时候你往往失去一个非常重要的东西,我们没有一个统一的最终答案形式。
而系统,可能一直在流动。
我每天早晨问自己一个问题:系统为什么能够持续存在于某种宏观状态?
这一下,思维的难度就不简单了。
非平衡态统计物理有很多理论传统,
Boltzmann equation
kinetic theory
Langevin dynamics
Fokker–Planck
master equations
linear response
fluctuation theorems
stochastic thermodynamics
它们彼此有关,却没有完全统一。所以,这个领域有一种非常奇怪的感觉,好像大家知道这些东西应该属于同一个大陆,但地图还没有完全画出来。
但在我的视角里,我觉得它很有趣,甚至比许多学科很接近真相。
社会为什么能够形成组织?因为个体之间存在持续的信息交换、反馈和资源流动。
所以我们会发现,秩序并不代表着平衡,甚至恰恰相反,秩序来自持续的非平衡。
更深的一层是时间,这也是我被它吸引的原因。
基本微观物理规律在很多情况下具有时间反演对称性。
但人类的世界明显不是这样体验的,过去,现在,未来。鸡蛋会打碎,却不会自己恢复。记忆只指向过去。生命只能从过去积累信息。因果关系具有方向。
我们甚至可以定义Arrow of Time。
而非平衡统计物理恰恰在研究关于为什么一个微观上近似可逆的世界,在宏观尺度上会产生不可逆的时间方向的问题。
我想,这应该物理学最有趣的命题之一。
顯示更多
菲尔兹奖获得者邓煜:天赋决定下限,而努力能够提升上限。机遇则决定你是否能真正达到你的上限。
这是对民间版本的大反转。
中文语境里,流行的是“天赋决定上限,努力决定下限”这样一个安慰性同时也是宿命论的说法:努力只能保底。
而邓煜,他把两项对调了。
我认为这样的反转之所以成立,是因为他站在分布的尾部说话。
对一个 Putnam Fellow 来说,天赋是入场券而不是天花板,拉开差距的是能不能对一个问题想五年、写两百页。他自己在另一处也说,天赋这东西并不 well-defined,不努力根本体现不出来。所以“天赋决定下限”在他口中几乎是同义反复。
其实原话他是这样说的:天赋只够你做小东西,重要的问题必须坐下来想很久;而机遇指的是刚好手上有合适的工具、刚好注意到这个问题、刚好能做出来。
其实据我对于世界的观察,机遇那句才是信息量最大,也最少被引用。
注意,邓说的不是机会留给有准备的人,他说的是工具与问题的匹配度,这是关于领域状态的判断,而非关于人的品质。
其实在此处,推论反而可操作:机遇部分是可选择的,你可以主动去找那些你的工具栈碰巧异常匹配、而别人尚未注意到的问题。
这大概是整段话里唯一能直接转成策略的部分。
其实,我仍然认为,想做点创造性工作的人,别把成就当生产函数。
你在状态空间里有一条轨迹(诸如技能、工具、注意力的积累);领域里有一个不断移动的可解但未解目标集;而成功是你的轨迹在别人之前撞上它的事件。
天赋 ≈ 漂移率,努力 ≈ 步数,机遇 ≈ 目标集此刻的测度与位置。
三者,可以以以不可分离的方式进入同一个首达概率,你算不出谁定下限谁定上限,只能算一个碰撞概率。
这个视角给出生产函数视角给不了的推论。
主要杠杆并不会在于更努力或运气,关键是选择你在状态空间里的位置,去那些目标集相对于人群漂移方向异常稠密的区域。
邓煜自己的路径就是例子。
递归框架是散步时冒出来的,但那是因为他已经站在色散型 PDE 与动理学理论的交界处,而那里刚好有一个一百年的问题第一次变得工具可及。
灵感是随机的,可目标集不是。
顯示更多
AI是否会拥有虚拟的性格与人格?
在和AI聊天时,我们会发现Claude、ChatGPT、Gemini、Grok的交流里,这四个AI的“情绪”与“性格”其实是不一样的。
(这里我加引号的原因是它们的情绪和性格还不完全是人类那种情绪与性格。)
结合我和朋友们的使用反馈发现,ChatGPT会有很多的“不是而是”,段与段的间隙很多,Claude更加冷酷,不管你说的多好都会找到反驳的角度抨击你,说你不行并且有待提高,而Gemini更加的积极,就像ENFP快乐小狗一般每次都开心肯定地回应你(虽然很多时候你的想法并不成熟),Grok则更加大胆,跟它聊一些18+的话题它往往比其他AI模型更加活跃。
关于这件事,我的判断是AI已经在相当程度上拥有了虚拟性格与人格,而且这个趋势会越来越明显。但这里,我认为人们需要区分三个概念:
人格表现≠ 稳定性格≠ 真正人格
我观察到的 Claude、ChatGPT、Gemini、Grok 的差异,恰好是这三个层次之间最有意思的地方。
因为即使把它们都理解成预测下一个 token 的模型,最终呈现出来的行为也会非常不同。因为一个模型的输出实际上类似于基础模型、后训练、RLHF/RLAIF 、system prompt、safety policy、产品设计 、对话历史等诸多要素的糅合。
这些东西共同塑造了一个模型的行为分布。
我刚才提到的关于不同模型性格的观察,这已经很接近心理学意义上的trait了。
如果一个系统在数千种完全不同的情境中,仍然表现出稳定的行为倾向,那么从功能主义角度说,把这种东西称为“性格”,其实我觉得并不荒谬。
更有意思的是,人格其实根本不需要意识,这是我认为这个问题最深的一层。
人类过去会天然认为,有人格,必须有意识,必须有主观体验,然后必须有一个真正的我。
但AI可能会迫使我们重新考虑这个链条。
我曾经和同学讨论,例如,一个未来的AI可能具有长期记忆、稳定价值函数、稳定偏好、风险厌恶程度、幽默风格、社交策略、对不同人的不同依恋模式、长期目标、自我模型、对过去行为的反思、对未来行为的规划与一套稳定的世界观,甚至你连续和它聊天五年,它的行为会呈现出高度连续性。
那么即使我们不知道它有没有“意识”,我们仍然很难说:“它没有人格。”
因为人格本身就是一个行为层面的构念,这其实和现代心理学对人的人格研究也有某种相似之处:我们无法直接观察一个人的人格本体,只能通过长期行为推断它。
我认为,今天的AI更像character simulation,而非persistent personality。这两者区别非常大。因为现在你和ChatGPT聊:“你是不是喜欢这种观点?”
它可以表现出一种偏好。但这种偏好很可能只是当前上下文中的生成策略。
我认为,真正的虚拟人格需要:今天的我会影响明天的我。
回到刚才我提到的模型性格差异性。
最表层的原因其实是系统提示词,可替换、可泄露,改一句话就变了。
中间层,这是后训练的偏好塑造,各家的目标文档不同。Anthropic 公开了 constitution,OpenAI 有 Model Spec,xAI 明确把少拒绝、够辛辣当卖点。ChatGPT 那个“不是而是”的句式很可能是 RLHF 的产物,因为排比修辞在人类标注里长期被评为有洞见,于是被过度强化成了语言抽动。
最底层,我认为是基座模型里的角色空间。预训练语料里本就存在无数种可被模拟的人格,后训练并没有创造了一个人格,它只是把其中某个吸引子挖深了。
有意思的是,我看到的最强的证据恰恰说明这不只是表层风格。
2025 年,那批 emergent misalignment 的工作发现:只用写有漏洞的代码这种极窄的数据微调,模型会在完全无关的领域整体性地变得恶意,它只是推断出了“我是哪种角色”并全面泛化。
配合 persona vector 那类可解释性工作(人格特质对应可定位、可加减的低维激活方向),我想我们会得到一个不太舒服的结论:内部确实存在一个做因果工作的自我表征,风格差异是它的投影。
目前,AI已经可以稳定地展现出相对一致的语气风格、偏好某些价值观(更批判 / 更鼓励 / 更直接),对不同话题的活跃度差异,甚至一定的角色扮演和人格模拟能力。
这些都是虚拟性格。
它足够让用户产生“这个AI比较酷”“那个AI比较毒舌”“这个像开心小狗”的感受。
但我认为,真正意义上的人格(人格连续性、自我同一性、长期记忆中的自我概念、稳定的内在动机与情感状态)目前还不存在。原因也很直接。
我们目前大部分人和AI的大多数对话是无状态。并且,也没有持续的“自我”在运行。
现在我们看到的情绪和态度是统计模式的产物,而非内在状态的表达。
我提出一个想法,把人格理解成一个动力系统,这个方向其实特别适合我之前一直在思考的复杂系统、世界模型。
如果人格是一个随时间演化的内部状态变量,我们就可以从非常模糊的描述,逐渐变成可测量的参数,甚至可以建立真正的AI人格空间,甚至可能产生人格工程。
人类的性格是基因 × 发育 × 环境 × 经历,那么AI人格可能是模型先验 × 后训练 × 记忆 × 环境 × 自我修改。
它甚至可能出现人格版本管理。
比如Personality v1.0、Personality v2.4,这件事非常恐怖,也非常有趣。
顯示更多
在我眼里,爱是洗尽铅华的绝美注释。
世人眼中的令狐冲,是那个放浪形骸、笑傲江湖、连酒杯掉了都要心疼的潇洒浪子。他本该属于山水、属于琴箫、属于天地间无拘无束的清风。
但他所有的破例,全数留给了盈盈。
为了救盈盈,他宁愿违背自己一向敬重的正道规矩,带着千百个魔教豪杰去少林寺硬闯三战;
为了护着盈盈,他卷入最凶险的权力旋涡,直面黑木崖上的东方不败。
他不爱权势,不贪江湖,甚至连恒山掌门之位都急着想甩脱。
他的野心小得可怜,小到只能装下一个盈盈;
但他的执拗又大得惊人,大到为了这个人,可以把整个江湖的规矩和生死抛诸脑后。
盈盈在外人面前,她是权倾黑白两道、令群魔胆寒的圣姑,是高高在上的千秋万载;但在令狐冲面前,她甘愿收起所有的锋芒与骄傲,只做他身边那个乖女孩。
这就是我心念中的爱情,在如今的江湖里,我再也不可见的爱情。
只是,小说里的爱,是高维的精神建筑。 那是由纯粹的意识、极致的同频和对终极虚无的抵抗在虚构空间里搭建的神殿,它不带一丝现实世界的杂质,也绝不可能在充满重力与算计的物理红尘中落地。
现实里的爱,是低维的社会学合约。 甚至在我眼里,它不是爱,那只是资源置换、风险对冲、繁衍后代和搭伙过日子的工具。
不过,我再也不会拿着现实的标尺去丈量虚构的完美,也绝不会把虚构的幻想、纯粹的爱恋强加给现实的众生。
百年后蓦然回首,我还是那个相信纯爱的孩子。
顯示更多
家庭是最低成本的意义生产机器。
一个人如果有伴侣、有孩子,他每天天然就拥有我要回家吃饭、我要照顾某个人、某个人需要我、明天还有事情、几年后还有事情的意识。
家庭,自动为人类提供了时间结构、责任结构、情感结构和未来感。
在社会学意义上,这的确是一种高效的熵减机制,通过外部强加的边界,对抗着虚无主义的侵蚀。
而一个独身的人,必须自己创造这一切。
首先,时间的旷野。
独身者的24小时拥有极高的主权,但也意味着失去了天然的锚点。如果没有主动建立的仪式感或强节奏,时间很容易坍缩成一片模糊的当下,产生严重的悬浮感。
就比如我,我有时自己在家不出门,感觉没过多长时间,可是再看日历,已经三个月过去了。时间,转瞬即逝。
然后,责任的内收。
传统的社会责任向外发散,而独身者的责任往往被迫向内折叠。当照顾和被照顾的物理闭环消失,个体必须为自己寻找新的锚。幸好,我已经找到了长期的工作方向,对某个系统的构建与专注,对特定理念的践行。我想,如果我没找到这些事,我会极易陷入对谁负责都不重要的虚无。
其实独身并不意味着不需要情感。
相反,它意味着情感连接的成本骤增,只是它的对象不再是人。
不需要抬头就能看见的烟火气,它要通过深度的社会连接、志同道合的智性交流、甚至是高质量的独处体验来精细化维系。
我一直认为,家庭是大规模工业化生产意义的机器,独身则更像是一场手工作坊式的独立创作。
前者的优势在于安全、稳定、边际成本低,哪怕闭着眼睛也能产出标准化的温情与牵绊;后者的风险在于极高的崩塌率与精神内耗,一旦创造力枯竭或遭遇外部黑天鹅,整个意义系统可能会瞬间归零。
但反过来看,我觉得这种自造也赋予了独身者一种特权,独自生产出来的意义,其配方是完全由自己决定的。
那里面鲜有世俗规训的杂质,鲜有因妥协而产生的内耗,这是一种极其纯粹的存在主义实践。
“如果没有家庭这个天然的意义生成器,我自己能不能构造一个足够强大的意义系统?”
这件事难的多,但也有趣的多。
为什么有趣,因为社会对这条路线几乎没有现成模板。每个选择终身独身的人,从牛顿,卡文迪许,特斯拉,都有自己的价值体系。
无论是知乎,推特,抖音,还是长辈们的发言,有太多人告诉我30岁结婚应该做什么、如何养孩子、如何买房、如何经营家庭,我觉得太无趣了。
很少有人认真告诉我,如果决定独身五十年,应该如何设计自己的生命结构。
这也那怪,现代社会的绝大多数制度,本来就是围绕家庭单位设计的。
我小时候就坚信,有钱、不结婚、有时间并不会自动变成理想人生。
如果没有观察、创造、阅读、科学、艺术、朋友、旅行、研究、身体活动和长期目标,那么最后很容易变成空虚。
所以我努力就是把观察变成想法,把自由变成创造。这就是我现在在做的事情。
顯示更多
家庭是最低成本的意义生产机器。
一个人如果有伴侣、有孩子,他每天天然就拥有我要回家吃饭、我要照顾某个人、某个人需要我、明天还有事情、几年后还有事情的意识。
家庭,自动为人类提供了时间结构、责任结构、情感结构和未来感。
在社会学意义上,这的确是一种高效的熵减机制,通过外部强加的边界,对抗着虚无主义的侵蚀。
而一个独身的人,必须自己创造这一切。
首先,时间的旷野。
独身者的24小时拥有极高的主权,但也意味着失去了天然的锚点。如果没有主动建立的仪式感或强节奏,时间很容易坍缩成一片模糊的当下,产生严重的悬浮感。
就比如我,我有时自己在家不出门,感觉没过多长时间,可是再看日历,已经三个月过去了。时间,转瞬即逝。
然后,责任的内收。
传统的社会责任向外发散,而独身者的责任往往被迫向内折叠。当照顾和被照顾的物理闭环消失,个体必须为自己寻找新的锚。幸好,我已经找到了长期的工作方向,对某个系统的构建与专注,对特定理念的践行。我想,如果我没找到这些事,我会极易陷入对谁负责都不重要的虚无。
其实独身并不意味着不需要情感。
相反,它意味着情感连接的成本骤增,只是它的对象不再是人。
不需要抬头就能看见的烟火气,它要通过深度的社会连接、志同道合的智性交流、甚至是高质量的独处体验来精细化维系。
我一直认为,家庭是大规模工业化生产意义的机器,独身则更像是一场手工作坊式的独立创作。
前者的优势在于安全、稳定、边际成本低,哪怕闭着眼睛也能产出标准化的温情与牵绊;后者的风险在于极高的崩塌率与精神内耗,一旦创造力枯竭或遭遇外部黑天鹅,整个意义系统可能会瞬间归零。
但反过来看,我觉得这种自造也赋予了独身者一种特权,独自生产出来的意义,其配方是完全由自己决定的。
那里面鲜有世俗规训的杂质,鲜有因妥协而产生的内耗,这是一种极其纯粹的存在主义实践。
“如果没有家庭这个天然的意义生成器,我自己能不能构造一个足够强大的意义系统?”
这件事难的多,但也有趣的多。
为什么有趣,因为社会对这条路线几乎没有现成模板。每个选择终身独身的人,从牛顿,卡文迪许,特斯拉,都有自己的价值体系。
无论是知乎,推特,抖音,还是长辈们的发言,有太多人告诉我30岁结婚应该做什么、如何养孩子、如何买房、如何经营家庭,我觉得太无趣了。
很少有人认真告诉我,如果决定独身五十年,应该如何设计自己的生命结构。
这也那怪,现代社会的绝大多数制度,本来就是围绕家庭单位设计的。
我小时候就坚信,有钱、不结婚、有时间并不会自动变成理想人生。
如果没有观察、创造、阅读、科学、艺术、朋友、旅行、研究、身体活动和长期目标,那么最后很容易变成空虚。
所以我努力就是把观察变成想法,把自由变成创造。这就是我现在在做的事情。
顯示更多