註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 pde_talks
pde_talks 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 pde_talks 的搜尋結果
核心野心:训练“AI 物理学家” 这 15TB 数据不是拿来看热闹的,而是为了训练 PDE(偏微分方程)代理模型。 传统解方程,超算要跑几周,烧掉上百万美元; 而 AI 代理模型的目标是:将几周的疯狂计算,极限压缩成一次仅需几毫秒的 AI 前向传播运算!
顯示更多
偶然看到一篇有意思的论文(2020年的),专门讨论数学各分支的鄙视链。 简单结论是:代数几何 ≈ 拓扑 > 微分几何(下滑中) > 概率论 / PDE(上升中) > 代数 ≈ 动力系统 > 分析 > 数值分析 ≈ 统计学
顯示更多
0
48
204
44
轉發到社區
效果惊艳的 AI 求解器 数据一出,已经有研究者大展身手。 例如基于这些数据训练出的 PDE-FM 模型,在 12 个测试集上将预测误差(VRMSE)平均降低了 46%,并在 6 个极端物理场景中跑出了全球最高精度。 百万级的传统求解器,正在面临 AI 的降维打击。
顯示更多
和Quant Alex @StochAlex07 讨论: SABR Theta与Spot Theta+Vol Theta+Cross Theta的异同与应用,以及SABR模型自洽性分析。 **English Summary of the Chat** **SABR Theta vs Spot Theta + Vol Theta + Cross Theta** The conversation between **Alex Wu** (white bubbles) and **Jeff Liang** (green bubbles) is a technical discussion focused on **SABR Theta versus Total Theta** (i.e., Spot Theta + Cross Theta + Vol Theta), model self-consistency, PDE residual, and the correct definition of SABR Greeks. ### Key Points Discussed: 1. **SABR Gamma = Spot Gamma** (first major question, raised by Jeff) Jeff asked whether SABR Gamma (\(\partial^2 P / \partial F^2\)) is identical to Spot Gamma and whether it includes the dependence of \(\sigma_B\) on \(F\). He also provided the full chain-rule expansion of SABR Gamma in terms of Black-76 Greeks. Alex confirmed the understanding and **later affirmed in code** that this is exactly how SABR Gamma is implemented in their system. 2. **SABR Theta vs Total Theta and Model Self-Consistency** (main topic, led by Jeff) Jeff shared a clear 3-point understanding: - SABR Theta is computed directly via the SABR approximation formula to obtain \(\sigma_B\), then applying the Black-76 chain rule: \(\partial P/\partial t =\) BS_Theta(\(\sigma_B\)) + BS_Vega \(\cdot \partial\sigma_B/\partial t\). - Total Theta is the exact decomposition from the SABR PDE (Spot Theta + Cross Theta + Vol Theta). - When the model is **fully self-consistent** (Residual = \(\partial P/\partial t + \mathcal{L}P = 0\)), SABR Theta = Total Theta; otherwise the difference is the unexplained PnL caused by the approximation error in the Hagan formula (especially pronounced in long-dated, high vol-of-vol, or high-skew options). 3. **Practical Implication – Theta Decomposition Decision** (comment by Alex) Alex noted that whether to perform Theta decomposition depends on the risk-management approach: - Without decomposition → use SABR Gamma vs. dP/dt. - With decomposition → SABR Gamma maps to Spot Theta, Vanna to Cross Theta, and Volga to Vol Theta. **Overall Tone**: The discussion is highly technical and collaborative. Jeff drives the conversation by asking clarifying questions and presenting a well-structured 3-point summary of his recent study. Alex provides confirmations, practical insights, and code-level validation. Both participants demonstrate a strong command of SABR model nuances, particularly the relationship between approximation error, PDE residual, and real-world risk management.
顯示更多
菲尔兹奖获得者邓煜:天赋决定下限,而努力能够提升上限。机遇则决定你是否能真正达到你的上限。 这是对民间版本的大反转。 中文语境里,流行的是“天赋决定上限,努力决定下限”这样一个安慰性同时也是宿命论的说法:努力只能保底。 而邓煜,他把两项对调了。 我认为这样的反转之所以成立,是因为他站在分布的尾部说话。 对一个 Putnam Fellow 来说,天赋是入场券而不是天花板,拉开差距的是能不能对一个问题想五年、写两百页。他自己在另一处也说,天赋这东西并不 well-defined,不努力根本体现不出来。所以“天赋决定下限”在他口中几乎是同义反复。 其实原话他是这样说的:天赋只够你做小东西,重要的问题必须坐下来想很久;而机遇指的是刚好手上有合适的工具、刚好注意到这个问题、刚好能做出来。 其实据我对于世界的观察,机遇那句才是信息量最大,也最少被引用。 注意,邓说的不是机会留给有准备的人,他说的是工具与问题的匹配度,这是关于领域状态的判断,而非关于人的品质。 其实在此处,推论反而可操作:机遇部分是可选择的,你可以主动去找那些你的工具栈碰巧异常匹配、而别人尚未注意到的问题。 这大概是整段话里唯一能直接转成策略的部分。 其实,我仍然认为,想做点创造性工作的人,别把成就当生产函数。 你在状态空间里有一条轨迹(诸如技能、工具、注意力的积累);领域里有一个不断移动的可解但未解目标集;而成功是你的轨迹在别人之前撞上它的事件。 天赋 ≈ 漂移率,努力 ≈ 步数,机遇 ≈ 目标集此刻的测度与位置。 三者,可以以以不可分离的方式进入同一个首达概率,你算不出谁定下限谁定上限,只能算一个碰撞概率。 这个视角给出生产函数视角给不了的推论。 主要杠杆并不会在于更努力或运气,关键是选择你在状态空间里的位置,去那些目标集相对于人群漂移方向异常稠密的区域。 邓煜自己的路径就是例子。 递归框架是散步时冒出来的,但那是因为他已经站在色散型 PDE 与动理学理论的交界处,而那里刚好有一个一百年的问题第一次变得工具可及。 灵感是随机的,可目标集不是。
顯示更多
0
64
214
38
轉發到社區
最近提交ipo的ai芯片的新宠Cerebras火遍硅谷。 其芯片在小模型场景下,其推理速度最高可达 H100 的 20 倍;而超大规模模型(如 400B 参数量级),Cerebras CS-3 系统的单用户响应速度约为 B200 的 2.4 倍 那么cerebras究竟是如何做到的呢? 它是否会成为英伟达杀手呢? 我们需从算力演进的本质开始。 AI算力的演进,正在从“算力本身”转向“通信与系统结构”。在这条演进路径上,Cerebras Systems提供了一种完全不同的答案:不是优化分布式,而是尽可能消灭分布式。 一、两条路线:消灭通信 vs 优化通信 当前AI算力本质上分为两种架构哲学:一条是以NVIDIA为代表的路线: 多芯片(GPU),高速互连(NVLink / CPO),scale-out(横向扩展) 另一条是Cerebras路径:单芯片做到极限(wafer-scale) 片内网络替代跨节点通信,scale-up(纵向放大) 核心区别是:一条在解决“如何连接更多芯片”,另一条在解决“如何不需要连接”。 二、为什么这条路现在才成立 wafer-scale并不是新概念,80年代就有人尝试,90年代商业化失败。原因是: 良率无法承受 没有容错机制 软件无法支撑 行业因此形成共识:小die + 高良率 + 分布式。 Cerebras的突破在于三件事同时成立: 1)容错机制工程化 2)片上网络成熟 3)AI workload匹配(高并行,强同步,通信主导) 本质变化是:从“完美硬件”转向“可容错系统”。 三、性能对比:单点极限 vs 系统扩展 在通信层面,两条路线的优劣非常清晰: 1)片内通信 Cerebras:纯片内 → 延迟最低、能耗最低 CPO:仍有光电转换 → 单点效率:Cerebras更优 2)系统扩展 Cerebras:一旦跨芯片 → 回到通信问题 CPO:带宽可持续扩展 → 系统能力:CPO更优 3)功耗结构 Cerebras:单机功耗极高,但通信极省 GPU+CPO:单点功耗可控,系统效率更平衡 结论很明确: Cerebras赢“单机极限”, CPO赢“系统规模”。 四、适用场景:谁该用cerebras 判断标准可以简化为三个问题: 1)通信是否是瓶颈 2)任务是否可集中 3)结构是否规则 因此,高度适用于大模型训练(dense模型),超长上下文,及部分HPC(PDE、流体等) 这些任务的共性是强耦合 + 高同步 + 高带宽 部分适用于大模型推理(低并发),图计算(结构复杂时优势下降) 而不适用于CPU(通用计算),高并发推理,移动/边缘芯片,实时系统 这些系统的共性:不规则 / 高并发 / 低延迟 五、是否会变成主流 尽管Cerebras在特定场景极强,但主流不会走这条路,原因是: 1)物理约束:功耗密度;信号延迟→ 容错解决不了这些问题 2)经济性:小die良率更高;chiplet更灵活 3)产业路径:TSMC等体系优化方向是模块化,多客户复用而不是超大单体 4)需求侧变化:推理占比远高于训练,多任务、高并发成为主流 六、cerebras的意义 与其说wafer-scale尺寸是重要的趋势,不如说容错设计是会被广泛吸收的哲学 未来可能会出现chiplet级容错,封装级绕路 核心变化是单个硬件不再需要完美,系统负责兜底。 回到最初的问题:Cerebras会不会成为NVIDIA的“杀手”? 答案其实已经很清楚。 它确实在一个关键点上击中了GPU体系的软肋——通信。但行业的选择,并不是非此即彼,而是多个技术突破同时采用:更强的互连、更低的通信能耗、更高的系统级效率。 因此,更准确的判断是Cerebras不是英伟达的杀手,而是英伟达及所有芯片公司可借鉴的最佳实践。 免责声明:本人持有文中提及的标的,观点必然偏颇,非投资建议,投资风险巨大,入场需极度谨慎 (图:一个cerebas芯片)
顯示更多
0
14
84
18
轉發到社區