注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 𝗯𝗶𝘀𝟭月号》
𝗯𝗶𝘀𝟭月号》 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 𝗯𝗶𝘀𝟭月号》 的推特
投机解码的 drafter 从来都是一个 token 一个 token 地猜。做出 DFlash 的推理公司 Inco AI 说这没必要:正确的 token 本来就在候选列表里,整块并行预测之后挑出一条连贯路径,输出不变,每次验证多赚一个完整的 token。 《DFlash 2:保持并行起草》 推理是 agent 时代的瓶颈。agent 会读、会规划、会调用工具,常常一跑就是几小时甚至几天。它们消耗 token 的速度,是聊天场景从未达到过的。而每一个 token 都要在模型上跑一次完整的前向传播。在 Inco AI,我们在构建一套面向未来 token 经济学的推理栈。这篇文章是一次预览。 我们的团队 1 月发布了 DFlash(论文: SGLang、vLLM、TensorRT-LLM 和 llama.cpp 里。NVIDIA 在 Blackwell GPU 上用它测到了最高 15 倍的吞吐;Google 报告在 TPU 上每秒 token 数提升 3 倍;CoreWeave 生产环境的 Kimi K2.7 Code 端点(Artificial Analysis 上该模型最快的端点)默认就跑 DFlash。生态已经在它之上构建:NVIDIA、Red Hat、Modal 都发布了 DFlash drafter;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)、NVIDIA(Nemotron 3.5 Lightning)随自家模型发布官方 drafter。在 Hugging Face 上,DFlash 模型被下载了超过 350 万次(截至 2026 年 8 月)。 投机解码是现代推理栈的核心组件之一。一个小 drafter 模型猜出一整块 token,目标模型在一次前向传播里验证整块。猜得好,一次前向变成多个 token;猜得差,丢掉重来。但多年来,起草本身一直是自回归的:一次一个 token。DFlash 让它也变成了一次通过:整块、每个位置,并行预测。 (演示视频:DFlash 2 在 Apple M5 Max 上用 oMLX 为 Qwen3.8-27B 起草,与自回归解码并排对比。 DFlash 2 把并行起草又往前推了一步:每次验证通过多产出 20% 以上的输出,增加的周期延迟只有约 1%,而输出可证明不变。跨基准测试的增益在 16–25%。配合今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下达到自回归解码 2.7–3.4 倍的吞吐。每个位置独立预测,留下两处空间:选对 token,以及在块的末尾守住准确率。DFlash 2 把这两处都拿了回来,同时没有放弃一次性通过的设计。 现在就能跑 DFlash 2 已经跑在主流推理引擎里。 SGLang: pip install -U "sglang[all] @ git+" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 vLLM: pip install -U "vllm @ git+" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' llama.cpp: git clone cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 oMLX:下载安装支持 DFlash 2 的预构建版( 在 oMLX 里跑 Qwen3.8-27B 加 DFlash 2: 1. 打开 oMLX 的 Model Downloader,下载 mlx-community/Qwen3.8-27B-4bit 和 incoai/Qwen3.8-27B-DFlash2。 2. 打开 Model Manager,编辑 mlx-community/Qwen3.8-27B-4bit,配置 DFlash: • DFlash:enabled • Draft model:incoai/Qwen3.8-27B-DFlash2 • Draft quantization:enabled • Runtime block size:5 • Verify mode:dflash 3. 保存设置,加载目标模型。 对的 token 早就在候选里 DFlash 每个位置独立、并行地预测。每个选择单独看都合理,但没有什么让它们彼此咬合,一个不连贯的块会在验证时被截断。近期的方法如 Domino 和 DSpark,用顺序的 Markov head 重写每个位置的完整词表分布来买连贯性。但真的需要这种昂贵的自回归纠错吗? 不需要。证据就在 DFlash 自己的候选列表里。拿第一个位置来说:DFlash 的第一选择 85.4% 的情况下是对的,但正确的 token 99.5% 的情况下都在前 16 个候选里。即使第一选择错了,对的 token 通常也在列表上。 表 1:Recall@1(第一选择正确的概率)与 Recall@16(正确 token 出现在前 16 候选里的概率),按起草位置统计,条件是前面每个位置都正确。GSM8K 上的五层 Qwen3-4B DFlash。接受长度包含验证器产出的下一个 token。 • 位置 0:Recall@1 85.4%,Recall@16 99.5% • 位置 1:80.3%,97.3% • 位置 2:79.4%,94.8% • 位置 3:78.3%,92.6% • 位置 4:77.5%,90.8% • 位置 5:75.9%,89.4% • 位置 6:72.9%,87.8% • 接受长度:4.27(只看第一选择);6.79(从前 16 里选) 一个总能从前 16 个候选里挑对的那个 oracle,会把接受长度从 4.27 抬到 6.79。这个差距是纯粹的选择空间。我们只需要在候选里选出一条正确的路径。 图 1:一个周期里的选择器。只用 DFlash,每个位置保留自己的第一选择;这里两个相邻位置选了同一个词,结巴在验证时死掉。DFlash 2 保留每个位置的 top 候选,选择器在候选之间走出一条连贯路径;这里整块都活了下来。 一个轻量的路径选择器 连贯性大体是局部的:一个候选合不合适,主要取决于它前面的那个 token,所以给相邻对打分应该就够了。DFlash 2 保留每个位置前 16 个候选,给每一对相邻候选打分。对前一个 token a 和当前候选 b: S_t(a,b) = U_t(b) + ⟨A(a)⊙H(h_t), B(b)⟩ 分数分两部分。第一部分 U_t(b) 是 DFlash 自己的 logit:drafter 本身有多喜欢 b。第二部分问 b 接在 a 后面有多顺:A 和 B 给每个 token 一个紧凑的 256 维嵌入,两个嵌入在一个上下文门控 H(h_t) 下匹配,门控决定匹配的哪些部分算数。本质上,这是对相邻候选做的低秩双线性注意力。 打分全程并行。每个位置的每一对相邻候选一次性全部算完,不需要额外的 backbone 或 LM head 前向。唯一串行的部分,是最后在预计算好的分数上走一遍:从最后一个已验证 token 出发,贪心地跟着每一步最好的后继走,采样从同样的分数里抽取,拒绝采样恢复出精确的目标分布。 表 2:只加路径选择(不加卷积)的接受长度,GSM8K 上的五层 Qwen3-4B。开销相对纯 DFlash:drafter 增加的参数、起草-验证周期增加的延迟。 • DFlash:T=0 下 4.27,T=1 下 3.78 • + DSpark 纠错:+77.8M 参数,+9.6% 延迟;4.49,4.08 • + 路径选择(我们的):+2.0M 参数,+0.6% 延迟;4.61,4.25 选择器在 T=0 下给 DFlash 加 0.34 个 token,T=1 下加 0.47。两个设置下都超过 DSpark 的纠错,参数少约 40 倍,延迟开销低 16 倍。选择比预测便宜。而且还有空间:oracle 能到 6.79。成对打分是我们能想到的最简单的选择器,我们相信这里还有很多可探索的。 后缀衰减是个局部问题 我们还注意到上面两行 recall 都在块尾下滑。连 oracle 都在衰减:即使选择完美,准确率仍然从第一个位置的 99.5% 掉到最后一个位置的 87.8%。没有选择器能修这个,因为候选自己就不够了。我们把这个叫后缀衰减,它是 backbone 的问题。 一个嫌疑是容量:五层 backbone 可能太小,撑不住横跨整块的依赖。如果真是这样,深度应该在靠后的位置帮上最多的忙。事实也如此:3 层、5 层、15 层的 DFlash 模型在第一个位置上几乎一样,越往块尾分得越开。但深度不加区分:多十层 attention block 到处加容量,连那些没什么可赚的靠前位置也加,把 DFlash 吸引人的那部分效率磨掉了。 图 2:GSM8K 上 Qwen3-4B 的 Recall@1(T=0),条件是前面每个位置都正确。所有 drafter 在相同设置下训练;卷积模型评估时不带选择器。它的卷积增加 3% 参数和 0.7% 周期延迟;15 层模型多出的十层增加 15.2%。 我们要一个有针对性的修法,而 DFlash 的 attention 指出了修哪里。它有两份工作:读块之前的上下文,以及建模块内部的依赖。但它在第二份上花的越来越少:块内注意力占比从第 1 层的 30% 掉到第 5 层的 8%,剩下的还集中在越来越少的一小撮 head 里。所以我们把两份工作拆开:一个专用模块承担块内工作,attention 继续读上下文。 图 3:五层 Qwen3-4B DFlash 的块内注意力按 head 分布。越亮的格子代表在起草块上花注意力越多的 head;靠后的层里,块内质量收缩、集中到少数几个 head。 一个轻量的局部卷积 块内工作本来就是短程的:一个块只有 4 到 16 个 token,最紧的依赖坐在相邻位置之间。自然的算子是短卷积:两个抽头,一个在当前位置,一个够到前一个位置,权重随内容自适应。跟随 Canon Layers、Dynamic Short Convolutions 和 Convolution for Large Language Models 的做法,我们在每个 attention 和 feed-forward 子层前后插入这个双抽头动态深度卷积: Conv_k(x)_t = k_{t,0}⊙x_t + k_{t,1}⊙x_{t-1} 每个系数由一个可学习的基核加上从当前隐藏状态算出的一个小修正组成;每 16 个通道共享一个修正。第一个位置读最后一个已验证 token 的表示,之后的每个位置读它前一个的。信息穿过整块,同时所有位置仍然并行计算。 图 4:双抽头动态卷积。每个 drafter 层的每个 attention 和 MLP 子层前后各有一个。内部:每个位置把自己的表示和前一个的混合;第一个位置读最后一个已验证 token。 卷积是块局部的、无状态的,所以能无缝插进 DFlash,不用动 attention、LM head 或验证。 只加 16.5M 参数(3%),带卷积的五层 DFlash 就逼近了 15 层 DFlash,大幅减轻后缀衰减。卷积给起草-验证周期延迟加 0.7%;多十层 Transformer 层加 15.2%。第 4、5 层的平均块内注意力从 9.4% 降到 0.5%,与卷积吸收局部工作、attention 回到读上下文一致。一个只够到前一个位置的核,买回了十层额外层的大部分收益:后缀衰减大体是个局部问题。 合在一起 到目前为止,选择器和卷积是分开测的;下面的完整对比把它们放在一起。DFlash 和 DSpark drafter 是我们在对齐的设置下自己训练的,MTP 随模型发布。 表 3:Qwen3.5-4B 每请求平均接受长度。采样:thinking 开启,温度 1.0,top-p 0.95,top-k 20,presence penalty 1.5,无损拒绝采样。 • GSM8K:MTP 4.78,DFlash 4.99,DSpark 5.69,DFlash 2 6.20 • MATH-500:5.04,5.42,6.20,6.76 • HumanEval:4.84,5.43,5.80,6.28 • MBPP:4.16,4.49,4.96,5.41 • MT-Bench:3.90,4.26,4.77,5.20 • 平均:4.54,4.92,5.49,5.97 DFlash 2 在每项基准上都领先。平均下来,它比 DFlash 多 1.05 个 token(21%),比 DSpark 多 0.48。升级仍然便宜:选择器和卷积加起来,只给五层 DFlash 的起草-验证周期延迟加了 1.3%。 在 MATH-500 上,增益逐位置可见:DFlash 2 到最后一个位置都稳在 86% 附近,而每个基线在块尾都比它低 6 到 9 个点。 图 5:MATH-500 上 Qwen3.5-4B 的条件接受率,采样同上。 两个 drafter,今天发布 我们今天发布两个 DFlash 2 drafter:一个给 Qwen3.8-27B( Meta 的 Muse Glimmer( Qwen3.8-27B,我们对比模型原生的 MTP 路径和一个社区 DSpark drafter。 表 4:Qwen3.8-27B 每请求平均接受长度,模型默认采样、块大小 8,对比原生 MTP 路径和社区 DSpark drafter。 • GSM8K:MTP 5.02,DSpark 4.36,DFlash 2 5.46 • MATH-500:4.72,3.92,5.28 • HumanEval:3.91,3.30,4.39 • MBPP:3.99,3.51,4.79 • MT-Bench:3.74,3.01,4.10 • 平均:4.28,3.62,4.80 对 Meta 的 Muse Glimmer,我们对比随模型发布的官方 DFlash drafter 和一个社区 DSpark drafter。 表 5:Muse Glimmer 每请求平均接受长度,模型默认采样、块大小 16。DFlash 是 Meta 随模型发布的官方 drafter;DSpark 是社区 drafter。 • GSM8K:DFlash 5.43,DSpark 5.45,DFlash 2 6.57 • MATH-500:5.39,5.01,6.56 • HumanEval:4.11,4.33,5.66 • MBPP:3.74,4.02,5.30 • MT-Bench:3.52,3.59,4.42 • 平均:4.44,4.48,5.70 差距很大:在两个模型上,DFlash 2 平均比 DSpark 多出超过一个完整的 token。它也超过每个模型的官方 drafter:Qwen3.8-27B 的 MTP、Muse Glimmer 的 DFlash。换算成吞吐,Qwen3.8-27B 上达到自回归解码的 2.7–3.4 倍,Muse Glimmer 上 3.1–4.6 倍。模型卡( 底线 agent 一个下午写出来的东西,聊天机器人要写一个月,而每一个 token 底下都坐着解码。DFlash 2 以接近自回归解码 3 倍的速度解码,每个 token 约三分之一的算力,输出相同。 七个月里,DFlash 从我们的论文变成了行业标准,超过 350 万次下载。在同一个设计内部,DFlash 2 每次通过多解码一个完整的 token,免费。那还只是服务栈的一个组件。推理离它的地板还很远。 在 Inco AI,我们在构建一套端到端的服务栈,把这个地板继续往下压。DFlash 2 是第一块。两个 drafter 今天发布在 Hugging Face。 如果你在规模化地服务 agent,想在你的栈里评估 DFlash 2,或者想为你跑的模型(包括你自己的微调)要一个 drafter,写信给我们:contact@inco.ai。 我们也在招人。如果你想一起构建这套栈,联系我们。 把候选连起来。起草,继续并行。 脚注:Modal 的 Speculation Is All You Need 指出,投机解码是对低延迟服务最重要的优化。我们是他们工作的超级粉丝,感谢他们自 DFlash 发布以来的支持和讨论。 本文引用格式:@misc{inco2026dflash2, title={DFlash 2: Keep Drafting Parallel}, year={2026}, month={August}, url={ 原文: #DFlash# #投机解码# #LLM推理#
显示更多
0
46
33
2
转发到社区
《AI 下半场:美股人形机器人产业链全梳理》 白毛股神 Serenity @aleabitoreddit 说:Robotics is next.🤖🤖🤖 过去两年,市场主要交易的是 AI 的大脑:GPU、CPU、存储、数据中心、大模型、推理算力。 但大脑建好之后,AI 不能永远只停留在屏幕里写代码、画图、聊天。 大模型是 AI 的大脑,机器人是 AI 的身体。大脑负责思考,身体负责行动。 只有当 AI 拥有了身体,它才能真正走进工厂、仓库、医院、家庭,去搬运、分拣、装配、护理、清洁,最终在真实世界里创造价值。 Biteye 按照人形机器人的组成部分,系统梳理了美股机器人及供应链核心标的👇 🔹 感知系统 这部分负责让机器人看到世界。它通过视觉、深度、触觉等传感器,把真实世界转化为数字信息,让机器人能够识别物体、理解环境并进行空间定位,是机器人理解外部世界的第一步。 $CGNX Cognex | ~$8B+ | 工业机器视觉龙头,工厂自动检测与识别系统 $KEYS Keysight | ~$30B+ | 测试测量系统,机器人电子系统验证基础设施 $TDY Teledyne Technologies | ~$25B+ | 高端工业相机+LiDAR+传感器系统 $ON onsemi | ~$25B+ | 自动驾驶+机器人图像传感器核心供应商 $NOVT Novanta | $5.61B | 做机器人力/力矩传感器,在人形机器人和工业机器人里很重要。 $AMBA Ambarella | ~$4B+ | AI视觉芯片,用于机器人/无人机/安防识别 $VPG Vishay Precision Group | ~$1.7B | 精密力学传感器公司,应变计和力传感器可用于人形机器人灵巧手、关节力控与高精度抓取,是 Optimus 供应链弹性标的之一。 $VLN Valens Semiconductor | ~$200M+ | 高速信号传输芯片公司,提供低延迟视觉数据传输方案,可用于机器人多摄像头、自动驾驶和端侧计算系统。 🔹 执行系统 执行系统相当于机器人的肌肉和关节,负责把计算系统发出的指令转化为真实动作。无论是行走、转身、抓取、搬运,还是保持平衡,都依赖电机、减速器、液压/气动系统和精密传动部件来完成。 $PH Parker Hannifin | ~$120B+ | 运动控制+液压系统,机器人核心驱动与执行器 $IR Ingersoll Rand | ~$32B+ | 工业压缩机+自动化气动系统 $FTV Fortive | ~$18B+ | 工业精密工具+自动化设备系统 $RRX Regal Rexnord | ~$14B+ | 电机+传动系统,工业机器人动力核心 🔹 计算与控制 计算与控制相当于机器人的“大脑 + 小脑”,负责处理感知数据、理解环境、规划路径,并把AI决策转化成稳定动作。它决定机器人反应快不快、动作准不准、能不能在复杂环境中自主运行。 $NVDA Nvidia | ~$3.0T+ | AI GPU + Jetson边缘计算平台,机器人算力绝对核心 $MSFT Microsoft | ~$3.2T+ | Azure + Copilot + AI基础设施,提供机器人云端大脑与开发平台 $GOOGL Alphabet | ~$2.0T+ | DeepMind + Waymo,布局自动驾驶与机器人AI系统 $AMD AMD | ~$880B+ | GPU/CPU替代方案,提供机器人边缘与训练算力 🔹 能源系统 能源系统决定机器人能运行多久、功率能有多强,包括电池技术、电源管理和充电系统,是机器人能否规模化落地的关键限制条件。 $ADI Analog Devices | $203.57B | 模拟芯片、电源管理、传感和工业控制巨头,机器人底层硬件核心。 $HON Honeywell | $144.11B | 电源管理+工业能源系统 $MPWR Monolithic Power Systems | $76.83B | 电源管理芯片龙头,广泛应用于机器人、AI服务器和汽车电子。 $VICR Vicor | $14.40B | 做高效率电源模块,将电池电压转换成不同部件用电,适合机器人能源系统。 $AMPX Amprius Technologies | $2.43B | 硅负极高能量密度锂电池,已切入无人机与机器人市场 $BLNK Blink Charging | $85.63M | EV充电基础设施公司,探索机器人与物流设备充电场景 🔹 基础软件 基础软件是人形机器人真正的“智能底座”,决定机器人不是简单重复动作,而是能够理解任务、学习环境并不断优化行为。 在人形机器人训练中,软件的重要性甚至高于单一硬件。机器人需要先在仿真环境中学习走路、抓取、避障和执行任务,再通过真实世界数据不断修正模型。 $MSFT Microsoft | ~$3.2T+ | Azure AI + Copilot 生态,机器人云端大脑与企业AI开发平台。 $NVDA Nvidia | ~$3.0T+ | Isaac Sim + Jetson + GPU 算力平台,机器人仿真训练和AI推理基础设施。 $TSLA Tesla | ~$1.3T+ | FSD + Optimus 数据闭环,端到端机器人策略模型代表。 🔹 人形机器人 在人形机器人方向,本体公司的目标是让机器人像人一样在复杂环境中完成通用任务;在工业和协作机器人方向,则更强调稳定性、效率和规模化部署。因此,这一层通常也是机器人产业链中最接近终端需求、最容易形成品牌和估值叙事的部分。 $TSLA Tesla | ~$1.3T+ | Optimus 人形机器人 + FSD 自动驾驶统一系统,代表“AI大脑 + 机器人本体 + 数据闭环”的一体化路线。 $HON Honeywell | ~$140B+ | 工业自动化、航空自动化与物流自动化解决方案商,更多偏机器人系统集成与场景落地。 $ABB ABB | ~$100B+ | 全球工业机器人和自动化龙头,产品覆盖机械臂、控制系统、产线自动化,是成熟工业机器人代表。 $TER Teradyne | ~$24B+ | 通过 Universal Robots 和 MiR 布局协作机器人与自主移动机器人,是工业协作机器人平台型公司。 $CCXI Churchill Capital Corp XI / Agility Robotics | 拟合并估值约 $2.5B | Agility 是美国人形机器人公司,核心产品 Digit 主攻物流、仓储和制造场景。 目前 Agility Robotics 正通过与 SPAC 公司 Churchill Capital Corp XI 合并上市,交易完成后预计更名为 Agility,并使用新 ticker $AGLT。 🌟写在最后 机器人产业链的投资逻辑,其实和半导体周期很像。 早期阶段,很难判断谁会成为最终赢家,但产业链上每一层都会先跑出阶段性机会:感知、执行、能源、控制、本体,都会随着行业关注度提升被重新定价。 今天优必选超仿生机器人刷屏,就是一个很明显的信号:机器人正在从实验室、发布会,开始走进大众视野。根据公开报道,优必选在 6 月 30 日发布会上表示,“优世界 U1”系列全渠道订单已突破 1 万台,并计划今年交付。 当然,这不代表机器人马上就会全面商业化。短期看,它更像一个从“概念展示”走向“真实订单”的拐点。真正值得关注的,是订单能不能持续、成本能不能下降、供应链能不能跟上。 对普通投资者来说,与其现在就押注谁是“人形机器人界的英伟达”,不如把机器人当成一条完整产业链来研究:感知、执行、能源、本体,每一层都选出核心公司,用组合方式分散单一标的不确定性。 Robotics is next 这句话大概率是对的。但节奏不会一蹴而就,真正的机会,可能藏在每一台机器人都绕不开的核心供应链里。
显示更多
0
6
75
25
转发到社区
长鑫存储扩产的设备供应链全景 长鑫现在合肥两座、北京一座,三座12英寸厂。合肥一厂11万片月产能,二厂8万片,北京厂7万片,加起来接近30万片,全部满产。两年涨了三倍,2024年初差不多10万片,2025年底冲到28到30万,2026年目标稳在30万。按晶圆片数算全球DRAM占比已经接近15%,但按销售额算只有3.97%,片数堆上来了,单价还在追赶。 工艺端,G4在16纳米已经量产,DDR5良率从2024年底的80%升到现在的90%区间。G5对应15纳米,2026年底量产。HBM2去年下半年就上了,比外界预期提前两年,主要供华为昇腾910。HBM3的前段晶圆产能主要在合肥和北京现有基地内部腾出来,目标月产6万片,约占30万片总产能的20%。后段的堆叠和封装由上海新建的HBM封测厂承接,2026年底投产。 产能还在继续扩。上海新厂分两期,Phase 1产能10万片,2027年初量产,Phase 2同样10万片,2028年初量产。加上现有的30万片,远期产能目标是奔着50万片以上去的。华为也在建一条10万片规模的产线,专门配合长鑫做昇腾系列所需的HBM3和LPDDR5X,2026年下半年开始全面量产。 IPO募资295亿,DRAM技术升级拿了130亿,量产线升级75亿,前瞻技术研发90亿。多家券商纪要提到其中约200亿会直接变成设备采购订单,叠加2024年712亿的存量Capex节奏,是国产设备厂未来两年最确定的基本盘。 长鑫正在进行的大规模扩产,设备采购需求非常可观。每个品类的国产化进展差异很大。 光刻是最大的对外依赖,国产化率连5%都不到。主力机器是ASML的NXT:1980Di,每小时出275片,覆盖到16纳米节点,目前还能正常采购。被荷兰管制的是NXT:2050i及以上,每小时295片,2023年9月起要许可证,2024年1月起对华许可基本停发。修正一个流传很广的说法,275到295片是1980Di到2050i的代际跳变,不是1980系列内部的迭代。长鑫往15纳米以下走,这道墙绕不开。上海微电子的28/14纳米DUV还在攻关,光刻这一环短期无解。 刻蚀占设备投资25到30%,是国产化最深的核心工艺。北方华创的ICP在长鑫产线上市占超过50%,中微的CCP介质刻蚀机做到50比1以上深宽比,专门用于HBM的TSV深硅通孔。但存储节点100比1深宽比的极端工艺,孔洞必须互相平行规整,任何偏差直接砸良率,Lam和东京电子在这个区间仍然是主力。 薄膜沉积占约25%,品类分得细。PECVD做绝缘层,PVD做金属互连,ALD做电容器的高k介电层。拓荆科技的PECVD已经批量进入长鑫DDR5和LPDDR5产线,北方华创的PVD覆盖铝铜溅射和氮化钛溅射。但DRAM电容器核心的高k ALD设备,应用材料和ASM的位置很难动,拓荆的ALD在验证爬坡中还没有大规模上量。整体看PECVD和PVD的国产化率高一些,ALD最低。 CMP只占设备投资5到7%。华海清科占国产CMP装备销售90%以上份额,12英寸Universal-300已经导入长鑫。新变量是中微4月29日刚过会的收购杭州众硅,6抛光盘架构是国际首创,效率比主流4盘方案高一截。国产CMP从单点供应正式进入双供。 清洗国产化率30到40%,盛美上海的SAPS/TEBO兆声波清洗覆盖FinFET和DRAM的16到19纳米制程。热处理40到50%,北方华创立式氧化炉打头,激光退火端莱普科技两年内国内市占从3%涨到16%,跟长鑫和长存共同开发匹配DRAM工艺的设备。这几个环节已经跑通了。 最薄弱的三个环节是量测检测、涂胶显影和离子注入。量检测国产化率个位数,KLA全球占51到54%,精测电子进了长鑫12英寸产线,中科飞测也在部分环节往里切,但高端光学检测和电子束检测差距仍然明显。涂胶显影国产化率仅4%,东京电子在大陆市占超过90%,芯源微是唯一量产替代,目前只在封装端站住了,前道关键层还进不去。离子注入同样个位数,万业凯世通累计交付40多台。弹性最大的三个环节,也是短期内最动不了的三个环节。 长存三期产线2026年一季度国产设备占比首次过50%,目标100%。长鑫设备国产化率已突破45%,但仍低于长存三期产线的水平。根源在工艺。DRAM的电容刻蚀和光刻精度对先进DUV的依赖远高于3D NAND。NAND可以靠堆层数绕过光刻瓶颈,DRAM要正面硬刚,结构性差异,跟意愿无关。 外部约束在收紧。4月22日美国众议院外交事务委员会投票通过了MATCH法案,路透社称之为"国会史上最大规模的半导体出口管制立法审议"。法案把长鑫、中芯国际、长江存储、华为、华虹一起列入covered facility,禁止ASML的DUV浸没式光刻机对长鑫出口,禁止盟国为既有设备提供维保,要求荷兰和日本在150天内对齐美方规则。主要推手是美光。一旦通过,NXT:1980Di这条最后的灰色通道就堵死了。长鑫本身还没进BIS实体清单,但设备进口其实早就在2022年10月那波18纳米以下DRAM工艺限制的笼子里。 45%的国产化率意味着长鑫在两条腿走路,海外设备保良率,国产设备保供应链安全。MATCH法案的压力反而在加速这个进程。长鑫每往国产设备多切一个百分点,对应的就是北方华创、中微、拓荆、华海清科、盛美这些公司实打实的订单增量。上海新厂分两期共20万片的增量产能,加上现有产线的持续技术升级,未来两到三年国产设备厂面对的是一个确定性极高的需求窗口。 从更长的时间尺度看,长鑫的扩产不只是一家公司的资本开支计划。它每走通一个工艺节点,整条12英寸国产设备平台就多一次被验证、被复用的机会。刻蚀和CMP已经证明了这条路径,薄膜沉积和清洗正在跟进,量测和涂胶显影是下一个要啃的硬骨头。这个验证循环一旦转起来,国产设备的竞争力会以远超线性的速度积累。
显示更多
0
187
2.2K
533
转发到社区
很多粉絲私訊什麼時候開放約會 其實我頻道裡面都有提示 你們是不是都沒有追蹤😠 趕快追蹤下列 不定時都有小驚喜(๑¯ω¯๑) - 𝗶𝗻𝘀:𝗷𝗼𝗹𝗶𝗲𝗯𝗮𝗼_𝗼𝟭𝟮𝟱 脆:𝗷𝗼𝗹𝗶𝗲_𝗼𝟭𝟮𝟱 粉絲福利入口
显示更多
0
5
378
67
转发到社区
橘爱里 [𝐀𝐢𝐫𝐢 𝐓𝐚𝐜𝐡𝐢𝐛𝐚𝐧𝐚] 在洗体美容店被操的超级辣妹 [𝑺𝒖𝒑𝒆𝒓 𝑮𝒂𝒍 𝑮𝒆𝒕𝒔 𝑺𝒄𝒓𝒆𝒘𝒆𝒅 𝒂𝒕 𝒂 𝑩𝒐𝒅𝒚 𝑾𝒂𝒔𝒉 𝑺𝒂𝒍𝒐𝒏] 1/3
显示更多
0
1
35
24
转发到社区
Yangyi's Patreon May's Tier1 is i 2B\( ^▽^ )/ In this reincarnation, we will chant the words of prayer. Give you my ass~~ 楊衣的Patreon 5 月份等級1 是2B\( ^▽^ )/ 在這輪迴中,我們會詠唱著祈禱的話語 #尼爾# #2B# Yangyi patreon :
显示更多
0
0
228
13
转发到社区
存储需求恐怕又要因为seedance2的出现指数级暴增. gpt3.5带来了文本时代,真正的视频时代,是seedance2带来的. 同样是几个提示词,视频ai消耗的存储将达到几百m,随着ai视频制作时长的增加这个体积还会更大. 这次衍生的存储需求会是原来文本的很多倍. 毕竟现在刷视频成瘾的群体是真多, 全球范围内从婴幼儿到老头老太太谁都逃不过,他们可能不爱看书不爱看新闻但绝对爱刷短视频. 基于此,又会产生新的投资需求. 视频ai需要的存储类型跟文本ai肯定有差异. gemini给出的现阶段抖音与yputobe采用的存储架构实录. 目前的视频存储并非单一介质,而是复杂的多级冷热分层架构 (Tiered Storage Architecture)。 A. 架构组成 1. 极热层 (Ultra-Hot Tier):用于应对瞬时爆发的流量(如顶流网红刚发布的视频)。 • 类型:NVMe SSD 集群 + 内存级缓存(Redis/Memcached)。 • 核心指标:**IOPS(每秒输入输出操作数)**和极低的延迟。 2. 热/温层 (Warm Tier):用于存放日常活跃观看的视频。 • 类型:高性能企业级机械硬盘 (HDD) 或大容量 QLC SSD。 • 核心指标:吞吐量 (Throughput) 与成本的平衡。 3. 冷层 (Cold/Archive Tier):用于存放数年前、几乎无人问津的长尾视频。 • 类型:高密度氦气硬盘 (HDD) 甚至物理隔离的磁带机。 • 核心指标:每 TB 持有成本 (TCO)。 B. 痛点:I/O 墙与存储孤岛 传统架构下,存储是“静态”的。但 AI 视频时代(SeenDance 2)要求存储从“仓库”变成“流水线”,这直接导致了存储逻辑的崩溃。 根据以上视频公司存储的现状与困境可以延伸出其三个未来发展方向. 视频 AI 存储的三个未来发展方向 1.方向一:从 HDD 到全闪存化 (All-Flash Data Center) AI 视频训练需要并行读取海量高清素材。传统 HDD 的寻道时间太慢,会拖累昂贵的 GPU 算力。全闪存阵列 (AFA) 将从“奢侈品”变成视频公司的“基础设施”。 2.方向二:CXL 技术下的“内存-存储”融合 Compute Express Link (CXL) 协议将打破内存和 SSD 的界限。对于 SeenDance 2 这种需要处理实时动作对齐的模型,数据在 SSD 和 HBM 之间的搬运速度决定了生成的流畅度。 3.方向三:近存计算 (Computational Storage) 与其把巨大的视频数据搬到 CPU 处理,不如直接在存储主控芯片上进行初步的数据预处理(如视频抽帧、格式转换). 基于以上及图片参数对存储公司作核心竞争力与趋势分析排序评级. SK海力士(S级): 凭借 Solidigm 的 QLC 容量优势和 HBM 的统治地位,卡死了“大容量读取”和“算力吞吐”两个核心环节。视频 AI 训练集的 EB 级存储首选。 三星Samsung (A+级): 读写最均衡。其 PCIe 5.0 写入速度冠绝群雄,是 SeenDance 2 生成 4K/8K 视频流时最佳的“高速缓冲区”。 闪迪SanDisk (A级): 独立后的黑马。其 HBF(高带宽闪存) 旨在打破内存墙,让 SSD 直接参与 AI 推理,极大利好 64G 内存(如你的 M4 Pro)在本地处理大模型视频生成。 美光Micron (A级): 写入寿命与能效比极高,适合 24/7 不间断生成视频的云工厂。 • WDC (B+级): 专注于 CXL 协议,解决数据中心内内存与存储的动态调配问题。
显示更多
0
28
292
55
转发到社区
一台 25GB 内存的普通电脑,跑起了 744B 的 GLM-5.2。 之前我们聊过 GLM-5.2 的 1M 上下文、聊过它对 AI 定价逻辑的冲击。今天聊一个更极端的问题:这个 744B 的庞然大物,最低能在什么样的机器上跑起来? GitHub 上一个叫 colibrì(蜂鸟)的项目给出了答案:约 25GB 内存的消费级机器。不用 GPU,不用 Python,整个引擎是一个约 2400 行的 C 文件,零依赖。 它的思路利用了 MoE 架构的本质: 744B 参数里,每个 token 真正激活的只有约 40B,其中逐 token 变化的路由专家只有约 11GB。于是—— 1️⃣ 稠密部分(注意力、共享专家)int4 量化后约 9.9GB,常驻内存 2️⃣ 21,504 个路由专家(约 370GB)放在硬盘上,按需流式读取 代价是什么?作者在 README 里写得异常坦诚:冷启动每个 token 要从磁盘读约 11GB,速度只有 0.05–0.1 token/秒。翻一句话可能要几分钟。 "This is not fast."——但它证明了一件事:跑通一个 744B 前沿模型,不一定需要机房,一台“比一个 H100 风扇还便宜”的机器就够了。 大模型的门槛,正在被各种意想不到的方式拆掉。 🔗:
显示更多
和Quant Alex @StochAlex07 讨论: SABR Theta与Spot Theta+Vol Theta+Cross Theta的异同与应用,以及SABR模型自洽性分析。 **English Summary of the Chat** **SABR Theta vs Spot Theta + Vol Theta + Cross Theta** The conversation between **Alex Wu** (white bubbles) and **Jeff Liang** (green bubbles) is a technical discussion focused on **SABR Theta versus Total Theta** (i.e., Spot Theta + Cross Theta + Vol Theta), model self-consistency, PDE residual, and the correct definition of SABR Greeks. ### Key Points Discussed: 1. **SABR Gamma = Spot Gamma** (first major question, raised by Jeff) Jeff asked whether SABR Gamma (\(\partial^2 P / \partial F^2\)) is identical to Spot Gamma and whether it includes the dependence of \(\sigma_B\) on \(F\). He also provided the full chain-rule expansion of SABR Gamma in terms of Black-76 Greeks. Alex confirmed the understanding and **later affirmed in code** that this is exactly how SABR Gamma is implemented in their system. 2. **SABR Theta vs Total Theta and Model Self-Consistency** (main topic, led by Jeff) Jeff shared a clear 3-point understanding: - SABR Theta is computed directly via the SABR approximation formula to obtain \(\sigma_B\), then applying the Black-76 chain rule: \(\partial P/\partial t =\) BS_Theta(\(\sigma_B\)) + BS_Vega \(\cdot \partial\sigma_B/\partial t\). - Total Theta is the exact decomposition from the SABR PDE (Spot Theta + Cross Theta + Vol Theta). - When the model is **fully self-consistent** (Residual = \(\partial P/\partial t + \mathcal{L}P = 0\)), SABR Theta = Total Theta; otherwise the difference is the unexplained PnL caused by the approximation error in the Hagan formula (especially pronounced in long-dated, high vol-of-vol, or high-skew options). 3. **Practical Implication – Theta Decomposition Decision** (comment by Alex) Alex noted that whether to perform Theta decomposition depends on the risk-management approach: - Without decomposition → use SABR Gamma vs. dP/dt. - With decomposition → SABR Gamma maps to Spot Theta, Vanna to Cross Theta, and Volga to Vol Theta. **Overall Tone**: The discussion is highly technical and collaborative. Jeff drives the conversation by asking clarifying questions and presenting a well-structured 3-point summary of his recent study. Alex provides confirmations, practical insights, and code-level validation. Both participants demonstrate a strong command of SABR model nuances, particularly the relationship between approximation error, PDE residual, and real-world risk management.
显示更多
吴说获悉,国际清算银行(BIS)发布 Working Paper 1374,提出利用 XRP Ledger(XRPL)验证官方统计数据来源和完整性的方案。该方法为 SDMX 数据集生成加密指纹,并将批量数据的摘要值写入 XRPL,原始数据本身不上链;用户可结合数字签名凭证和一次链上查询,确认数据发布者身份以及数据是否被篡改。原型测试显示,数据发布耗时约 3–5 秒,验证约 1–2 秒。论文强调,该系统目前仍为概念验证,并非正式生产部署。
显示更多