註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Google地圖
Google地圖 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Google地圖 的搜尋結果
📢 繪師攤主募集!Taiwan-Hot Doujin Market / TWDM01 台灣熱同人市集 mini 正式籌備中! 📢 繪師攤主報名連結: - TWDM簡介: 這會是一場以同人繪師為主軸、約20個攤位的小型市集 我們打造全新空間,不再是臨時租借的場地,而是真正屬於台灣熱專屬環境 不想再忍受大型活動人擠人的混亂? 在這裡,可以用更舒適、更放鬆的節奏更舒適、更自在地與同好交流 從TWHC開始,我們就一直想把「舒適」跟「品質」放在活動的最優先,即使過去活動以互動場為主,也從未停止邀請優秀繪師。 三年後的現在,全新空間終於落成,我們終於能親手準備一場真正以繪師為核心、也讓訪客更自在的市集 想好好欣賞作品、跟喜歡的繪師交流、買到心儀的周邊,卻又不想在人潮中消耗體力? 2026/11/21+22 13:00-19:00 歡迎大家來當第一批體驗新空間的訪客 也歡迎各位繪師一起加入,把作品帶到更自在的舞台! 活動地點: 台灣熱攝影棚3號 新北市土城區中央路一段33號2樓 (偉特磁磚樓上) 詳細google地圖: - 特別感謝視覺插圖: 麒麟 @HappyUnicorn70 蛞蝓肉舍 @Vincent13946559 Surio蘇大 @suriololi 風船貓 (FB maomaoe)
顯示更多
【2026台北漫博】 #親簽套組# 購買注意事項❗ 需從地圖指示之【同人區入口處】進入攤位內後,至櫃檯購買結帳。 無法從開放式動漫周邊區排隊結帳購買❗ 【2026 #漫畫博覽會# 】 日期:7.23(四) - 7.27(一) 地點:世貿一館 結賬方式:現金、刷卡、文化幣、LINE Pay、Apple Pay、Google Pay
顯示更多
📊 Bitget UEX 日報|2026 年 7 月 21 日 市場快照 加密總市值:約 2.31 兆美元(+1.4%) BTC:65,500 美元(+1.41%)|ETH:1,915 美元(+2.33%) 美股:道瓊 -0.59%(51,839 點)|標普 500 -0.19%(7,443 點)|那斯達克 -0.05%(25,508 點) 大宗商品:黃金 4,023 美元/盎司(+0.46%)|WTI 原油 82 美元/桶(-0.45%)|美元指數 100.96(近持平) 📈 關鍵價位 BTC 清算地圖: 下方多頭清算壓力已明顯減少,下行風險有所緩解。 上方 66,000–68,000 美元 為空頭清算密集區,若突破,可能引發空頭回補,推動行情續漲。 🔥 市場熱點 地緣政治: 川普表示伊朗將為美軍傷亡付出代價,伊朗則回應停火調解提議。布蘭特原油一度突破 90 美元 後回落,地緣風險持續支撐能源價格。 貿易政策: 川普宣布對加拿大部分商品加徵 50% 關稅(30 天後生效),市場擔憂供應鏈成本上升,避險需求升溫。 科技/AI: 本週 Google、Tesla、IBM、Intel 財報登場,市場聚焦 AI 投資回報。半導體與記憶體族群反彈,美光、Credo 等走強,AI 伺服器與資料中心需求持續受到關注。 🏛️ 機構觀點 BTC 現貨 ETF 已連續 5 日淨流入(昨日約 1.32 億美元),顯示機構資金持續回流。 AI 帶動半導體與記憶體供應仍吃緊,市場關注財報是否再次驗證 AI 資本支出成長。 整體維持審慎樂觀,短期留意財報季、政策消息及資金流向帶來的波動。 🔗 來源:
顯示更多
老黄点名了下一个将达到万亿美金市值的公司,相比这个Murphy(MRVL的CEO)今天演讲以及他与来黄的对话更值得一看。Murphy用近一个小时的时间,系统阐述Marvell如何押注数据基础设施、为什么光互联将成为AI时代的关键技术,以及这场从铜缆到光纤的转型将如何重塑整个数据中心架构,看完murphy的演讲,相信能对光互联的技术演化有更深的理解和认识,梳理下Murphy的演讲要点: 1、十年豪赌:如何成为数据中心之王 Murphy演讲从一段自我剖白开始。2014年加入Marvell 时,这家公司60%的收入来自消费电子市场,数据中心业务占比不到10%。也正是在那个时刻,他做出了一个大胆的判断——半导体行业的下一个增长周期,将由 Google、Amazon、Microsoft、Meta 等平台公司驱动,核心需求是“以大规模移动、存储、处理和保护数据的半导体技术”。 这个判断在当时并不被广泛认可。“数据基础设施”甚至还不是一个被行业承认的市场类别,只是 Marvell 用来描述未来愿景的内部术语。但 Murphy 和他的团队展现了惊人的执行力:通过一系列精准的并购和剥离,Marvell 在十年间投入了约285亿美元(225亿美元收购+60亿美元内部研发-40亿美元资产剥离),系统性地构建了从毫米到千公里、覆盖 AI 基础设施全栈的连接技术平台。 这些并购包括2018年收购 Cavium 强化计算和网络能力;2019年收购 Avera 建立定制芯片业务、收购 Aquantia 增强连接产品组合; 2021年以100亿美元收购 Inphi 获得世界级数据中心连接技术; 以及最近12个月内收购 Celestica AI 的光子结构技术和 Xcon 的 scale-up 交换能力。 结果是惊人的:Marvell 从2014年的25亿美元营收增长到2026财年预计的110亿美元,最近几年增速更是达到每年40%。根据上周财报电话会议后的华尔街共识预期,2027财年 Marvell 营收将达到164亿美元。更关键的是,数据中心业务占比已从不到10%飙升至上季度的75%以上。 2、连接性:AI 基础设施的真正瓶颈 Murphy 在演讲中抛出了一个核心问题:什么定义了 AI 基础设施的性能?大多数人会想到处理器、GPU、制程节点(3nm、2nm 甚至未来的1.4nm、1.6nm),或者高带宽内存。这些当然重要,但 Murphy 指出,这些都不是系统的决定性特征。 “因为一个处理器,无论它有多快、连接了多少内存,对于今天的 AI 工作负载来说根本不够。你需要数万个、最终是数百万个处理器作为一个单一的大规模计算引擎协同工作。这就是为什么这种规模的计算从根本上是一个连接性挑战。”Murphy 说道,“而且越来越多地,正是连接性的架构和特性定义了系统的性能。” 这个判断得到了英伟达 CEO 黄仁勋的呼应。在 Murphy 邀请下登台的黄仁勋强调,AI Agent 的计算模式是“分解和分布式的”(disaggregated and distributed)——当你把一个计算问题分解成许多部分,并分布到整个数据中心时,连接性就成为必需品。“我们分解和分布式计算,使其运行在这些巨大的集群上,这样我们就能聚合总计算量、总内存和总带宽。而使这一切成为可能的,就是连接性。”黄仁勋说,“这就是为什么 Matt 做得这么好,为什么 Marvell 如此关键。” Murphy 进一步解释了连接性瓶颈的演变逻辑:过去几年,AI 基础设施先后解决了计算瓶颈(英伟达引领的 GPU 革命)和内存瓶颈(HBM 高带宽内存的规模化),现在瓶颈正在再次转移。“现在是连接性将定义基础设施的极限,就像计算和内存一样。”他引用了与最大客户的对话:“世界上最大的超大规模云服务商现在正在重新构想他们的整个网络架构。他们认识到,扩展 AI 基础设施现在首先是一个连接性挑战。” 随着推理模型、专家混合架构(mixture of experts)、生成式 AI 的持续演进,更多数据必须在基础设施中移动,需要更高的带宽和更低的延迟。当工作负载不再适合单个数据中心时,就需要建设更大的数据中心或整个数据中心园区,以及它们之间的所有高速连接。“因此,连接性成为扩展计算的关键推动力,我们的客户越来越认识到光学是前进的方向。”Murphy 说。 3、从千公里到毫米:Marvell 的全栈连接布局 Murphy 用一张图展示了 AI 基础设施跨越的所有距离——从数据中心之间的数百甚至上千公里,到封装内部的毫米级距离。每一个距离都需要不同的解决方案、不同的技术、不同的工程团队,甚至不同的供应链。“这些不是同一问题的变体,而是根本不同的工程挑战。” 1)跨数据中心连接(数百至上千公里) 这需要非常专门的相干调制(coherent modulation)技术,核心是专用的数字信号处理器(DSP)。Marvell 是全球少数几家能够构建这种相干 DSP 的公司之一,已经领导了从100Gbps 到400Gbps 再到800Gbps 的代际演进。Murphy 在现场展示了一个相干光模块实物——这是一个极其复杂的工程产品,包含了 Marvell 最复杂的先进制程 CMOS DSP 芯片、第四代硅光子技术(已量产十年),以及用硅锗工艺设计的自研宽带模拟组件。“今年晚些时候,我们将采样世界上首个1Tbit、2nm 制程的相干光学解决方案。”Murphy 宣布。 2)数据中心内部连接(数百米) 数据中心内部包含成排的计算服务器,每个机架顶部通常有一个交换机,机架级交换机连接到脊柱和核心交换机,通过光纤电缆形成整个数据中心的网络结构。这部分使用的是更节能的 PAM4调制技术。Marvell 构建了业界领先的 PAM4 DSP 解决方案,以及高速模拟组件(包括跨阻放大器 TIA 和激光驱动器),并引领了从25Gbps、100Gbps、200Gbps、400Gbps 到800Gbps 的每一次重大转型。去年,Marvell 开始量产业界领先的1.6Tbps PAM4解决方案。在以太网交换方面,Marvell 拥有从51.2Tbps 到51.2Tbps 的完整产品组合,并在 ComputeX 当天宣布了专为 AI 数据中心设计的新一代102.4Tbps 以太网交换机,具有业界最低功耗。 3、机架内部连接 目标是以全互联(any-to-any)配置连接尽可能多的处理器——每个处理器都能直接与其他每个处理器通信。英伟达的 NVLink 72(因机架内连接72个 GPU 而得名)首次将这种架构推向市场。这需要完全不同的交换类别,以及通过机架内铜背板驱动超高速信号的能力。“今天,这不是光学的领域,这是铜的领域。”Murphy 说。核心差异化因素是电气 SerDes 技术而非光学。Marvell 拥有目前领先的200Gbps 电气 SerDes,并已在过去几年中演示了面向未来的400Gbps 技术,这些 SerDes 被集成到客户的定制芯片、XPU 以及 Marvell 自己的 scale-up 交换机中。 4)封装内部连接(毫米级) 当今最先进的芯片内部有多个 chiplet,2.5D 或3D 封装本质上是一种连接技术,允许这些 chiplet 在封装内非常靠近地放置,并通过超高速短距离 die-to-die 接口通信。Marvell 拥有领先的 die-to-die SerDes 和先进封装能力,使客户能够构建业界最复杂、最独特的多 die 芯片。 Murphy 强调,拥有所有这些能力“在一个屋檐下”是不寻常的、独特的。“当我们去竞争时,通常在每个类别中我们面对的是不同的竞争对手。但这就是我们的独特之处——我们是一站式商店,是整个连接堆栈的领导者。” 4、铜墙将移:光互联的物理必然性 Murphy 演讲的核心洞察集中在一个概念上:铜墙(Copper Wall)。他用一张图清晰地展示了当前 AI 基础设施中的连接分界线——左侧是光学连接(使用光纤电缆传输光信号,两端有复杂的电子设备驱动和调制激光),右侧是电气连接(使用铜缆、PCB 上印刷的铜走线,或封装内部的微观铜布线)。中间是“铜墙”,定义了信号在必须转向光学连接之前可以通过铜传输的最长距离。 “这是一个重要的区别,因为铜很简单、成本低,正如 Jensen 所说,你想尽可能长时间地使用它,这非常实用。但光学更复杂,需要激光器、光子学、复杂的电子设备。”Murphy 说,“而铜墙,我今天要告诉你们的是,它即将移动。它将再次移动,并将接管机架本身。这正在为光学行业创造需求的爆炸式增长。” 这不是偏好问题,而是物理定律。信号通过铜缆传输的距离与带宽成反比——每次带宽翻倍,距离就必须减半。Murphy 给出了具体数据:当今世界上最高速的生产系统运行在每通道200Gbps。在这个带宽下,电缆长度限制在大约1.5米。相比之下,100Gbps 系统可以使用约3米的电缆。而机架的高度约为2米,考虑到机架内部的所有布线,2.5米正好是极限。“所以当我们转向1.6Tbps 时,我们不能再用铜完全连接机架了。墙正在移动,而且是现在。” Murphy 强调,这不是遥远的未来:“今后,即使是机架内的连接也将变成光学的。整个行业都知道这一点即将到来,所以我们一直在为这一刻做准备——不仅仅是 Marvell,而是整个行业。你可以在台湾看到这一点,在供应链和正在发生的产能爬坡中。” 铜墙每向右移动一步,连接数量至少增加一个数量级。“这正在创造我提到的需求爆炸,光学供应链需要大规模扩展并做好准备。”Murphy 回顾了20年前的类似转型:当时数据中心内部的最先进技术是10Gbps,整个数据中心都使用铜缆,光学基本上只是电信技术,保留用于非常长的距离。但当墙移动时,光学行业迎接了挑战,今天世界上所有的超大规模数据中心都是光学连接的。这次转型催生了新的解决方案——针对数据中心内部优化的 PAM4技术,而 Marvell 是那里的关键创新者之一。 5、CPO:光互联的下一个前沿 当光学进入机架内部时,需要的新技术叫做共封装光学(Co-Packaged Optics, CPO)。Murphy 花了相当篇幅详细阐述这一技术:“CPO 是一种将光学连接一直带到封装本身、紧邻计算的技术,无论是定制计算还是交换芯片。” CPO 要解决的根本挑战是密度和功耗。机架内的连接数量是机架之间连接数量的10倍。“如果我们只是尝试使用数据中心机架间使用的相同光学技术,你不会有足够的功率,不会有足够的物理空间,无法容纳所有这些标准光学模块和电缆——这根本行不通,不可能。”Murphy 解释道。 CPO 的概念是将光纤直接带到封装,将驱动光纤信号的电子设备与定制计算或交换芯片紧密耦合。“这是一个巨大的变化,而且很难,因为你要结合芯片行业中一些最先进的技术:领先制程 CMOS、硅光子学、先进封装、光互连,所有这些都在一个小型紧密集成的系统中制造。复杂性非常高,但这是继续扩展带宽并克服我谈到的铜限制同时降低功耗的唯一方法。” Murphy 强调这不是未来主义的东西,而是正在发生的现实。他在现场进行了实物展示:一边是传统的以太网交换机——当天宣布的102.4Tbps Teralink 交换机,可以看到板中央的交换芯片,PCB 内部的铜走线将信号传输到前面板,所有光学模块都插在那里。另一边是基于 CPO 的交换机——封装中央仍然是交换芯片(51.2Tbps 交换机),但边缘周围是16个3.2Tbps 光学引擎。“16乘以3.2,你得到51.2Tbps。所以光纤现在直接连接到这些引擎,而不是前面板。我们完全消除了 PCB 上的铜走线。光直接从封装中出来。这是一个非常非常复杂的工程作品。”Murphy 说。 Marvell 为 CPO 投入了十多年:硅光子学、光学 DSP、所有周围的模拟宽带组件,以及实现这一切所需的所有先进封装。“这一切实际上都需要在 CPO 中汇聚。”Murphy 说。 6、英伟达的背书与 NVLink Fusion 合作 Murphy 特别强调了与英伟达的战略合作扩展。几个月前宣布的合作中,英伟达向 Marvell 投资了10亿美元,双方正在扩展跨多个维度的合作,包括光学、光子学和 NVLink Fusion。黄仁勋亲自登台与 Murphy 对话,这本身就是一个强有力的信号。 黄仁勋详细解释了 NVLink Fusion 的战略意义:“有时候,也许云服务提供商想要设计自己的定制芯片。在我们之间,我们也在 NVLink Fusion 上合作,这使得你可以使用相同的系统架构,内部有 Marvell 的一些半定制芯片、大量互连、硅光子和光学技术。我们可以创建一个本质上分解、分布和异构的数据中心。” 关键是系统架构保持一致。“他们的网络技术可以利用大量英伟达的堆栈。CPU 可以是 Vera,但它可以利用大量你们的堆栈。所以 NVLink Fusion 是关于采用英伟达的技术和我们的平台、Marvell 的技术和平台,然后我们融合它。这就是为什么它被称为 fusion。”黄仁勋说。 Murphy 追问了铜到光学的转型时间表。黄仁勋的回答非常务实:“我们应该尽可能长时间地使用铜,但铜有其限制——带宽和距离的限制。所以最终正确的策略是:尽可能长时间地用铜进行 scale up。之后,用光学进一步 scale up,用光学 scale out,用光学跨越连接。所以你在必须的地方使用光学,在可以的地方使用铜。” 但黄仁勋随即给出了乐观的市场预测:“底线是,在未来五到十年,我们将使用大量的铜,也将使用大量大量的光学。这些数据中心现在是基础设施的一部分。我说 AI 现在有用、有用的 AI 已经到来的原因是,现在 AI 是有利可图的,token 是有利可图的。当 token 生产有利可图时,每个人都想制造更多 token,这就是为什么 Marvell 的需求如此之高,我们的需求也如此之高。因为每个人都想生产更多 token,因为它被 Agent 到处使用。” 7、无距离数据中心:光互联的终极愿景 Murphy 在演讲的最后部分描绘了一个激进的未来愿景:他当数据传输全部变成光学时,距离实际上不再重要。“这是一个深刻的变化。”说。 今天的服务器、机架和整体数据中心架构都是围绕距离的约束设计的,软件工作负载也围绕这些相同的约束进行了优化。但如果距离不再重要呢? 首先,scale-up 网络的规模可以从72个或144个 XPU/GPU 扩展到1000个或更多,全部光学互连。“对工作负载的影响是巨大的。今天,AI 工作负载必须分解成适合 scale-up 集群的更小子问题,因为在集群外部通信今天更慢、带宽低得多。但光学互连系统可以管理数量级更大的工作负载。” 其次,服务器本身可以被解构。现代 AI 服务器由一定数量的 CPU、XPU、内存和网络接口组成,它们都在同一系统上的原因是距离——CPU 和 XPU 需要以非常高的带宽访问内存,这意味着它们需要紧挨着坐在板上,铜走线作为它们之间的连接。“但在这些连接都是光学的未来,距离实际上不重要。你可以想象一个完全解构的架构——XPU 在一个系统中,内存在另一个系统中,巨大的 CPU 在另一个系统中。” 这解锁了另一种可能性:今天系统中 CPU 和 XPU/GPU 的比例是固定的,必须在系统构建和部署时定义。但没有两个工作负载需要完全相同的比例,这意味着在任何给定时间,计算或内存的某些部分可能未被充分利用——这要花钱。“但一旦我们将系统分解为独立的计算池和内存池,并且它们都是光学互连的,我们就可以动态组合专用系统,然后针对任何工作负载进行优化。” Murphy 的终极愿景是“全球光学互连的数据基础设施”:“我们今天拥有的这些系统中的刚性边界开始消失。计算现在可以被池化,内存可以被池化,基础设施可以大规模动态组合。架构师第一次可以开始围绕模型的需求设计 AI 系统,而不是围绕互连的限制。” 他将这个愿景命名为“无距离数据中心”(data center without distance):“计算、内存、网络和光子学作为一个统一系统运行,数据中心中的数百万资源可以像一台机器一样协同工作,一个由工作负载需求定义的架构,而不是连接性的限制。我们相信这是计算基础设施的下一个时代,Marvell 正在帮助构建使这一切成为可能的连接基础。” 最后再多说点, Marvell的核心竞争力集中在两个细分领域。 1、定制芯片(ASIC/XPU)设计。 Marvell与博通是全球两大定制AI加速器设计巨头。大厂自研芯片的趋势正在加速——比如微软的Maia 200推理芯片、亚马逊的Trainium系列,背后都有Marvell的参与。TrendForce的预测数据值得留意:2026年定制AI芯片销售增速预计为45%,而同期GPU的增速仅为16%。不是GPU不行,而是超大规模云厂商在推理端的成本压力正在推动它们加速自研定制方案。 2、数据中心互连产品线。 这是Marvell更深的一条护城河。根据其财报,光学互连产品收入保持两位数季度环比增长,数据中心交换机业务预计2027财年将突破5亿美元。Marvell过去十年通过一系列并购累计投入约360亿美元,围绕连接搭建了涵盖定制芯片、高速交换器、光模块、硅光子和先进封装的完整技术平台。
顯示更多
0
99
485
142
轉發到社區
连微软这种家里有矿、手握无限云资源的超级巨头,居然因为交不起电费,把内部用的 Claude Code 授权全给停了! 微软在内部正式取消了 Anthropic 旗下 Claude Code 的使用授权。 导致这一决策的核心原因并非工具本身的生产力输出问题,而是基于 Token 计费的实际算力消耗成本已超出这家科技巨头的财务承受极限。 几乎在同一时间,Uber 首席技术官(CTO)发布内部备忘录警告,公司在 2026 年前四个月便已将全年的 AI 专项预算耗尽。 受此宏观趋势影响,美国市场 AI 软件定价普遍反弹 20% 至 37%,而微软旗下的 GitHub 也正在全面废除固定费率(Flat-rate)订阅制,转向基于实际使用量(Usage-based)的阶梯式计费模型。 这一连锁反应宣告了“AI 行业亏本补贴时代”的正式终结。 长期以来,市场形成了一种盲目的技术乐观主义叙事,认为随着模型迭代,推理和 Token 成本会遵循某种超摩尔定律无限坍塌。 然而,真实的商业化数据和脑力劳动替代成本表明,当企业级客户试图将大语言模型(LLM)全面接入高频生产线时,边际成本非但没有递减,反而随着调用频次与上下文长度的激增呈现指数级暴涨。 图表清晰地展示了这种财务异动:在固定席位收入(Per-Seat Revenue)保持恒定的情况下,人均 Token 算力成本(Per-Token AI Compute Cost)的陡峭上扬,直接导致了企业利润空间的黑洞式坍塌(Profit Collapse)。 从宏观资本分发与估值模型的本质来看,这种 unit economics(单元经济模型)的恶化将一级市场的头部 AI 实验室(如 OpenAI、Anthropic、Google)推入了双输的零和博弈。 为了在 IPO 前夕维持数千亿美元的估值神话,实验室在过去六个月内通过各种机制变相拉高了实际客单价。 而这直接导致企业端客户在预算熔断后开始战略性收缩 AI 应用规模,进而阻断了 AI 厂商的营收增速。 如果实验室选择降价强补,则其自身的现金流失血速度将无法维持下一代超级集群的建设。 这种供给侧与需求侧的定价错配表明,算力红利时代的虚假繁荣已经见顶,行业即将迎来大规模的资产减值与心智重组。
顯示更多
0
41
125
24
轉發到社區
10岁的一个中国小男孩,还不能开银行账户,却已经靠一个Google Play上的AI预测小工具App狂赚了21万美元。 而他的学校还在教他怎么用Excel画柱状图。 那天晚上,他把两台显示器和一台老笔记本搬到客厅角落,默默敲击键盘,用ChatGPT花了一个晚上就把整个App从零搭好了。 屏幕只亮着冷白的代码光,键盘声像雨点一样密集,他全程一言不发,只有手指在飞。录屏直接发到Bilibili,标题就五个字:《一个晚上,我干完了》。 他太小了,自己没法上架——没有开发者账号、没有支付方式、也没有成年身份证。 最后是他爸帮他提交的。父亲一个字代码都没碰,只是儿子指到哪里,他就面无表情地签字、验证、上传。 App定价1.49美元,带实时AI预测模块。上架第一个月就爆赚1.2万美元,到第十个月,已经稳定每月进账2.1万美元以上。这还是他在写作业、踢球和被逼睡觉的空隙里跑的。 谷歌每年砸80万美元请高级工程师维护类似的企业级预测工具,这个10岁小孩一个晚上就全部搞定。 录屏视频直接冲到27万播放。他把App带到学校演示,老师当场看傻,校长亲自给他批了“科技创新特别奖”,还把截图放大贴在学校大厅最显眼的位置。 八个月后,有人给他爸发了一张截图。 那是一个链上钱包:1,347,920美元纯利润,67,400单自动化交易。 同一个15分钟定时器——当初用来控制AI预测刷新的,现在每15分钟就在Solana链上疯狂扫 meme币和套利机会。 一个33岁的迪拜量化交易员,把那个Bilibili录屏慢放到0.2倍速,把屏幕上每一行闪烁的代码全部逐帧抠下来,然后把定时器直接焊死到真实链上数据,每15分钟自动执行一次低吸高抛,干完就继续开他的超跑去吃早茶。 八个月后,这个钱包直接杀到134万美元。他在私人量化Discord群里甩出一张截图,只打了一行字: “我偷了一个10岁小孩的作业,周三早上市场直接给我砸了18300美元。” 有人把这条消息截图发到Twitter。三个小时内,链上数据全被扒出来——所有交易时间戳,和那个小男孩App的15分钟定时器严丝合缝,一秒不差。
顯示更多
0
16
81
13
轉發到社區
推荐这篇文章,作者在 Google 和 Microsoft 都写过设计文档,他把设计文档的每个部分拆解到极其具体——每节都有示例、反例和"你需要回答什么问题"。如果你们团队的设计文档写得稀烂,这篇直接拿来当模板。 怎么写一份有效的软件设计文档 一份好的设计文档可以省下你数年的开发时间。写设计文档迫使你在浪费时间在错误实现上之前,先想清楚重要的决策。它也是协调团队和合作团队之间设计决策的最佳方式。 下面是我创建有效设计文档的方法,以及什么属于设计文档,什么不属于。 什么时候应该写设计文档 项目越复杂或风险越大,写设计文档的价值就越大。问这些问题: • 会有多人协调工作来实现这个设计吗? • 项目会超过三个月的全职开发工作吗? • 实现会在生产环境中跑几年吗? • 项目涉及跨团队协作吗? • 项目的目标和需求模糊吗? • 存在设计时可以预防的灾难性风险(比如安全漏洞、法律风险)吗? 如果对任何一个问题回答"是",可能值得写。对两个以上,"几乎一定"值得。 设计文档中应该投入多少 设计文档可以是简单的一页纸,也可以是 50 页需要五个不同团队签字的文档。没有通用规则规定你应该在设计文档上花多长时间,就像没有规则规定代码应该测多少。正确的投入取决于团队的目标、风险、截止时间和文化。有时候,正确的投入是零。 什么属于设计文档 一个简单的经验法则:如果我在这件事上错了,代价是什么? 不是所有设计决策同等重要。有些选择比其他选择灵活得多。如果你用 C++ 写了一个 web 应用,20 万行后发现 Ruby on Rails 才是更好的选择,你卡住了。另一些设计决策微不足道:比如一个"加载更多"按钮,如果你选错了,用户反馈几小时就能修复。你不会因为这件事在文档里写满你的思考过程,更不该浪费审查周期争论它。 设计文档的组成部分 标题 人们会在对话中用标题来指代你的项目,所以要有这些品质:简短(容易口头说出)、独特(让人清楚指的是哪个项目)、有画面感(概念上代表你的项目)。好名字:RecencyBank。坏名字:"飞天银马计划"。 元数据 作者(名字 + 邮箱)、创建日期、权威 URL。尤其当你们组织用短链接重定向如 http://go/recency-bank。 目标 一句话解释项目的 purpose,应该在文档第一页用任何干系人都能理解的平实语言出现。"通过在 Trogdor web 服务器和 Postgres 数据库之间增加缓存层来提高应用性能。" 背景 回答:团队为什么接这个项目?解决什么问题?之前有尝试解决吗?如果有相关文档,链接它们——项目测试计划、相关系统的设计文档、项目先前迭代的设计文档。 关键检查:你的设计文档在没有外部上下文的情况下能读懂吗? 目标 描述项目的高层目标,从背景部分逻辑连接过来,解释实现完成后世界是什么样子。避免用实现细节来设定目标——目标应该表达项目对用户、团队或公司的好处。 ❌ "将 Kubernetes 添加到我们的基础设施。" ✅ "最大限度地减少与部署新应用版本相关的中断。" 非目标 如果有些目标读者可能误以为在范围内的,明确写在非目标里。"创建一个通用、可复用的缓存系统——范围外。""位置感知缓存——范围外。" 场景 如果你的目标是"给图表加一个分享为 URL 的按钮",读者可能不理解实际是什么样子。场景部分允许你描绘一幅画面:Bob 创建自定义报告 → 点击菜单栏的分享 → 邮件链接给 Charlie → Charlie 看到只读模式下的完全相同的报告。 图表 图表极有价值,尽管可能看起来不那么明显。作为设计作者,你直观理解各部分如何拼在一起。你的审查者没有这个心理图景。最快让他们看到它的方法就是画出来。 考虑:数据如何流经你的系统?不同组件如何拼在一起?系统如何与依赖和下游客户端交互?定义了哪些通信协议? 选一个方便编辑的图表工具——Excalidraw、 Drawings。作者见过开发者画漂亮的白板图然后拍照放进文档,但第一稿很惊艳之后永远困在那张图上因为他们不能编辑照片。 术语表 定义读者可能不认识的术语。仔细想一下文档的潜在读者——特别是新成员和团队之外的人。最好的方案是使用可识别的术语,或在行内定义,这样读者不必在文档里跳来跳去。 约束 如果有重大约束——预算、客户端、基础设施或依赖——解释这些约束,让读者理解设计选择的背景。"我们的服务器全是 RISC-V,所有代码和依赖必须在 RISC-V 架构上运行。" 服务水平目标(SLO) SLO 是服务向客户端或用户提供的可衡量目标。在公司内部通常不会因为错误而惩罚同事(虽然那会有点好玩),所以设计文档定义 SLO 而非 SLA。 典型考虑:正常运行时间 / 可用性、延迟、规模。好的 SLO 防止模糊——"50% 用户面 HTTP 请求延迟 <=200ms",不是"在移动设备上性能好"。 监控 / 告警 如果你的服务挂了,你怎么知道?如果性能慢了 100 倍,你怎么知道?什么事件应该触发告警?"Trogdor 的 95% 用户面 HTTP 请求延迟 >= 3s——通知值班工程师。" 时间线 将项目分解为里程碑,指定干系人什么时候收到交付物。选择创造有用制品的里程碑。比如先做一个显示假数据的 UI 给客户看——假数据让你在错误理解需求时能尽早发现,而不是已经实现了所有后端管线再用生产数据填充 UI 后才发现。 接口 你的项目存在是为了服务人或其他软件系统,这些交互长什么样?图形系统的 UI(只需简单草图)、软件接口的 API 或 CLI 语义、文件接口的文件格式。用具体的代码示例说明接口的变化:type Server struct { db PostgresDB } → type Server struct { db } 依赖 / 基础设施 用什么编程语言?代码跑在什么硬件或服务上?持久数据存在哪里?深入思考哪些依赖在实现后难以改变——换语言或存储后端很难,但换第三方发邮件服务一个下午的事。 安全 考虑了哪些威胁?攻击面是什么?信任边界在哪里?即使认为安全威胁不太可能或无关,文档化你的推理仍然有助于提示审查者找出你忽略的威胁。 隐私 系统处理什么敏感数据?保留多久?谁可以访问?如何保护它? 法律考虑 如果在金融或医疗等高度监管领域——如何遵守相关法律。即使不在监管领域:如果事情出错系统是否可能违法?如何避免?如果开源,定义选什么许可和为什么。 日志 关键事件是什么?有不同日志级别吗?日志存在哪?保留多久?谁可以访问?有没有敏感数据必须排除出日志? 开放问题 文档化你的待解决问题:问题需要更多工作的是什么?看到什么选项能解决?下一步是什么? "选择缓存 RAM 大小:加 RAM 提高性能但贵且有收益递减。理论上可以设置测试环境跑模拟来发现最优值,但那些模拟要花 3 天开发时间。建议方案:选 128GB 不测试,可能接近最优,开发时间显著比 RAM 贵。下一步:问技术主管。" 已解决问题 解决开放问题后,总结决策,从开放问题移到已解决问题,保留完整讨论以备后查。 已考虑的替代方案 如果预料读者会问"为什么没选 X",主动回答。简要几行描述强力替代方案及为什么不行。不用在文档里耗费数小时写每个被拒方案的详尽理由。 驱动你的设计文档通过审查 完成设计文档后,下一阶段是和团队分享并收集反馈。(作者有一篇后续文章讲如何获得有意义的反馈。) 原文:Michael Lynch, "How to Write an Effective Software Design Document", Refactoring English, 2026-06-24 #软件工程# #设计文档# #工程实践#
顯示更多
$GOOGL 还是太全面了! 想象一下,你要把一座超级大都市里的每一座发电厂、每一根高压电缆、每一个变电站,乃至居民家里的每一个开关和电线,全部精细地画成一张完整的电路图。 更夸张的是,这张图对应的实际空间,只有一粒粗盐那么大。 这就是谷歌 Google Research 联合顶尖科研机构刚刚干出来的一件大事:他们把一只成年雄性果蝇的整套中枢神经系统,彻底绘制出来了。 这不仅仅是一个大脑,而是包含了大脑、视觉神经系统以及相当于人类脊髓的胸腹神经绳。全图囊括了超过 16.6 万个神经元,以及整整 1.25 亿个突触连接。 为了做出这张图,科学家把果蝇切成了几千个纳米级超薄切片,用电子显微镜扫描出海量的图像数据。谷歌则动用了专门的神经网络算法,把数以百万计的二维切片拼叠成三维的神经元结构。哪怕有了顶级 AI 的辅助,人类研究人员依然耗费了整整 44 个人年的精力去复核与修图。 当你真正看懂这张神经路线图,就会发现生物演化的机制有多精妙。比如科学家发现,果蝇在飞行、行走或者避障时,大脑并不是在实时指挥每一条腿该怎么迈。大部分动作是由靠近肢体的局部神经环路自主决定的。这不就是天然的边缘计算吗? 这也解释了为什么谷歌能一直保持极高的行业上限。大家平时看谷歌,觉得它是一个做搜索、做广告、做 YouTube 的商业公司。但它的底层内核,其实是一个解决超大规模复杂问题的工程计算引擎。从 AlphaFold 预测蛋白质结构,到重建人类大脑皮层切片,再到今天绘制完整的果蝇中枢神经系统。 当一家公司能把顶尖的算力、AI 算法与基础科学研究深度结合在一起的时候,它就不只是在做眼前的业务,而是在为未来几十年的人类科技铺设地基!
顯示更多
0
34
31
6
轉發到社區
投机解码的 drafter 从来都是一个 token 一个 token 地猜。做出 DFlash 的推理公司 Inco AI 说这没必要:正确的 token 本来就在候选列表里,整块并行预测之后挑出一条连贯路径,输出不变,每次验证多赚一个完整的 token。 《DFlash 2:保持并行起草》 推理是 agent 时代的瓶颈。agent 会读、会规划、会调用工具,常常一跑就是几小时甚至几天。它们消耗 token 的速度,是聊天场景从未达到过的。而每一个 token 都要在模型上跑一次完整的前向传播。在 Inco AI,我们在构建一套面向未来 token 经济学的推理栈。这篇文章是一次预览。 我们的团队 1 月发布了 DFlash(论文: SGLang、vLLM、TensorRT-LLM 和 llama.cpp 里。NVIDIA 在 Blackwell GPU 上用它测到了最高 15 倍的吞吐;Google 报告在 TPU 上每秒 token 数提升 3 倍;CoreWeave 生产环境的 Kimi K2.7 Code 端点(Artificial Analysis 上该模型最快的端点)默认就跑 DFlash。生态已经在它之上构建:NVIDIA、Red Hat、Modal 都发布了 DFlash drafter;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)、NVIDIA(Nemotron 3.5 Lightning)随自家模型发布官方 drafter。在 Hugging Face 上,DFlash 模型被下载了超过 350 万次(截至 2026 年 8 月)。 投机解码是现代推理栈的核心组件之一。一个小 drafter 模型猜出一整块 token,目标模型在一次前向传播里验证整块。猜得好,一次前向变成多个 token;猜得差,丢掉重来。但多年来,起草本身一直是自回归的:一次一个 token。DFlash 让它也变成了一次通过:整块、每个位置,并行预测。 (演示视频:DFlash 2 在 Apple M5 Max 上用 oMLX 为 Qwen3.8-27B 起草,与自回归解码并排对比。 DFlash 2 把并行起草又往前推了一步:每次验证通过多产出 20% 以上的输出,增加的周期延迟只有约 1%,而输出可证明不变。跨基准测试的增益在 16–25%。配合今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下达到自回归解码 2.7–3.4 倍的吞吐。每个位置独立预测,留下两处空间:选对 token,以及在块的末尾守住准确率。DFlash 2 把这两处都拿了回来,同时没有放弃一次性通过的设计。 现在就能跑 DFlash 2 已经跑在主流推理引擎里。 SGLang: pip install -U "sglang[all] @ git+" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 vLLM: pip install -U "vllm @ git+" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' llama.cpp: git clone cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 oMLX:下载安装支持 DFlash 2 的预构建版( 在 oMLX 里跑 Qwen3.8-27B 加 DFlash 2: 1. 打开 oMLX 的 Model Downloader,下载 mlx-community/Qwen3.8-27B-4bit 和 incoai/Qwen3.8-27B-DFlash2。 2. 打开 Model Manager,编辑 mlx-community/Qwen3.8-27B-4bit,配置 DFlash: • DFlash:enabled • Draft model:incoai/Qwen3.8-27B-DFlash2 • Draft quantization:enabled • Runtime block size:5 • Verify mode:dflash 3. 保存设置,加载目标模型。 对的 token 早就在候选里 DFlash 每个位置独立、并行地预测。每个选择单独看都合理,但没有什么让它们彼此咬合,一个不连贯的块会在验证时被截断。近期的方法如 Domino 和 DSpark,用顺序的 Markov head 重写每个位置的完整词表分布来买连贯性。但真的需要这种昂贵的自回归纠错吗? 不需要。证据就在 DFlash 自己的候选列表里。拿第一个位置来说:DFlash 的第一选择 85.4% 的情况下是对的,但正确的 token 99.5% 的情况下都在前 16 个候选里。即使第一选择错了,对的 token 通常也在列表上。 表 1:Recall@1(第一选择正确的概率)与 Recall@16(正确 token 出现在前 16 候选里的概率),按起草位置统计,条件是前面每个位置都正确。GSM8K 上的五层 Qwen3-4B DFlash。接受长度包含验证器产出的下一个 token。 • 位置 0:Recall@1 85.4%,Recall@16 99.5% • 位置 1:80.3%,97.3% • 位置 2:79.4%,94.8% • 位置 3:78.3%,92.6% • 位置 4:77.5%,90.8% • 位置 5:75.9%,89.4% • 位置 6:72.9%,87.8% • 接受长度:4.27(只看第一选择);6.79(从前 16 里选) 一个总能从前 16 个候选里挑对的那个 oracle,会把接受长度从 4.27 抬到 6.79。这个差距是纯粹的选择空间。我们只需要在候选里选出一条正确的路径。 图 1:一个周期里的选择器。只用 DFlash,每个位置保留自己的第一选择;这里两个相邻位置选了同一个词,结巴在验证时死掉。DFlash 2 保留每个位置的 top 候选,选择器在候选之间走出一条连贯路径;这里整块都活了下来。 一个轻量的路径选择器 连贯性大体是局部的:一个候选合不合适,主要取决于它前面的那个 token,所以给相邻对打分应该就够了。DFlash 2 保留每个位置前 16 个候选,给每一对相邻候选打分。对前一个 token a 和当前候选 b: S_t(a,b) = U_t(b) + ⟨A(a)⊙H(h_t), B(b)⟩ 分数分两部分。第一部分 U_t(b) 是 DFlash 自己的 logit:drafter 本身有多喜欢 b。第二部分问 b 接在 a 后面有多顺:A 和 B 给每个 token 一个紧凑的 256 维嵌入,两个嵌入在一个上下文门控 H(h_t) 下匹配,门控决定匹配的哪些部分算数。本质上,这是对相邻候选做的低秩双线性注意力。 打分全程并行。每个位置的每一对相邻候选一次性全部算完,不需要额外的 backbone 或 LM head 前向。唯一串行的部分,是最后在预计算好的分数上走一遍:从最后一个已验证 token 出发,贪心地跟着每一步最好的后继走,采样从同样的分数里抽取,拒绝采样恢复出精确的目标分布。 表 2:只加路径选择(不加卷积)的接受长度,GSM8K 上的五层 Qwen3-4B。开销相对纯 DFlash:drafter 增加的参数、起草-验证周期增加的延迟。 • DFlash:T=0 下 4.27,T=1 下 3.78 • + DSpark 纠错:+77.8M 参数,+9.6% 延迟;4.49,4.08 • + 路径选择(我们的):+2.0M 参数,+0.6% 延迟;4.61,4.25 选择器在 T=0 下给 DFlash 加 0.34 个 token,T=1 下加 0.47。两个设置下都超过 DSpark 的纠错,参数少约 40 倍,延迟开销低 16 倍。选择比预测便宜。而且还有空间:oracle 能到 6.79。成对打分是我们能想到的最简单的选择器,我们相信这里还有很多可探索的。 后缀衰减是个局部问题 我们还注意到上面两行 recall 都在块尾下滑。连 oracle 都在衰减:即使选择完美,准确率仍然从第一个位置的 99.5% 掉到最后一个位置的 87.8%。没有选择器能修这个,因为候选自己就不够了。我们把这个叫后缀衰减,它是 backbone 的问题。 一个嫌疑是容量:五层 backbone 可能太小,撑不住横跨整块的依赖。如果真是这样,深度应该在靠后的位置帮上最多的忙。事实也如此:3 层、5 层、15 层的 DFlash 模型在第一个位置上几乎一样,越往块尾分得越开。但深度不加区分:多十层 attention block 到处加容量,连那些没什么可赚的靠前位置也加,把 DFlash 吸引人的那部分效率磨掉了。 图 2:GSM8K 上 Qwen3-4B 的 Recall@1(T=0),条件是前面每个位置都正确。所有 drafter 在相同设置下训练;卷积模型评估时不带选择器。它的卷积增加 3% 参数和 0.7% 周期延迟;15 层模型多出的十层增加 15.2%。 我们要一个有针对性的修法,而 DFlash 的 attention 指出了修哪里。它有两份工作:读块之前的上下文,以及建模块内部的依赖。但它在第二份上花的越来越少:块内注意力占比从第 1 层的 30% 掉到第 5 层的 8%,剩下的还集中在越来越少的一小撮 head 里。所以我们把两份工作拆开:一个专用模块承担块内工作,attention 继续读上下文。 图 3:五层 Qwen3-4B DFlash 的块内注意力按 head 分布。越亮的格子代表在起草块上花注意力越多的 head;靠后的层里,块内质量收缩、集中到少数几个 head。 一个轻量的局部卷积 块内工作本来就是短程的:一个块只有 4 到 16 个 token,最紧的依赖坐在相邻位置之间。自然的算子是短卷积:两个抽头,一个在当前位置,一个够到前一个位置,权重随内容自适应。跟随 Canon Layers、Dynamic Short Convolutions 和 Convolution for Large Language Models 的做法,我们在每个 attention 和 feed-forward 子层前后插入这个双抽头动态深度卷积: Conv_k(x)_t = k_{t,0}⊙x_t + k_{t,1}⊙x_{t-1} 每个系数由一个可学习的基核加上从当前隐藏状态算出的一个小修正组成;每 16 个通道共享一个修正。第一个位置读最后一个已验证 token 的表示,之后的每个位置读它前一个的。信息穿过整块,同时所有位置仍然并行计算。 图 4:双抽头动态卷积。每个 drafter 层的每个 attention 和 MLP 子层前后各有一个。内部:每个位置把自己的表示和前一个的混合;第一个位置读最后一个已验证 token。 卷积是块局部的、无状态的,所以能无缝插进 DFlash,不用动 attention、LM head 或验证。 只加 16.5M 参数(3%),带卷积的五层 DFlash 就逼近了 15 层 DFlash,大幅减轻后缀衰减。卷积给起草-验证周期延迟加 0.7%;多十层 Transformer 层加 15.2%。第 4、5 层的平均块内注意力从 9.4% 降到 0.5%,与卷积吸收局部工作、attention 回到读上下文一致。一个只够到前一个位置的核,买回了十层额外层的大部分收益:后缀衰减大体是个局部问题。 合在一起 到目前为止,选择器和卷积是分开测的;下面的完整对比把它们放在一起。DFlash 和 DSpark drafter 是我们在对齐的设置下自己训练的,MTP 随模型发布。 表 3:Qwen3.5-4B 每请求平均接受长度。采样:thinking 开启,温度 1.0,top-p 0.95,top-k 20,presence penalty 1.5,无损拒绝采样。 • GSM8K:MTP 4.78,DFlash 4.99,DSpark 5.69,DFlash 2 6.20 • MATH-500:5.04,5.42,6.20,6.76 • HumanEval:4.84,5.43,5.80,6.28 • MBPP:4.16,4.49,4.96,5.41 • MT-Bench:3.90,4.26,4.77,5.20 • 平均:4.54,4.92,5.49,5.97 DFlash 2 在每项基准上都领先。平均下来,它比 DFlash 多 1.05 个 token(21%),比 DSpark 多 0.48。升级仍然便宜:选择器和卷积加起来,只给五层 DFlash 的起草-验证周期延迟加了 1.3%。 在 MATH-500 上,增益逐位置可见:DFlash 2 到最后一个位置都稳在 86% 附近,而每个基线在块尾都比它低 6 到 9 个点。 图 5:MATH-500 上 Qwen3.5-4B 的条件接受率,采样同上。 两个 drafter,今天发布 我们今天发布两个 DFlash 2 drafter:一个给 Qwen3.8-27B( Meta 的 Muse Glimmer( Qwen3.8-27B,我们对比模型原生的 MTP 路径和一个社区 DSpark drafter。 表 4:Qwen3.8-27B 每请求平均接受长度,模型默认采样、块大小 8,对比原生 MTP 路径和社区 DSpark drafter。 • GSM8K:MTP 5.02,DSpark 4.36,DFlash 2 5.46 • MATH-500:4.72,3.92,5.28 • HumanEval:3.91,3.30,4.39 • MBPP:3.99,3.51,4.79 • MT-Bench:3.74,3.01,4.10 • 平均:4.28,3.62,4.80 对 Meta 的 Muse Glimmer,我们对比随模型发布的官方 DFlash drafter 和一个社区 DSpark drafter。 表 5:Muse Glimmer 每请求平均接受长度,模型默认采样、块大小 16。DFlash 是 Meta 随模型发布的官方 drafter;DSpark 是社区 drafter。 • GSM8K:DFlash 5.43,DSpark 5.45,DFlash 2 6.57 • MATH-500:5.39,5.01,6.56 • HumanEval:4.11,4.33,5.66 • MBPP:3.74,4.02,5.30 • MT-Bench:3.52,3.59,4.42 • 平均:4.44,4.48,5.70 差距很大:在两个模型上,DFlash 2 平均比 DSpark 多出超过一个完整的 token。它也超过每个模型的官方 drafter:Qwen3.8-27B 的 MTP、Muse Glimmer 的 DFlash。换算成吞吐,Qwen3.8-27B 上达到自回归解码的 2.7–3.4 倍,Muse Glimmer 上 3.1–4.6 倍。模型卡( 底线 agent 一个下午写出来的东西,聊天机器人要写一个月,而每一个 token 底下都坐着解码。DFlash 2 以接近自回归解码 3 倍的速度解码,每个 token 约三分之一的算力,输出相同。 七个月里,DFlash 从我们的论文变成了行业标准,超过 350 万次下载。在同一个设计内部,DFlash 2 每次通过多解码一个完整的 token,免费。那还只是服务栈的一个组件。推理离它的地板还很远。 在 Inco AI,我们在构建一套端到端的服务栈,把这个地板继续往下压。DFlash 2 是第一块。两个 drafter 今天发布在 Hugging Face。 如果你在规模化地服务 agent,想在你的栈里评估 DFlash 2,或者想为你跑的模型(包括你自己的微调)要一个 drafter,写信给我们:contact@inco.ai。 我们也在招人。如果你想一起构建这套栈,联系我们。 把候选连起来。起草,继续并行。 脚注:Modal 的 Speculation Is All You Need 指出,投机解码是对低延迟服务最重要的优化。我们是他们工作的超级粉丝,感谢他们自 DFlash 发布以来的支持和讨论。 本文引用格式:@misc{inco2026dflash2, title={DFlash 2: Keep Drafting Parallel}, year={2026}, month={August}, url={ 原文: #DFlash# #投机解码# #LLM推理#
顯示更多
0
46
33
2
轉發到社區
当 AI 和世界还没有今天这么喧闹的时候,一个名叫 Andrej Karpathy 的年轻人,戴着那时还很时髦的 Google Glass,骑着自行车,从他上学的斯坦福,去他实习的 Google,一边骑,一边录了一段 vlog。 视频拍于 2013 年。那时他还是斯坦福博士生,在 Google 实习,做的项目是 deep learning:搭神经网络,让它理解图片和视频。拍摄工具是 Google Glass。他还自己给它写了应用,出门就戴着。他最喜欢的游戏是玩魔方,其实是他休息的方式。 斯坦福 计算机系的走廊,是 Larry Page 和 Sergey Brin 当年读博时走过的同一条。第一台 Google 服务器,也曾在这栋楼的地下室运行过。 Palo Alto 的路,到今天还是他当年记录的那个样子,破得很稳定。加州人有钱,但就是不用来修路。该咋地咋地。 到了 Google,园区还是那种这家公司刚刚长出来的感觉:餐厅、共享自行车、来参观的游客,还有一头恐龙雕塑。那时的 Google 还在三驾马车(Eric Schmidt带着两个founder)年代,除了 Google Glass,还在做 Google 气球和自动驾驶。 那个年代好像已经很远了。 当年连 Andrej 都要辛苦搭起来的神经网络,现在应该已经很容易了吧。 如果你对那个年代的斯坦福、Google 和 Palo Alto 好奇,这条视频是一个稀有的窗口。
顯示更多