註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Dynamos
Dynamos 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Dynamos 的搜尋結果
推荐这篇文章,Together AI 的 ThunderAgent(ICML 2026 Spotlight)。 把 agent 工作流当成一个"程序"来调度,而非一系列无关的请求——单节点吞吐翻倍,8 节点近线性扩展。 Together AI 在 7 月 29 日发布了 ThunderAgent——一个面向 agentic 推理的高吞吐调度系统。ICML 2026 Spotlight 论文。核心贡献:把 agent workflow 抽象为"程序"而非"一系列不相关的请求"。 问题:KV Cache Thrashing Agent 工作流在两个阶段之间交替:GPU 密集的推理阶段和 GPU 空闲的等待工具返回阶段。当数百个 agent 并发运行时,各自的 KV cache 在每轮不断增长,竞争有限的 GPU 内存。 传统推理引擎(vLLM、SGLang、TensorRT-LLM)按请求级别调度——agent A 暂停等待工具调用时,它的 KV cache 被 LRU 淘汰腾出空间给 agent B 的 prefill。当 A 的工具返回,引擎必须从头重算 A 的整段对话历史,这又淘汰了 C 的 cache。高并发下,这种淘汰和重算的级联反应导致严重的吞吐量和延迟退化——论文称之为 KV cache thrashing。 能通过加 GPU 节点解决吗?不完全。现有多节点路由器(如 SGLang Gateway)把每个 agent 钉在固定节点上以保留 cache 局部性——但 agent 的上下文长度不可预测增长,某些节点被赋予长上下文 agent 导致内存耗尽,其他节点闲置。 能通过 KV cache offloading 解决吗?也解决不了。LMCache 和 HiCache 把 KV cache 卸载到 CPU 内存或磁盘,扩大了总容量但只是延迟 thrasthing。当并发 agent 的工作集超过所有存储层级时,淘汰恢复,同一个恶性循环重现。 ThunderAgent 的解法 ThunderAgent 在 agentic 客户端和推理后端之间插入一个轻量调度层。它将每个 agent 工作流抽象为一个可调度程序(program),追踪其执行阶段、KV cache 占用和节点位置。 Program-level admission control:监控每个节点的内存压力,选择性暂停低优先级工作流,减少竞争 cache 的程序数量。当被暂停的工作流准备恢复时,通过全局等待队列路由到容量最充足的节点。 多节点部署:用全局等待队列替代了基于 session 的静态节点绑定。暂停的工作流恢复时被路由到可用容量最多的节点,在 KV cache 局部性和多节点负载均衡之间取得平衡。 评测 集成在 Together AI 自己的合成数据生成管道里——就是产生 CoderForge 等数据集的那套基础设施。对比 SGLang 默认调度器: 单节点 8×H100(HiCache offloading),batch size 192: • SGLang:吞吐 390 token/s,平均延迟 65s • ThunderAgent:吞吐 803 token/s,平均延迟 10.6s 多节点(2→8 节点): • 近线性扩展,16 GPU 到 64 GPU 吞吐从 671 增长到 2248 steps/min • 加速比随集群规模增大:2 节点 1.79× → 8 节点 2.39× 使用 一个 program_id 字段,OpenAI 兼容 API,直接适配现成的 offloading 和 speculative decoding。已被 SkyRL 和 NVIDIA Dynamo 集成。 GitHub: 论文: #AgentInference# #KVcache# #ThunderAgent#
顯示更多
英伟达老黄在GTC大会上都说了什么? 看了下演讲全文,感觉这次老黄不只是在卖芯片,而是在卖一个全新世界观:AI 不是工具,不是应用,而是人类下一个工业革命的能源+发动机。AI 是新时代的电力 + 发动机,Token工厂、AI代理智能体、物理AI 共同构成基础设施。梳理下要点: 1. 第一性原理:AI 的本质重新定义(别再当它是“聪明App”了) 老黄认为 1)AI 不是单一模型突破,也不是“会聊天”的玩具,而是像电力一样的核心基础设施。 2)每个公司都会用,每个国家都会建,不建就落后,就像19世纪不建电厂一样。 2)计算需求过去两年已增长“一百万倍”,且还在指数级加速。 老黄更是给了一个炸裂的前瞻指引,预计到2027年,仅英伟达这些旗舰芯片(Blackwell + Vera Rubin 系列)就能贡献至少1万亿美元营收。”(比之前市场预期的5000亿翻倍,时间拉长一年但金额更狠) 这已经不是简单的财报指引,是给全球CEO和国家元首的最后通牒:你们不投AI工厂,我们就帮别人建。 2. Token工厂:数据中心的新物种 老黄把数据中心彻底改名——不再是存数据的仓库,而是生产智能代币的工厂。CEO 现在要像管传统工厂一样管“代币产出率”和“单位代币成本”。英伟达通过全栈垂直整合,已经把单位代币成本做到全球最低。 这就是工业化拐点:AI 从实验室玩具 → 国家级重资产基础设施。 投资视角来看,这会让“AI基建”概念彻底主流化,能源、冷却、网络、光模块、液冷、变压器等全产业链都会被重估。别只盯着GPU,看“Token工厂”全链条。 3. Vera Rubin 平台:下一代AI工厂的完整蓝图 Rubin不是单颗芯片,是垂直整合的7大芯片 + 5个机架级系统 + 1个超级计算机*。 他的亮亮点在于: 1)Vera CPU(专为Agent优化)、全液冷、Groq确定性流式推理 + Dynamo解耦、吉瓦级工厂代币生成速度提升350倍。 2)大规模光电共封装(CPO)、硅光子,目标百万卡集群、低功耗低延迟。 老黄原话这么说:“Vera Rubin 不是芯片,而是一个巨型系统,从能源到端到端全优化。” 这其实在告诉对手和客户:英伟达已经把“AI发电厂”的参考设计做出来了,你们直接抄作业就行(当然得用我们的零件😎) 4. Agentic AI + OpenClaw:下一个十年的操作系统级革命 OpenClaw在这次GTC上被老黄定义为“AI时代的Linux”——开源、底层框架,让Agent自主调用工具、写代码、管理文件。 老黄宣布NewClaw企业版平台,现场“极简养虾”demo(一键让AI代理管复杂养殖流程),象征极简部署 + 自主执行。 老黄更是明确说,今天世界上每一家公司都必须制定OpenClaw策略。同时推Nemotron开放模型联盟(语言、视觉、机器人、生物、气候等全覆盖),开放生态才是王道。 这是在逼所有企业从SaaS转向AaaS(Agent as a Service),代理框架、工具链、隐私护栏相关公司会爆。开源+企业级双轮驱动,类似于当年Android的打法。 5. Physical AI + 机器人:从数字到物理的ChatGPT时刻 老黄认为物理AI迎来爆发:不再是屏幕里的智能,而是能真正作用于现实世界。他聊到Robotaxi Ready新增比亚迪、现代、吉利等,覆盖1800万辆/年 + Uber大规模部署。 现场迪士尼Olaf雪宝机器人直接登台,展示Omniverse数字孪生 + Newton物理引擎,从虚拟直接迁移到物理适应。 老黄说机器人会成为数万亿美元市场,而物理AI是下一个大爆炸的领域。当然我们自己也需要清楚,物理世界落地比数字难100倍,但一旦起飞,体量远超纯软件。关注端到端(感知-决策-执行)全链公司。 6. 更远的下一代 + 未来场景(Feynman + 太空) 1)预告Feynman架构:Rosa CPU、LP40 LPU(推理专用)、BlueField-5、CX10网络等。 2)太空数据中心:Vera Rubin Space-1轨道AI计算机,用Omniverse建“数字孪生”太空基建。 这一次老黄呼应了老马,英伟达不只是地球算力霸主,还想做太空AI基础设施。 老黄这次演讲核心就是 AI 是新时代的电力 + 发动机,Token工厂、AI代理智能体、物理AI 共同构成基础设施。英伟达提供从能源到芯片的全栈钥匙,这个市场到2027年带给英伟达至少万亿美元营收。
顯示更多
0
20
293
86
轉發到社區
#为什么是中国# #WhyChina# The Global Logic of China's Economic Growth in the First Half of 2026: A 4.7% GDP Increase 2026年上半年GDP增长4.7%:中国经济增长的全球逻辑 According to the latest semi-annual report, China's gross domestic product (GDP) reached 69.6 trillion yuan, representing a year-on-year increase of 4.7% at constant prices, in line with the annual growth target. Against a backdrop of intertwined international complexities and volatilities, China's economic performance is commendable. Yet, a closer look at the data reveals that the logic underpinning China's economic growth is being reshaped. (I) At the Industry Level, Notable Highlights Emerge: First, new quality productive forces are being cultivated and strengthened at an accelerated pace.** In the first half of the year, industrial production grew robustly. The value-added output of the equipment manufacturing sector increased by 9.3% year-on-year, and that of high-tech manufacturing grew by 13.3%, both outpacing the overall growth rate of industrial output above a designated scale. This underscores a clear trend toward a high-end, intelligent, green, and integrated industrial structure. Looking at specific products, the output of 3D printing equipment, lithium-ion batteries, industrial robots, and other products emblematic of new quality productive forces surged. The average daily token call volume has reached hundreds of trillions, showcasing the vitality and potential of the digital and intelligent economies. Second, new growth drivers are accelerating to take on a leading role. Preliminary estimates suggest that new growth drivers—encompassing high-end manufacturing, the digital economy, and modern services—contributed over 40% to economic growth in the first half of the year. The economy's distinct shift toward a higher quality and more optimized structure is evident, and this overall trend is accelerating. For instance, industries related to artificial intelligence, such as integrated circuit manufacturing and intelligent vehicle equipment manufacturing, have all maintained high growth rates exceeding 30%, vividly illustrating the pace of China's industrial upgrading. Third, confidence on the investment front is on the rise. In the first half of the year, investment in high-tech industries grew by 4.6% year-on-year. Notably, investment in the manufacturing of aircraft, spacecraft, and equipment, computer and office equipment manufacturing, and information services grew by 23.3%, 8.1%, and 15.5%, respectively. Investment structure best reflects market expectations. The increasing "new economy content" in investments signals an acceleration in the replacement of old growth drivers with new ones. Investment in intellectual property products grew by 9.4%, indicating that enterprises are placing greater emphasis on R&D and innovation. This suggests that technological advancement is not simply about capacity expansion but about qualitative change driven by innovation. (II) Observing a Major Economy Requires Looking Beyond the Immediate Figures to the Long-term Trajectory. Behind the "new economy content" of the semi-annual report lies China's ongoing transformation from a global manufacturing hub to a global center of innovation. At the 17th Annual Meeting of the New Champions (Summer Davos), observers noted a new phenomenon: a host of unicorn companies are heading to China. They are establishing R&D centers, regional headquarters, and deeply integrating into China's innovation and industrial chains—shifting from "produced in China" to "created in China." So, why China? Economist Justin Yifu Lin, in his book *Demystifying the Chinese Economy, touched upon the theory of the "speed of technological change." He argues that the essence of the industrial revolution is not just the application of new technologies, but more fundamentally, the ever-accelerating pace of technological change. Since the mid-18th century, starting with the steam engine reshaping the textile industry, the snowball of technological change has grown, rapidly sweeping through industries like chemicals and automobiles, ultimately redrawing the geographical map of great power competition. Looking at China today, the trajectory of accelerating technological change is equally clear. A leading enterprise can drive an entire industry, which in turn can boost a whole region. These burgeoning industrial clusters, growing from saplings to forests, not only enhance production efficiency and invigorate market vitality but also effectively improve development quality and resilience. For example, specialized and sophisticated "little giant" enterprises above a designated scale in Beijing, through deep cultivation of innovation chains, supply chain collaboration, and international expansion, have become "connecting points" and "accelerators" for the dual circulation strategy. More importantly, emerging industrial clusters possess powerful spillover effects. The rapid rise of new energy vehicles is not only reshaping the automotive industry but also driving transformations in chips, software, and energy networks, allowing more sectors to gain value from efficiency improvements. The swift advancements in AI and biomedicine are sparking a "gentle qualitative change" in people's livelihoods, significantly enhancing the sense of fulfillment and well-being through smarter, more affordable products and more livable environments. (III) Looking from the First Half to the Full Year, China's Development Momentum Remains Positive. Of course, during this critical period of transitioning between old and new growth drivers, China's economy still faces lingering issues and new challenges. Some core areas are still grappling with "bottleneck" technologies, certain high-tech industries face external risks of "decoupling" and supply chain disruptions, and "involution"-style competition affects the new energy market ecosystem. However, most of these are issues arising from development and transition, and they can be addressed with effort. The supporting conditions and fundamental trends for long-term economic improvement remain unchanged. China's economic journey toward a newer, higher-quality model is itself a process of encountering new problems and solving them along the way. By maintaining confidence, proceeding steadily, and balancing both qualitative improvements and quantitative growth, China's industries are poised to be brimming with dynamism, and the Chinese economy will continue to advance steadily and sustainably. #China# #Jiangxi# #JiangxiEconomy# #世界经济看中国# #赣出新精彩#
顯示更多
今天芯片圈最大的新闻,莫过于Gerard在创立Nuvia CPU被高通收购五年之后,重新出发,新创立了ARM CPU公司,名字也跟之前非常像,叫Nuvacore 现在这个时间点做数据中心CPU,确实是赶上了CPU十年来最好的时代: AI agent带来CPU短缺潮已经经隐隐浮现,AWS多个客户都提出要包揽所有Graviton ARM CPU产能 ------------ 这个消息对硅谷的芯片打工人吸引力是巨大的,Nuvacore这次的阵容都是功成名就的明星阵容,以前Nuvia创始团队重新集合,拿了红衫的投资,做面向 AI 基础设施/agentic computing 的通用ARM CPU。当年还是一个尚未完全被验证的大方向都能大获成功,而现在ARM CPU服务器正在风口浪尖上,前景和想象力和2019年Nuvia比起来大了太多了 上一次Gerard把Google,苹果platform architecture组的架构大佬挖了好多过去,这次的号召力只会强得多,240m的融资,已经验证过的路径和创始团队,肉眼可见的下一个增长风口,一定会让Nuvacore成为湾区最热门最受追捧的芯片startup,没有之一。毕竟这是一个肉眼可见能财富自由而且风险收益比极好的机会 ---------- 遥想当年Nuvia第一代CPU的发布赶上苹果M2时代,还是挺震撼的,Nuvia让高通在一年的时间CPU跑分进步了整整三代,单核跑分从2300变成3200,竟然超过了苹果M2 max一大截 可惜Nuvia Phoenix core从发布到最后上市拖了太久太久,中间苹果把牙膏挤爆了连着上市了M3/M4,于是Nuvia CPU上市之后从跟M2比较变成了跟M4比较,从期待中的C位变成背景板了 当年Nuvia的眼光非常超前,在2019年ARM CPU服务器市场占有率几乎为零的情况下,就是想从零开始打通这个市场,2021年被高通14亿美元收购之后,高通也给了无限的资源支持,扩招力度很大,给的薪水都是市面上最高一档的。 可惜大环境在2022年恶化的很快,加上高通的管理层战略眼光实在太差太短视,在业界ARM服务器生态都开始有起色的时候,为了股价节约开支,竟然再一次把自家的Nuvia CPU 服务器团队解散了(算上2015年已经解散过一次ARM服务器团队) 直到2025年,Nvidia的Grace ARM CPU都已经发布四年了,Vera ARM CPU都已经自研好久了,Amazon的ARM CPU Graviton都快占据CPU服务器新出货的50%了,高通才后知后觉谨慎的重启ARM服务器项目 所以这次Gerard从高通的高管位置把之前的创始团队拉出来自己干,可能是因为高通高层战略眼光实在太差屡屡错过机会,上次Nuvia想做ARM服务器,高通的承诺也因为大环境恶化没做数,结果被收购之后被高通取消了项目直接改做了laptop芯片和手机芯片 加上高通今年在手机销量上因为内存和存储历史级的巨额涨价,可以预见要受到重创(市场萎缩30%),能拿出的扩张预算有限,在高通能拿到的资源是受到掣肘的 而在创业公司里比在 Qualcomm 这种大平台里更容易拿到足够快的决策速度、团队纯度、产品定义权和资本叙事,于是选择在窗口已经被验证时重新集结老班底 但更可能因为,AI时代的CPU前景想象力真的太广阔了,完全值得重新投入一次,不是Gerard变了,而是外部市场变了 ------------------------ 进入2025年之后,AI agent的出现,隐隐让CPU重新变成了瓶颈 CPU服务器重新步入增长轨道,而且潜力巨大,有好几个因素: 1. 随着推理时代的到来,GPU演化到针对推理的系统级新架构,CPU 是永远在忙的总指挥orchestrator, 因为要追求token throughput,所以异构计算阶段变多 + 批处理数量batch越来越大,scheduling/routing/data flow复杂度变高,对orchestration要求也变高 所以在系统级异构推理架构里,AI加速器和GPU在CPU:GPU的配比上,也变得更为激进,从以前的1:4到Grace Blackwell的1:2,以后是很有希望达到1:1的比例的。Google TPU配Axion,Amazon Tranium配Graviton,Nvidia Rubin配自家Vera CPU 这条在我的去年11月半导体年终回顾写过,基本上在2026年成为了共识,虽然这部分主要是各家AI 芯片自研,并不是纯粹的CPU服务器,其实不算是外部CPU服务器的机会 2. 也是同一篇年终回顾里写到的: 从CPU视角去看agentic workload,routing和工具处理都在CPU上,如果把常用的agentic框架做profiling,比如SWE-Agent, LangChain, Toolformer,CPU最长可以占到90%的E2E端到端延迟,throughput瓶颈也更多的卡在CPU,CPU甚至能耗也超过了总能耗的40% Agentic AI目前是一个CPU瓶颈更多的事情,Agent管理很多个CPU,再加上agent经常要开sandbox,很可能会成就CPU需求的新一波回暖 现在回看去年写的这个逻辑,潜力是非常大的。但其实年初可能并没有很大规模发生,年初的CPU增长和各家渲染的CPU短缺潮和这个逻辑暂时关系不大,更多可能是前几年的capex投入GPU的比例太大,造成传统CPU服务器投入不够,所以需求上升是一个回补之前传统服务器投入不够的部分。 但到了下半年甚至2027,agent会开始更广泛的铺开,比如智能导购和客服,已经占到了Amazon去年年底100万CPU采购的相当部分比例,这部分的增长是很快的 前两个逻辑,基本上是今年主流叙事在讲CPU潜力的共识,但是我的感悟是,还有另外两个逻辑被低估了: 3. 造成CPU服务器潜力更大,更长线的主逻辑,可能和agent本身没有直接关系,而是code agent带来的副产物: coding门槛和速度的大幅优化,让“构建软件 + 连接软件 + 调用软件 + 自动化软件”这整件事便宜了一个数量级,Jevons 悖论在software供给端的展开,最终把世界推向更高的软件密度和 API 密度,这直接带来了CPU传统workload的线性上升 从2025年年底开始,coding agent迎来了质变,Claude code迎来了爆发式增长,三个月的token营收增长了三倍,那么导致的下一步必然是Code量的十倍增长,以及App数量的巨量增长 即便是在大厂,每天1m token消耗只能算是个平均水平,人均coding量必然是翻倍的(小厂就是翻十倍了),code供给量暴增,不会只停留在 repo 里,而会逐步变成更多长期运行的软件资产,长期存活的feature变多,product变多,microservice变多,API变多 长线来看,App/API所有的生产成本和生产周期会变成原来的10%,API实现极大富足。那么API的Usage就会大量的上升,这就会造成传统CPU Workload或者说CPU Seconds大量的上升,这甚至和agentic没有直接关系 时间维度上,这个逻辑并不是短期性质,Claude code的爆炸是这几个月刚发生的事情,那么产品上线,microservice,api上线,可能都要向后延迟。当软件变便宜,社会不会少用软件,只会把更多事情软件化 所以也许到下半年甚至更久才会看到,传统cpu云的需求又莫名其妙增加了,表面上看,甚至和AI agent没有直接关系 4. CPU是一个技术上很难通缩的东西,不像内存/存储有很多压缩算法会降低单任务对存储的用量,CPU workload增长转化成硬件需求增长是实打实的 比如说kvcache其实每年都有各种压缩技术出现,老的压缩技术比如kvcache的multi-head它会share一个head(GQV),这个大概会相当于4倍的压缩,再比如说去年turboquant这个技术也会新带来几倍的压缩。然后加上数据精度从FP16到现在的下一步要到FP4,精度的下降都会带来kvcache的压缩,从而带来存储方面的技术通缩。 但CPU是一个技术层面上通缩量很小的事情,目前任何的agentic的cpu workload(CPU seconds)增长都是硬件需求增长,它通缩的方面只有每年每一代跑分提高的10%到15%。如果说另外通缩因素,比如云的五倍六倍的超卖会不会影响?不会,因为它一直是超卖的,所以说超卖/利用率低这个CPU技术通缩的因素不会继续扩大了,每个增长的CPU seconds都是不怎么带打折的硬件线性增长 ARM的指引是CPU的供需缺口可能会到30%以上,这几个原因的叠加,加上AI服务器对CPU服务器产能和订单的挤压,可能会让缺口更大,各个hyperscaler的反应可能是会滞后的 ------------------ CPU整体需求潜力增长的同时,ARM服务器CPU也赶上了历史上最好的时代: Hyperscaler为了节省成本,接近50%的新增传统server CPU都是ARM,Google的Axion,Amazon的Graviton,Microsoft的Cobolt,Graviton甚至2026年的产能已经全部卖完,瓶颈成了产能 Google TPU配Axion,Amazon Tranium配Graviton,Nvidia Rubin配自家Vera CPU,这部分CPU为什么会集体转向ARM,除了成本因素之外,也因为推理系统为了追求token throughput,batch越来越高越做越复杂,自研ARM CPU以及系统性软件硬件的co-design会更方便,比如Nvidia是Dynamo去控制Vera和Rubin之间的协同 Nuvacore的规划上来看,不仅仅满足于做IP,也要做成品,因为在招聘网站上出现了validation engineer的职位 但是这次Nuvacore面临的挑战也不小:起步太晚了,无论是市场上,还是技术上,竞争都激烈了很多。CPU服务器和七年前比,已经复杂了很多,已经不再是单片CPU的竞争,而是rack系统级别的复杂度 现在开始做2028~2029年上市的CPU,要做到rack级别有竞争力,规模要大很多,基本上要几十个chiplet,500+个core拼起来,还要考虑如何适配AI agentic workload,工作量比以前明显要大的多,对一个startup的挑战比七年前也大得多 ---------------- 上次Nuvia在成立两年之后成功的以14亿美元出售,这次市场热度比五年前高了一个数量级,Nuvacore之后的路会怎么走呢? 如果是被收购路线,其实买家可能比五年前比并没有更多,这五年里,Google有了Axion,微软有了Cobalt,Amazon有了Graviton,Nvidia自研的Vera CPU已经成型,连ARM也打破了35年来只做IP的常规,开始做自己的AGI CPU芯片 最有可能的是Softbank系,softbank已经在ARM CPU服务器生态上布局深耕了多年,65亿美元收购了Ampere,再收购Nuvacore是很正常的事情,这个市场想象力足够大 其他的选择也可能是Meta,因为几家互联网公司里,只有Meta的silicon house没有稳定可靠的CPU服务器,有限的资源在MTIA都做AI加速器去了 但是Meta的问题在于稳定性极低,决策每个月都在变化,注意力非常短期化,项目随时取消,对Nuvacore来说完全无法兑现潜力,是一个非常糟糕的买家 但总体来说,Nuvacore的选择肯定比五年前宽了太多了,对ARM CPU服务器的潜力大家的共识都很明确,融资的难度要小很多,自己运营扩张起来,阻力比以前小很多,合作伙伴的配合程度上也因为未来预期,会容易很多 完全可以自己做大到比Nuvia当年更大的规模再考虑出路,根本不着急卖
顯示更多
0
28
486
97
轉發到社區