註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 1-performing
1-performing 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 1-performing 的搜尋結果
🚨 九命公社 · 半月报(2026 年 1 月下) 🌏 九命公社 × Consensus Hong Kong 2026 九命公社已成为 #Consensus2026# 官方华语社区合作伙伴 📅 时间:2026.2.10 – 2.12(香港) 🎟 专属购票链接: 🎫 优惠码:RPCDESK 📢 Holder 召集令 & 预备猫友机制进行中 长期或新购 RPC NFT 但尚未入群的朋友,请前往官网登记。 新成员采用「预备猫友」3 个月观察制,可通过内容贡献、社区参与或推荐转正,共同维护社区质量与活力。 🐱 新增猫友公示 本期新增 5 位正式猫友 & 2 位预备猫友,分别来自: 腾亚创变、众安集团、DeGate、GMA、Networked OS、Zerocap 等机构, 欢迎加入九命公社 🐾 🎊 近期回顾 · DeGate × 九命公社|链上美股实用场景分享 · 九命公社作为 Consensus HK Top Performing Community Partner🎟 抽取 4 张 Consensus Hong Kong 门票中奖猫友:Peter Wang / Ruby Wang / Jim Gao / Cccai 📣 Consensus HK 期间社区活动预告 🧊 2.10 16:00|【冰浴共识 · 寒冬中的清醒】 🤖 2.10 夜|Consensus HK Side Event|AI + Web3 🔮敬请期待: 🧢 全新 Logo 专属周边即将上线(正式猫友专享) 🎫 2026 香港 Web3 嘉年华 85 折门票优惠同步开放 📡 官方渠道 详细信息请查看完整半月报:
顯示更多
🔥 感谢九命公社每一位猫友的支持! 刚刚收到 Consensus Hong Kong 官方确认: 九命公社是本届Consensus活动的 Top Performing Community Partner 🎉 ⏰ 重要提醒 Consensus Hong Kong 门票将于香港时间今日晚上 11 点正式涨价。 尚未购票的会员朋友,可通过九命公社社区专属优惠码完成购买: 🎟 专属优惠码:RPCDESK 🔗 购票链接: 🎁 社区回馈福利在官方微信群同步开启【未加入微信群的正式会员可以联系我们】 为感谢大家的支持,我们将: 👉 在香港时间 1 月 31 日晚上 12 点前,开奖 👉 抽取 4 张 Consensus Hong Kong 门票回馈社区 📌 说明: • 本次抽奖仅对九命公社正式会员开放 • 中奖后将进行正式会员身份核验,确认无误后发放奖励
顯示更多
DeepSeek V4 Pro 的 performance 没有拳打 GPT、脚踢 Claude也可以理解,毕竟它的模型参数只有 1.6T 嘛。 DeepSeek 主要还是主打一个性价比。我自己用下来,感觉 Pro 推理速度还是比 Flash 慢很多。 所以其实我主力还是会用 GPT,然后便宜的用 DeepSeek Flash,Pro 应该也不会作为主力的。
顯示更多
接下来的这个 P, 表示过去的历史表现(Past Performance)。 狗狗币对催化剂的反应具有高度一致性。 比如在 2021 年 4 月,马斯克的推文让狗狗币的价格从 0.06 飙升到 0.7 美元,2022 年 11 月,马斯克收购推特后支持狗狗,价格从 0.07 涨到 0.16 美元,这些历史案例都说明了狗狗币在重大催化剂出现时的极高敏感性。 A 是时间和个人日程(At What Time and Personal Schedule)。 加密货币市场 24 小时不间断交易,但是催化剂发布后的三两天往往是波动最大的黄金窗口期。在消息发布后及时入场,波动放缓或达到目标价位时灵活退出,就需要多点时间盯盘。 这类标的最好不使用硬止损,因为做市商可以看到你的止损,尤其是散户集中入场的时候,资金排列是一个集中的整数,很容易被定点清除。 这个 R 指的是风险回报比(Risk-Reward)。 假设在 11 月 9 日突破高点的 0.22 附近入场,止损设置在 0.2 附近,潜在的止盈位置就一定要超过 1 比 3,高回报才有利可图,那止盈点至少要在 0.28, 这在当时的市场狂热程度来看,能达到这个目标位的概率很高。
顯示更多
#preOPAI# 是否会受到OpenAI股权转让限制的影响? 1、preOPAI 底层的 OpenAI 股权通过直接投资获得,而非投资者之间的股权转让,不受该份近期声明影响。 2、preOPAI 由Republic发行的债务凭证,旨在反映 OpenAI 业绩表现,并非真实股票,持有代币不代表持有OpenAI股权。因此,preOPAI 的交易和转移不受OpenAI股权转让限制,因为它不等于 OpenAI 的股权。 Will preOPAI be affected by OpenAI’s equity transfer restrictions? 1. The underlying OpenAI equity exposure of preOPAI was obtained through direct investment, not through equity transfers between investors, and is therefore not affected by the recent statement. 2. preOPAI is a debt instrument issued by Republic, designed to reflect OpenAI’s performance. It is not actual equity, and holding the token does not represent ownership of OpenAI shares. Therefore, trading and transferring preOPAI are not subject to OpenAI’s equity transfer restrictions, as preOPAI is not OpenAI equity.
顯示更多
0
21
35
2
轉發到社區
刚过去的周末,白宫南草坪上办了场UFC Freedom 250,那画面想想就有意思。 World Liberty Financial成了官方合作伙伴,直接赞助了25万美元的Performance of the Night奖金池,钱用他们的USD1稳定币发给表现突出的选手。 我刷到新闻第一反应是,这不就是个品牌曝光吗?结果把币安和Gate最近的持币活动一对比,就觉得这事儿玩得挺好玩的。 赛事那边,USD1上了现场,还直接进了选手的实际奖金袋。观众不用先搞懂储备啥的,就能看到它真真切切地用来发钱。很多平时不怎么关注稳定币的人,可能就因为某个选手赢了比赛拿到USD1奖金,才第一次记住它。 平台这边,币安把USD1持仓奖励延长到7月10日,总共17800万枚WLFI按周分发。Spot、Funding、Margin、Futures这些账户的净持仓都能参与,部分保证金还有1.2倍权重。 Gate那边最高能到20% APR的软质押,无需锁仓,每天按平均持仓算收益。 一个负责让大家在大众场合看见它,一个负责让钱在账户里多待一会儿。曝光解决认知入口,奖励解决持有黏性,两边动作正好接上。 讨论一开始多冲着白宫UFC和巨额奖金去的,正面声音挺多的。时间拉长后,大家就开始聊收益规则和活动能不能持久了。 热闹能把人带进来,但长期还是得看真实使用场景。等这些额外补贴慢慢退场后,USD1还能不能自然地继续出现在支付、交易和结算里,这才是关键。 你是因为一次够大的曝光才注意到一枚稳定币,还是它反复出现在自己的账户和日常场景里,才会慢慢信任它呢?
顯示更多
0
41
52
0
轉發到社區
Agent 用久了以后,难点会变成稳定、可控、可复盘 ECC 做的是 agent harness performance optimization system 面向 Claude Code、Codex、OpenCode、Cursor 这些工具 README 里写到 61 agents、246 skills、dashboard GUI、operator workflows、optimization skill pack 和 status snapshots GitHub 现在约 194k stars,今天新增 1.9k stars。已经在搭多 agent 工作流的人,可以拆一下它的 skills、memory、安全和 benchmark 做法。 仓库地址:
顯示更多
推荐 @MengTo 为设计师和开发者们开源的 Skills MengTo 是 @designcodeio 和 创始人,在设计和开发结合方面有非常深的积累,他的分享必须关注起来,这个开源项目把设计指令、工作流、风格系统、抓取与调试经验都沉淀成了「四大类、75 个 Skills」 1. Codex workflows - 10 个 可复用的 Agent 操作流程(抓取、转 prompt、性能剖析、内容生产) video-to-superprompt、stitched-full-page-capture、html-to-interaction-prompts、daily-ui-inspiration-capture、optimize-web-animations、performance-profiling 2. Media - 2 个 按用途/裁切/比例挑选高质量图片素材 aura-asset-images、unsplash-asset-images 3. UI - 1 个 “像设计系统一样写 prompt”的方法论 design-first-ui-prompting 4. Web design - 62 个 落地页结构、动效系统、WebGL/3D、CSS 处理、布局系统、视觉风格 landing-page、pricing-page、gsap、threejs、tailwindcss、animation-on-scroll、globe-gl、cobejs、vantajs、progressive-blur、css-border-gradient、各种 dark/glass/skeuomorphic 风格包 ... 旗舰工作流:从参考视频到一键 HTML 1. video-to-superprompt —— 输入一段参考视频(设计稿/落地页/动画录屏),用 ffprobe+ffmpeg 抽帧,按“故事 / 布局 / 运动 / 视觉 / 技术重建 / 可访问性”六层分析,输出一个长到不看原视频也能重建的 paste-ready prompt,明确点名 GSAP ScrollTrigger、Lenis、Three.js、video.currentTime scrubbing 等具体机制。 2. html-to-interaction-prompts —— 把已有 HTML 页面(如 Aura Build 产物)拆成“单段/单动画/单按钮/单 hover/单 WebGL 效果”的可复用 prompt 文章。 3. stitched-full-page-capture —— 解决 Framer 等懒加载/滚动动画站点 fullPage 截图发白的痛点:滚动预热 → 视口分步截图 → 垂直拼接 → 用拼接图重切 section crop,并写回 manifest。配套 Playwright + ffmpeg 脚本。 4. daily-ui-inspiration-capture —— 把“浏览 + 抓取 + 参考研究 + prompt 生成”组合成每日自动循环,产出 prompt pack。 两个值得细读的 Skill 范式 1. design-first-ui-prompting 给出了一套固定 prompt 骨架:GOAL → FORMAT → LAYOUT → TYPE SYSTEM → COLOR+MATERIAL → IMAGERY → COPY → CONSTRAINTS → NEGATIVE PROMPT,并强调三个关键技巧: · “Variants > rerolls”:先锁定布局+层级+文案,再每次只改一个变量(角度/强调色/卡片排布/背景调子)。 · 2-pass 字体工作流:模型常拼错字时,先无字生成留出文字安全区,再回 Figma 排版。 · Constraints card:用 FONT / STYLE / MODE 三行小面板像 mini style guide 一样锚定输出。 2. landing-page 则示范了一个“设计 + 转化 + SEO”三合一 SOP:先收集页面目的/受众/证据/约束,再给核心结构(首屏 5 要素 → 中段论证 → 底部异议处理),列出 4 种布局选型、6 条高转化策略、headline/CTA 文案模板、逐节迭代顺序、SEO/AEO 清单和常见坑——典型地体现了“Skill = 操作规程”的写法。
顯示更多
聊聊闪迪之前财报披露的长期协议模式,也是能改变存储厂商业务逻辑和估值逻辑的核心。闪迪最近大力推广的“新商业模式”(简称NBMs),核心是与大客户(主要是数据中心、云服务商等)签订多年期长期供应协议,不再像传统存储行业那样靠季度现货议价,而是用强约束力的合同锁定产能、收入和风险。 之前财报电话会上CEO亲自回应市场质疑,明确指出:客户不仅有预付款,还提供了数十亿美元的抵押/金融担保物(collateral),一旦违约立即转化为赔偿。 基于闪迪财报电话会和10-Q文件披露。梳理下闪迪与客户签的长期协议条款 1、合同规模和覆盖范围 1)已签署5份多年期供应协议(最长可达5年)。 2)这些协议已锁定2027财年超过1/3的NAND出货量,CEO表示随着后续签约推进,这个比例有望突破50%。 2)其中仅第三季度签署的3份合同,最低合同收入(Remaining Performance Obligations,RPO)就达到约420亿美元。 2、预付款(Prepayments) 1)部分客户已直接支付现金预付款。截至第三季度末,已体现在资产负债表上的预付款约为4亿美元。 这部分预付款直接改善了闪迪的现金流,也降低了供应商的产能投资风险。 3、抵押物 / 金融担保(Collateral / Financial Guarantees) 1)总金融担保超过110亿美元(5份协议合计)。 2)除了4亿美元预付款外,其余部分通过第三方金融机构管理的多种金融工具(如信用证、保函、抵押品等)实现。这些担保覆盖整个合同周期(全生命周期有效),不是一次性。 3)关键约束力:如果客户未能完成季度采购义务,相关金融担保将立即自动转化为违约赔偿,直接补偿闪迪的损失。 4、价格机制
混合模式:短期部分固定价,长期部分引入浮动价,既给客户一定价格缓冲,也让闪迪在市场价格上涨时能额外获利。 CEO Goeckeler原话(大意):
“外界有时质疑这些协议能否落实。我可以明确地说,实际情况完全相反。我们的客户是真实地在以数十亿美元的抵押品为担保——通过由第三方金融机构管理的各类金融工具,在整个合同期内有效。如果他们未能按季度如期履约,相应的财务赔偿将立即支付给我们。” 为什么会变成强约束力的长期协议 1)主要还是AI驱动的数据中心成为NAND最大需求方,市场从“买方市场”转向“卖方市场”。 2)闪迪通过这些“带牙齿”的长约,实现营收能见度大幅提升、风险可控,同时激励自己扩大HBF(高比特闪存)等先进产能投资。 3)不这么做,供应商产能投资犹豫,供给受限,影响的还是下游客户的自身业务。 4)以前存储行业都是季度现货,价格波动很大,现在存储厂商对此心有余悸。 三星在之前财报会上也明确表示,新型合同加入预付款 + 最低收入保障 + 金融抵押品后,约束力远超过去“基于互信”的老模式。 海力士也有此动作。逐渐这种带有预付款和抵押物的长期协议可能成为存储行业的惯例了。 需要重视这种“长期协议 + 预付款 + 抵押物”的模式,不只是简单锁产能,而是把合同变成了强法律+金融绑定的框架:客户想拿稳定货源,就必须真金白银(预付款+担保)做背书;闪迪则获得稳定现金流和最低收入底线,双方风险共担。 其实更重要的是,这种长期协议机制能让存储厂商未来几年的业务增长变得非常确定,透明性大大提高。
顯示更多
0
19
70
16
轉發到社區
非常深度一篇文章,从GPU架构进化的第一性原理出发,重点解答市场长期担忧的问题:为什么每个GPU的HBM内存需求必然是指数级增长?为什么HBM需求不会像传统DRAM那样停滞或周期性崩盘?记录个要点当做阅读笔记 1. AI推理时代的核心KPI已彻底改变 CPU时代:最高KPI是“performance / FLOPS”(跑分越快越好)。 AI推理时代(尤其是agentic flow兴起后):最高KPI变成token经济学——单位成本/单位电力下的token吞吐量(throughput) + token生成速度。 Nvidia的“AI工厂”本质就是:最低成本输出最多token,同时尽量提高token速度。Pareto frontier曲线要不断向右上方移动。 2. Token吞吐量的第一性原理公式(核心结论) Token throughput = HBM Size(容量) × HBM Bandwidth(带宽)Batch size(同时处理的请求数) 的瓶颈 = HBM Size 因为每个请求都自带hot KV cache,必须放在HBM里。随着batch增大,KV cache线性增长,HBM容量必须同步线性增长(否则就像接驳车车厢太小,要分多趟拉人)。 每个user的token生成速度 的瓶颈 = HBM Bandwidth 生成每一个token都要多次高频读取HBM里的权重和KV cache。带宽越高,decode速度越快(就像接驳车车门越宽,旅客上下车越快)。 完整类比: 吞吐量 = 接驳车车厢容量(HBM Size) × 车门宽度(HBM Bandwidth)。 只要想让token吞吐量每一代翻倍,HBM的Size × BW乘积就必须翻倍。这是硬件天花板,软件优化无法根本替代。 3. CPU时代 vs. AI时代的本质差异 CPU时代:DDR只是“辅助”,升级极慢(DDR3到DDR5花了15年)。 原因:CPU有大量cache、superscaler等隐藏延迟;日常workload对带宽/容量需求低;app size增长慢。 AI/GPU时代:计算范式彻底转向“memory-bound”(内存受限)。 推理即内存,KV cache + 上下文长度 + 多请求并发,把所有压力都压在HBM上。HBM已从“锦上添花”变成决定性因素。 4. 验证与现实对应 Nvidia从A100 → Rubin Ultra的token吞吐曲线,与HBM Size × BW曲线在对数轴上几乎完全重合(文章提到图二)。 即使利用率(utilization)很难达到100%,HBM仍是整个系统的天花板。老黄必须逼御三家(三星、海力士、美光)不断升级,否则GPU就卖不出去。 5. 软件优化无法改变硬件需求 软件再优化(如LPU把权重搬到SRAM),也只是从另一个维度改善Pareto曲线,硬件天花板仍由HBM决定。就像CPU时代软件再快,CPU厂也必须持续升级跑分一样
顯示更多
AI半导体终局推演2026(I) 当新token经济学范式从GPU算力转移到HBM 本文从从GPU架构进化路线本质出发,解释这个市场长久以来担心的问题: 每个GPU的HBM内存需求为什么一定会是指数增长,为什么HBM需求指数增长不会停滞? 并推导token经济学在当前架构下第一性原理:token吞吐 = HBM size X HBM BW带宽 同时讨论了,为什么GPU的天花板被HBM的两个发展维度所决定 HBM周期性这个话题争议一直很大,乐观派认为AI带来的需求比以前要大的多,但市场主流仍然认为前几次上升周期也有需求每年20%+增长,这次又有什么不一样呢?AI不影响HBM和传统DRAM一样有commodity属性,一旦在需求顶峰扩产遇上需求下行又会重蹈覆辙。 我们可以从算力芯片架构视角,从第一性原理出发,来拆解和推演一下这个问题:为什么这次真的不一样 ------------------------------- 历史:CPU算力时代 很久以来,我们都处在CPU主导算力的时代,CPU的最高级KPI就是performance,跑的更快,所以每一代的CPU都用各种方法来提高跑分,最开始是频率上升,后来是架构演进superscaler等等 这个时候为什么DDR不需要很快的技术进步速度?比如DDR3到DDR5竟然经历了15年之久 因为这个时期的DDR的角色是纯粹的辅助,而且辅助功能极弱,以业界经验,DDR的速度即便是提高一倍,CPU的performance一般只能提高不到20%这个量级 为什么DDR带宽速度提高了用处不大?两个原因 1. CPU设计了各种架构去隐藏 DDR延迟,比如superscaler,加大发射宽度,用海量的ROB和register renaming来提高并行度隐藏延迟,一级缓存cache,二级缓存cache,削弱了DDR的带宽速度需求 2. CPU workload对DDR带宽要求并不高,大部分日常负载比如打开网页,DDR带宽是严重过剩的,甚至云端负载 也就是说,在CPU时代,DDR的带宽速度是不太有所谓的,DDR4和DDR5除了少数游戏就没啥差别,甚至JEDEC标准也进步缓慢。 另外,绝大部分app需要一直停留在DDR上的部分并不多,需要的时候从硬盘上调度到DDR即可,app的size增长没那么快,导致对DDR的容量需求也较为缓慢。 所以最近十年来,平均每台电脑上的DDR容量大概从7~8GB变成了23GB,十年只增长了3倍。 而这部分升级缓慢直接影响了营收,size容量计价是赚钱的主要方式,速度的提高只是技术升级,提高size的单价,这两个的升级需求都不大,需求主要是随着电脑/手机数量增长而增长 所以DRAM在带宽速度和容量这两个维度上,一直是都是芯片产业锦上添花性质的附属品,DDR升级带来的边际效用是很低的,跟CPU时代的最高KPI几乎没什么直接联系 -------------------------------------------- 而到了genAI 大模型为主导的新时代,计算范式转移让最高级KPI起了根本变化 GPU发展到AI推理的时代,不再像CPU那样只看跑分,最高级的KPI不再是算力TOPS/FLOPS,而是token的成本,特别是单位成本/单位电力下的overall token throuput 其次是token吞吐速度,因为在agent时代,很多任务变成了串行,token吞吐速度成了用户体验的重要瓶颈。 这也是为什么老黄发明AI工厂概念的原因:最低成本的输出最多token,同时尽量提高token吞吐速度 AI训练时代,老黄的经济学是TCO(total cost ownership),买的GPU越多,省的越多 而老黄在推理时代的token经济学是: AI推理的毛利润很可观,所以逻辑已经转换成:Nvidia GPU是这个世界上让token单价最便宜的GPU,买的GPU越多,赚的越多 最高的KPI变成了Pareto frontier曲线,在提高token 吞吐throughput和提高token速度两个维度上尽量优化 (见图一) NVIDIA 的 token factory 代际进步,其实是在把整条 Pareto frontier 往右上推,这就是是AI推理这个时代最重要的KPI ---------------------------------- 接下来是本文最重要的逻辑链,如何从token吞吐量指数型增长的本质出发,推导出天花板瓶颈在HBM size和HBM 带宽的指数型增长 单卡GPU推理单线程batch size = 1的时代,token吞吐只有一个维度,就是HBM的带宽速度,带宽速度越高,token吞吐越大 但进入NVL72的年代,推理不再是单卡GPU时代,而是72个GPU + 36个CPU整个系统级别的token工厂,把HBM带宽和算力用满,获得极致的token吞吐量 Token 吞吐throughput的增长,依赖两个东西:同时批处理的请求数 X 每个user请求的平均token速度 也就是batch size X per user token 速度 以Rubin NVL72为例,在平均token速度是100 token/s的情况下,同时批处理1920个请求,得到token吞吐量是19.2万token/s 一个Rubin NVL72大概是120KW(0.12MW)的功率,所以得到单位MW能处理1.6M token/s (见图一) 所以,我们需要想方设法提高这两个参数:批处理数量batch size和per user token的平均速度,这两者相乘就是我们的最高KPI,也就是token的吞吐量 ------- 第一个参数:batch size的增长,瓶颈在HBM size 批处理量里的每一个请求req,都会自带kv cache,这部分kv cache是需要存在HBM里的,大小大概在几个GB到数十GB不等 因为hot kv cache是随时需要高频高速读取,所以必须放在HBM里,比如一个大模型的层数是80层,那么每一个token的生成阶段,都需要读取80次HBM里的kv cache 随着批处理数量batch size的增长,会带来hot kv cache的线性增长 又因为这个批处理量的所有请求的hot kv cache,都要放在HBM上,这也就带来了HBM size必须要随着批处理量batch size线性增长 就像是机场接驳车,登机口尽量快的接旅客到飞机,HBM size小了,相当于接驳车size小了,就得多接一趟 结论是:批处理量的数量batch size,瓶颈依赖于HBM size的增长 --------- 第二个参数:每个user请求的平均token速度,瓶颈在HBM带宽 大模型decode阶段的速度,瓶颈取决于HBM的带宽速度,因为每生成一个 token,都要把激活的权重和kv cache 读很多遍 LPU的出现,在batch不那么大的情况下,把激活权重这个部分搬到了SRAM上,但是每生成一个 token仍然要从HBM读很多次KV cache。HBM带宽越高,生成每一个token的速度也就越快,基本上是线性对应的 就像是机场接驳车,登机口尽量快的接旅客到飞机,hbm本身带宽速度就像是接驳车的车门有多宽,门越宽,旅客上接驳车越快 GPU的其他配置,都是在适配batch的增长以及要让token compute的速度配平HBM的增长,甚至会用多余的算力来获得部分的带宽(比如部分带宽压缩技术) —----- 在那个接驳车的比喻例子里 接驳车的车厢大小 = HBM Size(容量): 决定了一次能装下多少名旅客(也就是能同时装下多少个请求的 KV Cache)。车厢越大,一次能拉载的旅客(Batch Size)就越多。如果车太小,想拉100个人就得分两趟,系统整体的吞吐量就上不去。 接驳车的车门宽度 = HBM Bandwidth(带宽): 决定了旅客上下车的速度。门越宽,大家呼啦啦一下全上去了(Decode/生成Token的速度极快)。如果门很窄,哪怕车厢巨大能装200人,大家也得排着队一个一个挤上去,全耗在上下车的时间里了。 旅客的吞吐量 = 接驳车车厢容量 x 接驳车旅客上车速度(车门宽度) —--------------------------- 至此,我们从逻辑上推演出了token经济学的硬件需求第一性原理: Token throughput = HBM size X HBM Bandwidth AI推理这个时代的最高KPI,实际上是高度依赖于HBM的两个维度的进步的 如果要维持token throuput每一代两倍的增长,实际上意味着,每一代的单GPU上,HBM size X HBM BW带宽之积要增长两倍! 这也是历史上第一次,HBM内存的size可以影响最高的KPI token throughput! 要验证这个理论,可以把Nvidia从A100到Rubin Ultra这几代的token 吞吐throughput,和HBM size X HBM BW 放在同一个图里比较 (见图二) 可以发现,这两个曲线的走势在对数轴上惊人的一致 HBM size x HBM带宽增长的甚至要比token吞吐量更快,毕竟HBM决定的是天花板,实际上这个天花板增长的利用率utilization是很难达到100%的,也就是说,HBM size x HBM 带宽就算增长1000倍,其他算力和架构的配合下,很难把这1000倍的天花板潜力全部榨干 这条曲线不是巧合,而是系统最优化的必然解 throughput = batch × Bandwidth,这就是token factory 经济学最绕不开的第一性原理 —-------- 软件的影响呢?软件的优化会不会降低带宽的需求?降低HBM的需求? 这跟硬件是独立两个维度的,这好像在问,如果CPU上的软件优化了之后跑的更快,是不是CPU就十年不用发展了?反正软件跑的更快了嘛 这样的话,CPU厂还能赚得到钱吗?CPU想要存活下去,只有一条路可走,在标准benchmark,不考虑软件优化,每一代CPU必须要跑分更高,不然就卖不出去 GPU也是一样,软件优化如何,和自己的token吞吐量KPI每年都要大幅进步,是两回事 只要token的需求继续增长,对token throuput的追求就绝不会停止,那么对HBM size X HBM 带宽的追求也不会停止 如果HBM size和HBM 带宽发展慢了,老黄一定会亲自到御三家逼着他们技术升级,因为这就是老黄gpu的天花板,天花板要是钉死了不进步,老黄的GPU还能卖出去吗? 当然了,Nvidia需要绞尽脑汁去从异构计算的架构角度榨取HBM天花板之外的部分,比如LPU就是一个很好的尝试,把Pareto frontier从另一个角度改善了很多 (右半边高token速度的部分) —-------------------------------------- HBM内存已然告别了那个随波逐流的旧时代,在这条由指数级需求铺就的单行道上,以一种近乎宿命的方式走到了产业史诗的主舞台中央 推理范式第一性原理演化到这一步,只要老黄还要卖GPU,HBM就必须翻倍,而且必须代代翻倍。这是supply side的内生压力,与AI需求无关,与宏观周期无关,与hyperscaler的心情也无关 剩下的问题,只有一个: 当需求被物理锁定为指数增长的时候,供给侧的三个玩家,会不会还像过去三十年那样,亲手把自己再拖回一次周期的泥潭?
顯示更多
0
7
197
62
轉發到社區