Register and share your invite link to earn from video plays and referrals.

Bieriszc
@Bieriszc
无聊写bug撸毛自动化亏钱
Joined March 2012
347 Following    430 Followers
这轮 Qwen、DeepSeek、Kimi 旗舰开源模型给我最大的启发,不只是参数量继续增长,而是: Open-weight ≠ easy to self-host。 过去企业所谓的 self-host,基本是: 买一台 Dell/HPE/Supermicro 8卡 OEM AI server → 下载权重 → vLLM/SGLang → 挂一个内部 API。 但现在,部分满血或 FP8 frontier model 已经跨过单个 8-GPU NVLink domain 的显存边界;另一些即使勉强装得下,也几乎不给 KV cache、长上下文、并发和 HA 留空间。 真正的生产部署开始需要: 16/32张GPU、多节点高速网络、TP/PP/EP、prefill-decode separation、KV/state routing、调度、监控和故障恢复。 Self-host 的最小单位,正在从 single-node OEM AI server 变成 multi-node AI factory。 这并不意味着 OEM AI server 没有市场。FP4、Flash、蒸馏版、企业领域模型、RAG 和 Agent 仍然适合单节点部署。但想运行满血 frontier open model,企业买的已经不是一台服务器,而是一套 rack-scale infrastructure。 这也解释了为什么 open-source 不一定会削弱 NBIS、CRWV 等 Neocloud,反而可能强化它们: 模型权重被民主化了,但 frontier infrastructure 没有被民主化。 NBIS 和 CRWV 最新财报验证了几个趋势: 需求已经从训练扩散到 post-training、managed inference、open models 和 enterprise; 旧一代 GPU 仍可以承接 FP4、推理、RAG、Agent 和 batch workloads; GPU 的“技术前沿寿命”可能只有1–2年,但“经济产生现金流的寿命”可以达到5年以上; 真正稀缺的不是单张GPU,而是已经通电、联网、可调度、可交付的 AI cluster。 所以 NVIDIA 的 moat 也不应只理解为 CUDA,而是: GPU + NVLink/NVSwitch + Networking + Communication Libraries + Serving Stack + OEM/Cloud ecosystem。 同时,NVIDIA 数据中心业务正在“期货化”: 未来的 token 需求 → AI客户签长期算力合同 → Neocloud获得预付款和融资 → 提前购买GPU和网络设备 → NVIDIA今天确认收入。 NVDA赚的是短 duration,Neocloud承担的是长 duration。 这对 NVIDIA 未来12–24个月是 bullish:远期需求被提前锁定,收入可见性提高。 但长期风险也被推迟了:如果 active capacity 和真实 token demand 无法接住已经提前建设的 contracted capacity,最先出问题的不会是 NVIDIA,而是 Neocloud 的融资成本、客户预付款、GPU续租价格和 active MW 转化,之后才会传导成 NVIDIA 的订单悬崖。 因此分析 Neocloud 不能只看 Adjusted EBITDA,因为它剔除了最重要的折旧和利息。真正要看的是: active MW、客户预付款、项目回收期、折旧、利息、再融资和股权稀释。 我的结论是: Open-weight 正在民主化模型,但没有民主化 frontier compute。 Frontier self-host 正从 server-level deployment 升级成 cluster-level infrastructure。这个趋势对 NVIDIA、Neocloud 和 AI networking 都是长期利好,但股票选择取决于你愿意承担哪一种风险: CRWV 是高杠杆、执行更成熟的 AI utility; NBIS 是资产负债表相对更干净,但更依赖未来 capacity 兑现、估值和融资的 AI cloud growth stock。 $NVDA $NBIS $CRWV
Show more
看完了梁圣的演讲和很多twitter上面的观点,我先说下我的把。首先。GPU 五年折旧是合理的,CUDA 的单点锁定正在变弱,但 NVIDIA 的护城河并没有消失,而是从“软件锁定”升级成了“Token Economics+AI Factory 全栈”。 五年折旧不代表一张 GPU 五年后仍处于技术前沿,而是它在五年内仍能持续产生经济收益。新卡最初服务前沿训练、强化学习和最高端推理,随后逐步下沉到模型后训练、微调、RAG、企业 Agent、客服、文档处理、视觉 AI、批处理和开发测试。技术领先期可能只有两年,但经济寿命完全可以达到五年甚至更长。 H100 在 B200、GB200 和 B300 推出后仍然存在真实租赁需求,大型 H100 集群也可以在 xAI、Meta、Anthropic 等不同客户和工作负载之间重新配置。中国影子市场甚至愿意为受限制、缺乏官方支持的 NVIDIA GPU 支付显著溢价。这说明 NVIDIA GPU 不是一次性消耗品,而是具备通用性、流动性、可转租性和二级残值的生产资产。真正需要判断的不是第五年还能不能运行,而是第五年的租金、利用率和电力成本能否继续产生正贡献。 AI 从 hyperscaler 向 enterprise、银行、政府、医疗、制造和主权客户扩散,会进一步强化这条折旧逻辑。前沿模型公司永远希望获得最新 GPU,但大多数企业推理任务不需要最新一代架构。大量稳定、延迟要求适中、模型规模有限的企业工作负载,正好为旧 GPU 创造“第二生命周期”。因此,enterprise inference 不仅扩大 AI 算力需求,也会降低旧卡闲置率,延缓租金下滑和资产减值。 从 Neocloud 角度看,最理想的商业模式是:先通过 hyperscaler 和模型实验室的长期合同锁定基础收入,用这些锚定合同完成融资、建设数据中心和采购 GPU;再把剩余容量出售给 enterprise、政府、金融、医疗、机器人和 AI-native 客户,提高利用率和租金上限。大客户负责保底,长尾客户负责提高 ROIC。 这也是为什么 NVIDIA GPU 对 Neocloud 比专用 ASIC 更有价值。Neocloud 的核心能力不是只服务一个固定内部工作负载,而是把同一批算力在不同客户、模型和行业之间反复变现。今天可以租给 Meta,明天可以租给 Anthropic,之后还可以拆分给银行、医疗、企业软件和推理客户。通用 CUDA 生态、NVLink、网络、通信库、模型兼容性、OEM 支持和二级租赁市场,共同提高了资产流动性。 Dell、HPE、Supermicro 最近的订单、backlog 和客户结构,也在验证 AI 正从少数科技巨头向 enterprise 和 sovereign 客户扩散。Hyperscaler 有能力开发 TPU、Trainium 或其他 ASIC,也有足够的软件和编译器团队承担迁移成本;普通银行、政府和制造企业没有。它们更关心的是能否由 Dell、HPE、SMCI 或 Cisco 直接交付,能否满足安全、数据主权、合规、可靠性和运维要求,出现问题时由谁负责。在这种 OEM 驱动的企业市场里,NVIDIA stack 仍然是风险最低、部署最快、生态最完整的默认选择。 梁文锋关于 CUDA 的判断有一部分是对的。TileLang、Triton 和 AI 编程正在降低 Kernel 开发和跨平台迁移难度,所以“客户因为代码无法迁移而永远离不开 CUDA”的护城河确实在变浅。但 CUDA 从来不只是写 Kernel。真正的平台还包括驱动、编译器、cuDNN、cuBLAS、TensorRT、NCCL、NVSHMEM、NVLink、InfiniBand、Spectrum-X、调试工具、集群调度、故障恢复、OEM 认证和云端支持。 Jensen 很早就开始把 NVIDIA 的竞争标准从“单颗 GPU 和 CUDA 锁定”上移到 AI Factory 的整体经济性:tokens per watt、cost per token、revenue per megawatt、集群利用率、部署速度和可靠性。 旧的 NVIDIA 护城河是: 你很难离开 CUDA。 新的 NVIDIA 护城河是: 你即使可以离开,也未必能获得更好的 Token ROI。 因此,真正威胁 NVIDIA 的,不是竞争芯片能够运行同一个模型,而是竞争平台能够同时做到接近的模型效果、tokens/watt、cost/token、集群可靠性、部署速度、OEM 支持和跨客户流动性。在此之前,CUDA 的单点锁定可能继续变弱,但 NVIDIA 作为 AI Token Factory 和 enterprise AI Factory 默认平台的系统级护城河仍然存在。
Show more