Register and share your invite link to earn from video plays and referrals.

flyingwhale-飞鲸投资笔记
@flyingwhale919
A retail investor focused on semiconductors /technology. Interested in industry trends/company fundamentals. Sharing research/insights/market observations
Joined March 2022
552 Following    4.9K Followers
在 CoreWeave ($CRWV) 2026 年 Q2 财报电话会议中,管理层特别提到有客户签署了延伸至 2029 年的 A100 租赁合同。 由于Michael Burry等空头认为很多大厂强行延长了GPU的折旧时间,属于财务粉饰;也因此很多人认为这狠狠地打了Michael Burry的脸。 打不打脸另说,但这至少说明英伟达的GPU硬件的使用寿命会比大家想象的要长很多。传统印象中硬件很快就会过时,但英伟达 $NVDA在软件生态方面的改进,对旧硬件的续命与价值挖掘是有突出贡献的。 英伟达并非仅靠更新硬件(如 Hopper/Blackwell)来提升性能,其全栈软件生态的持续演进大幅延长了 A100(Ampere 架构)的技术生命周期与投资回报率(ROI): 1. 推理优化框架(TensorRT-LLM / vLLM 兼容)大模型推理算力释放:英伟达推出的 TensorRT-LLM 以及对开源社区(如 vLLM)的深层适配,引入了如 PagedAttention、Chunked Prefill(分块预填充)、投机采样(Speculative Decoding) 等高级优化技术。吞吐量倍增:通过纯软件层的内存管理与 Kernel 融合优化,A100 在运行主流开源大语言模型(如 Llama 3 系列、DeepSeek 系列)时的推理吞吐量和延迟表现,比硬件发布初期提升了数倍,使其非常适合承担性价比极高的中量级推理任务。 2. FlashAttention 与算子级(Kernel)优化突破 HBM2e 带宽瓶颈:A100 拥有 80GB HBM2e 显存和 2 TB/s 带宽。随着 FlashAttention-2 及后期针对 Ampere 架构算子的持续重构,GPU 在注意力机制计算时的显存读写开销大幅降低,使得计算单元(Tensor Cores)利用率接近极限。 TF32 与 INT8/FP16 持续调优:英伟达在 CUDA 代码库中持续完善 Ampere 专有的 Tensor Float 32 (TF32) 及混合精度计算吞吐,免去了企业大幅修改底层代码的麻烦。 3. 多实例 GPU(MIG)与细粒度切分资源弹性复用:A100 硬件上支持将单卡切分为最多 7 个独立的 MIG(Multi-Instance GPU)实例。 云原生调度优化:结合英伟达 Triton Inference Server 和云厂商(如 CoreWeave)的编排软件,企业可以将 80GB 的 A100 精细化切分给轻量级 AI 服务(如 Embedding 模型、小参数微调、RAG 向量检索等),实现极高的资源利用率和单位成本效益。 4. CUDA 向后兼容性与生态长寿命支持(LTS)版本不脱节:英伟达最新的 CUDA 版本(如 CUDA 12.x+)和底层驱动保持着对 Ampere 架构的完整原生支持与功能适配。 NGC 优化容器:英伟达在 NGC(NVIDIA GPU Cloud)上持续更新针对 A100 优化的深度学习框架容器(PyTorch、TensorFlow、NeMo 等),确保用户无需更改底层架构即可直接享受到软件栈带来的性能增益。 总结与行业视角英伟达的“软硬一体”策略使硬件随着时间推移因软件更新而变快(Software-Driven Performance Upgrades):集群成熟度(已部署、即开即用、供电稳定) + 软件持续优化(降低推理 Token 成本) = 旧卡仍具备高经济价值。对于很多企业而言,训练超级大模型可能需要 Hopper 或 Blackwell,但在长尾推理、中小型模型微调、RAG 和数据预处理等场景下,经过软件高度优化后的 A100 提供了极佳的成本效益比,因此租赁合同顺理成章地延长到了 2029 年。
Show more