가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

晚点 LatePost
@latepostnews
AI|科技|商业 晚一点,好一点。商业的真相总是在晚点。 《晚点 LatePost》官方账号
가입 November 2025
23 팔로잉 중    13.1K 팬
算力受限,但 Infra 效率还有很大的提升空间 ARR 迅猛增长受益于编程场景需求的快速攀升和前沿模型的强大引力。作为对比,智谱 2026 年 2 月初 GLM-5 模型发布前 ARR 约为 1 亿美元左右,根据《晚点 LatePost》了解,GLM-5 发布后智谱 ARR 在短期内即实现翻倍。根据 Artificial Analysis 的评测,GLM-5 发布时位居全球第四,仅次于 Claude 当时最先进的两款模型以及 OpenAI 的 GPT-5.2。 通过先进模型发布牵引收入抬升的剧本在中美两国都已跑通。 Anthropic 年化收入在 2025 年底为 90 亿美元,半年后已迅猛增长到 500 亿美元(根据 SemiAnalysis 的测算,7 月已超过 600 亿美元)。除了编程场景需求跑通之外,Anthropic 连续推出超过 OpenAI 的领先模型被认为起到重要作用。 智谱是第一个把这个剧本在中国复制的公司,类似的故事月之暗面和阿里随后都经历了一遍。7 月 16 日 Kimi 发布 K3,次日 API 就因过载中断近六个小时,而 Kimi 甚至停止了新用户注册。8 月 3 日阿里发布 2.4 万亿参数的 Qwen3.8-Max,港股当天涨 7%,市值重回 2.4 万亿港元,从 6 月低点算起反弹超过四成。 但在 Anthropic 走通 coding 这条路之前,几乎没有人对算力供应瓶颈有充分的估计,甚至 Anthropic 自己也是如此。对中国大模型公司,算力紧缺更加严峻。 在物理硬件无法快速扩展的情况下,工程师们转而聚焦在通过算法提升已有模型的推理效率上,特别是针对长程任务的处理——这是编程需求的痛点。 过去智谱被认为在 Infra 上缺乏经验,但随着 GLM-5 带来的先发优势,智谱在过去半年飞速弥补 Infra 效率上的短板。智谱在 7 月已完成对中科加禾的收购,在此之前,双方已经联合办公了数月。 在技术博客中智谱表示,一个 Agent 干活时平均要往模型里塞 7 万多 token 的上下文,远超日常聊天内容,而通过分拆 KV 缓存,智谱和中科加禾的研究成果可以将单个推理服务吞吐随长程任务增长而最高提升达 132%。 在另一项名为 ZCube 的大模型推理网络架构方案中,智谱宣称它的研究成果可以提升整个生产集群的吞吐量高达 15%,同时降低 AI 基建中交换机与光模块需求多达三分之一。 5 月下旬,智谱推出了高速版 API,每秒生成 token 数达到 400,相比常规 API 服务速度提升约 8 倍,官方称其 “刷新当前全球大模型厂商 API 的速度上限”。这项研究成果来自与 TileRT 团队的合作,后者与 TileLang 来自同一团队——就是那份广为流传的梁文锋讲话里,被认为有潜力瓦解英伟达 CUDA 护城河的编程语言。 不少研究员都同意, Infra 上值得优化的东西实在太多。6 月 9 日,TileRT 团队又公布了与小米合作的成果,把 MiMo-V2.5-Pro 这个拥有 1 万亿参数的模型的速度推到了 1000 token/s。 随着编程需求的爆发,智谱新模型训练也越来越朝着长程任务的方向进行,同时在模型架构上尽可能照顾推理的需求,TileRT 在介绍与智谱合作的那篇博客上,把它列为下一阶段的任务:模型、编译器与硬件开始重新耦合。 5.2 的几项核心架构改动,几乎都在围绕推理成本设计。技术报告公开的包括 IndexShare——通过复用稀疏注意力层的索引器把百万 token 场景下单位 token 的计算量降低 2.9 倍;以及改进后的 MTP 草稿层,接受长度提升 20%,生成速度随之快约两成。 后训练阶段,智谱重新采用了 PPO(Proximal Policy Optimization,近端策略优化),并配套了名为 SAO (Single-rollout Asynchronous Optimization,单轨迹异步优化)的异步方法,让每条任务跑完立刻进入学习——行业方法通常在约一百六十步就崩溃的地方,它稳定训练了一千步;自研框架 slime 则能在约两天里把十几个专家模型合并成一个。 技术报告中没有公开的是推理引擎层面的配套改造,所有这些优化的最终结果是一张归一化图,如果把 GLM-5.1 处理 3.2 万 token 上下文时的吞吐看作基准的话,20 万上下文长度时,GLM-5.2 的吞吐能力为 4.7 倍,而 GLM-5.1 则为 2.77 倍,几乎高了 70%。 这也是目前模型公司共同的优化方向。Kimi 的 K3 在模型架构上更激进,它把四分之三的注意力层改成了所谓 “线性注意力”,相比于智谱的方法,这是一种 “有损” 的改动,带来的好处也是立竿见影:缓存体积大幅减少,吞吐能力同步提高。 一位投资人对《晚点 LatePost》表示,Infra 层优化将是未来一两年 AI 投资的重要主题:模型能力趋同之后,谁能把同样的卡跑出更多 token,谁的账就更好看。这让 Infra 人才的薪资增长飞快,1% 的效率提升放在大规模部署的算力设备中,节省下来的钱也是天文数字。
더 보기
《晚点 LatePost 》独家获悉,智谱 MaaS 开放平台注册用户(即 API 用户)近 700 万,相比七月初增长约 200 万,其中包括 2.3 万家企业客户,对标 Codex 的开发者产品 ZCode 上线 1 个月用户突破百万。 今年以来,智谱 ARR 增长 15 倍,根据我们了解,在 Kimi 和阿里新模型发布后,智谱 ARR 增速没有受影响。有投资人透露目前 ARR 来到 20 亿美元,但智谱官方已经否认,接近公司的人表示,实际数字应该更高。 若按 20 亿美元口径计算,注册用户当月平均在智谱开放平台花费约 160 元人民币。 7 月 21 日,市场传出智谱已建成规模 1 GW 的国产 AI 算力基础设施,据《晚点 LatePost》了解,有超过 5 万块国产算力芯片已经启用,以缓解日益增长的推理需求,7 月 31 日,智谱长期限售的 Coding Plan 在大幅涨价后已开放购买。
더 보기