过去一年端侧推理公司的股价杀得很凶,两个原因叠在一起。消费电子和汽车需求走弱,把原有的出货基本盘压掉了一截;同时市场看到推理几乎全在云端完成,端侧那点算力承载不了日常可用的大模型,成长逻辑没有落点。
模型侧最近出现了变化。DeepSeek V4 Flash 0731 是 284B 的 MoE,每 token 只激活 13B,两台 DGX Spark 用 200Gbps RoCE 互联做 TP=2,配合投机解码,单流解码落在 40 到 60 tok/s 这个区间,上下文拉到 40 万甚至百万量级仍然可用,prefill 在 1.7k tok/s 附近。数字随上下文长度、并发数和 draft 接受率浮动,但已经越过了”能日常用”的线。
Qwen3.8-27B 走的是另一条路,做完 NVFP4 量化加投机解码,单台 GB10 就能跑出可交互的速度。稀疏激活加低比特量化两件事凑到一起,把”本地能用”的硬件门槛压到了五六万这个量级的盒子上。
国内做端侧推理的公司不少都在往这个形态上靠,多卡互联之后的实测性能可以接受,对应的需求是个人、小团队,以及数据不能出门的小公司做本地部署。
产品线的距离也没有原来想的那么远。国内车规大算力芯片这两年为了做 L3 域控,单颗等效算力已经到七百 TOPS 量级,Transformer 硬加速和混合精度在架构里就有,高速片间互联的物理通道也已经存在,改造成互联卡的成本低于从零设计。今年车展上车规平台的开发板已经现场跑千问 VLM,有些端侧推理芯片也进了消费级 AI 主机,三十瓦整机功耗下本地能到几十 tok/s。
真正要算清楚的是内存和互联。MoE 省下来的是计算,省不掉的是权重容量和 KV cache 带宽,单卡挂多少内存、卡间用什么方案互联、能给到多大带宽和多低延时,决定了盒子跑得动多大的模型、多长的上下文,TOPS 反而是最不构成约束的一项。出货量级、毛利结构和客户结构跟车规业务也完全不同,这部分要单独建模。
市场此前给这批公司的定价,隐含假设是端侧长期不存在大模型场景。现在这个假设还站不站得住,值得重新看。
显示更多