TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Macro_Lin
@LinQingV
Ex-quant & PM|AI chip design|Semis × Capital Markets|Not Financial Advice
参加 February 2019
1.5K
フォロー中
55K
ファン
Macro_Lin
@LinQingV
2026.08.24 01:46
过去一年端侧推理公司的股价杀得很凶,两个原因叠在一起。消费电子和汽车需求走弱,把原有的出货基本盘压掉了一截;同时市场看到推理几乎全在云端完成,端侧那点算力承载不了日常可用的大模型,成长逻辑没有落点。 模型侧最近出现了变化。DeepSeek V4 Flash 0731 是 284B 的 MoE,每 token 只激活 13B,两台 DGX Spark 用 200Gbps RoCE 互联做 TP=2,配合投机解码,单流解码落在 40 到 60 tok/s 这个区间,上下文拉到 40 万甚至百万量级仍然可用,prefill 在 1.7k tok/s 附近。数字随上下文长度、并发数和 draft 接受率浮动,但已经越过了”能日常用”的线。 Qwen3.8-27B 走的是另一条路,做完 NVFP4 量化加投机解码,单台 GB10 就能跑出可交互的速度。稀疏激活加低比特量化两件事凑到一起,把”本地能用”的硬件门槛压到了五六万这个量级的盒子上。 国内做端侧推理的公司不少都在往这个形态上靠,多卡互联之后的实测性能可以接受,对应的需求是个人、小团队,以及数据不能出门的小公司做本地部署。 产品线的距离也没有原来想的那么远。国内车规大算力芯片这两年为了做 L3 域控,单颗等效算力已经到七百 TOPS 量级,Transformer 硬加速和混合精度在架构里就有,高速片间互联的物理通道也已经存在,改造成互联卡的成本低于从零设计。今年车展上车规平台的开发板已经现场跑千问 VLM,有些端侧推理芯片也进了消费级 AI 主机,三十瓦整机功耗下本地能到几十 tok/s。 真正要算清楚的是内存和互联。MoE 省下来的是计算,省不掉的是权重容量和 KV cache 带宽,单卡挂多少内存、卡间用什么方案互联、能给到多大带宽和多低延时,决定了盒子跑得动多大的模型、多长的上下文,TOPS 反而是最不构成约束的一项。出货量级、毛利结构和客户结构跟车规业务也完全不同,这部分要单独建模。 市场此前给这批公司的定价,隐含假设是端侧长期不存在大模型场景。现在这个假设还站不站得住,值得重新看。
もっと見る
0
0
46
72
9
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
TVer新着
@TVer_info
100K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
New York Post
@nypost
4.1M ファン
モデルプレス
@modelpress
2M ファン
一劍浣春秋
@chee828
231K ファン
空空道人
@Kongkongda5882
30.8K ファン
AKB48公式
@AKB48_staff
289.6K ファン
ファミ通.com
@famitsu
1.4M ファン
NMB48 Official
@nmb48_official
133.7K ファン
フレッシュ撮影会【公式】
@fresh_akiba
94.4K ファン
乃木坂46
@nogizaka46
2M ファン
HKT48
@hkt48_official_
150.8K ファン
中國新聞社
@CNS1952
547.1K ファン
吴说区块链
@wublockchain12
180.6K ファン