TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Macro_Lin
@LinQingV
Ex-quant & PM|AI chip design|Semis × Capital Markets|Not Financial Advice
가입 February 2019
1.5K
팔로잉 중
55K
팬
Macro_Lin
@LinQingV
2026.07.18 14:18
开源模型的参数规模迅速膨胀,性能也在逼近甚至追平闭源frontier model。K2(1T)到DeepSeek V4 Pro(1.6T)再到K3(2.8T),间隔不到12个月。K3在独立评测中已经能对标Claude Fable 5,企业拿开源模型做私有化部署,不再是性能上的妥协,而是成本和隐私上的优选。 当这类万亿级MoE模型真正落地部署,硬件侧的瓶颈就不在算力了,而在内存容量、数据格式(FP4)、以及scale-up域内的低延时高带宽互联。 K3总参2.8T,FP4量化后权重约1.4TB,每个token只激活896个专家中的16个,计算量不大,但专家路由要求全部权重可访问,GPU大部分时间在等内存读取,不是在算。FP4不再是可选的精度降级,而是架构级的刚需,推理芯片如果不在硬件层原生支持FP4,基本没法跑这个体量的模型。 MoE模型的推理通常采用专家并行(EP),每个token的expert routing都需要跨卡通信完成分发和结果聚合。scale-up域内的低延时高带宽互联质量,直接影响用户端的token rate和系统的总吞吐。参数规模越大,需要装进同一个低延时域的权重越多,scale-up域也必须跟着扩大。 关于scale-up域内的具体方案,我在之前”把一万块芯片变成一台计算机”的三篇推文里详细讨论过,这里不再展开。 另一个被拉动的环节是CXL。MoE模型98%以上的专家权重在任意时刻是冷的,纯靠HBM装太贵。把冷专家放CXL-attached DDR5,热专家留HBM,做分层调度,理论上成本可以大幅下降。再往下一层,把更冷的权重卸载到高速SSD也在成为可行的路径,学术界和工业界都已经有MoE专家分层加载的方案在验证。未来大概率是HBM放热专家,CXL DRAM放温专家,SSD放冷专家,形成多级内存层次。Astera Labs和澜起在CXL控制器芯片上的卡位已经很清楚了,一个吃全球hyperscaler,一个吃中国本土供应链。 开源模型的参数规模没有放缓的迹象,scale-up域必须跟着扩大。更大的scale-up域意味着更多的HBM容量、更大的先进封装面积、更多的高速光互联和铜互联、更多的CXL内存扩展、以及更多的retimer。这条需求链条会随着每一代开源模型的参数膨胀持续拉长。 除了上边聊到的,还哪些受益环节?大家可以一起聊聊。
더 보기
0
0
7
154
23
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.1M 팬
オリコンニュース
@oricon
1.9M 팬
Reuters
@Reuters
26.3M 팬
Hello! Project Link
@UpFrontLink
15.5K 팬
一劍浣春秋
@chee828
230.5K 팬
billboard
@billboard
16.5M 팬
ATEEZ(에이티즈)
@ATEEZofficial
4.8M 팬
Pop Base
@PopBase
6.4M 팬
MLB
@MLB
13.6M 팬
First Squawk
@FirstSquawk
556.2K 팬
Forbes
@Forbes
20.3M 팬
JO KWON
@2AMkwon
976.9K 팬
BOYNEXTDOOR
@BOYNEXTDOOR_KOZ
870.1K 팬
루아(RUA/露雅)🍀
@Ru_a09
40.9K 팬
Binance
@binance
16.1M 팬