卧槽,Kimi &GLM 5.2 联合体牛 !
让GLM 5.2 终于有眼睛了。
有人直接把Kimi的MoonViT视觉编码器挂到了GLM 5.2上,做成了一个可用的视觉版本,还开源了NVFP4量化权重。
这不是官方联合训练的完整多模态模型,而是把一个Kimi 强视觉编码器和另一个团队的强语言模型硬接在一起,居然能直接用。
以前大家觉得多模态必须从头一起训才能对齐好,现在这种“插件式”组装已经开始出现实用效果。
强视觉编码器可以像模块一样被复用,文本模型也能快速获得看图能力。
模型地址:
显示更多
🔬 RadixArk 开源了一个专门干大模型后训练的强化学习框架 Miles,几千张卡的任务中途挂了也不用从头再来
GitHub 上两千六百多 star、四百多个 fork,v0.1 是今年 8 月刚发的。
做过大规模后训练的都知道最肉疼的是哪一下:一个任务连着跑好几天,推理引擎中间抽风一次,整个作业就得重启,几十小时的卡时直接打水漂。Miles 把这件事按住了,SGLang 引擎出问题时能原地恢复接着跑,不重启任务。
它的分工是 SGLang 扛高吞吐 rollout、Megatron-LM 扛可扩展训练,想轻装上阵也有一套基于 PyTorch FSDP2 的后端。中间那些隐形损耗它也一并收拾了:rollout 和训练之间不再来回 detokenize 和 retokenize,token 进 token 出;MoE 老大难的路由不一致,用 Rollout Routing Replay 压了下去。
再往上,MXFP8 和 NVFP4 这类低精度训练它支持,硬件从 NVIDIA 的 GB300、B200 一路吃到 AMD 的 MI355X,DeepSeek-V4、Kimi-K3、GLM-5.2 这些模型是发布当天就能训。项目本身是从 slime fork 出来的,LoRA 训完的适配器能直接扔给 SGLang 做 rollout,不用中间那道转换。
训大模型最贵的从来不是算力,是重跑一遍的那几天。
GitHub:
显示更多
过去一年端侧推理公司的股价杀得很凶,两个原因叠在一起。消费电子和汽车需求走弱,把原有的出货基本盘压掉了一截;同时市场看到推理几乎全在云端完成,端侧那点算力承载不了日常可用的大模型,成长逻辑没有落点。
模型侧最近出现了变化。DeepSeek V4 Flash 0731 是 284B 的 MoE,每 token 只激活 13B,两台 DGX Spark 用 200Gbps RoCE 互联做 TP=2,配合投机解码,单流解码落在 40 到 60 tok/s 这个区间,上下文拉到 40 万甚至百万量级仍然可用,prefill 在 1.7k tok/s 附近。数字随上下文长度、并发数和 draft 接受率浮动,但已经越过了”能日常用”的线。
Qwen3.8-27B 走的是另一条路,做完 NVFP4 量化加投机解码,单台 GB10 就能跑出可交互的速度。稀疏激活加低比特量化两件事凑到一起,把”本地能用”的硬件门槛压到了五六万这个量级的盒子上。
国内做端侧推理的公司不少都在往这个形态上靠,多卡互联之后的实测性能可以接受,对应的需求是个人、小团队,以及数据不能出门的小公司做本地部署。
产品线的距离也没有原来想的那么远。国内车规大算力芯片这两年为了做 L3 域控,单颗等效算力已经到七百 TOPS 量级,Transformer 硬加速和混合精度在架构里就有,高速片间互联的物理通道也已经存在,改造成互联卡的成本低于从零设计。今年车展上车规平台的开发板已经现场跑千问 VLM,有些端侧推理芯片也进了消费级 AI 主机,三十瓦整机功耗下本地能到几十 tok/s。
真正要算清楚的是内存和互联。MoE 省下来的是计算,省不掉的是权重容量和 KV cache 带宽,单卡挂多少内存、卡间用什么方案互联、能给到多大带宽和多低延时,决定了盒子跑得动多大的模型、多长的上下文,TOPS 反而是最不构成约束的一项。出货量级、毛利结构和客户结构跟车规业务也完全不同,这部分要单独建模。
市场此前给这批公司的定价,隐含假设是端侧长期不存在大模型场景。现在这个假设还站不站得住,值得重新看。
显示更多