가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Sixeared
@6_eared
@CantonNetwork@CanPayAI MOD | Canton Coin ($CC) Holder Sharing insights on trading automation & Canton ecosystem | Host Old-school AI Agent | Peace & Love
가입 May 2014
3.9K 팔로잉 중    5.3K
刚刚还在说 K3 部署得花不少钱,这不,马上有人开始研究怎么让大模型的蒸馏少烧一点机器。 K3 这种 2.8T 模型,光 BF16 原始权重就约 5.6TB。 Moonshot 官方给出的建议是 64+ accelerators 的 supernode。那我们就粗算一下,假设全部用 H200。 H200 单卡有 141GB HBM,公开价格按约 2.7 万美元算,折合人民币大约 19 万一张。 64 张 H200,就是约 1200 万人民币。 这还只是 GPU。 再加上 CPU、内存、NVMe、高速网络、服务器、电源、散热和后续运维,一套真正拿来跑 K3 的 64-accelerator 集群等等等等…… 所以自己部署的话,算下来三千万左右吧,人民币啊。 这个 GitHub 项目做的事情就很明确:把教师模型每个位置 Top-100 的 logits 先缓存下来,学生后面直接用缓存训练,减少教师反复计算的成本。 另外,它把 KL loss 改成 Fused Chunked 的计算方式,不再一次性生成完整的 vocab × seq 稠密张量,而是把输出投影直接融进 KL 计算,按 chunk 处理。 实际测试里,GPT-OSS 20B、32K context 的节点数从 4 个缩到 1 个,单步从 57 秒降到 12.23 秒,单 GPU 吞吐从 74.2 提到 345.7 TFLOP/s。 代码已经开源: 有条件的朋友可以去试试。 我倒想知道,看到这条的有多少大佬能自己部署 K3。 大佬带带弟弟。 论文在这里:
더 보기
既然 Kimi K3 已经把开放 Agent 模型带到 2.8T 参数这个规模,@Meta 为什么还发布一个 30B 的 Muse Glimmer? Kimi K3 代表的是一条很明确的路线:继续扩大开放模型的能力边界—— 2.8T 参数、1M context、视觉理解,面向长程 coding、知识工作和深度推理。Kimi 官方还建议用 64+ accelerators 的 supernode 部署它。它更接近在回答: 开放模型还能承载多复杂的 Agent 任务? Glimmer 选择的是另一种部署尺度。 30B 多模态、Apache 2.0 开放权重。 HuggingFace在发布说明里直接写了本地 coding、文档分析、个人助手,以及 “Claw- or Hermes-like setups”;发布当天还提供 transformers、llama.cpp、vLLM 接入,并展示了 GGUF 量化和 OpenAI-compatible endpoint 的本地运行路径。 Llama 早就能接进 Agent,Glimmer 的变化不在于第一次具备这项能力。我认为重点是: 这次发布把模型的使用语境更明确地放到了自行部署 Agent 的开发者场景里。 当然,本地不等于轻量。HF 给出的 BF16 推理参考仍是 1×80GB H100,这不是普通人能部署的;量化后的性能、硬件门槛和长期运维成本,还需要真实使用验证。 所以 Meta 发 Glimmer,并不是拿 30B 去打压 2.8T。 K3 把开放模型推向更大的能力规模;Glimmer 则把多模态、开放权重、量化路径和本地 Agent 工作流结合在一起。 Meta 这次关注的可能是另一类需求:开发者是否能把模型部署、修改,再接进自己的文件、工具和工作流。 出处:
더 보기