注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 SebastianRaschka
SebastianRaschka 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 SebastianRaschka 的推特
推荐这篇笔记,对 Kimi K3 架构的独立技术拆解。 六个要点——最让人意外的一条:它完全没有使用位置嵌入,在 2.8T 这种规模上仍然是第一个。 Sebastian Raschka 在 Kimi K3 技术报告发布第二天(7/28)写了一篇精炼的架构笔记,今天登上了 HN 首页(#12,419# 分)。文章很短但信息密度高,以下是六个要点。 1. 本质上是 Kimi Linear 的超级放大版 K3 的架构直接继承自去年的 Kimi Linear(48B),只是从 48B 放大到了 2.8T。"K3 是目前最大的开源权重模型。"(注:Kimi K3 有 2.8T 总参数,104B 激活) 2. 唯一新增组件是 LatentMoE 与 Kimi Linear 相比,K3 唯一的新架构组件是 LatentMoE——和 Nemotron 3 Ultra 使用的结构相同。核心思想是把大型线性层压缩(下投影),类似于 multi-head latent attention(MLA)的做法。 3. 整体趋势指向推理效率 K3 延续了 Nemotron 3、DeepSeek V4 等模型的共同方向:用效率优化版替换标准组件。具体来说: • MoE → LatentMoE • 标准 attention → multi-head latent attention + Kimi Delta Attention (KDA) 4. Attention Residuals 是唯一非效率类改动 与 DeepSeek V4 用 mHC(manifold-constrained Hyper-Connections)改进残差路径不同,K3 使用 Attention Residuals——跨层连接残差,连接本身用 attention score 作为重要性/贡献权重。根据技术报告,它一致地改善验证损失和下游性能(少量提升),带来约 4% 的训练成本增加和 2% 的推理成本增加。 5. K3 完全去掉了 RoPE K3 在所有层使用 NoPE(No Positional Embeddings),这也是从 Kimi Linear 继承的。近期其他架构的趋势是在局部 attention 层(如 sliding window attention)使用 RoPE,在全局层使用 NoPE。有过一些纯 NoPE 的架构,但据 Raschka 所知,K3 是第一个达到前沿水平的纯 NoPE 模型。 6. 原生多模态支持 K3 现在原生支持视觉输入——Raschka 把它列为值得关注的新增能力。 Raschka 的结论 "有一些其他有趣的训练细节在技术报告中,但架构方面的要点就是这些。总的来说是一次非常棒的发布。" Raschka 的 LLM 架构画廊(涵盖本文提到的所有组件): 原文: #KimiK3# #LLMArchitecture# #SebastianRaschka#
显示更多
想建立高质量的AI信息流,从这15个账号开始! 这 15 个账号基本覆盖了: 研究 工程 教育 开源 产品 AGI 思考 AI 真实能力评测 @karpathy 他的推文经常提前定义 LLM 叙事。很多你两个月后在 LinkedIn 上看到的 AI 话题,可能他早就讲过了。 @fchollet Keras 作者,ARC-AGI 提出者。经常分享关于智能、本质能力、Benchmark 和 AI 局限性的深度思考。 @ylecun 深度学习先驱,Meta 首席 AI 科学家。观点很宏观,也经常有对 AI 研究路线的批判和讨论。 @AndrewYNg AI 教育领域的传奇人物。内容非常实用,覆盖机器学习建议、课程、产品落地和真实世界应用。 @rasbt Sebastian Raschka,经常分享实用 ML / LLM 实现、“从零构建”教程,以及相关书籍内容。 @dair_ai 高频更新 ML / AI 论文线程,用通俗方式拆解前沿研究,适合快速跟进 AI 进展。 @lilianweng 前 OpenAI 成员。她的 Lil’Log 风格内容非常值得看,擅长深入拆解 LLM 研究和技术细节。 @jeremyphoward 经常分享 AI / Crypto 相关观点,也长期推动实用深度学习的普及和大众教育。 @simonw Django 联合创始人。聚焦实用 LLM 工具、实验、提示词、Agent 和工程实践拆解。 @_akhaliq 持续整理最新 arXiv 论文、模型发布、开源 AI 项目和研究动态,信息流非常快。 @ID_AA_Carmack 关注 AGI 和底层优化问题,很多观点能让你重新思考“智能”和“工程”的本质。 @gwern 高质量长文作者,擅长 AI 研究笔记、深度 essays 和长期主义视角的技术观察。 @goodside 专注 LLM 评测、提示词研究和真实能力测试,经常能看到非常细的模型行为观察。 @drfeifei 计算机视觉先驱,关注以人为中心的 AI、空间智能和未来 AI 研究方向。 @demishassabis Google DeepMind CEO。长期关注通用 AI 的未来方向,也是理解 DeepMind 路线的重要窗口。 大家还有要补的吗?评论区👇👇👇👇
显示更多
0
10
126
26
转发到社区