注册并分享邀请链接,可获得视频播放与邀请奖励。

AI Dance
@AI_Whisper_X
China AI insider | Silicon Valley Decoded 一边盯硅谷,一边扒中国AI 算法 + VC 双视角 · 讲人话 📬 aidance.info@gmail.com
加入 October 2024
293 正在关注    5.9K 粉丝
今天想复盘一下,大模型注意力机制的变化历史,以及各家开源模型的选择。 - Kimi K3:KDA+MLA - DeepSeek V4-Pro:不用 MLA 了,改共享 KV 加两道块压缩 - GLM-5:压缩 + 全层动态稀疏,还公开了否决线性的数据 - MiniMax:走过两条路,中间还退回过原点
显示更多