HuggingFace 独立研究者 AuroraAI-Research 把语言模型压到了 8 万参数——训练是在一台小米手机的 CPU 上完成的。
《Aurora-80K:一个现代微型语言模型》
Aurora-80K 是 AuroraAI-Research 发布在 HuggingFace 上的微型语言模型:正好 8 万参数,Apache 2.0 许可,整个权重文件只有约 0.3MB。作者称这是 Aurora 系列的新起点,用来取代之前那些"低效的旧模型",更大尺寸的版本已在路上。
最有意思的是词表设计。8 万参数的模型通常只能用几百词的词表,它却塞进了 4096 词表——靠分解表示:嵌入层拆成 64 个 cluster 向量和 64 个 sub-token 向量,相加组合出全部 4096 个词。128 个向量就顶起一张 4096 宽的嵌入表。
输出层同样分解。推理时先预测 cluster(64 选 1),再在 cluster 条件下预测 sub-token(64 选 1),两级合起来就是完整的 4096 词表概率。输入输出两头都省。
架构是现代配置的极简版:2 层 Transformer、hidden 64、SwiGLU 前馈、RMSNorm、ALiBi 位置编码配 256 的注意力窗口、4 头注意力。评测数字:Wikitext-2 BPB 3.2902,BLiMP 52.31%,Arc-Easy 26.05%。
训练数据是 fineweb-edu 按教育分 4 分以上过滤出的约 4000 万 token,跑 2 个 epoch。训练设备是小米 14T Pro,钉在 4 个 Cortex-X4 CPU 大核上,算上预处理和 tokenizer 训练,全程约 6 小时。
适合玩极限压缩、或者想研究"现代架构缩到最小长什么样"的人。仓库里权重、tokenizer、 齐全,装个 torch 就能在 CPU 上跑。AuroraAI-Research 主页还会更新更大的尺寸。
原文:
#
Aurora80K# #
TinyLM# #
开源模型#