2.78 万亿参数模型,终于开始“走下神坛”了。
过去几年,大模型竞争的一个核心指标,就是参数量,每一次参数跃迁,都意味着更大的训练成本、更恐怖的显存需求,也意味着普通开发者越来越难参与。
但现在,事情正在发生变化。
有人做了一个只有 176KB 的纯 C99 推理引擎,让一个 2.78 万亿参数的 Kimi K3 模型,可以在 8.24GB 内存的 CPU 上运行。
没有 GPU。
没有 CUDA。
没有复杂框架。
听起来很神奇!
它没有把整个模型塞进内存,而是通过磁盘流式读取MoE,需要哪个,就加载哪个。
不管用什么方式,大模型从“云端巨型基础设施”,走向“人人可拥有的计算能力”,一定是大势所趋。
在过去,
模型 = 巨量服务器
算力 = 数据中心的 GPU 集群
普通用户 = 调用 API
以后可能变成:
模型 = 本地文件
算力 = 手里的电脑、手机、边缘设备
用户 = 自己掌控 AI
这和当年开源操作系统、开源数据库的发展路径非常像。
早期,最强的软件运行在昂贵服务器上;
后来 Linux、MySQL 让普通开发者也拥有了企业级能力。
AI 可能正在经历类似的阶段。
虽然,本地运行 2.78T 参数,并没有什么很好的性能。
流式加载必然速度巨慢,延迟巨高,稍微复杂的任务依然是需要占用更大的资源。
但它证明了一件非常关键的事情:
未来限制 AI 普及的,可能不再是模型规模,而是模型是否足够开放、足够高效。
闭源模型在追求更强的能力上限;
开源模型正在疯狂的“让更多人用起来”。
当一个万亿参数模型,有一天可以像安装软件一样进入普通电脑……
那真的很疯狂。
显示更多