♻️ 真香!DeepSeek 公开的 DeepJIT,让 GPU 算子编译一次就能在多用户、多进程、多台机器之间共享复用,英伟达显卡和华为昇腾 NPU 走的是同一套接口。
仓库 9 月 8 号才建,挂在 DeepSeek 官方 GitHub 账号下,只有头文件,引进 C++20 项目就能用。
跑大模型时不少自定义算子是运行时现编译的,一个进程编一遍、一台机器又编一遍,卡一多,光等编译就把启动拖慢了。
DeepJIT 的做法是给每份编译产物算一个缓存键,源码、引用的头文件、编译器版本、编译选项都算进去,结果放进本地或分布式文件系统上的共享目录,别的进程、别的节点命中了就直接加载,不用再编。
用 PyTorch 的也不用额外折腾,默认跟着当前的 CUDA 流或 torch_npu 流走,通过 pybind11 就能接进来。目前只支持 Linux,按历史记录预热缓存、直接从 Python 传源码编译这两项还在开发中,暂时用不了。
编一次到处用,集群越大,省下的等待时间越多。
GitHub:
顯示更多