登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

Ren
@Ryrenz
参加 March 2025
0 フォロー中    0 ファン
♻️ 真香!DeepSeek 公开的 DeepJIT,让 GPU 算子编译一次就能在多用户、多进程、多台机器之间共享复用,英伟达显卡和华为昇腾 NPU 走的是同一套接口。 仓库 9 月 8 号才建,挂在 DeepSeek 官方 GitHub 账号下,只有头文件,引进 C++20 项目就能用。 跑大模型时不少自定义算子是运行时现编译的,一个进程编一遍、一台机器又编一遍,卡一多,光等编译就把启动拖慢了。 DeepJIT 的做法是给每份编译产物算一个缓存键,源码、引用的头文件、编译器版本、编译选项都算进去,结果放进本地或分布式文件系统上的共享目录,别的进程、别的节点命中了就直接加载,不用再编。 用 PyTorch 的也不用额外折腾,默认跟着当前的 CUDA 流或 torch_npu 流走,通过 pybind11 就能接进来。目前只支持 Linux,按历史记录预热缓存、直接从 Python 传源码编译这两项还在开发中,暂时用不了。 编一次到处用,集群越大,省下的等待时间越多。 GitHub:
もっと見る