注册并分享邀请链接,可获得视频播放与邀请奖励。

Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
加入 March 2025
678 正在关注    10.8K 粉丝
♻️ 真香!DeepSeek 公开的 DeepJIT,让 GPU 算子编译一次就能在多用户、多进程、多台机器之间共享复用,英伟达显卡和华为昇腾 NPU 走的是同一套接口。 仓库 9 月 8 号才建,挂在 DeepSeek 官方 GitHub 账号下,只有头文件,引进 C++20 项目就能用。 跑大模型时不少自定义算子是运行时现编译的,一个进程编一遍、一台机器又编一遍,卡一多,光等编译就把启动拖慢了。 DeepJIT 的做法是给每份编译产物算一个缓存键,源码、引用的头文件、编译器版本、编译选项都算进去,结果放进本地或分布式文件系统上的共享目录,别的进程、别的节点命中了就直接加载,不用再编。 用 PyTorch 的也不用额外折腾,默认跟着当前的 CUDA 流或 torch_npu 流走,通过 pybind11 就能接进来。目前只支持 Linux,按历史记录预热缓存、直接从 Python 传源码编译这两项还在开发中,暂时用不了。 编一次到处用,集群越大,省下的等待时间越多。 GitHub:
显示更多