登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
参加 March 2025
678 フォロー中    10.8K ファン
⚡ 一个二进制文件跑本地大模型,还给你 OpenAI 风格的接口 GitHub 上 5.7K stars,Rust 写的 本地跑模型最劝退的是环境:装 Python、配 CUDA、编译推理后端,一套下来两小时,换台机器再来一遍。 Shimmy 把这些压成一个单二进制:直接加载 GGUF 模型文件,起来就是 OpenAI 风格的 API 端点,原本调云端的代码改个地址就能用。2.0 版本把 llama.cpp 后端移除了,改用自研的 Airframe WebGPU 推理引擎,Rust 加 WGSL 实现。 模型覆盖上,项目列了 11 个模型家族和 25 种已认证的模型与量化组合,Q4_0、Q4_K_M、Q5_K_M、Q6_K 这些常见量化格式都在。还支持 YaRN RoPE 扩展上下文和 INT4 KV 缓存量化,显存紧张的机器能多撑一会儿。 本地推理这件事,越简单的方案活得越久。 GitHub:
もっと見る