⚡ 一个二进制文件跑本地大模型,还给你 OpenAI 风格的接口
GitHub 上 5.7K stars,Rust 写的
本地跑模型最劝退的是环境:装 Python、配 CUDA、编译推理后端,一套下来两小时,换台机器再来一遍。
Shimmy 把这些压成一个单二进制:直接加载 GGUF 模型文件,起来就是 OpenAI 风格的 API 端点,原本调云端的代码改个地址就能用。2.0 版本把 llama.cpp 后端移除了,改用自研的 Airframe WebGPU 推理引擎,Rust 加 WGSL 实现。
模型覆盖上,项目列了 11 个模型家族和 25 种已认证的模型与量化组合,Q4_0、Q4_K_M、Q5_K_M、Q6_K 这些常见量化格式都在。还支持 YaRN RoPE 扩展上下文和 INT4 KV 缓存量化,显存紧张的机器能多撑一会儿。
本地推理这件事,越简单的方案活得越久。
GitHub:
顯示更多