🔥 浏览器里直接跑大模型的神器 WebLLM,不用后端、不用 API key,网页打开就能聊,算力全在用户自己电脑上
GitHub 狂揽 1.9 万 stars,配套论文挂在 arXiv 2412.15803,底下的运行时 TVMjs 由 CMU Catalyst、UW SAMPL、上海交大、OctoML 和 MLC 社区一起发起。
想给自己的网页加个 AI 功能,以前的流程是:搭个后端、接上 OpenAI、按 token 付费,最后还得跟用户解释一遍“你输进去的东西会经过我的服务器”。三件麻烦事,没一件跟你真正想做的功能有关。
WebLLM 靠 WebGPU 在浏览器里做硬件加速推理,接口照着 OpenAI 那套做的,流式输出和 JSON 模式都在,原来的调用代码基本不用改。Llama 3、Phi 3、Gemma-2B、Mistral-7B、Qwen2 这些开源模型原生就支持,自己的模型也能接进来。
跑起来也不会把页面拖死,模型可以丢进 Web Worker 或 Service Worker 里算,主线程该干嘛干嘛;模型文件缓存在浏览器 Cache API、IndexedDB 或者 OPFS 里,还能用 SRI 哈希校验一遍,防止半路被人掉包。想做成 Chrome 扩展也有现成例子。
上一代 AI 应用要先跟用户要信任,WebLLM 这种是压根不用要。
GitHub:
显示更多