💾 太强了,把 AI 的整个记忆库压进一个文件里
GitHub 已经封神,16.2K stars
给 AI 做知识库,通常要起一套:向量数据库一个服务,全文检索一个服务,元数据再放个数据库。开发时跑 Docker Compose,部署时三个组件挨个配,想把知识库拷给同事,得导出三份东西。
Memvid 把这些收进单个 `.mv2` 文件:文件头、预写日志、数据段、全文索引、向量索引、时间索引全在里面,拷贝一份文件就等于搬走了整个记忆库。检索能力一样不少,全文用 Tantivy 加 BM25,向量走 HNSW,本地嵌入跑 ONNX 模型,支持 BGE、Nomic Embed Text 和 GTE 系列。
核心是 Rust 写的,另外给了命令行工具、Node.js SDK 和 Python SDK。PDF 文本提取、图像嵌入、音频转录、加密这些都是可选特性,示例里有 CLIP 图像检索和 Whisper 音频转录。
顺带一提,它 v1 那套把数据编码进二维码的方案已经弃用了,现在这版务实得多。
好的抽象不是加一层,是把三层合成一个文件。
GitHub:
顯示更多