註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Mulight 沐光🌟 | Gate美股0费率
@Mulight
胜不妄喜,败不惶馁。胸有激雷而面如平湖。 AI 研究员 & 美股分析师 AIGC • AI Agent • 链上 • 预测 商务:@mulight0826 沐光之城:
加入 September 2022
3.7K 正在關注    14.9K 粉絲
Deekseek 的API要涨价了,而且输出和输入的token还是分开计价,用了几个月累计才这点,我的hermes全靠deepseek,兄弟们有没有性价比高的平替?
顯示更多
553GB的K3模型,在12GB内存的笔记本上跑起来了。三步就能复现。 GitHub上的colibri项目把K3的GGUF量化版用Docker跑在WSL2里,只给了12GB内存。553GB的权重当然塞不进内存,但它换了个思路,用mmap把权重映射到磁盘文件上,操作系统自动管理哪些页面留在RAM里。RSS停在12GB,但背后实际映射了31.7GB数据。 操作很简单。模型文件放NVMe上,docker compose up -d,第一次等八分钟建权重缓存,之后每次启动0秒加载。curl发请求跟OpenAI API格式完全一样。 速度不快,七分钟左右出一个回复。跑K3的门槛从64GB内存加显卡,降到了一台闲置笔记本加块NVMe。
顯示更多