AI模型动态KV Cache技术分享
这两天一直在研究上下文和KV Cache的动态调节技术,终于被我搞出来了
现在用户部署的时候,KV Cache会根据用户输入的上下文动态调节显存占用的值,而不是像原来那样通过 --gpu-memory-utilization 固定的显存分配申请
KV Cache 按照公式 2 GiB + tokens × 87 KiB 来计算,再按 256 MiB 对齐
改动以后, Qwen 3.8 27B 512K和900K上下文的显存差距可以拉到 30GB 左右, 用户可以用多余的30GB显存并行跑其他模型
顯示更多
Qwen 3.8 27B真的太智能了, 自动帮我做很多事情
这几个星期的移植,我的感受, 如果一个模型只有代码数据,没有其他数据, 30B的稠密模型就可以解决80%工程师遇到的问题
顯示更多