가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Andy Stewart
@manateelazycat
懒猫微服CEO | 前Deepin CTO | 仗剑走天涯 懒猫微服购买链接 懒猫微服有啥用?
가입 April 2009
556 팔로잉 중    53.5K 팬
AI模型动态KV Cache技术分享 这两天一直在研究上下文和KV Cache的动态调节技术,终于被我搞出来了 现在用户部署的时候,KV Cache会根据用户输入的上下文动态调节显存占用的值,而不是像原来那样通过 --gpu-memory-utilization 固定的显存分配申请 KV Cache 按照公式 2 GiB + tokens × 87 KiB 来计算,再按 256 MiB 对齐 改动以后, Qwen 3.8 27B 512K和900K上下文的显存差距可以拉到 30GB 左右, 用户可以用多余的30GB显存并行跑其他模型
더 보기
Qwen 3.8 27B真的太智能了, 自动帮我做很多事情 这几个星期的移植,我的感受, 如果一个模型只有代码数据,没有其他数据, 30B的稠密模型就可以解决80%工程师遇到的问题
더 보기