🐳 DeepSeek 刚开源了 DeepSelect,大模型里“从海量候选中挑出前 K 个”这一步,比 PyTorch 自带的 torch.topk 快 2 到 20 倍。
它是给 DeepSeek 稀疏注意力 DSA 和采样器用的 TopK 内核,而 DSA 就用在 DeepSeek V3.2、V4 和 V4.1 上。仓库昨天才建,今天就发了 1.0.0。
稀疏注意力的思路是每一步只看最要紧的那部分 token,挑哪几千个就靠 TopK;生成时从约 12.8 万的词表里采样,也要先挑出前 K 个候选。
DeepSelect 把这两个场景分别做了优化:批大小、词表大小随便设,K 最多到 4096,每一行还能单独设长度上限,接口同样返回 values 和 indices 两个张量。默认开着 NaN 检查,发现坏数值直接终止程序。
如果你在做推理框架、抠每一步的开销,可以拿仓库自带的基准测试跑一遍对比。
GitHub:
显示更多