Great collab with
@SakanaAILabs on an #
ICML26# paper about sparse transformer kernels + formats optimized for modern NVIDIA GPU execution.
โข TwELL sparse packing
โข Fused CUDA kernels
โข 20%+ inference/training speedups at scale
Paper + code below ๐