CUDA: branchless Q4_K/Q5_K unpack to speed up mmvq, L2 prefetch on DGX Spark - #26705
Merged
am17an merged 10 commits intoSep 7, 2026
Merged
background
wait
wait-all
cancel
parallel
Loading