From 7ea567a2458a4800a6a0e3e0a6ba41fcbd00d146 Mon Sep 17 00:00:00 2001 From: Martin Vit Date: Sat, 18 Jul 2026 15:53:47 +0000 Subject: [PATCH] build(cuda): pin CUTLASS DSL 4.5.3 for SM120 --- requirements/cuda.txt | 4 +++- 1 file changed, 3 insertions(+), 1 deletion(-) diff --git a/requirements/cuda.txt b/requirements/cuda.txt index 8bd497eb2e56..f80c46c07fd5 100644 --- a/requirements/cuda.txt +++ b/requirements/cuda.txt @@ -24,7 +24,9 @@ nvtx==0.2.15 fastsafetensors >= 0.3.2 # QuACK and Cutlass DSL for FA4 (cute-DSL implementation) -nvidia-cutlass-dsl[cu13]==4.6.0 +# 4.6.0 spills the SM120 B12X W4A16 prefill kernel (255 registers and a +# 256-byte stack per thread); 4.5.3 restores spill-free code generation. +nvidia-cutlass-dsl[cu13]==4.5.3 quack-kernels>=0.4.0 # Required for tml-fa4 # Tokenspeed_MLA for faster mla with spec decode