diff --git a/python/cudnn/deepseek_sparse_attention/indexer_forward/_interface_sm90.py b/python/cudnn/deepseek_sparse_attention/indexer_forward/_interface_sm90.py index b96474668..c83d4b5ae 100644 --- a/python/cudnn/deepseek_sparse_attention/indexer_forward/_interface_sm90.py +++ b/python/cudnn/deepseek_sparse_attention/indexer_forward/_interface_sm90.py @@ -47,8 +47,8 @@ def indexer_fwd( w: torch.Tensor, ratio: int = 4, qhead_per_kv_head: Optional[int] = None, - out: Optional[torch.Tensor] = None, sm_scale: float = 1.0, + out: Optional[torch.Tensor] = None, cu_seqlens_q: Optional[torch.Tensor] = None, cu_seqlens_k: Optional[torch.Tensor] = None, max_seqlen_q: Optional[int] = None, diff --git a/python/cudnn/deepseek_sparse_attention/indexer_forward/api.py b/python/cudnn/deepseek_sparse_attention/indexer_forward/api.py index ccf4b722d..bf3a0b1f9 100644 --- a/python/cudnn/deepseek_sparse_attention/indexer_forward/api.py +++ b/python/cudnn/deepseek_sparse_attention/indexer_forward/api.py @@ -229,6 +229,7 @@ def indexer_forward_wrapper( q_stage: int = 2, kv_stage: int = 4, sm_scale: float = 1.0, + out: Optional[torch.Tensor] = None, stream: Optional[cuda.CUstream] = None, cu_seqlens_q: Optional[torch.Tensor] = None, cu_seqlens_k: Optional[torch.Tensor] = None, @@ -267,6 +268,7 @@ def indexer_forward_wrapper( ratio=ratio, qhead_per_kv_head=qhead_per_kv_head, sm_scale=sm_scale, + out=out, cu_seqlens_q=cu_seqlens_q, cu_seqlens_k=cu_seqlens_k, max_seqlen_q=max_seqlen_q, @@ -286,6 +288,7 @@ def indexer_forward_wrapper( w, ratio=ratio, qhead_per_kv_head=qhead_per_kv_head, + out=out, m_block_size=m_block_size, n_block_size=n_block_size, num_threads=384,