diff --git a/tests/unit_tests/transformer/experimental_attention_variant/test_attention_variant_dsa.py b/tests/unit_tests/transformer/experimental_attention_variant/test_attention_variant_dsa.py index 96253a4ca10..45470d4dd6c 100644 --- a/tests/unit_tests/transformer/experimental_attention_variant/test_attention_variant_dsa.py +++ b/tests/unit_tests/transformer/experimental_attention_variant/test_attention_variant_dsa.py @@ -423,6 +423,7 @@ def test_fused_indexer_loss_gradient_matches_autograd(self, seqlen_and_topk, spa class TestFusedDSAIndexerLossGradientTP: """Test FusedDSAIndexerLoss gradient consistency across different TP sizes.""" + @pytest.mark.flaky_in_dev @pytest.mark.skipif(not torch.cuda.is_available(), reason="CUDA not available") def test_fused_indexer_loss_gradient_tp_consistency( self, tensor_model_parallel_size, sparse_loss