From 3ea24129a7f9c442ee229901e663772b69cee693 Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?oliver=20k=C3=B6nig?= Date: Tue, 14 Apr 2026 14:55:21 +0000 Subject: [PATCH] ci: mark test_fused_indexer_loss_gradient_tp_consistency as flaky_in_dev MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Co-Authored-By: Claude Sonnet 4.6 Signed-off-by: oliver könig --- .../experimental_attention_variant/test_attention_variant_dsa.py | 1 + 1 file changed, 1 insertion(+) diff --git a/tests/unit_tests/transformer/experimental_attention_variant/test_attention_variant_dsa.py b/tests/unit_tests/transformer/experimental_attention_variant/test_attention_variant_dsa.py index 96253a4ca10..45470d4dd6c 100644 --- a/tests/unit_tests/transformer/experimental_attention_variant/test_attention_variant_dsa.py +++ b/tests/unit_tests/transformer/experimental_attention_variant/test_attention_variant_dsa.py @@ -423,6 +423,7 @@ def test_fused_indexer_loss_gradient_matches_autograd(self, seqlen_and_topk, spa class TestFusedDSAIndexerLossGradientTP: """Test FusedDSAIndexerLoss gradient consistency across different TP sizes.""" + @pytest.mark.flaky_in_dev @pytest.mark.skipif(not torch.cuda.is_available(), reason="CUDA not available") def test_fused_indexer_loss_gradient_tp_consistency( self, tensor_model_parallel_size, sparse_loss