diff --git a/tests/integration/defs/perf/test_perf_sanity.py b/tests/integration/defs/perf/test_perf_sanity.py index b6c7737cbe5a..4a24d6f748d3 100644 --- a/tests/integration/defs/perf/test_perf_sanity.py +++ b/tests/integration/defs/perf/test_perf_sanity.py @@ -1391,7 +1391,9 @@ def _parse_disagg_config_file(self, config_file_path: str, config_file: str): for concurrency in concurrency_values: client_config_data = { "concurrency": concurrency, - "iterations": benchmark.get("multi_round", 1), + "iterations": 1 + if benchmark_mode == "gen_only" + else benchmark.get("multi_round", 1), "isl": benchmark.get("input_length", 1024), "osl": osl, "random_range_ratio": benchmark.get("benchmark_ratio", 0.0), diff --git a/tests/integration/test_lists/waives.txt b/tests/integration/test_lists/waives.txt index 7ced2db0c3f8..ff2a3a8429f1 100644 --- a/tests/integration/test_lists/waives.txt +++ b/tests/integration/test_lists/waives.txt @@ -325,9 +325,7 @@ disaggregated/test_disaggregated.py::test_disaggregated_gpt_oss_120b_harmony[gpt accuracy/test_llm_api_pytorch.py::TestDeepSeekV3Lite::test_bfloat16_4gpus[pp4-mtp_nextn=0-attention_dp=False-cuda_graph=False-overlap_scheduler=False-torch_compile=False] SKIP (https://nvbugs/6050489) disaggregated/test_disaggregated.py::test_disaggregated_overlap_gen_first[ctx_pp1-TinyLlama-1.1B-Chat-v1.0] SKIP (https://nvbugs/6057459) disaggregated/test_disaggregated.py::test_disaggregated_overlap_gen_first[ctx_pp4-TinyLlama-1.1B-Chat-v1.0] SKIP (https://nvbugs/6057460) -perf/test_perf_sanity.py::test_e2e[disagg_upload-gen_only-gb200_deepseek-v32-fp4_32k4k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-UCX] SKIP (https://nvbugs/5844149) -perf/test_perf_sanity.py::test_e2e[disagg_upload-gen_only-gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX] SKIP (https://nvbugs/5844149) -perf/test_perf_sanity.py::test_e2e[disagg_upload-gen_only-gb200_deepseek-v32-fp4_32k4k_con256_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-UCX] SKIP (https://nvbugs/5844149) +perf/test_perf_sanity.py::test_e2e[disagg_upload-gen_only-gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX] SKIP (https://nvbugs/6085022) perf/test_perf_sanity.py::test_e2e[disagg_upload-gen_only-gb200_deepseek-r1-fp4_128k8k_con128_ctx1_pp8_gen1_dep16_eplb0_mtp2_ccb-UCX] SKIP (https://nvbugs/6060119) perf/test_perf_sanity.py::test_e2e[disagg_upload-gen_only-gb200_deepseek-r1-fp4_128k8k_con64_ctx1_pp8_gen1_dep32_eplb0_mtp3_ccb-UCX] SKIP (https://nvbugs/6060119) full:sm89/accuracy/test_llm_api_pytorch.py::TestGemma3_1BInstruct::test_fp8_prequantized[torch_compile=False] SKIP (https://nvbugs/6070878) diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-UCX.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-UCX.yaml index 861b1fab55d1..faaf881af078 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-UCX.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-UCX.yaml @@ -48,24 +48,27 @@ worker_config: gen: print_iter_log: true max_batch_size: 1 - max_num_tokens: 256 + max_num_tokens: 8 + max_input_len: 32784 + max_seq_len: 40960 tensor_parallel_size: 8 moe_expert_parallel_size: 8 pipeline_parallel_size: 1 context_parallel_size: 1 enable_attention_dp: false + enable_lm_head_tp_in_adp: false cuda_graph_config: enable_padding: true max_batch_size: 1 kv_cache_config: enable_block_reuse: false - free_gpu_memory_fraction: 0.9 + free_gpu_memory_fraction: 0.25 dtype: fp8 tokens_per_block: 64 moe_config: backend: TRTLLM cache_transceiver_config: - max_tokens_in_buffer: 32768 + max_tokens_in_buffer: 32832 backend: UCX disable_overlap_scheduler: true speculative_config: &id001 @@ -84,6 +87,8 @@ worker_config: print_iter_log: true max_batch_size: 1 max_num_tokens: 32784 + max_input_len: 32784 + max_seq_len: 32832 tensor_parallel_size: 4 moe_expert_parallel_size: 4 pipeline_parallel_size: 1 @@ -93,14 +98,14 @@ worker_config: cuda_graph_config: null kv_cache_config: enable_block_reuse: false - free_gpu_memory_fraction: 0.6 + free_gpu_memory_fraction: 0.4 dtype: fp8 tokens_per_block: 64 moe_config: backend: CUTEDSL use_low_precision_moe_combine: true cache_transceiver_config: - max_tokens_in_buffer: 32768 + max_tokens_in_buffer: 32832 backend: UCX disable_overlap_scheduler: true speculative_config: *id001 diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml index 502f14dc896d..a2b8f7b1a8f4 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml @@ -49,6 +49,8 @@ worker_config: print_iter_log: true max_batch_size: 64 max_num_tokens: 128 + max_input_len: 32784 + max_seq_len: 40960 tensor_parallel_size: 32 moe_expert_parallel_size: 32 pipeline_parallel_size: 1 @@ -60,7 +62,7 @@ worker_config: max_batch_size: 64 kv_cache_config: enable_block_reuse: false - free_gpu_memory_fraction: 0.85 + free_gpu_memory_fraction: 0.5 dtype: fp8 tokens_per_block: 64 moe_config: @@ -70,7 +72,7 @@ worker_config: num_slots: 288 layer_updates_per_iter: 1 cache_transceiver_config: - max_tokens_in_buffer: 32768 + max_tokens_in_buffer: 32832 backend: UCX disable_overlap_scheduler: true speculative_config: &id001 @@ -88,6 +90,8 @@ worker_config: print_iter_log: true max_batch_size: 1 max_num_tokens: 32784 + max_input_len: 32784 + max_seq_len: 32832 tensor_parallel_size: 4 moe_expert_parallel_size: 4 pipeline_parallel_size: 1 @@ -97,14 +101,14 @@ worker_config: cuda_graph_config: null kv_cache_config: enable_block_reuse: false - free_gpu_memory_fraction: 0.6 + free_gpu_memory_fraction: 0.4 dtype: fp8 tokens_per_block: 64 moe_config: backend: CUTEDSL use_low_precision_moe_combine: true cache_transceiver_config: - max_tokens_in_buffer: 32768 + max_tokens_in_buffer: 32832 backend: UCX disable_overlap_scheduler: true speculative_config: *id001 diff --git a/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con256_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-UCX.yaml b/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con256_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-UCX.yaml index 24eb58b3b976..bdb9d1ded5ef 100644 --- a/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con256_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-UCX.yaml +++ b/tests/scripts/perf-sanity/disaggregated/gb200_deepseek-v32-fp4_32k4k_con256_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-UCX.yaml @@ -48,7 +48,9 @@ worker_config: gen: print_iter_log: true max_batch_size: 8 - max_num_tokens: 256 + max_num_tokens: 64 + max_input_len: 32784 + max_seq_len: 40960 tensor_parallel_size: 32 moe_expert_parallel_size: 32 pipeline_parallel_size: 1 @@ -60,14 +62,14 @@ worker_config: max_batch_size: 8 kv_cache_config: enable_block_reuse: false - free_gpu_memory_fraction: 0.85 + free_gpu_memory_fraction: 0.5 dtype: fp8 tokens_per_block: 64 moe_config: backend: CUTEDSL use_low_precision_moe_combine: true cache_transceiver_config: - max_tokens_in_buffer: 32768 + max_tokens_in_buffer: 32832 backend: UCX disable_overlap_scheduler: true speculative_config: &id001 @@ -85,6 +87,8 @@ worker_config: print_iter_log: true max_batch_size: 1 max_num_tokens: 32784 + max_input_len: 32784 + max_seq_len: 32832 tensor_parallel_size: 4 moe_expert_parallel_size: 4 pipeline_parallel_size: 1 @@ -94,14 +98,14 @@ worker_config: cuda_graph_config: null kv_cache_config: enable_block_reuse: false - free_gpu_memory_fraction: 0.6 + free_gpu_memory_fraction: 0.4 dtype: fp8 tokens_per_block: 64 moe_config: backend: CUTEDSL use_low_precision_moe_combine: true cache_transceiver_config: - max_tokens_in_buffer: 32768 + max_tokens_in_buffer: 32832 backend: UCX disable_overlap_scheduler: true speculative_config: *id001