From ef7fd4a042255ea03280bff55a42932c4ace9598 Mon Sep 17 00:00:00 2001 From: FredricZ-2007 <226039983+fredricz-20070104@users.noreply.github.com> Date: Fri, 7 Aug 2026 09:19:13 +0800 Subject: [PATCH] remove UCX cases on qa side Signed-off-by: FredricZ-2007 <226039983+fredricz-20070104@users.noreply.github.com> --- .../test_lists/qa/llm_perf_disagg.yml | 12 -- .../test_lists/qa/llm_perf_multinode.txt | 13 -- ...tx1_pp8_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml | 104 --------------- ...x1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml | 105 --------------- ..._dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml | 122 ------------------ ..._dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml | 112 ---------------- ...1_dep4_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml | 108 ---------------- ..._ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-UCX.yaml | 104 --------------- ...x1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml | 103 --------------- ...ctx1_tp1_gen1_dep8_eplb0_mtp0_ccb-UCX.yaml | 100 -------------- ...ctx1_pp4_gen1_dep8_eplb0_mtp1_ccb-UCX.yaml | 107 --------------- ...x1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml | 105 --------------- ..._dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml | 122 ------------------ ..._dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml | 112 ---------------- ...1_dep2_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml | 108 ---------------- ...x1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml | 103 --------------- 16 files changed, 1540 deletions(-) delete mode 100644 tests/scripts/perf/disaggregated/gb200_deepseek-r1-fp4_128k8k_con128_ctx1_pp8_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb200_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb200_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb200_glm-5-fp4_8k1k_con1024_ctx1_dep4_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb200_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb200_qwen3-235b-fp4_8k1k_con1024_ctx1_tp1_gen1_dep8_eplb0_mtp0_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb300_deepseek-r1-fp4_128k8k_con256_ctx1_pp4_gen1_dep8_eplb0_mtp1_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb300_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb300_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb300_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb300_glm-5-fp4_8k1k_con1024_ctx1_dep2_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml delete mode 100644 tests/scripts/perf/disaggregated/gb300_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml diff --git a/tests/integration/test_lists/qa/llm_perf_disagg.yml b/tests/integration/test_lists/qa/llm_perf_disagg.yml index 9acefe684999..42a168bd869a 100644 --- a/tests/integration/test_lists/qa/llm_perf_disagg.yml +++ b/tests/integration/test_lists/qa/llm_perf_disagg.yml @@ -9,37 +9,30 @@ llm_perf_disagg: tests: # GB200 DeepSeek-R1 - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_128k8k_con128_ctx1_pp8_gen1_dep16_eplb0_mtp1_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_128k8k_con128_ctx1_pp8_gen1_dep16_eplb0_mtp1_ccb-UCX] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_128k8k_con1_ctx1_pp8_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_128k8k_ctx1_pp4_gen8_pp4_bs2_eplb0_mtp0_con2-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_ctx1_gen3_tep8_bs32_eplb0_mtp0_con1_ccb-NIXL] TIMEOUT (120) # GB200 DeepSeek-V32 - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_32k4k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_32k4k_con256_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb256_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_8k1k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX] TIMEOUT (120) # GB200 GPT-OSS-120B - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-UCX] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) # GB200 Kimi-K2.5-Thinking - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_8k1k_con4_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) # GB200 Qwen3-235B - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_qwen3-235b-fp4_8k1k_con1024_ctx1_tp1_gen1_dep8_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_qwen3-235b-fp4_8k1k_con1024_ctx1_tp1_gen1_dep8_eplb0_mtp0_ccb-UCX] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_qwen3-235b-fp4_8k1k_con1_ctx1_tp1_gen1_tep4_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_qwen3-235b-fp4_8k1k_con64_ctx1_tp1_gen1_tep4_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) # GB200 wideep @@ -61,22 +54,18 @@ llm_perf_disagg: # GB300 DeepSeek-R1 - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_128k8k_con1_ctx1_pp4_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_128k8k_con256_ctx1_pp4_gen1_dep8_eplb0_mtp1_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_128k8k_con256_ctx1_pp4_gen1_dep8_eplb0_mtp1_ccb-UCX] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_128k8k_con64_ctx1_pp4_gen1_dep16_eplb0_mtp1_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_8k1k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX] TIMEOUT (120) # GB300 DeepSeek-V32 - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con256_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con256_ctx1_dep8_gen1_dep8_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb256_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_8k1k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX] TIMEOUT (120) # GB300 DeepSeek-V4-Pro - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v4-pro-fp4_8k1k_con1229_ctx7_dep4_gen1_dep8_eplb384_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v4-pro-fp4_8k1k_con666_ctx8_dep4_gen1_dep32_eplb384_mtp3_ccb-NIXL] TIMEOUT (120) @@ -84,7 +73,6 @@ llm_perf_disagg: # GB300 Kimi-K2.5-Thinking - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_kimi-k25-thinking-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-NIXL] TIMEOUT (120) - - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX] TIMEOUT (120) - perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_kimi-k25-thinking-fp4_8k1k_con4_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] TIMEOUT (120) # GB300 Qwen3-235B # GB300 wideep diff --git a/tests/integration/test_lists/qa/llm_perf_multinode.txt b/tests/integration/test_lists/qa/llm_perf_multinode.txt index 9eb5adbcf384..a050c7070cd9 100644 --- a/tests/integration/test_lists/qa/llm_perf_multinode.txt +++ b/tests/integration/test_lists/qa/llm_perf_multinode.txt @@ -2,13 +2,11 @@ # GB200 DeepSeek-R1 perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_128k8k_con128_ctx1_pp8_gen1_dep16_eplb0_mtp1_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_128k8k_con128_ctx1_pp8_gen1_dep16_eplb0_mtp1_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_128k8k_con1_ctx1_pp8_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_128k8k_ctx1_pp4_gen8_pp4_bs2_eplb0_mtp0_con2-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_8k1k_ctx1_gen3_tep8_bs32_eplb0_mtp0_con1_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_1k1k_con1024_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_1k1k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] @@ -17,16 +15,13 @@ perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-r1-fp4_1k1k_con3072 # GB200 DeepSeek-V32 perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_32k4k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_32k4k_con256_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb256_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_8k1k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX] # GB200 GPT-OSS-120B perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con128_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con4_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con512_ctx1_tp1_gen1_dep2_eplb0_mtp0_ccb-NIXL] @@ -34,7 +29,6 @@ perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_gpt-oss-120b-fp4_8k1k_con512 # GB200 Kimi-K2.5-Thinking perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb416_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_8k1k_con4_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_1k1k_con2048_ctx1_dep4_gen1_dep32_eplb0_mtp0_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_1k1k_con4096_ctx1_dep4_gen1_dep8_eplb0_mtp0_ccb-NIXL] @@ -42,30 +36,25 @@ perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_kimi-k25-thinking-fp4_1k1k_c # GB200 Qwen3-235B perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_qwen3-235b-fp4_8k1k_con1024_ctx1_tp1_gen1_dep8_eplb0_mtp0_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_qwen3-235b-fp4_8k1k_con1024_ctx1_tp1_gen1_dep8_eplb0_mtp0_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_qwen3-235b-fp4_8k1k_con1_ctx1_tp1_gen1_tep4_eplb0_mtp0_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb200_qwen3-235b-fp4_8k1k_con64_ctx1_tp1_gen1_tep4_eplb0_mtp0_ccb-NIXL] # GB300 DeepSeek-R1 perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_128k8k_con1_ctx1_pp4_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_128k8k_con256_ctx1_pp4_gen1_dep8_eplb0_mtp1_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_128k8k_con256_ctx1_pp4_gen1_dep8_eplb0_mtp1_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_128k8k_con64_ctx1_pp4_gen1_dep16_eplb0_mtp1_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_8k1k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX] # GB300 DeepSeek-V32 perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con256_ctx1_dep4_gen1_dep32_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_32k4k_con256_ctx1_dep8_gen1_dep8_eplb0_mtp0_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb256_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_8k1k_con1_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX] # GB300 DeepSeek-V4-Pro perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v4-pro-fp4_8k1k_con1229_ctx7_dep4_gen1_dep8_eplb384_mtp3_ccb-NIXL] @@ -74,7 +63,6 @@ perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_deepseek-v4-pro-fp4_8k1k_con # GB300 GLM-5 perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_glm-5-fp4_8k1k_con1024_ctx1_dep2_gen1_dep8_eplb256_mtp1_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_glm-5-fp4_8k1k_con1024_ctx1_dep2_gen1_dep8_eplb256_mtp1_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_glm-5-fp4_8k1k_con1_ctx1_dep2_gen1_tep8_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_glm-5-fp4_8k1k_con512_ctx1_dep2_gen1_dep32_eplb0_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_glm-5-fp4_1k1k_con1_ctx1_dep2_gen1_tep4_eplb0_mtp3_ccb-NIXL] @@ -84,7 +72,6 @@ perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_glm-5-fp4_1k1k_con512_ctx1_d # GB300 Kimi-K2.5-Thinking perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_kimi-k25-thinking-fp4_8k1k_con1024_ctx1_dep4_gen1_dep32_eplb416_mtp3_ccb-NIXL] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-NIXL] -perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX] perf/test_perf_sanity.py::test_e2e[disagg-e2e-gb300_kimi-k25-thinking-fp4_8k1k_con4_ctx1_dep4_gen1_tep8_eplb0_mtp3_ccb-NIXL] # GB300 Qwen3-235B diff --git a/tests/scripts/perf/disaggregated/gb200_deepseek-r1-fp4_128k8k_con128_ctx1_pp8_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb200_deepseek-r1-fp4_128k8k_con128_ctx1_pp8_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml deleted file mode 100644 index cc82fc3112de..000000000000 --- a/tests/scripts/perf/disaggregated/gb200_deepseek-r1-fp4_128k8k_con128_ctx1_pp8_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml +++ /dev/null @@ -1,104 +0,0 @@ -metadata: - model_name: deepseek_r1_0528_fp4_v2 - precision: fp4 - model_dir_name: DeepSeek-R1-0528-FP4-v2 - supported_gpus: - - GB200 - script_file: disaggr_torch.slurm - benchmark_type: 128k8k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 10 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '128' - input_length: 131072 - output_length: 8192 - dataset_file: datasets/perf-ci/deepseek_r1-128k8k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes TLLM_SPEC_DECODE_FORCE_NUM_ACCEPTED_TOKENS=1 - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 8 - max_num_tokens: 32 - tensor_parallel_size: 16 - moe_expert_parallel_size: 16 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 8 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 131104 - backend: UCX - disable_overlap_scheduler: true - speculative_config: &id001 - decoding_type: MTP - max_draft_len: 1 - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - max_batch_size: 1 - max_num_tokens: 131104 - tensor_parallel_size: 1 - moe_expert_parallel_size: 1 - pipeline_parallel_size: 8 - context_parallel_size: 1 - enable_attention_dp: false - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.3 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 131104 - backend: UCX - disable_overlap_scheduler: true - speculative_config: *id001 diff --git a/tests/scripts/perf/disaggregated/gb200_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb200_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml deleted file mode 100644 index 04e74a93b974..000000000000 --- a/tests/scripts/perf/disaggregated/gb200_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml +++ /dev/null @@ -1,105 +0,0 @@ -metadata: - model_name: deepseek_r1_0528_fp4_v2 - precision: fp4 - model_dir_name: DeepSeek-R1-0528-FP4-v2 - supported_gpus: - - GB200 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 5 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '4096' - input_length: 8192 - output_length: 1024 - dataset_file: datasets/perf-ci/deepseek_r1-8k1k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes TLLM_SPEC_DECODE_FORCE_NUM_ACCEPTED_TOKENS=1 - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 256 - max_num_tokens: 512 - tensor_parallel_size: 16 - moe_expert_parallel_size: 16 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 256 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - speculative_config: &id001 - decoding_type: MTP - max_draft_len: 1 - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - max_batch_size: 2 - max_num_tokens: 16384 - tensor_parallel_size: 4 - moe_expert_parallel_size: 4 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.6 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - speculative_config: *id001 diff --git a/tests/scripts/perf/disaggregated/gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml deleted file mode 100644 index 69919b355ed8..000000000000 --- a/tests/scripts/perf/disaggregated/gb200_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml +++ /dev/null @@ -1,122 +0,0 @@ -metadata: - model_name: deepseek_v32_fp4 - precision: fp4 - model_dir_name: DeepSeek-V3.2-FP4-v2 - supported_gpus: - - GB200 - script_file: disaggr_torch.slurm - benchmark_type: 32k4k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 2 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '2048' - input_length: 32768 - output_length: 4096 - dataset_file: datasets/perf-ci/deepseek_v32-32k4k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes TLLM_SPEC_DECODE_FORCE_NUM_ACCEPTED_TOKENS=1 - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 64 - max_num_tokens: 128 - max_input_len: 32784 - max_seq_len: 40960 - tensor_parallel_size: 32 - moe_expert_parallel_size: 32 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 64 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.5 - dtype: fp8 - tokens_per_block: 64 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - load_balancer: - num_slots: 288 - layer_updates_per_iter: 1 - cache_transceiver_config: - max_tokens_in_buffer: 32832 - backend: UCX - kv_transfer_timeout_ms: 600000 - disable_overlap_scheduler: true - speculative_config: &id001 - decoding_type: MTP - max_draft_len: 1 - num_postprocess_workers: 4 - stream_interval: 20 - nvfp4_gemm_config: - allowed_backends: - - cutlass - - cublaslt - - cutedsl - - cuda_core - ctx: - print_iter_log: true - max_batch_size: 1 - max_num_tokens: 32784 - max_input_len: 32784 - max_seq_len: 32832 - tensor_parallel_size: 4 - moe_expert_parallel_size: 4 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.4 - dtype: fp8 - tokens_per_block: 64 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 32832 - backend: UCX - kv_transfer_timeout_ms: 600000 - disable_overlap_scheduler: true - speculative_config: *id001 diff --git a/tests/scripts/perf/disaggregated/gb200_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb200_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml deleted file mode 100644 index 3256aebcc704..000000000000 --- a/tests/scripts/perf/disaggregated/gb200_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml +++ /dev/null @@ -1,112 +0,0 @@ -metadata: - model_name: deepseek_v32_fp4 - precision: fp4 - model_dir_name: DeepSeek-V3.2-FP4-v2 - supported_gpus: - - GB200 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 5 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '4096' - input_length: 8192 - output_length: 1024 - dataset_file: datasets/perf-ci/deepseek_v32-8k1k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 128 - max_num_tokens: 128 - tensor_parallel_size: 32 - moe_expert_parallel_size: 32 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 128 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - tokens_per_block: 64 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - load_balancer: - num_slots: 256 - layer_updates_per_iter: 1 - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - num_postprocess_workers: 4 - stream_interval: 20 - nvfp4_gemm_config: - allowed_backends: - - cutlass - - cublaslt - - cutedsl - - cuda_core - ctx: - print_iter_log: true - max_batch_size: 2 - max_num_tokens: 16384 - tensor_parallel_size: 4 - moe_expert_parallel_size: 4 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.6 - dtype: fp8 - tokens_per_block: 64 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb200_glm-5-fp4_8k1k_con1024_ctx1_dep4_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb200_glm-5-fp4_8k1k_con1024_ctx1_dep4_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml deleted file mode 100644 index 19c11f4a1f66..000000000000 --- a/tests/scripts/perf/disaggregated/gb200_glm-5-fp4_8k1k_con1024_ctx1_dep4_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml +++ /dev/null @@ -1,108 +0,0 @@ -metadata: - model_name: glm_5_nvfp4 - precision: fp4 - model_dir_name: GLM-5-NVFP4 - supported_gpus: - - GB200 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 10 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '1024' - input_length: 8192 - output_length: 1024 - dataset_file: -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes TLLM_SPEC_DECODE_FORCE_NUM_ACCEPTED_TOKENS=1 - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 128 - max_num_tokens: 256 - tensor_parallel_size: 8 - moe_expert_parallel_size: 8 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 128 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - load_balancer: - num_slots: 256 - layer_updates_per_iter: 1 - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - speculative_config: &id001 - decoding_type: MTP - num_nextn_predict_layers: 1 - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - max_batch_size: 2 - max_num_tokens: 16384 - tensor_parallel_size: 4 - moe_expert_parallel_size: 4 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.6 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - speculative_config: *id001 diff --git a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-UCX.yaml deleted file mode 100644 index a3684f5fca53..000000000000 --- a/tests/scripts/perf/disaggregated/gb200_gpt-oss-120b-fp4_8k1k_con1024_ctx1_tp1_gen1_tp4_eplb0_mtp0_ccb-UCX.yaml +++ /dev/null @@ -1,104 +0,0 @@ -metadata: - model_name: gpt_oss_120b_fp4 - precision: fp4 - model_dir_name: GPT-OSS-120B-FP4 - supported_gpus: - - GB200 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k - # Mirror of the Dynamo GPT-OSS-120B TRT-LLM disagg deployment recipe: - # https://github.com/ai-dynamo/dynamo/tree/main/recipes/gpt-oss-120b/trtllm/disagg -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: "--gres=gpu:4" - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 10 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '1024' - input_length: 8192 - output_length: 1024 - dataset_file: datasets/perf-ci/gpt_oss_120b-8k1k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - # Env vars taken from the Dynamo deploy.yaml (OVERRIDE_QUANT_ALGO selects - # W4A8_MXFP4_MXFP8, which is the distinguishing feature of this recipe vs. - # existing gpt-oss perf-sanity configs; PDL / no-parallel-weight-load / - # disabled NCCL graph register / disabled UCC collective are preserved so - # the same load & runtime paths are exercised). - worker_env_var: "TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes OVERRIDE_QUANT_ALGO=W4A8_MXFP4_MXFP8 TRT_LLM_DISABLE_LOAD_WEIGHTS_IN_PARALLEL=True NCCL_GRAPH_REGISTER=0 OMPI_MCA_coll_ucc_enable=0" - server_env_var: "TRTLLM_SERVER_DISABLE_GC=1" -profiling: - nsys_on: false -worker_config: - gen: - print_iter_log: true - tensor_parallel_size: 4 - moe_expert_parallel_size: 1 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: false - max_batch_size: 1280 - max_num_tokens: 20000 - max_seq_len: 11000 - trust_remote_code: true - allreduce_strategy: AUTO - attention_dp_config: - enable_balance: true - cuda_graph_config: - enable_padding: true - max_batch_size: 1280 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.85 - dtype: fp8 - moe_config: - backend: TRTLLM - cache_transceiver_config: - max_tokens_in_buffer: 9216 - backend: UCX - disable_overlap_scheduler: false - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - tensor_parallel_size: 1 - moe_expert_parallel_size: 1 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: false - max_batch_size: 64 - max_num_tokens: 20000 - max_seq_len: 9000 - trust_remote_code: true - cuda_graph_config: - enable_padding: true - max_batch_size: 30 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - moe_config: - backend: TRTLLM - cache_transceiver_config: - max_tokens_in_buffer: 9216 - backend: UCX - disable_overlap_scheduler: true - num_postprocess_workers: 4 - stream_interval: 20 diff --git a/tests/scripts/perf/disaggregated/gb200_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb200_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml deleted file mode 100644 index 04a85f5b3f40..000000000000 --- a/tests/scripts/perf/disaggregated/gb200_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml +++ /dev/null @@ -1,103 +0,0 @@ -metadata: - model_name: k25_thinking_fp4 - precision: fp4 - model_dir_name: Kimi-K2.5-NVFP4 - supported_gpus: - - GB200 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 5 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '4096' - input_length: 8192 - output_length: 1024 - dataset_file: -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 256 - max_num_tokens: 256 - tensor_parallel_size: 16 - moe_expert_parallel_size: 16 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 256 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - trust_remote_code: true - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - max_batch_size: 2 - max_num_tokens: 8768 - tensor_parallel_size: 4 - moe_expert_parallel_size: 4 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.6 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - trust_remote_code: true diff --git a/tests/scripts/perf/disaggregated/gb200_qwen3-235b-fp4_8k1k_con1024_ctx1_tp1_gen1_dep8_eplb0_mtp0_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb200_qwen3-235b-fp4_8k1k_con1024_ctx1_tp1_gen1_dep8_eplb0_mtp0_ccb-UCX.yaml deleted file mode 100644 index e850787be69c..000000000000 --- a/tests/scripts/perf/disaggregated/gb200_qwen3-235b-fp4_8k1k_con1024_ctx1_tp1_gen1_dep8_eplb0_mtp0_ccb-UCX.yaml +++ /dev/null @@ -1,100 +0,0 @@ -metadata: - model_name: qwen3_235b_a22b_fp4 - precision: fp4 - model_dir_name: Qwen3-235B-A22B-FP4 - supported_gpus: - - GB200 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 10 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '1024' - input_length: 8192 - output_length: 1024 - dataset_file: datasets/perf-ci/qwen3_235b-8k1k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 128 - max_num_tokens: 128 - tensor_parallel_size: 8 - moe_expert_parallel_size: 8 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 128 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.9 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 32768 - backend: UCX - disable_overlap_scheduler: true - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - max_batch_size: 4 - max_num_tokens: 32768 - tensor_parallel_size: 1 - moe_expert_parallel_size: 1 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: false - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.6 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 32768 - backend: UCX - disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb300_deepseek-r1-fp4_128k8k_con256_ctx1_pp4_gen1_dep8_eplb0_mtp1_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb300_deepseek-r1-fp4_128k8k_con256_ctx1_pp4_gen1_dep8_eplb0_mtp1_ccb-UCX.yaml deleted file mode 100644 index 8f3db7438f47..000000000000 --- a/tests/scripts/perf/disaggregated/gb300_deepseek-r1-fp4_128k8k_con256_ctx1_pp4_gen1_dep8_eplb0_mtp1_ccb-UCX.yaml +++ /dev/null @@ -1,107 +0,0 @@ -metadata: - model_name: deepseek_r1_0528_fp4_v2 - precision: fp4 - model_dir_name: DeepSeek-R1-0528-FP4-v2 - supported_gpus: - - GB300 - script_file: disaggr_torch.slurm - benchmark_type: 128k8k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 3 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '256' - input_length: 131072 - output_length: 8192 - dataset_file: datasets/perf-ci/deepseek_r1-128k8k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TLLM_SPEC_DECODE_FORCE_NUM_ACCEPTED_TOKENS=1 - TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 16 - max_num_tokens: 64 - tensor_parallel_size: 8 - moe_expert_parallel_size: 8 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 16 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 131104 - backend: UCX - kv_transfer_timeout_ms: 600000 - disable_overlap_scheduler: true - speculative_config: &id001 - decoding_type: MTP - num_nextn_predict_layers: 1 - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - max_batch_size: 1 - max_num_tokens: 131104 - tensor_parallel_size: 1 - moe_expert_parallel_size: 1 - pipeline_parallel_size: 4 - context_parallel_size: 1 - enable_attention_dp: false - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.3 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 131104 - backend: UCX - kv_transfer_timeout_ms: 600000 - disable_overlap_scheduler: true - speculative_config: *id001 diff --git a/tests/scripts/perf/disaggregated/gb300_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb300_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml deleted file mode 100644 index 8c62df6d0af7..000000000000 --- a/tests/scripts/perf/disaggregated/gb300_deepseek-r1-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp1_ccb-UCX.yaml +++ /dev/null @@ -1,105 +0,0 @@ -metadata: - model_name: deepseek_r1_0528_fp4_v2 - precision: fp4 - model_dir_name: DeepSeek-R1-0528-FP4-v2 - supported_gpus: - - GB300 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 5 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '4096' - input_length: 8192 - output_length: 1024 - dataset_file: datasets/perf-ci/deepseek_r1-8k1k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes TLLM_SPEC_DECODE_FORCE_NUM_ACCEPTED_TOKENS=1 - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 256 - max_num_tokens: 512 - tensor_parallel_size: 16 - moe_expert_parallel_size: 16 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 256 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - speculative_config: &id001 - decoding_type: MTP - num_nextn_predict_layers: 1 - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - max_batch_size: 2 - max_num_tokens: 16384 - tensor_parallel_size: 4 - moe_expert_parallel_size: 4 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.6 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - speculative_config: *id001 diff --git a/tests/scripts/perf/disaggregated/gb300_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb300_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml deleted file mode 100644 index 86ede92716e3..000000000000 --- a/tests/scripts/perf/disaggregated/gb300_deepseek-v32-fp4_32k4k_con2048_ctx1_dep4_gen1_dep32_eplb288_mtp1_ccb-UCX.yaml +++ /dev/null @@ -1,122 +0,0 @@ -metadata: - model_name: deepseek_v32_fp4 - precision: fp4 - model_dir_name: DeepSeek-V3.2-FP4-v2 - supported_gpus: - - GB300 - script_file: disaggr_torch.slurm - benchmark_type: 32k4k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 2 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '2048' - input_length: 32768 - output_length: 4096 - dataset_file: datasets/perf-ci/deepseek_v32-32k4k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes TLLM_SPEC_DECODE_FORCE_NUM_ACCEPTED_TOKENS=1 - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 64 - max_num_tokens: 128 - max_input_len: 32784 - max_seq_len: 40960 - tensor_parallel_size: 32 - moe_expert_parallel_size: 32 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 64 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.5 - dtype: fp8 - tokens_per_block: 64 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - load_balancer: - num_slots: 288 - layer_updates_per_iter: 1 - cache_transceiver_config: - max_tokens_in_buffer: 32832 - backend: UCX - kv_transfer_timeout_ms: 600000 - disable_overlap_scheduler: true - speculative_config: &id001 - decoding_type: MTP - num_nextn_predict_layers: 1 - num_postprocess_workers: 4 - stream_interval: 20 - nvfp4_gemm_config: - allowed_backends: - - cutlass - - cublaslt - - cutedsl - - cuda_core - ctx: - print_iter_log: true - max_batch_size: 1 - max_num_tokens: 32784 - max_input_len: 32784 - max_seq_len: 32832 - tensor_parallel_size: 4 - moe_expert_parallel_size: 4 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.4 - dtype: fp8 - tokens_per_block: 64 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 32832 - backend: UCX - kv_transfer_timeout_ms: 600000 - disable_overlap_scheduler: true - speculative_config: *id001 diff --git a/tests/scripts/perf/disaggregated/gb300_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb300_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml deleted file mode 100644 index c188a43ca143..000000000000 --- a/tests/scripts/perf/disaggregated/gb300_deepseek-v32-fp4_8k1k_con4096_ctx1_dep4_gen1_dep32_eplb256_mtp0_ccb-UCX.yaml +++ /dev/null @@ -1,112 +0,0 @@ -metadata: - model_name: deepseek_v32_fp4 - precision: fp4 - model_dir_name: DeepSeek-V3.2-FP4-v2 - supported_gpus: - - GB300 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 5 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '4096' - input_length: 8192 - output_length: 1024 - dataset_file: datasets/perf-ci/deepseek_v32-8k1k-20480-ratio-1_for_serve.json -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 128 - max_num_tokens: 128 - tensor_parallel_size: 32 - moe_expert_parallel_size: 32 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 128 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - tokens_per_block: 64 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - load_balancer: - num_slots: 256 - layer_updates_per_iter: 1 - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - num_postprocess_workers: 4 - stream_interval: 20 - nvfp4_gemm_config: - allowed_backends: - - cutlass - - cublaslt - - cutedsl - - cuda_core - ctx: - print_iter_log: true - max_batch_size: 2 - max_num_tokens: 16384 - tensor_parallel_size: 4 - moe_expert_parallel_size: 4 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.6 - dtype: fp8 - tokens_per_block: 64 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true diff --git a/tests/scripts/perf/disaggregated/gb300_glm-5-fp4_8k1k_con1024_ctx1_dep2_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb300_glm-5-fp4_8k1k_con1024_ctx1_dep2_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml deleted file mode 100644 index 51f008f1ae4a..000000000000 --- a/tests/scripts/perf/disaggregated/gb300_glm-5-fp4_8k1k_con1024_ctx1_dep2_gen1_dep8_eplb256_mtp1_ccb-UCX.yaml +++ /dev/null @@ -1,108 +0,0 @@ -metadata: - model_name: glm_5_nvfp4 - precision: fp4 - model_dir_name: GLM-5-NVFP4 - supported_gpus: - - GB300 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 10 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '1024' - input_length: 8192 - output_length: 1024 - dataset_file: -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes TLLM_SPEC_DECODE_FORCE_NUM_ACCEPTED_TOKENS=1 - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 128 - max_num_tokens: 256 - tensor_parallel_size: 8 - moe_expert_parallel_size: 8 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 128 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - load_balancer: - num_slots: 256 - layer_updates_per_iter: 1 - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - speculative_config: &id001 - decoding_type: MTP - num_nextn_predict_layers: 1 - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - max_batch_size: 2 - max_num_tokens: 16384 - tensor_parallel_size: 2 - moe_expert_parallel_size: 2 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.6 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - speculative_config: *id001 diff --git a/tests/scripts/perf/disaggregated/gb300_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml b/tests/scripts/perf/disaggregated/gb300_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml deleted file mode 100644 index 4fde4a0dcd0a..000000000000 --- a/tests/scripts/perf/disaggregated/gb300_kimi-k25-thinking-fp4_8k1k_con4096_ctx1_dep4_gen1_dep16_eplb0_mtp0_ccb-UCX.yaml +++ /dev/null @@ -1,103 +0,0 @@ -metadata: - model_name: k25_thinking_fp4 - precision: fp4 - model_dir_name: Kimi-K2.5-NVFP4 - supported_gpus: - - GB300 - script_file: disaggr_torch.slurm - benchmark_type: 8k1k -slurm: - script_file: disaggr_torch.slurm - partition: - account: - job_time: 02:00:00 - job_name: unified-benchmark - extra_args: --gres=gpu:4 - numa_bind: true -benchmark: - mode: e2e - use_nv_sa_benchmark: false - multi_round: 5 - benchmark_ratio: 0.0 - streaming: true - concurrency_list: '4096' - input_length: 8192 - output_length: 1024 - dataset_file: -hardware: - gpus_per_node: 4 - num_ctx_servers: 1 - num_gen_servers: 1 -environment: - container_mount: - container_image: - model_path: - trtllm_repo: '' - build_wheel: false - work_dir: - worker_env_var: TLLM_LOG_LEVEL=INFO TRTLLM_SERVER_DISABLE_GC=1 TRTLLM_WORKER_DISABLE_GC=1 TRTLLM_ENABLE_PDL=1 ENROOT_ALLOW_DEV=yes - server_env_var: TRTLLM_SERVER_DISABLE_GC=1 -profiling: - nsys_on: false -accuracy: - enable_accuracy_test: false - env_var: - HF_HOME: - tasks: - gsm8k_local: - model: local-completions - model_args_extra: num_concurrent=512,max_retries=3,tokenized_requests=false,timeout=1200,max_gen_toks=256,max_length=4096 - extra_kwargs: - trust_remote_code: true - custom_config: tests/integration/lm_eval_configs/gsm8k_local.yaml -worker_config: - gen: - print_iter_log: true - max_batch_size: 256 - max_num_tokens: 256 - tensor_parallel_size: 16 - moe_expert_parallel_size: 16 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: - enable_padding: true - max_batch_size: 256 - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.8 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - trust_remote_code: true - num_postprocess_workers: 4 - stream_interval: 20 - ctx: - print_iter_log: true - max_batch_size: 2 - max_num_tokens: 8768 - tensor_parallel_size: 4 - moe_expert_parallel_size: 4 - pipeline_parallel_size: 1 - context_parallel_size: 1 - enable_attention_dp: true - enable_lm_head_tp_in_adp: true - cuda_graph_config: null - kv_cache_config: - enable_block_reuse: false - free_gpu_memory_fraction: 0.6 - dtype: fp8 - moe_config: - backend: CUTEDSL - use_low_precision_moe_combine: true - cache_transceiver_config: - max_tokens_in_buffer: 16384 - backend: UCX - disable_overlap_scheduler: true - trust_remote_code: true