From ae8efdb55640c50188456c537594b4ce939bf88d Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 16:54:10 -0700 Subject: [PATCH 01/23] new command --- benchmarks/dsr1_fp4_b200_slurm.sh | 68 +++++++++++++++++++++++++++++++ 1 file changed, 68 insertions(+) create mode 100644 benchmarks/dsr1_fp4_b200_slurm.sh diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh new file mode 100644 index 0000000000..33c6c40514 --- /dev/null +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -0,0 +1,68 @@ +#!/usr/bin/env bash + +echo "JOB $SLURM_JOB_ID running on NODE $SLURMD_NODENAME" + +huggingface-cli download $MODEL +SERVER_LOG=$(mktemp /tmp/server-XXXXXX.log) + +set -x +PORT=$(( 8888 + $PORT_OFFSET )) + +TP = '' +if [[ $CONC -eq 4 || $CONC -eq 8 || $CONC -eq 128 || $CONC -eq 256 ]]; then + TP = 8 +elif [[ $CONC -eq 16 || $CONC -eq 32 || $CONC -eq 64 ]]; then + TP = 4 +fi + +if [[ $TP == '' ]]; then + echo "Error: TP is not set" + exit 1 +fi + +python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --trust-remote-code \ +--tensor-parallel-size=$TP --data-parallel-size=1 \ +--cuda-graph-max-bs 256 --max-running-requests 256 --mem-fraction-static 0.85 --kv-cache-dtype fp8_e4m3 \ +--chunked-prefill-size 16384 --max-prefill-tokens 32768 \ +--enable-ep-moe --quantization modelopt_fp4 --enable-flashinfer-allreduce-fusion --scheduler-recv-interval 10 \ +--enable-symm-mem --disable-radix-cache --attention-backend trtllm_mla --enable-flashinfer-trtllm-moe --stream-interval 10 \ +> $SERVER_LOG 2>&1 & + +set +x +IGNORE_PAT="Ignore import error when loading sglang.srt.models.glm4v_moe: No module named 'transformers.models.glm4v_moe'" + +while IFS= read -r line; do + printf '%s\n' "$line" + + # Skip the known benign "Ignore import error ..." line + if [[ "$line" == *"$IGNORE_PAT"* ]]; then + continue + fi + + # Keep your original "error" trap for everything else + if [[ "$line" =~ [Ee][Rr][Rr][Oo][Rr] ]]; then + sleep 5 + tail -n100 "$SERVER_LOG" + echo "JOB ${SLURM_JOB_ID:-NA} ran on NODE ${SLURMD_NODENAME:-unknown}" + exit 1 + fi + + # Break when server is ready + if [[ "$line" == *"The server is fired up and ready to roll"* ]]; then + break + fi +# Start tail from the beginning so we don't miss early lines +done < <(tail -n +1 -F "$SERVER_LOG") + +set -x +git clone https://github.com/kimbochen/bench_serving.git +python3 bench_serving/benchmark_serving.py \ +--model $MODEL --backend vllm \ +--base-url http://0.0.0.0:$PORT \ +--dataset-name random \ +--random-input-len $ISL --random-output-len $OSL --random-range-ratio $RANDOM_RANGE_RATIO \ +--num-prompts $(( $CONC * 10 )) --max-concurrency $CONC \ +--request-rate inf --ignore-eos \ +--save-result --percentile-metrics 'ttft,tpot,itl,e2el' \ +--result-dir /workspace/ \ +--result-filename $RESULT_FILENAME.json From 580bd36a2e2be086edea7d6d2b1dba7363514e38 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 16:54:53 -0700 Subject: [PATCH 02/23] redundant stuff --- .github/workflows/dsr1-tmpl.yml | 3 +-- 1 file changed, 1 insertion(+), 2 deletions(-) diff --git a/.github/workflows/dsr1-tmpl.yml b/.github/workflows/dsr1-tmpl.yml index df05305d4b..75d4701740 100644 --- a/.github/workflows/dsr1-tmpl.yml +++ b/.github/workflows/dsr1-tmpl.yml @@ -153,8 +153,7 @@ jobs: osl: ${{ inputs.osl }} max-model-len: ${{ inputs.max-model-len }} random-range-ratio: ${{ inputs.random-range-ratio }} - tp-list: '[8]' - + bmk-b200-trt-fp4: if: ${{ inputs.use_b200 }} uses: ./.github/workflows/benchmark-tmpl.yml From 68cdf7a3e770a8d46123811542507602d20b4c07 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 17:10:35 -0700 Subject: [PATCH 03/23] new command --- benchmarks/dsr1_fp4_b200_slurm.sh | 11 +++++++++++ 1 file changed, 11 insertions(+) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index 33c6c40514..2801efbc7b 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -56,6 +56,17 @@ done < <(tail -n +1 -F "$SERVER_LOG") set -x git clone https://github.com/kimbochen/bench_serving.git + +python3 bench_serving/benchmark_serving.py \ +--model $MODEL --backend vllm \ +--base-url http://0.0.0.0:$PORT \ +--dataset-name random \ +--random-input-len $ISL --random-output-len $OSL --random-range-ratio $RANDOM_RANGE_RATIO \ +--num-prompts $CONC --max-concurrency $CONC \ +--request-rate inf --ignore-eos \ +--result-dir /workspace/ \ +--result-filename bak.json + python3 bench_serving/benchmark_serving.py \ --model $MODEL --backend vllm \ --base-url http://0.0.0.0:$PORT \ From b9fd613417ff49d69e21794765061a500fe598d5 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 17:12:03 -0700 Subject: [PATCH 04/23] new command --- .github/workflows/runner-sweep-test.yml | 1 + benchmarks/dsr1_fp4_b200_slurm.sh | 2 -- 2 files changed, 1 insertion(+), 2 deletions(-) diff --git a/.github/workflows/runner-sweep-test.yml b/.github/workflows/runner-sweep-test.yml index 6e6ca023de..63a2e04899 100644 --- a/.github/workflows/runner-sweep-test.yml +++ b/.github/workflows/runner-sweep-test.yml @@ -26,6 +26,7 @@ on: - 'lmsysorg/sglang:v0.4.9.post1-cu126' - 'lmsysorg/sglang:v0.5.0rc1-cu128-b200' - 'lmsysorg/sglang:v0.5.2rc2-cu126' + - 'lmsysorg/sglang:v0.5.2rc2-cu129' - 'rocm/7.0-preview:rocm7.0_preview_ubuntu_22.04_sgl-dev-v0.5.2rc2-mi30x_rc1' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2.post1' diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index 2801efbc7b..4929b9e27a 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -64,8 +64,6 @@ python3 bench_serving/benchmark_serving.py \ --random-input-len $ISL --random-output-len $OSL --random-range-ratio $RANDOM_RANGE_RATIO \ --num-prompts $CONC --max-concurrency $CONC \ --request-rate inf --ignore-eos \ ---result-dir /workspace/ \ ---result-filename bak.json python3 bench_serving/benchmark_serving.py \ --model $MODEL --backend vllm \ From 712856c421e9d8ae13ab650e0a30d059568047a4 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 17:13:07 -0700 Subject: [PATCH 05/23] new command --- .github/workflows/runner-sweep-test.yml | 2 +- .github/workflows/runner-test.yml | 1 + 2 files changed, 2 insertions(+), 1 deletion(-) diff --git a/.github/workflows/runner-sweep-test.yml b/.github/workflows/runner-sweep-test.yml index 63a2e04899..ceae836343 100644 --- a/.github/workflows/runner-sweep-test.yml +++ b/.github/workflows/runner-sweep-test.yml @@ -26,7 +26,7 @@ on: - 'lmsysorg/sglang:v0.4.9.post1-cu126' - 'lmsysorg/sglang:v0.5.0rc1-cu128-b200' - 'lmsysorg/sglang:v0.5.2rc2-cu126' - - 'lmsysorg/sglang:v0.5.2rc2-cu129' + - 'lmsysorg/sglang:v0.5.3rc1-cu129' - 'rocm/7.0-preview:rocm7.0_preview_ubuntu_22.04_sgl-dev-v0.5.2rc2-mi30x_rc1' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2.post1' diff --git a/.github/workflows/runner-test.yml b/.github/workflows/runner-test.yml index 9db2644c02..3fd2edc2e7 100644 --- a/.github/workflows/runner-test.yml +++ b/.github/workflows/runner-test.yml @@ -51,6 +51,7 @@ on: - 'lmsysorg/sglang:v0.4.9.post1-cu126' - 'lmsysorg/sglang:v0.5.0rc1-cu128-b200' - 'lmsysorg/sglang:v0.5.2rc2-cu126' + - 'lmsysorg/sglang:v0.5.3rc1-cu129' - 'rocm/7.0-preview:rocm7.0_preview_ubuntu_22.04_sgl-dev-v0.5.2rc2-mi30x_rc1' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2.post1' From d76f7a911db8c26b7ae4b4071419a05816820586 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 17:13:40 -0700 Subject: [PATCH 06/23] new command --- benchmarks/dsr1_fp4_b200_slurm.sh | 1 + 1 file changed, 1 insertion(+) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index 4929b9e27a..7bba4b8a3a 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -57,6 +57,7 @@ done < <(tail -n +1 -F "$SERVER_LOG") set -x git clone https://github.com/kimbochen/bench_serving.git +# warmup for JIT kernels python3 bench_serving/benchmark_serving.py \ --model $MODEL --backend vllm \ --base-url http://0.0.0.0:$PORT \ From e71bb8f6d05bd9a28e1217d442343e862fb6df2d Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 17:26:07 -0700 Subject: [PATCH 07/23] new yaml structure --- .github/workflows/dsr1-tmpl.yml | 4 +++- benchmarks/dsr1_fp4_b200_slurm.sh | 2 ++ 2 files changed, 5 insertions(+), 1 deletion(-) diff --git a/.github/workflows/dsr1-tmpl.yml b/.github/workflows/dsr1-tmpl.yml index 75d4701740..326019edba 100644 --- a/.github/workflows/dsr1-tmpl.yml +++ b/.github/workflows/dsr1-tmpl.yml @@ -153,7 +153,9 @@ jobs: osl: ${{ inputs.osl }} max-model-len: ${{ inputs.max-model-len }} random-range-ratio: ${{ inputs.random-range-ratio }} - + tp-list: '[4, 8]' + conc-list: '[4, 8, 16, 32, 64, 128, 256]' # Custom concurrency values for this job + bmk-b200-trt-fp4: if: ${{ inputs.use_b200 }} uses: ./.github/workflows/benchmark-tmpl.yml diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index 7bba4b8a3a..6e13973b02 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -20,6 +20,8 @@ if [[ $TP == '' ]]; then exit 1 fi +echo "TP: $TP, CONC: $CONC" + python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --trust-remote-code \ --tensor-parallel-size=$TP --data-parallel-size=1 \ --cuda-graph-max-bs 256 --max-running-requests 256 --mem-fraction-static 0.85 --kv-cache-dtype fp8_e4m3 \ From 00313310e11df64455b1cce57eadbeb183677411 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 17:28:12 -0700 Subject: [PATCH 08/23] new yaml structure --- benchmarks/dsr1_fp4_b200_slurm.sh | 14 -------------- 1 file changed, 14 deletions(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index 6e13973b02..f18d632c1e 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -8,20 +8,6 @@ SERVER_LOG=$(mktemp /tmp/server-XXXXXX.log) set -x PORT=$(( 8888 + $PORT_OFFSET )) -TP = '' -if [[ $CONC -eq 4 || $CONC -eq 8 || $CONC -eq 128 || $CONC -eq 256 ]]; then - TP = 8 -elif [[ $CONC -eq 16 || $CONC -eq 32 || $CONC -eq 64 ]]; then - TP = 4 -fi - -if [[ $TP == '' ]]; then - echo "Error: TP is not set" - exit 1 -fi - -echo "TP: $TP, CONC: $CONC" - python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --trust-remote-code \ --tensor-parallel-size=$TP --data-parallel-size=1 \ --cuda-graph-max-bs 256 --max-running-requests 256 --mem-fraction-static 0.85 --kv-cache-dtype fp8_e4m3 \ From 7ffd0e025490c210b5aa57ae51d21a2abf3d5dfa Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 17:28:44 -0700 Subject: [PATCH 09/23] redundant character --- benchmarks/dsr1_fp4_b200_slurm.sh | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index f18d632c1e..a76af3c863 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -52,7 +52,7 @@ python3 bench_serving/benchmark_serving.py \ --dataset-name random \ --random-input-len $ISL --random-output-len $OSL --random-range-ratio $RANDOM_RANGE_RATIO \ --num-prompts $CONC --max-concurrency $CONC \ ---request-rate inf --ignore-eos \ +--request-rate inf --ignore-eos python3 bench_serving/benchmark_serving.py \ --model $MODEL --backend vllm \ From 682738499468c3e9afabeca38db15b154a58a95f Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 17:30:08 -0700 Subject: [PATCH 10/23] images --- .github/workflows/runner-sweep-test.yml | 2 +- .github/workflows/runner-test.yml | 2 +- 2 files changed, 2 insertions(+), 2 deletions(-) diff --git a/.github/workflows/runner-sweep-test.yml b/.github/workflows/runner-sweep-test.yml index ceae836343..e3053b4109 100644 --- a/.github/workflows/runner-sweep-test.yml +++ b/.github/workflows/runner-sweep-test.yml @@ -26,7 +26,7 @@ on: - 'lmsysorg/sglang:v0.4.9.post1-cu126' - 'lmsysorg/sglang:v0.5.0rc1-cu128-b200' - 'lmsysorg/sglang:v0.5.2rc2-cu126' - - 'lmsysorg/sglang:v0.5.3rc1-cu129' + - 'lmsysorg/sglang:v0.5.3rc1-cu129-b200' - 'rocm/7.0-preview:rocm7.0_preview_ubuntu_22.04_sgl-dev-v0.5.2rc2-mi30x_rc1' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2.post1' diff --git a/.github/workflows/runner-test.yml b/.github/workflows/runner-test.yml index 3fd2edc2e7..848d6665de 100644 --- a/.github/workflows/runner-test.yml +++ b/.github/workflows/runner-test.yml @@ -51,7 +51,7 @@ on: - 'lmsysorg/sglang:v0.4.9.post1-cu126' - 'lmsysorg/sglang:v0.5.0rc1-cu128-b200' - 'lmsysorg/sglang:v0.5.2rc2-cu126' - - 'lmsysorg/sglang:v0.5.3rc1-cu129' + - 'lmsysorg/sglang:v0.5.3rc1-cu129-b200' - 'rocm/7.0-preview:rocm7.0_preview_ubuntu_22.04_sgl-dev-v0.5.2rc2-mi30x_rc1' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2.post1' From 7e56d0c3e6d7a2fe8b119bb90890cd09723be4a1 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 19:17:58 -0700 Subject: [PATCH 11/23] added config --- .github/workflows/dsr1-tmpl.yml | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/.github/workflows/dsr1-tmpl.yml b/.github/workflows/dsr1-tmpl.yml index 326019edba..29a6ebb496 100644 --- a/.github/workflows/dsr1-tmpl.yml +++ b/.github/workflows/dsr1-tmpl.yml @@ -144,7 +144,7 @@ jobs: secrets: inherit with: runner: b200 - image: 'lmsysorg/sglang:v0.5.0rc1-cu128-b200' + image: 'lmsysorg/sglang:v0.5.3rc1-cu129-b200' model: 'nvidia/DeepSeek-R1-0528-FP4' framework: 'sglang' precision: 'fp4' @@ -153,7 +153,7 @@ jobs: osl: ${{ inputs.osl }} max-model-len: ${{ inputs.max-model-len }} random-range-ratio: ${{ inputs.random-range-ratio }} - tp-list: '[4, 8]' + tp-list: '[8]' conc-list: '[4, 8, 16, 32, 64, 128, 256]' # Custom concurrency values for this job bmk-b200-trt-fp4: From 2e45e2d6ab1daefba7089a9b1bdb512ae13c4bdd Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 19:27:50 -0700 Subject: [PATCH 12/23] moved yaml --- .github/workflows/runner-sweep-test.yml | 2 +- .github/workflows/runner-test.yml | 3 +-- 2 files changed, 2 insertions(+), 3 deletions(-) diff --git a/.github/workflows/runner-sweep-test.yml b/.github/workflows/runner-sweep-test.yml index e3053b4109..1eab7f9fd9 100644 --- a/.github/workflows/runner-sweep-test.yml +++ b/.github/workflows/runner-sweep-test.yml @@ -26,7 +26,6 @@ on: - 'lmsysorg/sglang:v0.4.9.post1-cu126' - 'lmsysorg/sglang:v0.5.0rc1-cu128-b200' - 'lmsysorg/sglang:v0.5.2rc2-cu126' - - 'lmsysorg/sglang:v0.5.3rc1-cu129-b200' - 'rocm/7.0-preview:rocm7.0_preview_ubuntu_22.04_sgl-dev-v0.5.2rc2-mi30x_rc1' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2.post1' @@ -36,6 +35,7 @@ on: - 'rocm/vllm-dev:open-mi300-08052025' - 'rocm/vllm-dev:open-mi355-08052025' - 'vllm/vllm-openai:v0.10.2' + - 'lmsysorg/sglang:v0.5.3rc1-cu129-b200' model: description: 'Model' diff --git a/.github/workflows/runner-test.yml b/.github/workflows/runner-test.yml index 848d6665de..21afc5e778 100644 --- a/.github/workflows/runner-test.yml +++ b/.github/workflows/runner-test.yml @@ -51,7 +51,6 @@ on: - 'lmsysorg/sglang:v0.4.9.post1-cu126' - 'lmsysorg/sglang:v0.5.0rc1-cu128-b200' - 'lmsysorg/sglang:v0.5.2rc2-cu126' - - 'lmsysorg/sglang:v0.5.3rc1-cu129-b200' - 'rocm/7.0-preview:rocm7.0_preview_ubuntu_22.04_sgl-dev-v0.5.2rc2-mi30x_rc1' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2' - 'nvcr.io#nvidia/tensorrt-llm/release:1.1.0rc2.post1' @@ -61,7 +60,7 @@ on: - 'rocm/vllm-dev:open-mi300-08052025' - 'rocm/vllm-dev:open-mi355-08052025' - 'vllm/vllm-openai:v0.10.2' - + - 'lmsysorg/sglang:v0.5.3rc1-cu129-b200' model: description: 'Model' required: true From 5ee23ee2dac338cbb0a56cfd90302f6dfeb1285a Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 20:05:51 -0700 Subject: [PATCH 13/23] slurm script --- benchmarks/dsr1_fp4_b200_slurm.sh | 27 ++++++++++++++++++++++++++- 1 file changed, 26 insertions(+), 1 deletion(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index a76af3c863..c3418ca42d 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -8,10 +8,35 @@ SERVER_LOG=$(mktemp /tmp/server-XXXXXX.log) set -x PORT=$(( 8888 + $PORT_OFFSET )) +SCHEDULER_RECV_INTERVAL='' + +if [[ "$ISL" == "1024" && "$OSL" == "1024" || "$ISL" == "1024" && "$OSL" == "8192" ]]; then + SCHEDULER_RECV_INTERVAL=10 + + if [[ "$CONC" -gte 16 ]]; then + SCHEDULER_RECV_INTERVAL=30 + fi + +elif [[ "$ISL" == "1024" && "$OSL" == "8192" ]]; then + SCHEDULER_RECV_INTERVAL=10 + + if [[ "$CONC" -gte 32 ]]; then + SCHEDULER_RECV_INTERVAL=30 + fi + +fi + +echo "SCHEDULER_RECV_INTERVAL: $SCHEDULER_RECV_INTERVAL, CONC: $CONC, ISL: $ISL, OSL: $OSL" + +if [[ "$SCHEDULER_RECV_INTERVAL" == '' ]]; then + echo "Error: SCHEDULER_RECV_INTERVAL is not set" + exit 1 +fi + python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --trust-remote-code \ --tensor-parallel-size=$TP --data-parallel-size=1 \ --cuda-graph-max-bs 256 --max-running-requests 256 --mem-fraction-static 0.85 --kv-cache-dtype fp8_e4m3 \ ---chunked-prefill-size 16384 --max-prefill-tokens 32768 \ +--chunked-prefill-size 16384 \ --enable-ep-moe --quantization modelopt_fp4 --enable-flashinfer-allreduce-fusion --scheduler-recv-interval 10 \ --enable-symm-mem --disable-radix-cache --attention-backend trtllm_mla --enable-flashinfer-trtllm-moe --stream-interval 10 \ > $SERVER_LOG 2>&1 & From 989f10de50e4dc2ae332df86a3d5e4577146650f Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 20:09:53 -0700 Subject: [PATCH 14/23] slurm config --- benchmarks/dsr1_fp4_b200_slurm.sh | 21 +++------------------ 1 file changed, 3 insertions(+), 18 deletions(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index c3418ca42d..705491982a 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -10,29 +10,14 @@ PORT=$(( 8888 + $PORT_OFFSET )) SCHEDULER_RECV_INTERVAL='' -if [[ "$ISL" == "1024" && "$OSL" == "1024" || "$ISL" == "1024" && "$OSL" == "8192" ]]; then +if [[ "$CONC" -lt 16 ]]; then SCHEDULER_RECV_INTERVAL=10 - - if [[ "$CONC" -gte 16 ]]; then - SCHEDULER_RECV_INTERVAL=30 - fi - -elif [[ "$ISL" == "1024" && "$OSL" == "8192" ]]; then - SCHEDULER_RECV_INTERVAL=10 - - if [[ "$CONC" -gte 32 ]]; then - SCHEDULER_RECV_INTERVAL=30 - fi - +elif [[ "$CONC" -gte 16 ]]; then + SCHEDULER_RECV_INTERVAL=30 fi echo "SCHEDULER_RECV_INTERVAL: $SCHEDULER_RECV_INTERVAL, CONC: $CONC, ISL: $ISL, OSL: $OSL" -if [[ "$SCHEDULER_RECV_INTERVAL" == '' ]]; then - echo "Error: SCHEDULER_RECV_INTERVAL is not set" - exit 1 -fi - python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --trust-remote-code \ --tensor-parallel-size=$TP --data-parallel-size=1 \ --cuda-graph-max-bs 256 --max-running-requests 256 --mem-fraction-static 0.85 --kv-cache-dtype fp8_e4m3 \ From 11092bdb9d2a181cfed038928665c9bb5f59c702 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 20:11:12 -0700 Subject: [PATCH 15/23] slurm config --- benchmarks/dsr1_fp4_b200_slurm.sh | 6 ++---- 1 file changed, 2 insertions(+), 4 deletions(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index 705491982a..9e47baba5b 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -8,11 +8,9 @@ SERVER_LOG=$(mktemp /tmp/server-XXXXXX.log) set -x PORT=$(( 8888 + $PORT_OFFSET )) -SCHEDULER_RECV_INTERVAL='' +SCHEDULER_RECV_INTERVAL=10 -if [[ "$CONC" -lt 16 ]]; then - SCHEDULER_RECV_INTERVAL=10 -elif [[ "$CONC" -gte 16 ]]; then +if [[ "$CONC" -gte 16 ]]; then SCHEDULER_RECV_INTERVAL=30 fi From 6f18531831e58372ef402d8627f8a9dfc47cdcae Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 20:13:41 -0700 Subject: [PATCH 16/23] slurm config --- benchmarks/dsr1_fp4_b200_slurm.sh | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index 9e47baba5b..13386331d3 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -20,7 +20,7 @@ python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --tensor-parallel-size=$TP --data-parallel-size=1 \ --cuda-graph-max-bs 256 --max-running-requests 256 --mem-fraction-static 0.85 --kv-cache-dtype fp8_e4m3 \ --chunked-prefill-size 16384 \ ---enable-ep-moe --quantization modelopt_fp4 --enable-flashinfer-allreduce-fusion --scheduler-recv-interval 10 \ +--enable-ep-moe --quantization modelopt_fp4 --enable-flashinfer-allreduce-fusion --scheduler-recv-interval $SCHEDULER_RECV_INTERVAL \ --enable-symm-mem --disable-radix-cache --attention-backend trtllm_mla --enable-flashinfer-trtllm-moe --stream-interval 10 \ > $SERVER_LOG 2>&1 & From 07c41fcafc14d496fc153b60f29058b4d04c4ca1 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 20:15:08 -0700 Subject: [PATCH 17/23] slurm config --- benchmarks/dsr1_fp4_b200_slurm.sh | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index 13386331d3..de93a855f3 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -10,7 +10,7 @@ PORT=$(( 8888 + $PORT_OFFSET )) SCHEDULER_RECV_INTERVAL=10 -if [[ "$CONC" -gte 16 ]]; then +if [[ "$CONC" -ge 16 ]]; then SCHEDULER_RECV_INTERVAL=30 fi From 53d1e9c671b9374a726380d509e88c237689890b Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 20:33:39 -0700 Subject: [PATCH 18/23] slurm config --- benchmarks/dsr1_fp4_b200_slurm.sh | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index de93a855f3..db17f4eb7c 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -10,7 +10,7 @@ PORT=$(( 8888 + $PORT_OFFSET )) SCHEDULER_RECV_INTERVAL=10 -if [[ "$CONC" -ge 16 ]]; then +if [[ $CONC -ge 16 ]]; then SCHEDULER_RECV_INTERVAL=30 fi From fa4f926278ec8bcd422ca6ddd233bc9c07bcabb4 Mon Sep 17 00:00:00 2001 From: Kaunil Dhruv Date: Fri, 19 Sep 2025 20:47:54 -0700 Subject: [PATCH 19/23] slurm config --- benchmarks/dsr1_fp4_b200_slurm.sh | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index db17f4eb7c..7f32558add 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -16,7 +16,7 @@ fi echo "SCHEDULER_RECV_INTERVAL: $SCHEDULER_RECV_INTERVAL, CONC: $CONC, ISL: $ISL, OSL: $OSL" -python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --trust-remote-code \ +PYTHONNOUSERSITE=1 python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --trust-remote-code \ --tensor-parallel-size=$TP --data-parallel-size=1 \ --cuda-graph-max-bs 256 --max-running-requests 256 --mem-fraction-static 0.85 --kv-cache-dtype fp8_e4m3 \ --chunked-prefill-size 16384 \ From c3f8da874bdea732fb70bf8c19edb37b73c443ab Mon Sep 17 00:00:00 2001 From: Kedar Potdar <115327600+kedarpotdar-nv@users.noreply.github.com> Date: Fri, 19 Sep 2025 21:02:32 -0700 Subject: [PATCH 20/23] Update dsr1-tmpl.yml update runner --- .github/workflows/dsr1-tmpl.yml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/.github/workflows/dsr1-tmpl.yml b/.github/workflows/dsr1-tmpl.yml index 29a6ebb496..375e53291e 100644 --- a/.github/workflows/dsr1-tmpl.yml +++ b/.github/workflows/dsr1-tmpl.yml @@ -143,7 +143,7 @@ jobs: uses: ./.github/workflows/benchmark-tmpl.yml secrets: inherit with: - runner: b200 + runner: b200-trt image: 'lmsysorg/sglang:v0.5.3rc1-cu129-b200' model: 'nvidia/DeepSeek-R1-0528-FP4' framework: 'sglang' From 306c378ae88bccfcf7acd0591cc27dd6b250c65c Mon Sep 17 00:00:00 2001 From: Kedar Potdar <115327600+kedarpotdar-nv@users.noreply.github.com> Date: Fri, 19 Sep 2025 21:03:42 -0700 Subject: [PATCH 21/23] Update dsr1_fp4_b200_slurm.sh --- benchmarks/dsr1_fp4_b200_slurm.sh | 2 ++ 1 file changed, 2 insertions(+) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index 7f32558add..c7cef22360 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -16,6 +16,8 @@ fi echo "SCHEDULER_RECV_INTERVAL: $SCHEDULER_RECV_INTERVAL, CONC: $CONC, ISL: $ISL, OSL: $OSL" +export FLASHINFER_LOGGING_LEVEL=0 + PYTHONNOUSERSITE=1 python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --trust-remote-code \ --tensor-parallel-size=$TP --data-parallel-size=1 \ --cuda-graph-max-bs 256 --max-running-requests 256 --mem-fraction-static 0.85 --kv-cache-dtype fp8_e4m3 \ From 8e61c53c861ed65a1674d87d86d2b9dbff80aff0 Mon Sep 17 00:00:00 2001 From: Kedar Potdar <115327600+kedarpotdar-nv@users.noreply.github.com> Date: Fri, 19 Sep 2025 21:09:15 -0700 Subject: [PATCH 22/23] Update dsr1_fp4_b200_slurm.sh --- benchmarks/dsr1_fp4_b200_slurm.sh | 1 - 1 file changed, 1 deletion(-) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index c7cef22360..a816fea7b5 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -16,7 +16,6 @@ fi echo "SCHEDULER_RECV_INTERVAL: $SCHEDULER_RECV_INTERVAL, CONC: $CONC, ISL: $ISL, OSL: $OSL" -export FLASHINFER_LOGGING_LEVEL=0 PYTHONNOUSERSITE=1 python3 -m sglang.launch_server --model-path $MODEL --host 0.0.0.0 --port $PORT --trust-remote-code \ --tensor-parallel-size=$TP --data-parallel-size=1 \ From 8ed75862dc1d241f3e0448421ef24cafe1e6bb0e Mon Sep 17 00:00:00 2001 From: Kedar Potdar <115327600+kedarpotdar-nv@users.noreply.github.com> Date: Fri, 19 Sep 2025 21:40:20 -0700 Subject: [PATCH 23/23] Update dsr1_fp4_b200_slurm.sh add comment on scheduler recv logic --- benchmarks/dsr1_fp4_b200_slurm.sh | 5 +++++ 1 file changed, 5 insertions(+) diff --git a/benchmarks/dsr1_fp4_b200_slurm.sh b/benchmarks/dsr1_fp4_b200_slurm.sh index a816fea7b5..d3a6b22225 100644 --- a/benchmarks/dsr1_fp4_b200_slurm.sh +++ b/benchmarks/dsr1_fp4_b200_slurm.sh @@ -8,12 +8,17 @@ SERVER_LOG=$(mktemp /tmp/server-XXXXXX.log) set -x PORT=$(( 8888 + $PORT_OFFSET )) + +# Default: recv every ~10 requests; if CONC ≥ 16, relax to ~30 requests between scheduler recv polls. + SCHEDULER_RECV_INTERVAL=10 if [[ $CONC -ge 16 ]]; then SCHEDULER_RECV_INTERVAL=30 fi + + echo "SCHEDULER_RECV_INTERVAL: $SCHEDULER_RECV_INTERVAL, CONC: $CONC, ISL: $ISL, OSL: $OSL"