diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml index 0890ace22f..165301c53c 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p1d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b300-1p1d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" precision: fp4 resources: @@ -31,12 +31,10 @@ backend: prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc decode_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc vllm_config: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml index 19cdeb0793..b32295e325 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p2d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b300-1p2d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" precision: fp4 resources: @@ -31,12 +31,10 @@ backend: prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc decode_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc vllm_config: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml index 858576055b..ff1b0c73c7 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p4d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b300-1p4d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" precision: fp4 resources: @@ -31,12 +31,10 @@ backend: prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc decode_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc vllm_config: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml index b4da6d26e4..c5f096d64d 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/1p6d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b300-1p6d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" precision: fp4 resources: @@ -31,12 +31,10 @@ backend: prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc decode_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc vllm_config: diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml index 73aa7c161c..790e6759a4 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/2p3d-dep2-tp4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b300-2p3d-dep2-tp4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" precision: fp4 resources: @@ -31,12 +31,10 @@ backend: prefill_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc decode_environment: VLLM_FLOAT32_MATMUL_PRECISION: high - VLLM_FLASHINFER_ALLREDUCE_BACKEND: trtllm UCX_TLS: cuda_copy,cuda_ipc,rc vllm_config: diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index f70c76ee53..6e4fc8d341 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -6917,7 +6917,7 @@ minimaxm3-fp4-b300-dynamo-vllm-8k1k-legacy-max-tput: dp-attn: false minimaxm3-fp4-b300-dynamo-vllm-mtp: - image: vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2 + image: vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9 model: nvidia/MiniMax-M3-NVFP4 model-prefix: minimaxm3 runner: b300 @@ -7003,6 +7003,23 @@ minimaxm3-fp4-b300-dynamo-vllm-mtp: tp: 4 ep: 1 dp-attn: false + +minimaxm3-fp4-b300-dynamo-vllm-mtp-legacy-dep4: + image: vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2 + model: nvidia/MiniMax-M3-NVFP4 + model-prefix: minimaxm3 + runner: b300 + precision: fp4 + framework: dynamo-vllm + router: { name: dynamo-router, version: "1.3.0.dev20260710" } + kv-p2p-transfer: nixl + multinode: true + disagg: true + scenarios: + fixed-seq-len: + - isl: 8192 + osl: 1024 + search-space: - spec-decoding: "mtp" conc-list: [256, 512] prefill: diff --git a/perf-changelog.yaml b/perf-changelog.yaml index a8aaaa28e0..c3602ff749 100644 --- a/perf-changelog.yaml +++ b/perf-changelog.yaml @@ -5061,6 +5061,16 @@ - "Exclude known-bad nodes mia1-p01-g09,g14 from the disagg node pool" pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2301 +- config-keys: + - minimaxm3-fp4-b300-dynamo-vllm-mtp + - minimaxm3-fp4-b300-dynamo-vllm-mtp-legacy-dep4 + description: + - "Refresh five MiniMax-M3 NVFP4 B300 8k1k disaggregated Dynamo-vLLM EAGLE3 recipes from vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2 to vllm/vllm-openai:nightly-4080263bb2c5d10deac17aaeb88e0823bc35bca9" + - "Remove the deprecated VLLM_FLASHINFER_ALLREDUCE_BACKEND=trtllm override from the five refreshed prefill and decode environments, matching the image compatibility adjustment established by PR #2120" + - "Retain the 2P1D DEP4 recipe on its legacy image and all-reduce settings under a separate matrix key" + - "Preserve all six existing 8k1k EAGLE3 topologies, speculative-token settings, chat template, random range ratio, and 12 total concurrency points" + pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2314 + - config-keys: - qwen3.5-fp8-gb200-dynamo-sglang-mtp description: