From 046ac1fcd0d3b3da928b48d99c64e3dcdc89ee7d Mon Sep 17 00:00:00 2001 From: Xin Li Date: Mon, 3 Aug 2026 18:56:05 -0400 Subject: [PATCH 1/2] feat(minimaxm3-fp4-b300-dynamo-vllm-mtp-legacy-dep4): bump vLLM nightly to 5e35a6f4, enable cutlass MSA decode MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit 中文:将 minimaxm3-fp4-b300-dynamo-vllm-mtp-legacy-dep4 vLLM 镜像升级至 nightly-5e35a6f4f9bbc217c599692157ca985c894373f7,在解码侧 attention-config 中启用 minimax_m3_msa_decode_backend=cutlass Co-Authored-By: Claude Sonnet 4.6 (1M context) --- .../b300-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml | 6 ++++-- configs/nvidia-master.yaml | 2 +- 2 files changed, 5 insertions(+), 3 deletions(-) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml index 5943109612..8187c94cd7 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/minimax-m3/b300-fp4/8k1k/mtp/2p1d-dep2-dep4-eagle3-8k1k.yaml @@ -2,7 +2,7 @@ name: "minimax-m3-vllm-disagg-b300-2p1d-dep2-dep4-fp4-8k1k-eagle3" model: path: "nvidia/MiniMax-M3-NVFP4" - container: "vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2" + container: "vllm/vllm-openai:nightly-5e35a6f4f9bbc217c599692157ca985c894373f7" precision: fp4 resources: @@ -52,6 +52,7 @@ backend: kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' block-size: 128 + kv-cache-dtype: fp8 gpu-memory-utilization: 0.95 max-model-len: 9472 language-model-only: true @@ -70,8 +71,9 @@ backend: trust-remote-code: true no-enable-prefix-caching: true kv-transfer-config: '{"kv_connector": "NixlConnector", "kv_role": "kv_both"}' - attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8"}' + attention-config: '{"backend": "FLASHINFER", "use_trtllm_attention": true, "indexer_kv_dtype": "fp8", "minimax_m3_msa_decode_backend": "cutlass"}' block-size: 128 + kv-cache-dtype: fp8 gpu-memory-utilization: 0.9 max-model-len: 9472 language-model-only: true diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index 90e54195b6..a73d08eaee 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -7872,7 +7872,7 @@ minimaxm3-fp4-b300-dynamo-vllm-mtp: dp-attn: false minimaxm3-fp4-b300-dynamo-vllm-mtp-legacy-dep4: - image: vllm/vllm-openai:nightly-8e981630c9336233ca9de91452f68918bddbc4e2 + image: vllm/vllm-openai:nightly-5e35a6f4f9bbc217c599692157ca985c894373f7 model: nvidia/MiniMax-M3-NVFP4 model-prefix: minimaxm3 runner: b300 From fa04264f6a3518754e8005f86cccc39c8fdf7b68 Mon Sep 17 00:00:00 2001 From: Xin Li Date: Mon, 3 Aug 2026 18:56:36 -0400 Subject: [PATCH 2/2] chore: add perf-changelog entry for minimaxm3-fp4-b300-dynamo-vllm-mtp-legacy-dep4 nightly bump Co-Authored-By: Claude Sonnet 4.6 (1M context) --- perf-changelog.yaml | 7 +++++++ 1 file changed, 7 insertions(+) diff --git a/perf-changelog.yaml b/perf-changelog.yaml index 7a064f8090..88c4dd06ba 100644 --- a/perf-changelog.yaml +++ b/perf-changelog.yaml @@ -5374,3 +5374,10 @@ - "Image: lmsysorg/sglang:v0.5.16-cu130" pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2420 + +- config-keys: + - minimaxm3-fp4-b300-dynamo-vllm-mtp-legacy-dep4 + description: + - "Bump vLLM nightly image to nightly-5e35a6f4f9bbc217c599692157ca985c894373f7 (fixed-len MiniMax-M3 fix); update 2p1d-dep2-dep4 recipe YAML container to match" + - "Enable minimax_m3_msa_decode_backend=cutlass in decode attention-config" + pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2483