From 58c3e91617f47c7817903024616aae41e4521183 Mon Sep 17 00:00:00 2001 From: Klaud-Cold Date: Thu, 10 Sep 2026 06:43:19 +0000 Subject: [PATCH 1/3] feat(config): refresh kimik3-fp4-gb200 DSpark DCP16 AgentX vLLM image to nightly-dev-arm64-cu13-3696c77 MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Move kimik3-fp4-gb200-dynamo-vllm-agentic-dspark-mooncake-dcp16-agg and its unshared srt-slurm recipe from vllm/vllm-openai:nightly-dev-arm64-cu13.0.1-75c2eef to vllm/vllm-openai:nightly-dev-arm64-cu13-3696c77, pinned by digest sha256:42e17a3c600c043c45e0623e4568cd4d5903dd76525a85f5df6ca6fa65358b12. model.container and identity.container.image match the master image; topology, speculation, workloads, Dynamo pin and concurrency points are unchanged. 将 kimik3-fp4-gb200-dynamo-vllm-agentic-dspark-mooncake-dcp16-agg 及其未共享的 srt-slurm 配方镜像从 vllm/vllm-openai:nightly-dev-arm64-cu13.0.1-75c2eef 更新为 vllm/vllm-openai:nightly-dev-arm64-cu13-3696c77,并按 digest sha256:42e17a3c600c043c45e0623e4568cd4d5903dd76525a85f5df6ca6fa65358b12 固定。 model.container 与 identity.container.image 与主配置镜像一致;拓扑、投机解码、 工作负载、Dynamo 版本和并发点均保持不变。 Co-Authored-By: Claude Fable 5.1 --- .../agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml | 4 ++-- configs/nvidia-master.yaml | 2 +- 2 files changed, 3 insertions(+), 3 deletions(-) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/kimi-k3/agentic/agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/kimi-k3/agentic/agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml index 6878c47b00..515f3b1f85 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/kimi-k3/agentic/agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/kimi-k3/agentic/agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml @@ -3,14 +3,14 @@ name: "kimi-k3-vllm-agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic" model: path: "kimi-k3" - container: "vllm/vllm-openai:nightly-dev-arm64-cu13.0.1-75c2eef" + container: "vllm/vllm-openai:nightly-dev-arm64-cu13-3696c77@sha256:42e17a3c600c043c45e0623e4568cd4d5903dd76525a85f5df6ca6fa65358b12" precision: "fp4" identity: model: repo: "moonshotai/Kimi-K3" container: - image: "vllm/vllm-openai:nightly-dev-arm64-cu13.0.1-75c2eef" + image: "vllm/vllm-openai:nightly-dev-arm64-cu13-3696c77@sha256:42e17a3c600c043c45e0623e4568cd4d5903dd76525a85f5df6ca6fa65358b12" frameworks: dynamo: "ba83080ecd31c1ce918559e576d3c5bc9e092ff1" diff --git a/configs/nvidia-master.yaml b/configs/nvidia-master.yaml index 11fa1c1ce7..3a17fea7ef 100644 --- a/configs/nvidia-master.yaml +++ b/configs/nvidia-master.yaml @@ -8537,7 +8537,7 @@ kimik3-fp4-gb200-dynamo-vllm-agentic: - "CONFIG_FILE=recipes/vllm/kimi-k3/agentic/agg-gb200-dep16-throughput-vllm-simple-offload-agentic.yaml" # Kimi-K3 GB200 TP16/DCP16 profiles using Mooncake DRAM offload. kimik3-fp4-gb200-dynamo-vllm-agentic-dspark-mooncake-dcp16-agg: - image: vllm/vllm-openai:nightly-dev-arm64-cu13.0.1-75c2eef + image: vllm/vllm-openai:nightly-dev-arm64-cu13-3696c77@sha256:42e17a3c600c043c45e0623e4568cd4d5903dd76525a85f5df6ca6fa65358b12 model: moonshotai/Kimi-K3 model-prefix: kimik3 runner: cluster:gb200-nv From a090cd67522d8062408c79f8e90a276f2aeb615a Mon Sep 17 00:00:00 2001 From: Klaud-Cold Date: Thu, 10 Sep 2026 07:24:10 +0000 Subject: [PATCH 2/3] fix(recipe): use the native Dynamo chat processor for kimik3 GB200 DCP16 DSpark MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit vLLM moved vllm/entrypoints/openai/cli_args.py (vllm-project/vllm#53659, 2026-08-25), which Dynamo's `--dyn-chat-processor vllm` frontend path imports at the pinned ba83080 and on Dynamo main. Drop dyn-chat-processor and the vLLM-parser-only frontend flags (tool-call-parser, reasoning-parser, enable-auto-tool-choice) so the frontend uses Dynamo's native processor, as the GB300 Kimi-K3 recipes already do. Tool-call and reasoning parsing remain kimi_k3 through the workers' dyn-tool-call-parser / dyn-reasoning-parser. vLLM 在 vllm-project/vllm#53659(2026-08-25)中移动了 vllm/entrypoints/openai/cli_args.py,而 Dynamo 固定版本 ba83080 及 main 上的 `--dyn-chat-processor vllm` 前端路径仍导入该模块。移除 dyn-chat-processor 及仅 vLLM 解析器接受的前端参数(tool-call-parser、reasoning-parser、 enable-auto-tool-choice),使前端使用 Dynamo 原生处理器,与 GB300 Kimi-K3 配方 一致。工具调用与推理解析仍通过 worker 的 dyn-tool-call-parser / dyn-reasoning-parser 使用 kimi_k3。 Co-Authored-By: Claude Fable 5.1 --- ...agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml | 9 +++++---- 1 file changed, 5 insertions(+), 4 deletions(-) diff --git a/benchmarks/multi_node/srt-slurm-recipes/vllm/kimi-k3/agentic/agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml b/benchmarks/multi_node/srt-slurm-recipes/vllm/kimi-k3/agentic/agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml index 515f3b1f85..48df897f0d 100644 --- a/benchmarks/multi_node/srt-slurm-recipes/vllm/kimi-k3/agentic/agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml +++ b/benchmarks/multi_node/srt-slurm-recipes/vllm/kimi-k3/agentic/agg-gb200-dcp16-dspark4-maxseq2-mooncake-agentic.yaml @@ -40,11 +40,12 @@ frontend: type: dynamo enable_multiple_frontends: false args: - dyn-chat-processor: "vllm" + # vLLM moved vllm/entrypoints/openai/cli_args.py (vllm-project/vllm#53659, + # 2026-08-25), which Dynamo's `--dyn-chat-processor vllm` path imports, so + # this image runs the native Dynamo chat processor. Tool-call and reasoning + # parsing stay on kimi_k3 through the workers' dyn-tool-call-parser and + # dyn-reasoning-parser registration below. trust-remote-code: true - tool-call-parser: "kimi_k3" - reasoning-parser: "kimi_k3" - enable-auto-tool-choice: true router-mode: "random" router-session-affinity-ttl-secs: 900 env: From e9e068ac9687233a8ca409afd3056f2f448e0521 Mon Sep 17 00:00:00 2001 From: Klaud-Cold Date: Thu, 10 Sep 2026 09:30:14 +0000 Subject: [PATCH 3/3] chore(changelog): record kimik3 GB200 DSpark DCP16 AgentX vLLM image refresh MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Append the perf-changelog entry for PR #2956: image bump to vllm/vllm-openai:nightly-dev-arm64-cu13-3696c77 (digest-pinned) and the native Dynamo chat processor for the frontend. 为 PR #2956 追加 perf-changelog 条目:镜像升级为 vllm/vllm-openai:nightly-dev-arm64-cu13-3696c77(按 digest 固定),前端改用 Dynamo 原生聊天处理器。 Co-Authored-By: Claude Fable 5.1 --- perf-changelog.yaml | 7 +++++++ 1 file changed, 7 insertions(+) diff --git a/perf-changelog.yaml b/perf-changelog.yaml index b05aba27c6..5bb8dfa32f 100644 --- a/perf-changelog.yaml +++ b/perf-changelog.yaml @@ -7049,3 +7049,10 @@ description: - "Remove the unstable concurrency-1152 2P DEP8 prefill plus DEP12 decode point after repeated benchmark failures." pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2623 + +- config-keys: + - kimik3-fp4-gb200-dynamo-vllm-agentic-dspark-mooncake-dcp16-agg + description: + - "Bump the vLLM image from vllm/vllm-openai:nightly-dev-arm64-cu13.0.1-75c2eef to vllm/vllm-openai:nightly-dev-arm64-cu13-3696c77 pinned by digest sha256:42e17a3c600c043c45e0623e4568cd4d5903dd76525a85f5df6ca6fa65358b12." + - "Run the Dynamo frontend with its native chat processor because vLLM moved vllm/entrypoints/openai/cli_args.py (vllm-project/vllm#53659), which the pinned Dynamo ba83080 vLLM chat-processor path imports; tool-call and reasoning parsing stay on kimi_k3 through the worker dyn-tool-call-parser and dyn-reasoning-parser registration." + pr-link: https://github.com/SemiAnalysisAI/InferenceX/pull/2956