From ecd4191f2efb2dcccf79fa70b3650d811d3bca67 Mon Sep 17 00:00:00 2001 From: Yi Yao Date: Sun, 5 Jul 2026 18:10:30 -0700 Subject: [PATCH 1/3] Bump to vllm xpu 0.24.0 Signed-off-by: Yi Yao --- container/context.yaml | 4 ++-- container/templates/wheel_builder.Dockerfile | 9 +++++---- .../vllm/launch/xpu/agg_lmcache_multiproc_xpu.sh | 1 - examples/backends/vllm/launch/xpu/agg_lmcache_xpu.sh | 1 - examples/backends/vllm/launch/xpu/agg_multimodal_xpu.sh | 1 - .../backends/vllm/launch/xpu/agg_request_planes_xpu.sh | 1 - examples/backends/vllm/launch/xpu/agg_xpu.sh | 1 - tests/serve/test_vllm_xpu.py | 2 +- 8 files changed, 8 insertions(+), 12 deletions(-) diff --git a/container/context.yaml b/container/context.yaml index ec8bdeaecb36..aba0b729df5d 100644 --- a/container/context.yaml +++ b/container/context.yaml @@ -67,8 +67,8 @@ vllm: xpu: base_image: public.ecr.aws/q9t5s3a7/vllm-ci-test-repo runtime_image: public.ecr.aws/q9t5s3a7/vllm-ci-test-repo - base_image_tag: ad7125a431e176d4161099480a66f0169609a690-xpu - runtime_image_tag: ad7125a431e176d4161099480a66f0169609a690-xpu + base_image_tag: ee0da84ab9e04ac7610e28580af62c365e898389-xpu + runtime_image_tag: ee0da84ab9e04ac7610e28580af62c365e898389-xpu baseline_sbom: vllm-ci-test-repo@efec382c cpu: base_image: ubuntu diff --git a/container/templates/wheel_builder.Dockerfile b/container/templates/wheel_builder.Dockerfile index fa3dd99a5d13..452070ff2c2e 100644 --- a/container/templates/wheel_builder.Dockerfile +++ b/container/templates/wheel_builder.Dockerfile @@ -78,7 +78,9 @@ RUN wget -O- https://apt.repos.intel.com/intel-gpg-keys/GPG-PUB-KEY-INTEL-SW-PRO RUN wget --tries=3 --waitretry=5 https://raw.githubusercontent.com/intel/llm-scaler/35a14cbc08d714f460a29b7a7328df5620c8530f/vllm/patches/ai-dynamo-xpu/patches/ucx-v1.12.0.patch -O /tmp/ucx.patch # Install Intel GPU runtime packages -RUN apt update -y && apt upgrade -y && \ +RUN apt update -y && \ + apt-get remove -y level-zero 2>/dev/null || true && \ + apt upgrade -y && \ apt-get install -y libze1 libze-dev libze-intel-gpu1 intel-opencl-icd \ libze-intel-gpu-raytracing intel-ocloc intel-oneapi-compiler-dpcpp-cpp-2025.3 && \ apt-get clean && rm -rf /var/lib/apt/lists/* @@ -295,7 +297,7 @@ ENV SCCACHE_BUCKET=${USE_SCCACHE:+${SCCACHE_BUCKET}} \ # Stays LGPL-only: --disable-gpl --disable-nonfree are preserved; H.264 comes from # NVIDIA's NVENC (proprietary HW encoder, already a runtime dependency of these # GPU images) and VP9 from libvpx (BSD). -# Do not delete the source tarball for legal reasons. +# Do not delete the source tree for legal reasons. ARG FFMPEG_VERSION ARG NV_CODEC_HEADERS_REF ARG LIBVPX_REF @@ -328,8 +330,7 @@ RUN --mount=type=secret,id=aws-web-identity-token,target=/run/secrets/aws-token make install && \ ldconfig && \ cd /tmp && \ - curl --retry 5 --retry-delay 3 -LO https://ffmpeg.org/releases/ffmpeg-${FFMPEG_VERSION}.tar.xz && \ - tar xf ffmpeg-${FFMPEG_VERSION}.tar.xz && \ + git clone --depth 1 --branch n${FFMPEG_VERSION} https://github.com/FFmpeg/FFmpeg.git ffmpeg-${FFMPEG_VERSION} && \ cd ffmpeg-${FFMPEG_VERSION} && \ ./configure \ --prefix=/usr/local \ diff --git a/examples/backends/vllm/launch/xpu/agg_lmcache_multiproc_xpu.sh b/examples/backends/vllm/launch/xpu/agg_lmcache_multiproc_xpu.sh index 365b6aecbfcd..51e2cc584e0f 100755 --- a/examples/backends/vllm/launch/xpu/agg_lmcache_multiproc_xpu.sh +++ b/examples/backends/vllm/launch/xpu/agg_lmcache_multiproc_xpu.sh @@ -49,7 +49,6 @@ DYN_SYSTEM_PORT=${DYN_SYSTEM_PORT:-8081} \ python -m dynamo.vllm --model "$MODEL" --enforce-eager \ --max-model-len "$MAX_MODEL_LEN" \ --max-num-seqs "$MAX_CONCURRENT_SEQS" \ - --block-size "${BLOCK_SIZE:-64}" \ ${GPU_MEM_ARGS:---gpu-memory-utilization 0.75} \ --kv-transfer-config '{"kv_connector":"LMCacheConnectorV1","kv_role":"kv_both","kv_buffer_device":"xpu"}' & diff --git a/examples/backends/vllm/launch/xpu/agg_lmcache_xpu.sh b/examples/backends/vllm/launch/xpu/agg_lmcache_xpu.sh index 5e4a1fb575e0..a1a23f13a938 100755 --- a/examples/backends/vllm/launch/xpu/agg_lmcache_xpu.sh +++ b/examples/backends/vllm/launch/xpu/agg_lmcache_xpu.sh @@ -38,7 +38,6 @@ DYN_SYSTEM_PORT=${DYN_SYSTEM_PORT:-8081} \ python -m dynamo.vllm --model "$MODEL" --enforce-eager \ --max-model-len "$MAX_MODEL_LEN" \ --max-num-seqs "$MAX_CONCURRENT_SEQS" \ - --block-size "${BLOCK_SIZE:-64}" \ ${GPU_MEM_ARGS:---gpu-memory-utilization 0.75} \ --kv-transfer-config '{"kv_connector":"LMCacheConnectorV1","kv_role":"kv_both","kv_buffer_device":"xpu"}' & diff --git a/examples/backends/vllm/launch/xpu/agg_multimodal_xpu.sh b/examples/backends/vllm/launch/xpu/agg_multimodal_xpu.sh index 1dc83d277d28..d09e26e87e31 100755 --- a/examples/backends/vllm/launch/xpu/agg_multimodal_xpu.sh +++ b/examples/backends/vllm/launch/xpu/agg_multimodal_xpu.sh @@ -84,7 +84,6 @@ DYN_SYSTEM_PORT=${DYN_SYSTEM_PORT:-8081} \ python -m dynamo.vllm --enable-multimodal --model $MODEL_NAME \ --max-model-len "$MAX_MODEL_LEN" \ --max-num-seqs "$MAX_CONCURRENT_SEQS" \ - --block-size "${BLOCK_SIZE:-64}" \ ${GPU_MEM_ARGS:---gpu-memory-utilization 0.75} $MODEL_EXTRA_ARGS "${EXTRA_ARGS[@]}" & # Exit on first worker failure; kill 0 in the EXIT trap tears down the rest diff --git a/examples/backends/vllm/launch/xpu/agg_request_planes_xpu.sh b/examples/backends/vllm/launch/xpu/agg_request_planes_xpu.sh index 1248a6bfeb94..fcd5d130f6ee 100755 --- a/examples/backends/vllm/launch/xpu/agg_request_planes_xpu.sh +++ b/examples/backends/vllm/launch/xpu/agg_request_planes_xpu.sh @@ -64,7 +64,6 @@ DYN_HEALTH_CHECK_ENABLED=true \ python -m dynamo.vllm --model "$MODEL" --enforce-eager \ --max-model-len "$MAX_MODEL_LEN" \ --max-num-seqs "$MAX_CONCURRENT_SEQS" \ - --block-size "${BLOCK_SIZE:-64}" \ $GPU_MEM_ARGS & # Exit on first worker failure; kill 0 in the EXIT trap tears down the rest diff --git a/examples/backends/vllm/launch/xpu/agg_xpu.sh b/examples/backends/vllm/launch/xpu/agg_xpu.sh index a897b006cf63..a20e566bed8f 100755 --- a/examples/backends/vllm/launch/xpu/agg_xpu.sh +++ b/examples/backends/vllm/launch/xpu/agg_xpu.sh @@ -55,7 +55,6 @@ DYN_SYSTEM_PORT=${DYN_SYSTEM_PORT:-8081} \ python -m dynamo.vllm --model "$MODEL" --enforce-eager \ --max-model-len "$MAX_MODEL_LEN" \ --max-num-seqs "$MAX_CONCURRENT_SEQS" \ - --block-size "${BLOCK_SIZE:-64}" \ $GPU_MEM_ARGS "${EXTRA_ARGS[@]}" & # Exit on first worker failure; kill 0 in the EXIT trap tears down the rest diff --git a/tests/serve/test_vllm_xpu.py b/tests/serve/test_vllm_xpu.py index 718d5c6acebf..4400f13a6057 100644 --- a/tests/serve/test_vllm_xpu.py +++ b/tests/serve/test_vllm_xpu.py @@ -111,7 +111,7 @@ class VLLMConfig(EngineConfig): pytest.mark.requested_vllm_kv_cache_bytes( 1_119_388_000 ), # KV cache cap (2x safety over min=559_693_824) - pytest.mark.timeout(120), # ~5x observed 24.3s; CI machines are slower + pytest.mark.timeout(420), pytest.mark.post_merge, ], model="Qwen/Qwen3-0.6B", From e44e639b7177735e8a2c3e50bf251e35dfdfab26 Mon Sep 17 00:00:00 2001 From: Yi Yao Date: Sun, 5 Jul 2026 18:34:57 -0700 Subject: [PATCH 2/3] rollback ffmpeg installation Signed-off-by: Yi Yao --- container/templates/wheel_builder.Dockerfile | 5 +++-- 1 file changed, 3 insertions(+), 2 deletions(-) diff --git a/container/templates/wheel_builder.Dockerfile b/container/templates/wheel_builder.Dockerfile index 452070ff2c2e..d7bc3b5be872 100644 --- a/container/templates/wheel_builder.Dockerfile +++ b/container/templates/wheel_builder.Dockerfile @@ -297,7 +297,7 @@ ENV SCCACHE_BUCKET=${USE_SCCACHE:+${SCCACHE_BUCKET}} \ # Stays LGPL-only: --disable-gpl --disable-nonfree are preserved; H.264 comes from # NVIDIA's NVENC (proprietary HW encoder, already a runtime dependency of these # GPU images) and VP9 from libvpx (BSD). -# Do not delete the source tree for legal reasons. +# Do not delete the source tarball for legal reasons. ARG FFMPEG_VERSION ARG NV_CODEC_HEADERS_REF ARG LIBVPX_REF @@ -330,7 +330,8 @@ RUN --mount=type=secret,id=aws-web-identity-token,target=/run/secrets/aws-token make install && \ ldconfig && \ cd /tmp && \ - git clone --depth 1 --branch n${FFMPEG_VERSION} https://github.com/FFmpeg/FFmpeg.git ffmpeg-${FFMPEG_VERSION} && \ + curl --retry 5 --retry-delay 3 -LO https://ffmpeg.org/releases/ffmpeg-${FFMPEG_VERSION}.tar.xz && \ + tar xf ffmpeg-${FFMPEG_VERSION}.tar.xz && \ cd ffmpeg-${FFMPEG_VERSION} && \ ./configure \ --prefix=/usr/local \ From 28e1655d5a779be3bcc766a488d460f132c6ae78 Mon Sep 17 00:00:00 2001 From: Yi Yao Date: Sun, 5 Jul 2026 19:40:00 -0700 Subject: [PATCH 3/3] Rollback vllm xpu upgrade Signed-off-by: Yi Yao --- container/context.yaml | 4 ++-- container/templates/wheel_builder.Dockerfile | 4 +--- 2 files changed, 3 insertions(+), 5 deletions(-) diff --git a/container/context.yaml b/container/context.yaml index aba0b729df5d..ec8bdeaecb36 100644 --- a/container/context.yaml +++ b/container/context.yaml @@ -67,8 +67,8 @@ vllm: xpu: base_image: public.ecr.aws/q9t5s3a7/vllm-ci-test-repo runtime_image: public.ecr.aws/q9t5s3a7/vllm-ci-test-repo - base_image_tag: ee0da84ab9e04ac7610e28580af62c365e898389-xpu - runtime_image_tag: ee0da84ab9e04ac7610e28580af62c365e898389-xpu + base_image_tag: ad7125a431e176d4161099480a66f0169609a690-xpu + runtime_image_tag: ad7125a431e176d4161099480a66f0169609a690-xpu baseline_sbom: vllm-ci-test-repo@efec382c cpu: base_image: ubuntu diff --git a/container/templates/wheel_builder.Dockerfile b/container/templates/wheel_builder.Dockerfile index d7bc3b5be872..fa3dd99a5d13 100644 --- a/container/templates/wheel_builder.Dockerfile +++ b/container/templates/wheel_builder.Dockerfile @@ -78,9 +78,7 @@ RUN wget -O- https://apt.repos.intel.com/intel-gpg-keys/GPG-PUB-KEY-INTEL-SW-PRO RUN wget --tries=3 --waitretry=5 https://raw.githubusercontent.com/intel/llm-scaler/35a14cbc08d714f460a29b7a7328df5620c8530f/vllm/patches/ai-dynamo-xpu/patches/ucx-v1.12.0.patch -O /tmp/ucx.patch # Install Intel GPU runtime packages -RUN apt update -y && \ - apt-get remove -y level-zero 2>/dev/null || true && \ - apt upgrade -y && \ +RUN apt update -y && apt upgrade -y && \ apt-get install -y libze1 libze-dev libze-intel-gpu1 intel-opencl-icd \ libze-intel-gpu-raytracing intel-ocloc intel-oneapi-compiler-dpcpp-cpp-2025.3 && \ apt-get clean && rm -rf /var/lib/apt/lists/*