From 0728acbbb79c69ab4aaa314e9c14a615c00e3441 Mon Sep 17 00:00:00 2001 From: "renovate[bot]" <29139614+renovate[bot]@users.noreply.github.com> Date: Mon, 27 Jul 2026 10:56:34 +0000 Subject: [PATCH] =?UTF-8?q?fix(container):=20update=20image=20ghcr.io/ggml?= =?UTF-8?q?-org/llama.cpp=20(e7249fa=20=E2=9E=94=20eddb40b)?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml | 2 +- kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml | 2 +- kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml | 2 +- 3 files changed, 3 insertions(+), 3 deletions(-) diff --git a/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml b/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml index cfc9d3fbc2..0a1f0b56d8 100644 --- a/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml +++ b/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml @@ -38,7 +38,7 @@ spec: # Native upstream GTT-leak mitigation in LLMKube >=0.9.10; lifetime includes # startup and model load before this Vulkan embedder is recycled. maxPodLifetimeSeconds: 86400 - image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:e7249fa3c18189a825898832cc4d722d7f9c0160c29540ced793c833ab9f2432 + image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:eddb40b8a348a652c8829ef036df9bbbae537755ae7026bf6d4b403840cd468e # Two slots are the Vulkan-safe floor; more interleaving did not improve # throughput on this compute-bound iGPU. VMCP has its own embedder now. parallelSlots: 2 # Vulkan warmup hangs at parallel=1 (llama.cpp #24307) diff --git a/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml b/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml index d56bb1f302..9471893bc0 100644 --- a/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml +++ b/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml @@ -32,7 +32,7 @@ spec: # Must be recent enough for Qwen3.5's GDN (Gated Delta Networks) architecture; # verified to load `qwen35` and run GDN fully on Vulkan (no CPU fallback). # Tracked by the llmkube-models Renovate customManager (.renovaterc.json5). - image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:e7249fa3c18189a825898832cc4d722d7f9c0160c29540ced793c833ab9f2432 + image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:eddb40b8a348a652c8829ef036df9bbbae537755ae7026bf6d4b403840cd468e parallelSlots: 2 # Vulkan warmup hangs at parallel=1 (llama.cpp #24307) contextSize: 16384 # GDN keeps KV tiny, so long ctx is cheap; 16K is plenty for offload jinja: true # use the model's chat template (correct Qwen3.5 formatting + tool calls) diff --git a/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml b/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml index 8eb3f0b9a1..428cceb246 100644 --- a/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml +++ b/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml @@ -50,7 +50,7 @@ spec: # Native upstream GTT-leak mitigation in LLMKube >=0.9.10; lifetime includes # startup and model load before this Vulkan embedder is recycled. maxPodLifetimeSeconds: 86400 - image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:e7249fa3c18189a825898832cc4d722d7f9c0160c29540ced793c833ab9f2432 + image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:eddb40b8a348a652c8829ef036df9bbbae537755ae7026bf6d4b403840cd468e # 2 slots (the Vulkan floor — warmup hangs at parallel=1, llama.cpp #24307): # the iGPU is compute-bound, so extra slots add interleave, not throughput # (measured on qwen3-embedding: 4 slots didn't move latency, Q8_0 did). Two