diff --git a/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml b/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml index cfc9d3fbc2..0a1f0b56d8 100644 --- a/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml +++ b/kubernetes/apps/ai/llmkube/models/qwen3-embedding.yaml @@ -38,7 +38,7 @@ spec: # Native upstream GTT-leak mitigation in LLMKube >=0.9.10; lifetime includes # startup and model load before this Vulkan embedder is recycled. maxPodLifetimeSeconds: 86400 - image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:e7249fa3c18189a825898832cc4d722d7f9c0160c29540ced793c833ab9f2432 + image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:eddb40b8a348a652c8829ef036df9bbbae537755ae7026bf6d4b403840cd468e # Two slots are the Vulkan-safe floor; more interleaving did not improve # throughput on this compute-bound iGPU. VMCP has its own embedder now. parallelSlots: 2 # Vulkan warmup hangs at parallel=1 (llama.cpp #24307) diff --git a/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml b/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml index d56bb1f302..9471893bc0 100644 --- a/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml +++ b/kubernetes/apps/ai/llmkube/models/qwen35-2b.yaml @@ -32,7 +32,7 @@ spec: # Must be recent enough for Qwen3.5's GDN (Gated Delta Networks) architecture; # verified to load `qwen35` and run GDN fully on Vulkan (no CPU fallback). # Tracked by the llmkube-models Renovate customManager (.renovaterc.json5). - image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:e7249fa3c18189a825898832cc4d722d7f9c0160c29540ced793c833ab9f2432 + image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:eddb40b8a348a652c8829ef036df9bbbae537755ae7026bf6d4b403840cd468e parallelSlots: 2 # Vulkan warmup hangs at parallel=1 (llama.cpp #24307) contextSize: 16384 # GDN keeps KV tiny, so long ctx is cheap; 16K is plenty for offload jinja: true # use the model's chat template (correct Qwen3.5 formatting + tool calls) diff --git a/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml b/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml index 8eb3f0b9a1..428cceb246 100644 --- a/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml +++ b/kubernetes/apps/ai/llmkube/models/vmcp-embedding.yaml @@ -50,7 +50,7 @@ spec: # Native upstream GTT-leak mitigation in LLMKube >=0.9.10; lifetime includes # startup and model load before this Vulkan embedder is recycled. maxPodLifetimeSeconds: 86400 - image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:e7249fa3c18189a825898832cc4d722d7f9c0160c29540ced793c833ab9f2432 + image: ghcr.io/ggml-org/llama.cpp:server-vulkan@sha256:eddb40b8a348a652c8829ef036df9bbbae537755ae7026bf6d4b403840cd468e # 2 slots (the Vulkan floor — warmup hangs at parallel=1, llama.cpp #24307): # the iGPU is compute-bound, so extra slots add interleave, not throughput # (measured on qwen3-embedding: 4 slots didn't move latency, Q8_0 did). Two