From 6e48a596295b48b5a25b147d216882604bba0bde Mon Sep 17 00:00:00 2001 From: Sangeeth0301 Date: Sun, 23 Aug 2026 00:53:09 +0530 Subject: [PATCH] Seed hybrid mamba running state with correct block size --- vllm/v1/worker/gpu/model_states/mamba_hybrid.py | 5 ++++- 1 file changed, 4 insertions(+), 1 deletion(-) diff --git a/vllm/v1/worker/gpu/model_states/mamba_hybrid.py b/vllm/v1/worker/gpu/model_states/mamba_hybrid.py index 420bf5d6dd2e..b6c256bdf6bf 100644 --- a/vllm/v1/worker/gpu/model_states/mamba_hybrid.py +++ b/vllm/v1/worker/gpu/model_states/mamba_hybrid.py @@ -109,8 +109,11 @@ def add_request(self, req_index: int, new_req_data: NewRequestData) -> None: self.num_accepted_tokens_gpu[req_index].fill_(1) if self._align_mode: # Seed the running state block from the resumed/prefilled position. + mamba_bs = (self._mamba_spec.block_size + if self._mamba_spec is not None + else self.cache_config.block_size) self._mamba_state_idx_gpu[req_index].fill_( - (new_req_data.num_computed_tokens - 1) // self.cache_config.block_size + (new_req_data.num_computed_tokens - 1) // mamba_bs ) def _get_mamba_group_info(