diff --git a/vllm_ascend/xlite/xlite.py b/vllm_ascend/xlite/xlite.py index f71e4d22fdb1..9ff835f6bf5d 100644 --- a/vllm_ascend/xlite/xlite.py +++ b/vllm_ascend/xlite/xlite.py @@ -661,7 +661,9 @@ def extract_kv_cache(self, kv_caches: list[tuple[torch.Tensor, ...]], /) -> list mla_caches: list[tuple[torch.Tensor, ...]] = [] idx = 0 - index_mask = self.xlite_config.index_full_mask or [True] * self.xlite_config.n_layers + index_mask: list[bool] = ( + getattr(self.xlite_config, "index_full_mask", None) or [True] * self.xlite_config.n_layers + ) dummy_indexer_cache = (_DUMMY_TENSOR,) for mask in index_mask: indexer_caches.append(kv_caches[idx] if mask else dummy_indexer_cache)