diff --git a/vllm_ascend/attention/attention_v1.py b/vllm_ascend/attention/attention_v1.py index 61bc41b9fb6f..367fc07145a4 100644 --- a/vllm_ascend/attention/attention_v1.py +++ b/vllm_ascend/attention/attention_v1.py @@ -1313,8 +1313,8 @@ def forward_fused_infer_attention( sparse_mode = 3 attn_output, _ = torch_npu.npu_fused_infer_attention_score_v2( query, - key, - value, + key.contiguous(), + value.contiguous(), num_query_heads=self.num_heads, num_key_value_heads=self.num_kv_heads, input_layout="TND",