Skip to content

cuda : relax tensor contiguity requirements for quantized concat - #25678

Merged
fairydreaming merged 3 commits into
ggml-org:masterfrom
fairydreaming:cuda-q-concat-fix
Jul 15, 2026
Merged

cuda : relax tensor contiguity requirements for quantized concat#25678
fairydreaming merged 3 commits into
ggml-org:masterfrom
fairydreaming:cuda-q-concat-fix

Conversation

@fairydreaming

@fairydreaming fairydreaming commented Jul 14, 2026

Copy link
Copy Markdown
Contributor

Overview

This PR allows concatenation of non-contiguous quantized tensors in CUDA backend for one specific case where dim is not 3 and tensors are contiguous in dims < 3. We need this to handle multi-stream quantized KV cache tensor concatenation in DeepSeek V4 implementation.

Fixes #25530

Additional information

The existing implementation has a loop iterating over dim 3, so it handles this case without any changes. Contiguity requirement in CPU backend was also relaxed so that test cases could work.

Requirements

@fairydreaming
fairydreaming requested review from a team and ggerganov as code owners July 14, 2026 18:51
@github-actions github-actions Bot added testing Everything test related ggml changes relating to the ggml tensor library for machine learning CUDA Related to the CUDA backend labels Jul 14, 2026
@fairydreaming
fairydreaming merged commit a3e5b96 into ggml-org:master Jul 15, 2026
30 of 31 checks passed
zengde pushed a commit to zengde/llama.cpp that referenced this pull request Jul 16, 2026
…l-org#25678)

* cuda : relax tensor contiguity requirements for quantized concat

* tests : add test cases for non-contiguous quantized concat

* ggml : relax contiguity requirements for quantized concat

---------

Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com>
CowboyTim pushed a commit to aardbeiplantje/llama.cpp that referenced this pull request Jul 21, 2026
…l-org#25678)

* cuda : relax tensor contiguity requirements for quantized concat

* tests : add test cases for non-contiguous quantized concat

* ggml : relax contiguity requirements for quantized concat

---------

Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com>
smalinin pushed a commit to smalinin/llama.cpp that referenced this pull request Aug 4, 2026
…l-org#25678)

* cuda : relax tensor contiguity requirements for quantized concat

* tests : add test cases for non-contiguous quantized concat

* ggml : relax contiguity requirements for quantized concat

---------

Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com>
satindergrewal pushed a commit to satindergrewal/llama.cpp that referenced this pull request Aug 12, 2026
…l-org#25678)

* cuda : relax tensor contiguity requirements for quantized concat

* tests : add test cases for non-contiguous quantized concat

* ggml : relax contiguity requirements for quantized concat

---------

Co-authored-by: Stanisław Szymczyk <sszymczy@gmail.com>
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

CUDA Related to the CUDA backend ggml changes relating to the ggml tensor library for machine learning testing Everything test related

Projects

None yet

Development

Successfully merging this pull request may close these issues.

Eval bug: GGML_ASSERT in ggml_cuda_op_concat with DeepSeek V4 + quantized KV cache (non-contiguous src)

4 participants