diff --git a/cpp/tensorrt_llm/batch_manager/trtGptModel.h b/cpp/tensorrt_llm/batch_manager/trtGptModel.h index eb1a815a6837..54ad36b13895 100644 --- a/cpp/tensorrt_llm/batch_manager/trtGptModel.h +++ b/cpp/tensorrt_llm/batch_manager/trtGptModel.h @@ -1,5 +1,5 @@ /* - * SPDX-FileCopyrightText: Copyright (c) 2025 NVIDIA CORPORATION & AFFILIATES. All rights reserved. + * SPDX-FileCopyrightText: Copyright (c) 2026 NVIDIA CORPORATION & AFFILIATES. All rights reserved. * SPDX-License-Identifier: Apache-2.0 * * Licensed under the Apache License, Version 2.0 (the "License"); @@ -184,18 +184,6 @@ class TrtGptModel : public executor::Model TLLM_LOG_INFO("TRTGptModel maxInputLen: %d = max_input_len (in trtllm-build args)", mMaxInputLen); } - // TODO: remove this when XQA JIT can be enabled for fp8 RNN models - if ((modelConfig.getQuantMode().hasFp8Qdq() || modelConfig.getQuantMode().hasFp8RowWise()) - && modelConfig.isRnnBased()) - { -#if defined(_WIN32) - if (getenv("TRTLLM_ENABLE_XQA_JIT") == nullptr) - _putenv_s("TRTLLM_ENABLE_XQA_JIT", "0"); -#else - setenv("TRTLLM_ENABLE_XQA_JIT", "0", 0); -#endif //_WIN32 - } - using tensorrt_llm::common::stl_utils::toString; TLLM_LOG_INFO("Capacity Scheduler Policy: %s", diff --git a/cpp/tensorrt_llm/common/envUtils.cpp b/cpp/tensorrt_llm/common/envUtils.cpp index 1a1b75e2f10e..61e81c9135af 100644 --- a/cpp/tensorrt_llm/common/envUtils.cpp +++ b/cpp/tensorrt_llm/common/envUtils.cpp @@ -151,21 +151,6 @@ bool forceXQAKernels() return forceXQA; } -std::optional getEnvEnableXQAJIT() -{ - static std::optional val = [] - { - std::optional val = std::nullopt; - auto const tmp = getIntEnv("TRTLLM_ENABLE_XQA_JIT"); - if (tmp.has_value()) - { - val = static_cast(tmp.value()); - } - return val; - }(); - return val; -} - std::optional getEnvXqaBlocksPerSequence() { static auto const xqaBlocksPerSeq = []() diff --git a/cpp/tensorrt_llm/common/envUtils.h b/cpp/tensorrt_llm/common/envUtils.h index 832421ec60ef..196c15aadbf8 100644 --- a/cpp/tensorrt_llm/common/envUtils.h +++ b/cpp/tensorrt_llm/common/envUtils.h @@ -39,11 +39,6 @@ bool getBoolEnv(char const* name); // XQA kernels (optimized kernels for generation phase). bool forceXQAKernels(); -// Whether XQA JIT is enabled. -// -// Returns the value of TRTLLM_ENABLE_XQA_JIT env var. If such env var doesn't exist, std::nullopt is returned. -std::optional getEnvEnableXQAJIT(); - // 0 means to use heuristics. std::optional getEnvXqaBlocksPerSequence(); diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/CMakeLists.txt b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/CMakeLists.txt index 3a83768eb5fc..9ad95211f86f 100644 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/CMakeLists.txt +++ b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/CMakeLists.txt @@ -87,11 +87,3 @@ target_link_libraries(decoder_attention_src PUBLIC nvrtc_wrapper_src set_property(TARGET decoder_attention_src PROPERTY POSITION_INDEPENDENT_CODE ON) set_property(TARGET decoder_attention_src PROPERTY CUDA_RESOLVE_DEVICE_SYMBOLS ON) - -# Embed cubins via INCBIN. Replaces the bin2c-style hex-array .cpp stubs that -# previously lived under cubin/ and bloated the source tree by ~166 MB. -include(tllm_cubin_archive) -tllm_add_cubin_archive_sources( - decoder_attention_src "${CMAKE_CURRENT_SOURCE_DIR}/cubin" - ARCHS 80 86 89 90 120 - IMPLICIT_FAMILY) diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_cubin.cpp b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_cubin.cpp deleted file mode 100644 index 2ae659b0ff4b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_cubin.cpp +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5e976d4272d60ef0b0904e6bbd2646318aa91207ed06aed593efae5066828a97 -size 280380 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_cubin.h b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_cubin.h deleted file mode 100644 index b31539a4d143..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_cubin.h +++ /dev/null @@ -1,48 +0,0 @@ -/* - * SPDX-FileCopyrightText: Copyright (c) 1993-2023 NVIDIA CORPORATION & - * AFFILIATES. All rights reserved. SPDX-License-Identifier: Apache-2.0 - * - * Licensed under the Apache License, Version 2.0 (the "License"); - * you may not use this file except in compliance with the License. - * You may obtain a copy of the License at - * - * http://www.apache.org/licenses/LICENSE-2.0 - * - * Unless required by applicable law or agreed to in writing, software - * distributed under the License is distributed on an "AS IS" BASIS, - * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. - * See the License for the specific language governing permissions and - * limitations under the License. - */ - -#include "tensorrt_llm/common/config.h" -#include - -TRTLLM_NAMESPACE_BEGIN - -namespace kernels -{ -struct XQAKernelMetaInfo -{ - Data_type mDataType; - Data_type mKVDataType; - unsigned int mHeadDim; - unsigned int mBeamWidth; - unsigned int mNumQHeadsOverKV; - unsigned int mMTileSize; - unsigned int mTokensPerPage; - bool mPagedKVCache; - bool mMultiQueryTokens; - unsigned int mSM; - const unsigned char* mCubin; - unsigned int mCubinSize; - char const* mFuncName; -}; - -extern XQAKernelMetaInfo const sXqaKernelMetaInfo[]; -extern size_t const sXqaKernelMetaInfoSize; - -// clang-format on -} // namespace kernels - -TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 6c4d76a0887e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2063569aaba76709c4baf0dacc68b195cb93f07e23d356f43cde1c7bb03d6582 -size 29783 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 2d82285e08ba..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4ada0c381c9dea26f9ebc168aba2194cda75c52ae962333fd396e479ab7bb18a -size 27560 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index d903d07f1ff1..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e4067892ded96a7d31304c3bab3fdd13adc7af938c40900eaff613e1800689f0 -size 27561 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 037e94306a0b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b8bd273f79bae99c5e5ec2bc93e1e953dc049a0e53693074c6b72e671ec6d5e2 -size 28988 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 5a5ecc761d6f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:49edfba71c31289202a67935114ee53dc4fa783d2e9ea41b280471082924c6fe -size 36141 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 6e27a505516c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f9431256c5df2450f5f0bc2e5a51f9a87bb9ae00c4b163f68c75e32b0317151c -size 34207 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index ca557332399f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:54c15bf23b51104c6ccd48b4b6adab5cd5141fee4e0c19de0fa4f9348aaafac2 -size 34209 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 69c94df702d8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f03dc244c58688ee25a348349da2a351a206b8b819366a67eb918cc0fd46f332 -size 34936 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 3e681502fa7f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bd83414cd7dedab127e4f01a145020c19ec4f936f060d98c8235986158b4b30f -size 26319 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 388d51b49a63..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:98f8c0ea9d45a62e65efc5848011254b1bf0c7ab567d226ccd467a91ebac38c0 -size 23166 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index f8cd7c1b4d66..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0ebf547de96932383e1c1e91d7cad687fa6bd0df16a1ee52b9bd3e6aa43e386b -size 23164 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 8ed340159ac7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:698ee61ac595e67a728dbd5ab383fb3e7708c1a371a7c41f581daccc1ef8104a -size 23876 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index d9bf1a2909c1..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cf333f83d5479d28bdd1bae7c45f055e628250f98decde10b2039f18fe7c060f -size 21223 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index f5b59bcef528..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4b9e4b6303b96bafe2fc8f7cf175e2c7379f18ae18723e42037d210fd7e0dd53 -size 25141 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 3f3dc843e626..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4d793c636a7bf46d288fed83904e5b22fd5e8da79fc5efec3ee08d47f1ab2820 -size 24220 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index d295cf4a529e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bda636a89105831ae31837be51b5702af577dc0cc8fe95656d5966c7d2e1da60 -size 24209 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 3991abe5063c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5e69b5af1021dd779c286ad3724ea7e158794a759adb7a78659de6e9abf52024 -size 22772 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 918a9d299e78..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9c3f5c73d6539134c0a8c3d138347d1a8715585de3eee2dd5ca96cd6d780b1c3 -size 31226 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index b1adbe1f4903..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6847366fe6d6d8cad55854bdd1a1f9bedd6f7ffad231e6110972683a71d1213d -size 29059 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 5bd726170774..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1a1052d597587395ecfbeb569dc7c7d26d3e1b384a3b7b3317b08b5633176321 -size 29059 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 9c130eb02f79..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dba113b12459ce04d28dc11d0700701261d56d5782d4aba3717b92e63cf07a12 -size 29847 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 16cbbc328bf6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2baec154e3d80398279d676f6cd71a49b303ba8c023cace5887727a44fcb750c -size 37706 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index bc00dd15880c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:296e0cbb36292f893041450e67a0d159afa41cdcf6933d97aba70a90596ef401 -size 35141 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index b592b4b36fc2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4dcd5bc7493f6ddafa48c3aac71b50b1a13ea5496fceeb6b8c97452ff5c8df15 -size 35147 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 5451fa2a7ff4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:012d659f5ce224cafe6191ec8ab1ca691215064251d66e32e315336c4a909046 -size 36460 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 3dd338b51571..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f68ff2cfcb7b71de6211486aad522b61f7990c9944fc73d9cdfaf120962ea003 -size 27528 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index f74cb770471b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1d022108e4d1eccb949aa83515f562a4154709b76bbcde8065e50a913625b47a -size 23650 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 8dfdbddb3ad3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4db834ef20cb83954fd627e1560d358dc6e0092b69798efdc32174aa6633679e -size 23652 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 053e6c144247..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:48b08886cc60a48e997bbd0984c0c58618f59979ce01c68d45740287d16be887 -size 24983 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 5baa33956011..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:916e3842cb4c02099e77e99e55294f6e8a7f9fdfcbdd5c58dbb537239dc7de81 -size 22066 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 443714192334..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7f920cb6521a793cb76b6144c70c43952c3755d71c6f6127a2c87aaca947ff91 -size 29430 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index bc9f7bc11fd5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8ea2540d381642e70aecd2a0edb2863d8a7496453963b2c54d5d0f5e60a7366b -size 27658 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 73ec6bb7cd86..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3eda29dcbf8f0dc9f792662eedf036ca34c51332dd44a32aac5f5f31f02926ce -size 27652 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index a44ef0b84457..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5a32d345c13847a70131e5c618d0894eba279c9e8b59c1264585d14714615975 -size 25627 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index e102a1c4bec0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ddc1b09fbdb1a51e3822e3074703f80cd12127d8de0e812eb4c3de920eac5de1 -size 24744 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 975fa66d614b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a5fd20960b6aee81df197698cd4e64caf6da6e4cb814aa6c504f1291616713e0 -size 33171 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 8d9cd802857c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ed2fca38cf2b090ec2d2b4525c0f744eb6d64adf095c099c4464d934169ec906 -size 27765 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index ef1eca909a1a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2f317dcae0666b442a46004ef693339b378f22d06deae5e5e250f3e20553c444 -size 27763 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index af2fefb2acd2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:24f13f9bee68fc89c3fbbe2c0d61e2853b208d92d5106520469363963333bc0e -size 32080 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 191888eea67f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ee668eee4136779f9bfdcd7e16c9ff0f6bfd15697ccb219031e39b4ee3cdfb1a -size 41715 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 6cdde99bd5da..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1ac54660e8f272d62f187039ef8a385167b5dd64907eba212e5784f54c1d46c4 -size 35350 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index d3d113e92eca..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4e443f4048e08b5049c43506a5116c71e413aa5467a5a154fe12b6d779dac3ce -size 35345 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index f0560f8b5bdb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:16a0c0ae7113e98b6c184ae66ce2f2437d3d0680b3dcba18fe28f57a5444301f -size 37269 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 1b64e4e6ad02..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:437976fae795923238b075e99187abd9829a908d9683885daaf6822cccd65426 -size 23771 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index a1b60deeba52..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:77fcfc92726902f878de075203fcc2640750d4c2dd215cca9c98af88e4f1b129 -size 31235 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index d90331806ad7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:62beafe8e51cd10e76a5f34ff60131bc24a75eb340da956749a5e0ccd6eaa7a8 -size 28732 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 3ef3871b500d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fe05826e0866a18922e577dfff0a46dab60852e3b063579b3052b68d0b90f1d7 -size 28736 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 391ff6858fec..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:43af1942591aaf0da37a77c5719a56217bea2bc55bd03041841191210fd26e7d -size 29750 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index f38582be0494..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fe968a3eb318f75747ec6de708a839bda4ffc6d6746c5260125e7a3b1bbb9c45 -size 37360 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index fa5b8aa245a3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ce6188c7afe1dc5923eb89070d43cbd15ec9fec3d2bdb9e9fd60435371463bcb -size 34863 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index f138a2fa71be..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:04fe518f2557c5fd469e92b6deb7fa66b5c7bc2211386f2d0d599942ebd151d3 -size 34858 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index e825620bb41f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:841a7c17bbf99929614db50577518b9770a52c7da06f3365586e8160f5761062 -size 36871 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index fc94f7617c10..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1b24e04f2cac80a9f14e18f023efd638c80f252aaedc6acf86d0182555284f22 -size 26998 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 52fa77313172..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3a2653f5e3463eb278d81d9db5436eef72bc28a86d42d10742110b0a12a315a4 -size 22971 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 98656a092719..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:79d5ac36631de5e07a35f15bba6ecac8033b7ba67d52e4007a41632728b6249c -size 22967 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 0d3da8da88ed..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e988ace10f9ee8f8328e6ea23dd7b19fc02eac6885851a9f8180b4ddd74fe9b4 -size 25076 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 9e0bc49dde89..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0499563faf3010071d1654d8784e1251a432012fa44a6f99584e3dc9f9be8c99 -size 22133 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 6c3099dd2167..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:abaa31810c570a4c9613a99a9a02ff2b762ecc557a1fddb0b9759631ffe1c2b1 -size 28188 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 5df2c427460b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e84916db81d3d4663140169abc24e6a1d96e0803e5f7ed2fde39818fa24b9b9f -size 26935 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index a1d969bf5c9a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5a459916a5429b33876ad9fd6d4659514ff0f5f34e0a795400f3d17e79abccda -size 26929 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index be5345ee6307..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:920271a70c5582e828f116d8492c6a2159e5eb665eb6977d139638e63cc26177 -size 25632 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index cc0e3f006128..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:74db2eb65ce364b618a4c4c09e91dfffadf14476145fdd1e9b876bcb7344b58f -size 28532 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index be53f433f8ad..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5e74acddb12e4fb221956e64957a0b14bba927cd0c39c9cac683499b205d1582 -size 28051 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 17648a8c52c1..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:15ddf9b39b184a84405bf229430bf5e5ecf56502ed099d43495876b9ecda9efb -size 32782 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 6c5b6dc32daf..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ef2bcdc4e78fb407e887472597094d283bb92aa19f058cc21f9e9135827678c5 -size 32564 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 0aa8ecda7918..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:64e09cf4f377ae819e9aec6ac9fc21c28dcaf681c58379ba2cdbb128cda131b9 -size 27565 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 06ee8145e613..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:380b4f7588681f013ed08f100e0c0daf84a94d4f9c1c91479bab344cc4963a2a -size 11050 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 5794a4451eb9..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2022f7c8630bc526d5cddf0f099a7d07db1575cb7c3cdb4fc8f7826a83a4fcd9 -size 25127 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index b7f80b8ca20d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:216db2bdfccee7b8e7f5b28fbc3b9832a8065e1936c633b78c02272eae905add -size 27923 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index fb06f42fb263..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b7ef60aa457136d68735cbe642a28953320f004dcf0358791df06364cd6612d2 -size 9310 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 75aac13316f6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0bfb39a072c918009e5b5eee046952230a5c96057e66575dccf2a5b5e0031b4f -size 29507 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index ffaf43c1159f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9e112e7475c891927cad1b2d86a89a3b4a0555be377477592d502700af9a5dea -size 28631 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 1ac5ae26b935..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:154978875025226a0866229482ce94be4e6bc3799d155f8ed3ef3ef10882b62d -size 33479 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index e805e0fc1de0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f89896cf432f6e40553794c6e1489c0e8390ae3d8ade18d8ee472e3069733219 -size 33677 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 7ebac82714bd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e7e72db532c85bafc94362a9fbb6ef5b2034a69371f5be8c5f3b28e0bb82a503 -size 28460 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index fafc91775d54..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ab8833402fea8fb9a9a47e1c53cc745b3a333d407e449cd070a14e053d81d127 -size 11221 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 7a9d1d623c28..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:635f98dc060e885a4350a3308865b981fe7991b307f357645680d6297860495e -size 25858 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index f4eca27f2cb7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9c12f446925468ebcdd4bb5605441ed93b61c7f036038f44d44ff1a539fa1631 -size 29662 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 16dd6ed443fb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:96132af77fade6262b1a6327f48b191ff8f39def60327105b856921505fb602e -size 9475 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 821539e54900..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:be039df98cda427ae2e6607d733e0b514b814d1bb4a529f910b3bf5f13dded04 -size 27862 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 00df69f86262..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:578120c5677385dbd235d7ef75640c47865cee7c5147f56d07280c71f355e52e -size 32519 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 0948b5a8dd45..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d1ff0c6c3d2a29d939abeefff3be2c8c1918604e410080e3bceebea12c3eecda -size 34680 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 1ea06ff87622..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a0f4ac7fc0ecc9aaf798bd72e04dc53033406373b012de168388570abcbf37b2 -size 39263 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 572c16a4fc65..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6b15dd754c3566cea899305c96f2c392015a367ed258d70bdec2605cb2fb16ae -size 41133 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 4cd29d00739c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b5bb3fe09a04036e8ee5f545e8c32c68a15ea3c7341fd2786a627261f6d88092 -size 26583 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 94fddc2a3134..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:11c778fcafae8563cfdaead8ee4a56379ac5e8cb9bd81a2af4db408ab58b9557 -size 29359 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index f9df36b78f04..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f0440467c6837cb96b6219ccbae8d0edec4a616d8f309d63ad4b3001fcb4c5b9 -size 28242 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 5ece74608e4c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e7e4c8ac918180c84c56cacd62c27319a663c83d43502a0fcd8947931aee4dd7 -size 33461 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 138a12275a0e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:67b5bfa5e4616eba8ee56981cf85012ebb94fd649ae040aaaf46e8d4b7d0c025 -size 33698 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 244f7b42e989..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:580e2119fa8a455c0fa977ca2772dc451954fbb0615e8fb72aa01e68acd48a35 -size 28320 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 6734165ef0d3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6f1561b6b3d93e7cb6ab2a915507784448b45f82a14e4cbe81d9bb4311aaed10 -size 11239 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index f9eff8273f32..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c7fb1edc92298d1a505a7e396f6d0a371111ae57f3880adee07953d3ad7552ca -size 25868 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index fda751108b35..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:41d837ef492bfbfabeea607b88045b65a4caec64b6df3aa78215fcead8a8f08b -size 29223 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 643efafa16e3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ea34a5f4a281f64af7e6847d0d97bb57f549786c0746c9dd027dada259e6796e -size 9394 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index c7c03759b363..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:917169e87deb27a99823a5b050d402bee3d1c082881b28c2214253baf9bdcbce -size 35966 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 00b3cfccc8f8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5d4327017cdc76883161c3400c7e0c30c60ce28ea0e59f2ff637d913875963da -size 33234 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index e469825ee2c2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e96e85784a78c3ff9be9c9d66edefd80730fa472c24d7b3d0af72901e71a3838 -size 33232 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 64a2185d29f4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e9438f069f67b2591b8ea2d69abcb1165a81ab99e3cbf0beb94bc835686330bb -size 25251 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 6583033648f5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:15d43222849f516d03087329c0c703383c1be97486491d664cb9c75898e75986 -size 39349 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index bf28e9e92a08..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a82f6ea770a97604e93373086264f9f426e7436e5fa7e3ed739d7d446d5d3c05 -size 37657 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index ad1cd79d533d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:eadf89bdf0e748f8756bc7ede7b2337fa023ec7710252ec53f2b9fbcb32c1009 -size 37655 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index f1faa6658ae8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2dace4b7df4aa0e8e314dc36e64d76b6e0c11ef350b548258b1ff163c47d151e -size 29841 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 57ae70c40f3e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:26fc9dd94d809f223d86e87a2142e778e9fce509df0e8725fc5f68f65b37d285 -size 34566 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 0f374bffd288..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:527ebb7352fdf014e4435da00459d7e7299e88bc360d538b0a6a5e153e04f484 -size 32536 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 1c9ae9b91255..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:eae60d838bd6301f7ab218af566ffbaa463f3cfbf58b514c333dde7c6bbd584a -size 32531 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 278c421b343b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b0d782cfedb3845d73cae2350c5b6e45ed4baee3f00b37ff2b55b3047dece00c -size 25652 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index d081fc98aaea..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:63bcf11a0df840a88f9853ff5aceb86a9f61ba372d5bb860f270d2ce34176788 -size 25207 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index c89f3e09af03..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c408e506dacd2c94d39816523b2cc4441140ab6c2b2a621c680323ce22d312a9 -size 32953 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 359bb60f1840..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0bb2d2857f4b93e6845e0878c8439cf153c57b1e8c74e6292d9456b398b60edd -size 33060 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index e78d390bf712..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:54a4e0a7c2154c7c0a657f26635fee950032020f6b0eced79c9d426bb4c8af2b -size 33059 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 31ff26f05c0b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b5029302d8162f76fa11ab612d6b0607a5ca08ca89c3bbbb777b7b66aed92619 -size 23081 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 7449bba6aa2b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f7ee744f1315d5a3e7cc2eaa8b6faa0d56b7517cc9281888a9e085bfdfae038f -size 36352 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 472c223b1589..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4e17cab7470f846f2d74302114ca574d80f8dae6bedfa7f1f72ebb1788f915f3 -size 33752 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 459d4c731d10..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:300ece7aaf6a31588a3e704c27099edbd65e784ec0b735c6ee3d5ab68d869e73 -size 33749 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 21208665f742..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3126679aae31a773687d92c98049a903e0b7b0c18c8b389000a481352249dcab -size 25970 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index d270a2534e27..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8f8bf381cecdeb27f8845b33932807e2f108040a9e1af84d2efcad44935b1340 -size 40522 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 5d188eb41957..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a8f721e062245defa2ff3466e74915359cd85d3b497f3e1e68efb70205b89105 -size 38278 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 919a6b83d294..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f53cf838774139d8089c32186983471d9e79d0c7225b9b345a7f1fd255f8ca94 -size 38277 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index d6746a0a1ffe..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6055ba1289a954b3ecb7485d0fa2549aef5eb59bf040554dd9a6fbc9d5b9c7bb -size 31062 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 57b1627f4eba..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1854bc878ec40e5ce0b2a93bca1447038f3cc5294750d1b6d51b26c10a1ff5f5 -size 36208 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 62c3016462b8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f40adc8a3afce0cfd59426844ef93e4827b6cbf9b53409843f606b08182e449b -size 33561 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 36e38aedb450..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:61199505e6ef01cd84ea58e8048991806904dbe825fd502c28f9413a2623deae -size 33557 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 3dd763b4c4b6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c8d9c0ae0e4e0e82cff53baf5c22c4e2d9d2b083c9917a08611a2beb893a1ee2 -size 26786 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index a5909bc5a1dd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d525e4436bc42f5fe944e1830cddb828e01d385a44434a4ada4b62e667f29e07 -size 25888 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index ed496c9b3273..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8d47b030beac2adf98cc6e6bfe4bf177344405ecfb89951e83d11a733508c4e1 -size 34841 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index dbb51e6947d8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dc8fb0c202e028c74514e31fa74cf2c2bb7ae870da31f07ae8425e835fe0413e -size 34583 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 7aba3bd97250..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6f66ca1b5e24aed4e328f0bac6bd384183c0c5ec8e9d7b0d0afbadf2d3b40421 -size 34579 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 0cebd1a770f4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:eff7d688a4bae61ec74776931dad987a723c3b22077398f9efa1983423581ef8 -size 24756 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index e3b8cf867dee..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f84f8f8752736fd3c996f4754b5154cbbcd012d01063833bfa07d1227cbfb590 -size 27616 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index fd27495f1fc6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1e8f414323c6b9325226ceef1608d93e5d15b26506028ec980e9a10773aa72ad -size 41069 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 0282a598de86..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:01f4a864ba49fb09c7e451ae993d66e14aa4ec31183231b7d214ea8b810d50d0 -size 37388 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index bbbbf80934c0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1b945592a47d41eabadd71db0f4a0878bf690e236d2ea2029ceb88cc72696cbc -size 37383 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 0c50308f41f8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c49b78319153d361a39004bddf2dae2fb9a667885d516b0e9917495f2340a3b4 -size 32435 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 45fb3efa9658..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9c9add49db5c05aa7c06d22d5f331e4a3f11afcf29e3076bd488ad392d16f02d -size 48178 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 897888c325c0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8d6411e83626b2964795333515e018e0097c2d5646f1b99c8ae2cb9cb97dea16 -size 44836 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 66facd3c5253..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:475a47b3d7dd68d0acf4e929b128268de5dff5ef6249f64b66d9bab90dc61274 -size 44833 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 1e8fc07d8770..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3f43afc52ed2d6f18deda0f8a2fcf630afcf3d6f907e814c30d5c679e28824f4 -size 38441 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 4515a8233c77..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:93258682b32c64487ddd25a101c1e2cd801d78edd545a7ab86bae9db9b8fa293 -size 26787 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index c56538e13366..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2d7dee2d70002f7b3bfc299e687f78f420e864271d285411cebaeda11feb1bee -size 36259 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 8668b6d36b8d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d7a7800b20ece9ec2c86ff2ec5033a4fd4a469b5afa51130646b46df3a07623a -size 33652 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 2af34814ea43..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f7f997b2b4975a995d23c74bc7a7ce0af01c9549a879f3e3669edae0f705522d -size 33646 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index dc7137b5cd34..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8548fb31657279b86030a7c444d8b8e9f53a0849b7ab9483b7faaa5d0301cbc1 -size 25729 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index b297de19d197..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ab58bca16ad6e499f0d216c6d508451d2661d354b08efbe25ba8b23ad4dd5009 -size 39965 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index a0f62515d2a3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ed84297e4899fbbb8e2b1522784e4d39932b523182b5fcc39bd9619d162f2163 -size 37079 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 6d0c9aa1fcc8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b47b1a2a3c3ceed61d4422c412294506064561b6c50b3c48d55a558545544c42 -size 37075 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index f853c3bc7dfe..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:03cc60e3894ba6dcf6e48f4725f874c175f0105e741b639c50f3b93482960b72 -size 31137 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 2374d74e2c96..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8ef9a01dfc1ce7856dc9bf5747716313a080b152590c7f3a2cb880066d8d3a3b -size 35932 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 64845ff8d3a2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7f77438748f6f045cd5f8436f62b7b75ecedbd912d716a71461a2bb7578e5d8f -size 33181 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index ffe1082b98e4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bbaeebbf829701b06d02079478c44dbea804fff810db7e878edd983760d04caa -size 33178 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index d23cbf8fbf95..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e5d093e126766a2a4e675d5604fa8489a03cb9b40e9debcb1e01ddabecca6cbd -size 26432 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index f14dec20fb39..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f7a85c8f6c43f90e83377adbc2bb2c6a9b656e7d879b88ac100ea8f812bc2d77 -size 26051 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 0eb9fc2c6bbb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e7974234a2879e2ccc73097f41f46383a4bfc851269511f433a217bce54e8ab2 -size 35072 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 0c68ef24183f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2e66e0f5cfa916fc99acc39dd7dc0645aaf12c316d7dac42af040d7def11ffa1 -size 34566 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 280492ea6c2b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d5f67f8065b452e3f557584b3f49092908ac2ad09077079a76e339176ed09589 -size 34573 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 8be74cc05b14..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:162e25616e6dfe790c0eb26e305883f962cc65b97717bcb0c4eedca2abbc72d5 -size 25173 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index b3eee3846b86..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5e1bcb5d4711d27b80971edfefa221039c081960fdac7bf7afda054c677199b3 -size 31153 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 70bbbf0c8614..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c33a4ff48accfd33e578c90f08fb71a284f9ff77a0df903e878323956440e1df -size 26963 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 3db5a11b08ad..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:89d04efa0115d66ab1e76434381b5b726b2b1dd8992fa68f6b1b59ca69374d67 -size 26961 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index a5ecd25ea33a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4e8d324109a246a8e0fb17890fa5fe7fed44a405878f511c429ff6492feb80d2 -size 28247 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index befa7cf49eac..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dbe78eec42e03044b79fb2653aa17604e6f2a215fd855d0a2520995bd5c48d5f -size 23116 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 5229d68e5f20..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d622e85bf570b46a095f4a10b6a80b8adc423cf6cb0dadc3a19070edf3c0fb7d -size 30057 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index a422bdff9b8a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5e9fc9b09223fe188154341d97c61418a1b5117472e33ace7a65a6bfd0ce0624 -size 27370 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 3c59d5fc9165..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0b42a8b958af476f6b2bdced30dd3b964713a092ee7a3508a42872b2eb82ef87 -size 27353 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index e1c0c7bd9ef7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ca0b0ead5f258d42064a148e3e86f99c2ca0c743f64da95f26cceaaaa472c4dc -size 24667 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index df35233d067f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3e6618612e8ef069c28115476b692317d401c84e8ebb250fef4a69ef0d944639 -size 32847 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index cafd0f9fc274..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:af1239f6ff565639fed9dc086fdad66c0ff3fb4635e3851e6aead60a0058f280 -size 26909 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 518363344a81..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5d356422f07cf8d88af7dd7dc32431a9a292aab73f30421a2b08526d4ccaad0c -size 26907 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index f401ee3b1a62..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e2ab69795838b2411d41021cbb9c982db5e7c15295a0594c9bddbc0d715bd63f -size 29043 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 7ebf18f3a13f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c0a403ecc4a2dca87a45914a286638e5224b028dad984156d3b56076732d7837 -size 24295 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 1ebf8f3020ae..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a7e3675bdde327cd41b9e1790d58d7a01a156f6b2f1f05792b56645330646a3a -size 34952 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 5d1aa432ecf2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:41c5496d90e37c9a9bb02438b14e1cdefd20409971125ce150fe84e25adce3a2 -size 33282 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index fadcdef3ad63..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7ecf6c862386f98206aa41b9e24ff7aedc1492934b4a87a05a0c7b6bf142a773 -size 33272 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index b965d45dcbc8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ba450d81100336a2155f913864db073ced9f16e27f425c5ba8a048a34a49ab30 -size 29954 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index aaa986969167..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dd6b62a8f5b77b286501fcc1d0c12ce82c77cd485f56a8622e80e925fb2c26bf -size 27341 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index f67c93f5bc41..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a6be62a3a9c9121abbb3dbd87d5d6d2c2168078614175d5741cec1adf3e87d1c -size 25763 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 9b2b3bf7401b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4fdba3d6715df5e10e936d81a6a3682833330de0febfd75b8921a2ab5ee5815a -size 32832 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 30a75bdb4ac7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c7e7e2443e0270693066e1e52ff6e13a4c395f41e8bbe6a45c5a80601b93a37f -size 25676 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index b10ebb6337a5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f931f6364098ec0f54b1107ba00014047563a2aa95c14c7b3bab7c49875f5687 -size 25675 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 2b9420ef1c0b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d132653ce4bf93a788f26e574e2cc59fd7e7a9426c145fc942e428b7204072f9 -size 28969 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 152b55fc5d8a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:77991a7836bea52b623dfaf38db34d561f190ae1230c7a21d1b8a659afd8966c -size 23554 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 5425a130dfab..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0ed14dc4e245204629013f9e1fe5fb485a6bcc50dc78cda78db71df3e4e8006b -size 33274 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index d0b39e023389..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:13006f6a26d9c9419a23b3b876b591b949ba2c4b666cd0bbc1a7d9ebe2538b28 -size 32125 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index b0ad7ce26e49..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d6b4135d8986a2c58eeb44db4c12b049a434d657ee22caf59f74ee7ef1df6a0d -size 32120 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index d1e7b6c366dc..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_bf16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c92a7e7730358bff7afe7a2c3aa3e37d9efc6bad84a489e5da7864313e62a85e -size 28262 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 1fb512e715c8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:51f850264aa759d1920cdeb3b157c88d4dc7dd27bab62b92a625672a479da1a5 -size 30075 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 29dd63fa3c91..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3e2f595aeee98dfe23616f7c83df68696fee120009103b727681cdd101369522 -size 12845 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index ae79cbf81445..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:feffebb95b8dafeee7d31652591f24eb619fcfc39f29787c446e98c396052746 -size 31060 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 35b2d11804ae..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a9485cfa3304659acd4d89b9049fd6a131971f7fe7f0dcb657510012fa731f65 -size 30819 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 89809d63d307..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8e3b5bc8842b125ae26ea07b4d3f2973f5bf6eddc80d50c996917ee8c65d4ee4 -size 11293 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 9c7435b90fe1..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:19b0294f0dbbc18f75c29000477bec2cc88d5045725aee1e50e7c1156d760c90 -size 32206 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index feffff6c5579..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:541a5c53173fded0ad967868e34370620e24841b8b094bc9b3ecd0f5914bf75c -size 12966 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index ed8b9059814d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:aff62bfc6ed60032937757431b13cdfa4dfb5c65cd61a7b8665b3e1a15e3e221 -size 32066 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 68af0f0c0445..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2f2ae676505eb998e522859da846e1418b5611ba42da19e5cd5bfd9a84f35c87 -size 35987 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index e216c1034c92..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4f18385f1608ed5d60ac1c51aec619565c73f2413a72ad505840e24884a4f42a -size 11444 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 614f482c9a4d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c155f569aadf342dd4b60eba92feefee308cb3fa3893738ccbea1d9a5b771796 -size 33306 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index cf4cd4203847..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7e9fe9f316d2fb66abedae222234d217490fdf9349cfaae8e7c396a8a0457f53 -size 32451 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index a7f91c2f4459..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5f5eff797036fa1993dee7273a3ddda35f324bad881184506bae1995c2270075 -size 31544 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index c0cf68465cc8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7676b35673bef7ed20cd369f24d99524869781bc8d4bb9d4f701f1239d9b6bf2 -size 12903 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 7f56b5accf23..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:015da48f2e7def07d4b811d722a35e0c4725e32928f33b9f306a2ad4cc1c2a7a -size 32018 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 29ec4b87ddc9..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ed6b38ba9dd22e675312643fb1179a7b7c4c91641c97b9408f4a67d3e67046dc -size 33033 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 0dd562df5ee6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cfebabed8eb55fe4e4ec83a24e71ae97e46a3a312ee1da1e6375eaad36f67091 -size 11403 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 4d0fcd4f33ef..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e4463069b022929cb46842a3417da7d3a0cb43715148bfb95ab0620c378444eb -size 46365 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index f2ee8baa18b3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1f2b80a611a7c2c3177bf223cd0583b1cff5e08a132d48202f6a53dee6a59218 -size 39583 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index b21335795bd9..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:57e9cf032023a58212e8d5c6ef7ba836d04cf4c0544592a5bfe382b11fc96113 -size 39581 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 084f54704164..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1352f215c47cb6d957ba70f0367447cb22cc9cae3621a51967f4e1fcd1cb1aea -size 31146 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 1b8464986073..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9393f7e322927d64639f085b96e111cb3c59f2b59ff7e202cdd608e0c2a5b42f -size 29867 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index f2b54cc59377..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8f978f52624694610dff8f0cb7db9a77dcd5cc8205aa7c0e258224028abef452 -size 37675 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index d2e2e0908e45..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b6310ee2f526b5c6c40f16518eab71ad263a0d9589c57ad71629bab8bae87cf8 -size 37836 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 38f7075a36bf..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ba484ad3c046dce1e9b26533e6e76142ea0e1bd0da74c10d6452c421f6be8ecd -size 37832 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 4a4aa34848de..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:861a8d714fc2ffbda8cc7c551b0cd2a7440421b607463c7f55029703b730f19e -size 25150 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index f8eb064c8956..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c8406958042c3d5cb6bd5bd6be33aaf0ea6ede3c8b9111200068de6e6157dfc5 -size 47070 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 0d59ded320be..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:05e333343a76e142c2e79bdc7098107cb97c76e95549e90637b733892eac4c5c -size 40934 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index e2f44ffdadad..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c6e42a03067dc7ee4f36f9c62a6b1c84a6ad459b7fbdde0af937e665b5568055 -size 40934 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index ec5b817ad794..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b59bfba7ef460f200283ec359626131080033fab1ac4bb9eb23477c5f2ff6c69 -size 31065 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 07fd6444d604..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6a5d10b6036e955fe976bad27ae4b255d8ed5fc4d286e7f63d161887815d0664 -size 30815 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 2128c0de85ff..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c4a6b779a99476cc830432f1cae8ceb0204a56dcdeadbed71ee2b9a7a9126f2e -size 45772 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 3591940376dd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d9977026d0e7c0ba8ee432db3bf4a652a31e14c519fa28f83115a31715ebdb2b -size 44700 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 566049c768f0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:caeeee184e82c0178ec233e3cfe698a32e932b2bd451e34e63c6592f8f0c097e -size 44696 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 5abe6f540a88..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7381458177df32e0683535e3e2987f8ba1ad15d084e042e4fa7e74a38411de67 -size 29548 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index c27e541f1727..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:11557624152e1c569736f34518e21153c9187c7119364b28ad42f44e26b085cf -size 32436 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 08d7f664628b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d9242727eafd76bd513637f0263177d0b1d87558b78b7e7b410a872b3e90bde8 -size 31311 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 73c2111e2733..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b09c4ef914af48fc5ae9ba60e98c8bf274d3adcbbaedc0f455a6d0f566148f8d -size 47301 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 595170bdcb24..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a40ed6e59edadd99b0352c38ee013de74d1c4015fc15848aa3b5f9ba973925cb -size 40965 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 32f4a36f6a25..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a42adc80851201554ee4d3ab4791f5b34be5bfbe2b309d5d275a221cb15a998b -size 40964 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index d7954a8a3edb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:43626960d1b887e06452addd949bc6acc1f0088d7b493a8fe51fd04370ea1d6d -size 30981 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index e688b5b72638..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c7db3a3bb143ba273bf279c55985a35c3aa74e0a66d08da92516d444be707738 -size 30897 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index b8016181206e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9cf5d7b66862e4ba0de0a4c7873d3fe58bf00e14841f5c6980265136d382c1cb -size 39590 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 0fca3121dccd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8b189e35a898b6928098dcbd79ab60b23646131eb2d23c8fb71c559d3fb66e63 -size 41528 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 57f8a8a3d4e5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d4c3f7bea7a681f904cf585335096edcd9e909a325176720bac7ff192839a157 -size 41525 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 253bc7cafd11..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:22e0715a807d4fcdc4b874dd0802de9ff04d0b746fe5c449311e0e65dc9b3c00 -size 30015 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 267796e7be4f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0da747ec6be990f2632f5fa3732a05d7a46f881a4186b6d4153c16ac57088f7d -size 23860 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst deleted file mode 100644 index 4359d7d8f6cd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4544104a460410351349c90d4788954cd651c816e63f57459e5c5be77cf9b786 -size 30647 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst deleted file mode 100644 index 906416eb8567..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:40a1af85afdb89dcfdd9f58bef152a1daca05a2f0003f35d7968203b5d8dcdd5 -size 29215 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index aabfd2f3e197..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:de3f1126b34f9064527b0c3c37a05727ec0b54df4f1cb74ffe5d618e602838c3 -size 29204 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index 268c22c0e5ba..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ad3437edbad5040a4e8f05207f0650459ab75e093e60e580087639ec96be7786 -size 26487 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index b28bf03a97fc..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bb9368971e5762a71dff3399ffb296888e55bd34bde4e4cf41e05eeb1193e56b -size 24431 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index b3bbdfc77132..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2b23222e6b82e3fb03c6df7f4ed96ec27056bc01d2d75bc3c61570e3366297f2 -size 25137 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index e72f13c98cc7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7836634a82d2e1be97404495c1a5603728bf45b81976c664350bde0062b33069 -size 24758 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst deleted file mode 100644 index 866813c9dcb0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4f7f536eb49b47d5819fe27207514c89b28a845f584154d0ef37059a3fe2b5bd -size 29871 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst deleted file mode 100644 index d4b393b70004..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b38e41ebc2eb4755aba12e963b21dc89a0591c36275460b951e81f9c243d34c5 -size 28598 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index c6ed31bc346e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c0249897a643239c10721dbab96c83bb1308d5d2806ddb1db05c2357bbfd74ce -size 28581 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index fb43383f47ec..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:57c174355c9d6f2e08cc8e0200ec7af8eabd0849895fbfee189ef627a21c81ff -size 27286 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 02bbe980cf7b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_bf16_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2c71f1484cb7e0557e291458d3f53e4b70dd82a60ce77639672dab995fb3ed97 -size 25057 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index af8a8cce719e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:49c2e83ef7450d5286d90eab3a5be3e3bb160b016afa14b7a1c635135326e1f6 -size 28357 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index 9ce9f55b5f9f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0af91cb22d3dfbeead544e8e3a2ec636fd7b690c4ba8802d1fc8fc8b346b0080 -size 27782 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index 40da6241abbb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0ddc44178111bf1bca1d937483bb7471bc6af95150ad7523a5618284ed8e66cd -size 25494 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index f8470567aff8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3300561200bf520a48699d8273de68e029f44b219b5ca875684f99a6740f2fd2 -size 28532 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index fc08839c7dc6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3d0cc27c9d786d760a9d72133e5e556a583e992d21045380cac1eacf9139bf14 -size 28914 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 68759ab31482..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1c3ea5b609c0b8451f8d812c45c414d11e18ca829296899f8929790d579218a6 -size 28887 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index c6cefdb2b161..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4d5f831ce8ee49e24cc6822d09ef7e9f8f9a3a4c163c81dc2b5dcb0919252256 -size 27744 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index 117d0a6cabc2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:484c5505932eb8c40be4595e650bd900b9ad2d590e5edd24746d3115db5d9ce2 -size 25533 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 0764e512edda..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dbfe33fbd03ca86680f9c3bf529342b270bbcfe078e985d958f23f64288ca0c1 -size 29197 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index b4fe453f72de..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b85d4b70d78977c74976e98330b45aae16e065613ddf1022be2ff6b04c6f3e73 -size 28892 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst deleted file mode 100644 index 9637b93bc02d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a5720c9278d6bd8beb45f99ff656c5a651fdd92bbd74c39772b3a11918e8464c -size 31190 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst deleted file mode 100644 index 652d3f6f286e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:430320a5b201a340e45f766ea59773d3394b14e416b2268d3e7aac8bde3f8b80 -size 31281 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index 43a8a68d5807..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4305653687460e79186d0b21b7014a89a8545486d9f8c746889cb1fa4875d19b -size 31277 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index 13763e8c9d71..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:19705d6b1462f9ab2421149243ea598389fc68937c04ea98cf1479c6f701ca65 -size 23517 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 1fef84515853..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:66acf5f4f723ba06e46712f0ed4a916607bb62cd805d4941dc1af90e619f72e3 -size 29789 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 00831a113811..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:99a60a7ec336ed70ceb47e4d238a462d387892941fd51776a01461b3bdf5c7e7 -size 29893 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 55777687cdf3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8dfffb278f3c598d15fb370335e6186ce95cbb72aa40ff0a37dcb55f0f6a5f5e -size 29906 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst deleted file mode 100644 index 6472c433df80..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:632e15ca0e0bf65a42103fa2043bc0ad2e9139b2021090bb46e16e83da782a2a -size 31322 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst deleted file mode 100644 index c2245a9b3f37..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:65f41fd261a26e4d9d9a053d985ef62def63be073cca378a1ea84ff74e365b4b -size 31044 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index 758eb37ee180..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e9e8ccaab153e82194ae27333e6c26a09a04e1a2cf32bc1201c58e2222991102 -size 31038 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index 04cef73940e7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8d3b982400185dcf6a8e356797382352535d4361cb0cf6a81e46e4fdd1159890 -size 22801 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 61e0f40bfd0e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ac5ec7f399e3b710dfff7359c5def48da7c41eb4706116bf52c6769c0fcc3cc1 -size 30049 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 998906c4097f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9c75f3d166caf6ca6e682cc2915f8322ee6753598b3e6ed87cf6799c7d4f91ed -size 28726 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 1ce66cebca45..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f5d2dcf0c57ad54a69b75ea765e38217683176cb2b68bd8a7bdf8b9441477e61 -size 23620 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 74e53950325a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4b6c54f01b528969d29990daed97277a1b9034eb876023d5c61a9238de77f458 -size 23619 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 60f882f5641b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:23477595d70a17d57896368ddef9eaf41b5b03b02c55a9dadf611c73a87d5172 -size 27344 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 6be6718b636f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c6199660b066d723f94e4a9f5c9b590af72c61a24b0524554dcef21a22be3f65 -size 34332 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 9114c6937700..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7545d5c0d2049d5bf9be348b601735091305903cc6e8185725615e455df74ecc -size 30507 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 26bb1225d6ce..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:24082612ed3c4a0926daa869cc5f205f309c819607a17a5f9672fd1ad3bd664c -size 30500 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 0056b4634d65..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f669b2317a7f00b1230af3d184a3074c91ff382589916cf023fdf3527fa4de37 -size 33008 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index d6a51f054dc5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:972440c271776982ab86928c234b7256d95944ae8a262ef0f1992d531d968380 -size 25267 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 7f6f9e844aa9..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2843bdd28c449b451eff40c96cc221ab42e0bfe312f0a5791f30032fa390c146 -size 22658 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index f584a5976556..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9d5e8225fc66a81551e06daa6f9eaf0bc115b7681bfc89671dd0c70d559672ca -size 22668 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 194e07cec66c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:17a60f954502167e291182f81bb7396bf58f17c17b44ae5847bfa14e57198438 -size 24296 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index adb21393dd68..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:db98b679059f75cc2fe12973d121261426aafac8007e0275212d7cc3b8ae8c7e -size 31378 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 10386f4acc85..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6f4d75e05e26c61f3e4e519d6d22e573607d02f377f2c9ab0ef70482d1d0be05 -size 29235 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 349bab3496b1..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:43210e9471b05a4f22b49b8818d5ef01cc6715ac365863de994b363559bc9624 -size 29244 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index d15d049f84ec..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_bf16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5882e5237e3daec2254ff96aa8c4f3afaca1978b57f2c739c31111b4233bc326 -size 30021 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index a9918ddf159e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b3c8bedda4665d75169a96d389d9c8804c4844f00111e2ab30624523bf6761ae -size 26589 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 5209a7cbd915..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c59f410fd88ffb3f30b4645b48199f16df22bceea12d14ef9412e39ee44d7e1b -size 26139 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index fa0cdf82d506..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:89a4d5246dc6c696cea9f8ab0edad7a5be258b2db30dc85de69db737c57f7822 -size 33062 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index e4aaa36e155c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:82bd207819af67cab57ca592546d4a2ab0ecd2f3a9a322602100fd7bb6338b50 -size 31920 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 4897efc97426..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9dc4aee867b1155957e2dcdc7589b6a6c2eeb40c2f65e96e0e504419d8844279 -size 25852 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 3bd7f06284bc..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b8557e51cbedd475f2ee109463f6a56090b23a133669201f7e387fb53b989ffd -size 25049 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 43169861a657..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9908389205c31f928932444d18f5c8e3e677b8159326ec3cf25031c8a29b2de1 -size 32389 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index fa411a38f351..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b4e1c256cca5de2cf4c3be93bed1d83decc16e071cd3e7b460496207a12f61f4 -size 30859 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index d7adb9ee0147..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8df5e96a90bd5d542908942447612b541f974e02981fb4437526411c560baefb -size 30208 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 32262f709adb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d4e840b7fb5e8125c96b4ac57fb713798a5b547c4b14df716b861586abf2f4c8 -size 30067 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 33abf60b71f2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:27e49f1f4b1a5e1095d2ae04199000659b18f2627538a85ee7d342a51ac0dbef -size 30063 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 51e36cc6bee7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6a30a73f5e2ed54c3ed7bebf180ec21dad3c138647414db7bf68af837fbb8208 -size 24771 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index dafca937a631..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:96a7cd112e3f8bc0be11c2901ceb22477fb42621f0887153563d2a2962108300 -size 36285 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index c9cdaa0b169a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e90ae2ce096fcf99f86f5f9ca536752eb5899c3242782124e4847ac6fe2260fd -size 36575 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 46df547b92ef..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fdfc6264eafb63deb9bec11b1b8ed25cf2a62ed02c9bb84340a48fb7894f35d9 -size 36572 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 712106909977..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ab8614f6d64aa5a2c93c657173374a996654e85a38b3204d373ec7da70380c8c -size 30734 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 8651717f2470..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cbc2ed5872daadaa674c3cab6ec90cfc6cb4f62ddefd0efc52fd3927beb02a63 -size 28819 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 0755dadeb22d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6a97b8ce83ec54af534b7656971d8681f79df15148d5706947f6ab63a54ed7f9 -size 29085 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index f63b7931bdcb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:00ec6a57826b19abd2eadff7444619b07b5551b585a583c327f841a5f90ca747 -size 29081 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 406e3dbcf0fc..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0904fd3b3407269a4c68d16de4e48fcc34b08b55f07bf5bccdc6a1d7b6e5e243 -size 23515 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 7534da42e413..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:71dc5bdb8c7e37bb264719e9537f779e546c1b14a68e3bd0ad5d4b16b89707eb -size 34679 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 4ef463924810..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3e9860112506fe83aeded77c5f9869e592b48d097bd3c36f8d5a8e1cd7bf0efb -size 35751 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 2f7d6a283ffb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:45bf328ae196db81707cad40c5d37ceba89b44e7aa3713b5603095ebf3695ab7 -size 35746 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 8718579bb549..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_bf16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9bb7ff5b77e0a4bd8b267bb97dfc5f2bedb976becc73a4a84d7356bc01c4385f -size 29352 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 58fc0b8e460d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e927cdf740bf5b929e7cb2fe0ad90a4956150e1f4459a3d9721704b276f91c87 -size 25493 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 7b0019fe2de6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:024a69d40ddaf3fe791981ef395fc28c9a36a0a6d8c6f5cf9537e5e5bce54fe9 -size 26143 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 16699e94730c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:001b1210eeb5ca5c8a56eb0659a90ad8ce504ae14b092b9778f1df2cc773418a -size 29957 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index a2c8b9133a20..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9a073de1131fa3298b0565fca9c4b89c01d683e18feb0c5ecdcb72654234ec2e -size 29272 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 5d2c3b5a6363..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:07b0a251615f66a61e9b0e0ddb56a8dec6a715453b932af29ebbb687a97cfeaf -size 20278 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index edfe1ccbde96..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:41cb90d18dce0b80cb7d9780911c3bd7e4fa58d065a9504c63030933dd965193 -size 10975 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 4166069454ff..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:477141b3a4d1f82f565ad07e7b6059e6f27ce5b58d5784d0744646355f1f4761 -size 19202 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 00ed8f3fec49..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c26b603f03b2d1a4f1045087caf039aeba3ef452bfa70a3aee81847913218c0f -size 21207 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index cb87710c7f8b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dadbc4c7c3f6cf1b1ed8d62b00644eb4cec5037ce0f4e446541e39b277b12ea5 -size 9322 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index bcfbdf6950bc..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:78ea5c129c16c08653fb13377ccd7579b81bb05d4e3902c2e3d687a31b3b9b31 -size 26009 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 7d242cea750a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:130f58b832e33e57d6fbd621c6ff23ad5bc984058b7ab3acbf216f2e9c9b579c -size 27106 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 6a7202a5d333..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d33938a02b4e405547a058c6167cb4488b26794bffae1a6bfa63b9d5bbb1bf8c -size 30372 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 5c4f4b258e4a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b44fa698c5a617e30268958e385e1e7001c4ddae33d0acd24881d964e7e3be8f -size 30511 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 041d327ee82e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ad4e090f0ad7ebd71f5ed909d7b065d19ac4583b85a9a50782cbc68d31512e90 -size 21390 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index edbbc38576fb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d5f960cc76e6c54d80db2f7b6c3dbf6c850996ec3b352822f7df82ec6207ea4a -size 11157 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 0b8723108f10..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:eb4199efaf646441f2dd0f01b0d0732bbf12316d60d3cd48980fd3f5b1f576ee -size 19875 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index e1b530c0969e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1b7d1af9fc61640f8d467cba4cf4a4f6d7be45212b69bf2623c75bf19100ad1b -size 22144 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 5c752ec6fe0d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cac89030190627c15e6236c620c1162524ade963f6b2d5fd1b51c9ed150ba8ab -size 9485 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 07bb9eba9fa2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cbed9ee91d0c17ec0b7ae6780e01d5f42fce0515fbbb10917b21a67f529d2bba -size 21913 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index f01983665e0b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:79c72756c30def3f08474b3e0a204abfa45058915b773ef6e5e237489839fced -size 24706 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 1c794c7935de..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:440e3cdd9ec50b7325b4358255f98f438990ce66217d54afd566df7a2154129f -size 27745 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index d360999f81cb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:22774b63079d3ac5fc1b7c545de67c14e61fc065c5635acde168bad819c29dfd -size 32574 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 2af74d8dc69c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:101435d61570b7b19d1cf01d0649181469b42b00b30cf9ee1a10b13d1fd586e1 -size 33980 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 97718f1f6b52..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:79a84972244c4debdcadb80fd7c345bf1d40aa0827f6658d80e746e04609576c -size 20883 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index c1aca34c442c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:daa137e99f88f2ae1a7c543a00ac9cdc746dcb08a80944a89fcd5b06bb66a12d -size 25891 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index c88cd9918cbb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0631fa63fe564161bdb410b4ab730449231c8d2cb2d87068d4d1964a5f0079e5 -size 26903 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index cc1c5c5b202b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:10e56def9a76144ce9477b8365cf7c8a3886585b6a99617631550ba0a0ef04e0 -size 30501 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index b0193a14ed07..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b24de053a670da5110702ebd9403ce490222991d2823fe9356159c5f85a0f7d4 -size 30364 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 52211d0a9e42..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cba07913e0d6ec05f0f9117e1a2b92e58448577a65021205225df6fc92b3d887 -size 20897 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index b90d197ad482..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4f5b2262d515d2411c03b44693293b6040c72075348647d3592aa675daa7a0e6 -size 11139 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 1018931aa541..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:84bf57f3565c48db5aeb0c1db5b44c24edcbeccb859b5947ab473bfe4f38f243 -size 19993 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 113bf145bdc3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a57714a02934ec1e41c997a9e987df9e07aa8c2d718389b0664b19f794f862c0 -size 22068 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 5d64a90831e5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d40ab71038cf7f9502927b75a397887f21de8f41fd61aeffa5f4972ac25129cc -size 9430 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 48880df35cf0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d06b440ed9e56e3405e2272639b53b53ea0e03449298c376cf3c6fe2eda58f1e -size 29782 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 50a591ddb563..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0a7c19640dbc17ce9e61b5a54c854bcfb35b262ae3d0b698e0ff16a4e1d1f9c6 -size 27387 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 2aee9a6ba8b4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:363b18ae69b983314a5b6e402e65f4b5bf06cac8f56ac80e7ee05099bcfa03b2 -size 27384 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 75a96cc899c3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fa045420ea051a6e8e93ffefe60067888270ac4d4afd1ac5fc557a9d3e1acf4d -size 28932 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 77ecdeaf28e4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1afc52084be99abdb2da538834eb3f558f262f935d3aa9621971c7231a5bae30 -size 36131 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index ca863a188d2f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a136d8735edcb1c159189b0b8975734e398871ffd8be2ae2720c6470148c7bb7 -size 33945 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 74e975356cae..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3ee079ba0f95b3fbe93f32467b8d96005de3223b9eea41e8f5746797ec157edd -size 33946 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 62323796a55a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f91b7b68f4ebf67336269d39a29adeccee23e729d5bc3ca408bf815194227c55 -size 34891 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 147f75e21b73..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6f61a0ebefec8102ba7595754a580f52648a96083d0e1d7d6f28bd76a9fcb8aa -size 26268 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 34b95ebd5249..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f1fef6bc29dd8abeeaea17b57e27838520f4389bcefc22344a309175e705ef05 -size 23106 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 3d8e01596671..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:244cfdc24da050a53ebeb35ef96f9d6d593435b86ed8d62c8c00547d34f4ae19 -size 23104 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 7d1ae5467392..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5d12a0b6e219dc7c705f9632ac252472c498b52606664fe2b0ef674dfd9b9400 -size 23638 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 040ed87f6918..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:06eebdb462e58f664a6fb2f2824962d49bf8e505a0e388061225156c4d9b73a1 -size 21065 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 290ff7694485..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d60a6aabddd1c9fc6490f5105d415206be9ddfc1c1db8f45d061d3eb1f1621d2 -size 25209 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index c0a2602c9fdd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4fb5dfa6d1e16d237165997fccce09edbfbe6a8f45b8ca70b3162999a981b7e2 -size 24071 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index b4e8067fa328..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c72919db8756f5a2da2a5fa1a5d094ef303abc59e9517cf57265a491b7cb7b37 -size 24069 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 90b2dbd4a5ec..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:071408d78d8c021ef3d691afb6a57ab81f28fb300907c304281c9d4ecb40a2f8 -size 22639 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index b01d5fa57a04..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:67fbc3949132563a9dc8dd98ffc533277f2527f3372df645f1ad2269e38e930f -size 31397 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 26319870c185..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ead182c80bba600f3a2249fe096e5949879b49b2d0287ee8af7cb391710c4cd1 -size 28964 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 2de8b51fa105..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:51dac1a438ee141daf0822e2d37c1db1944c44fa694cd154fbd48779929be557 -size 28962 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index e0a51eb9ed4b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cbb8f361e029f6577d6a89d55850da2af01fe99c018c354cd5beb80bc30fdd90 -size 29611 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index d2db33aa1612..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5642bd5a978a52156ba8642ff64c3f6618902a2f15bc8428497510e8ea1f3fe8 -size 37530 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index b7398603ee4c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2f1ac98ce7714da0b5c1df0ca182d339980bc3a2b759af0b83033303cadbc4d2 -size 35209 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index b6c6c4b8050e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d32c8e204664ba17b8b3530c057e1ad6681b626683021b9baa0b956ae86bf5e4 -size 35206 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 1ecbf619014a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:262e78ce7c406d7373b4238cb5874093736dc61065a263ae775f12eb403b5a69 -size 36017 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index e903fce76938..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:eea379d4ca7365d6fdfdf5fa6a47103c5f10942ce5a725c55bc58da76e1853e6 -size 27353 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index de6373c18ed6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cf47cc3cb8f878667b02f85fdc8cfdf24d5a832e654a70bfc47e2e516dd2a1d9 -size 23538 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 20c0ee4b30e7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b659171bb93ad40581e92b327b071375e974b191455e3d3d9beb88a4af48765b -size 23533 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index aebb970c3ee7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:131c40a94379e5b20c0d60c8103cf907d8cf58f64c1abd75433ebe0b68d436e7 -size 24751 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index d22da76351b7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0a8827cbe60005584359e2a1a39f3c272bbf41c52a44b0e028e925740268e81d -size 21894 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 34277f54a6c9..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:06302802a97e27b6514e9cb556b91978bcbe96fb3ebccd8d753825ba5629900a -size 29446 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index b1bac6660fd9..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d349edb50f9305ff73a713d63614b9ba4d1cb679d2cef67972dbe0dc9643c0e7 -size 27419 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 905d9e8f3f30..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6d5ca08f37e82a7363f9376fe5177d8219a94890be49ed89a9f8785f76774a73 -size 27416 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 7f665c1e8acb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2163d1b54890eb7bfd1f956c437c4e6cad609d64cda98c2fe689950e10ae529d -size 25296 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index c6c59680803f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:64de8269deaca9a2067fb3cc0e27e93063e9d900bc79b2109dbb2c23dd7ffcf1 -size 24621 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 40c39830adb7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:39bba4c37b12557ea4bf7af7d21fedcef5021405d9265de881a96dd9fe17823b -size 33003 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index dcf9d96dd436..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e58db3c296a893f8f4b73b7725ade25540fb12509c33371e9bf7d380fb562b6f -size 27546 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 530276fe3528..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:04e5768dc139eabe05ee497492eda12588d2c7ecc81b624333100593372be120 -size 27542 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index cfc12925ea37..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d6320d9de7be501807d170204d904646babfb354bd4dfd868a7d156b403cc51f -size 32038 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index b4de343ab696..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9ef758710f41642a4c1e7d1737082618d376b7d5b3ab335efab2531ad7c28039 -size 41334 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 8cb4db639888..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d04b70b71c61a2d49929b3e9bc2be7535f3db1e769e3739e1e6bdcd338ef849b -size 34917 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 2a6f25c08fff..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1be6434b8e9a419c3e9f4ac09fd773f31e3d4e11842851b377987ad1c8515a24 -size 34914 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 1a13ed58c8d5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cd6edc09815ad061d91d345235dc99f6a1d9ca804c74acc3c024ab11d73b7438 -size 36770 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 8dd262bdee5b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2c677f6426c88819eb8d05e72afa4d13f90c8a57b7e209b74570b2a60cee3c7b -size 23680 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 73499acec285..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a0254492a5d4cdd9c6d859d66b3b69e42d984f84c85b64fd4997c524e3673d70 -size 31189 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 579c43ca847c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3890c11ad212bb98a6bc9fa3aca8ed9ff4bc86dbff360bb1c07025f0669c9c8e -size 28551 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 5b7ef5c4e6b4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bddc8565634a1cb1bf17925b818f87898c2b9720c4d27aa2268bec35925ea8d8 -size 28546 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index c7dc0158958f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2e4c80718b3dd9b5083c71a5d14dd2e8144d1b4baa547b699cdc06cf20cff1b8 -size 29680 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 5e2e165e26df..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1460a64112ebf73c27f82b6f4768b42168e702cb5b8a6c91d4b2bf0da5c2c72f -size 37406 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index aa97bc1bae0e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:da75261773506d891dcb9ed256a919021eafe096a93748b2f683eb3303bb6303 -size 34792 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 29111eb4b916..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:33b5ae71ae500ba71ef932aef74cbe4049de5a5d98470617050827795e92a5eb -size 34795 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index b32ed3ddf54c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bb51b07ca8d254fb7e2af5252a686edbbb35518b304b7dad2ca3fc0870623d28 -size 36544 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 3b2b5a274f2d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6cf5ffe62ffea160eb3d1e61fea8b065d1b989fda13ccf6bd4b1d3e7cfd068fd -size 26944 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 0d13f743b258..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6ddcd4fb801e534aba58bdb9da1a133a95fbab88a5866960fb6db20f8789dffb -size 22769 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index ad22f22d3142..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:61e397bbc7a7b5c99f5f1f02949ef4bd6540f97033dd916c5535699344a70f25 -size 22765 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index d7f7e7f6588a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:29eef1b32180c3296a33ad486731156f58dbfa6d97d30b36e97fbd0c13b7646c -size 24890 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 34cf2f3491cc..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a2cf0b75795ccac7a824a5043e776d266a454cb5199d8d5df1d4c1128a62a7fd -size 21952 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index deeb34078e08..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:de159a6b9ace8adfa17185f3d291ff074befc970aa7ec36be416b0aa9980714e -size 28152 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 7607047d50b2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a32ee4146e0c2011f494446db6a4cc37edb837749c5b7ec86e1c2d04c85f9222 -size 26800 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index cb7f868125b7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e022fc499136325aad162ddc453e5ac07975e83e94ad82f67d7dbed28a4dbab3 -size 26796 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 68e870ea7894..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:061a78ff56c2c078f452fd631399275eb38c5c88272f3bcc64c86340e01e45ba -size 25408 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index dee158b24977..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9594ca4d4604216e1449bc70c0435034e326d1c97408bc27be419efbfbf2cea6 -size 28417 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index eb8074c488cb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:df9677c29a754e48fba99c39dcc5ecf05623f0e5a7cd41bba419975eb406046b -size 26234 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index afd8f021b5f7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:656a537a5415f4dd9a0eac618c6a8fc83ae187fba7040cb8717dd4bf29f0e063 -size 26233 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 9d6bbd62e95b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:63c0645c70593cb0279ca7b4d3be76323bbef293c6158feb52a883d63b59d32d -size 25113 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 847944fe7e4c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4bd06e3301947e9ad9cda05fcde7434d88931a40976985f90a8abd60fc3a0267 -size 32417 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index e227066a87a8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e79dc7a5c1bf2f9b16c8ddc6aa26b2d7998f9dd2d8ea284a60eef9a32e41e7db -size 30537 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 0304e858d5a2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:25dac9f55770da570ba4501264358d39e3d860eaa5f94eaec742d7eafad36e14 -size 30542 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 05465d9e604d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3374641b8187512c0cbfa696a226dbd9a5cc5dcab29f4ffdec5525661f87399c -size 29722 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 728065c1338e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:049b9fd994b7d4982ce261a0a3fb158173c6ae5d4e39967d60a4ae39c842176c -size 27268 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 8171db77a5f4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:54446538cfe13e26e5ab452c92a34e6ecfe87fe958caab45fd8f6f7fdcd9c3b0 -size 24828 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 1d9355644f4f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e6f77f7e37c06c9b259a2b0ee41a67761d3fd003d39dcdfeaec06cc643528093 -size 24824 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index eaba6f302de2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:79a1b4223a74b2309dc59e6edbc11317fb6ae53de7bbceda17e410338b2511c2 -size 25447 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 3e5ef9b82fe6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b19fa0f8c884dd9dd2ba07168f1b65f0b91a5f52e0844855b7723841482e0970 -size 25072 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 778ad826a3fd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fb1ccc1d132ead40228eeeeb71463030366be74afde31ab75c824d95fbfe13eb -size 25323 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 8c00960d3f8b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9d75875f8341c8e8957f7eb3d2354a5377b8ab8a47617ee16fdda0f12a11c6b9 -size 25550 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index e22bf894f625..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b86463b3e906e2a51859cc1a3762d6935b46baea8df6eb1f4525265e34c86068 -size 25554 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 6fb887290124..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:abdcb63f51c0162b54fafbb16ef85f65f26ba80221d773c6e86ab1d805ecb57c -size 22839 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 89164be23493..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d60b865f86113b352c262f5ffdb762527a1301184e77e15c5518c4fe40e19de4 -size 29156 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 6c187b3978a6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bb5ff92286c6693b1ced196b626fab94e901cea8fa65783589098e0131666a34 -size 27052 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index d70dbbe032b0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:879148d4bdf1a3c73d7bf04b6be5ef0074ec92c873cad2ef3b6938b597ccada5 -size 27056 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index fc681c47a555..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e0f6579b1a0a2d8e49d2b690f77da50231c72c7669994547125b9d29a86adce4 -size 25890 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index e43f68b052cd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6042d79fa07d90e3ca478adf79770dda7c703a4021783d67855ecfc028ba37b0 -size 32979 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index e072a9f49541..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:542b831f117cb9167c227b8cc8d79145cb585bbc9cb6d07cf47b2b7c572c4758 -size 30931 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 3ae1469be2aa..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bfd56129f5c69bc30ef969be11d8e97f008d23ef9a05369e993e20026f470840 -size 30931 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 72eac387a0ea..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4bbda9aa2eddce4a5aeca071c42e690ad3a0b109ac056bac25c6a325bf03da87 -size 31153 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index cbe713a98ee3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9f81e375e279368eaa6e3fc30e64bcd6e4764027e8f4701ba26761f4817ddb6f -size 28230 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 4dce91ddebb3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6ae7ef70f3eca23f3afa4caf84a64d887393d924bb61a97893663d96b7b28abd -size 25749 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 749955e18a7d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:766a2bc4764630de6f6212363721de71e8d021df2152fc5827a1d4a77d636cdd -size 25743 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index ad044ff3b166..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:05ab36dafd5d3e755ea7b34e73e71968ead42c8a67cf343da3497eb45ce2a016 -size 26623 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 71e1cef24c70..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:465448a3f6e657fc5799408687fb1346a635020c4d74a30585f0d69f66a5c91b -size 25654 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index be8e1fed697e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:efd693ebc3c576a66460731d7a584f7d9fc0c48902e77e654b5a581304be9f79 -size 27182 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index e1bee2bf8a2b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:33e0eff66c9644f7c0f7bf4cb74e7b9fca9aba75bec6e0fb1e6f216a99ff99ed -size 27119 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index a21ad8405139..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d39e7a8ccc0656cf8cce22d27cf46eff709cae50a902a115fa1a68808b6d46bc -size 27117 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 75698acfc4be..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:534f01a3d0a9bd049c2e4987ad8bf891b8ad71a1f31a220112bbc0463f8b7d8a -size 24569 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 57571385402c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e073a359339ebdce58d9775f8643640d772ce8a8f63834f25e80a1e2ea06540c -size 27501 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 605ad3e4c306..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0e91df1ec560e065c21f66907d145999fdd4e925f6ab963023f61e215be43fce -size 33504 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index e4ed112135d0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bb308eb848919a97fa8731ca399cbd8edcff42c87bc9409a2f947995bdae9839 -size 29360 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 5571d487287f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fcaac42372a83d97a2a19a288a13aa5da4797695d1afac442ec23ac16e9559d1 -size 29373 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 5d424e1dde1d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dc586f7466143b6d6ecb051288e2d88b59686a518e514df4ce7ece7a85bf0680 -size 32261 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index b3000a71b959..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bf765571a6d4ee63edcf49114ffab1c4b3b3d076e983bff290dd4ce7a903429a -size 41080 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 4cb6dff6821c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:14903bff67d158b8cb9369e9b25737c4a081bc573bb08c5327dba613fe376e4b -size 37587 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index fc55471dbe3d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:41409c1794986c5aaf8c170aeef1e570e7795b8deb07f139a3338482d782ad4d -size 37591 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 0a9bc14d8b9d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:78d8fc76e52f104253d457d989c7febf072cdc1b76e028471c496ad6459741e7 -size 38306 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index c40dff447588..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8d33121931017d6e91c1cf99307b43d7de5721d835d74c0055355b9431fe6c22 -size 26690 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 760f57a356c3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:499b23832f1e9b6121907e8cf5838f03d578e45585bdbf8e4a53d961aa9e7410 -size 29396 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 4718dbaccfe5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9432b8dd08a82df8a5ada793f3ab97aff1868ff113561adbe4225835caa8750c -size 26773 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index ea5179d7ccd8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dfb76922fd4e0ab3368cdee91c5568eb8b043872ade70d9dce7a39e2f7487813 -size 26770 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 76c71c090b74..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:902c4c4bde0c9b7dae2c2d9076b5492f23dc2112e4cabb592158badd864dfb3a -size 25621 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index f259179605ad..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:51ed0fb8bed95e4dbb48bcc026650a079bc40b594f4f9d4d2040656d4e565dab -size 33248 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 9fb53aaf311e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fb39c21b4ed0e4a59875489c5b6ec0ab7a070fbd1c2f99f5165aec7ca94ccdf4 -size 31197 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 1a80165afd3d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:180c356b43834c7e51a44dd90e69fa00b11d7c0e6e773e84221d918b99b83484 -size 31194 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index f4297ad732dd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:20e76ae65020dadbf91bd2d83df291148d5563b3a27e1db0d011bf08afd017b7 -size 30978 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index ad408662292a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b2f47f3c51b226a889f0ad5e3eb64fd862f71e49898c80977d3892663364b5bc -size 27874 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index a87e30c4a955..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d27be33209be604fb15b0afc10ac1cccccc2ef7fb2c6be7af6755c2b8e90f499 -size 25689 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 722385872015..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6f4927f4187dcbc1a6053804d379fd3063a2e79c9387a1cdabc0faa95b366791 -size 25684 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index a728778441f3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4bade85a84a474f190d9d68a1e0543548e37046db7c5b7acc965e592ff8a6007 -size 26298 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index bb7f9121e2b7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1baf211c3a7793c59ec3421e046171ef03c44214c640f41c11d43a93df08d569 -size 25936 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 15d9463a0cdf..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d80300d0d2c285da0d380dc9c5bc381f7d19cab6f749a26c1f293682ab000cdf -size 27082 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 24fa8673634b..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1b591794ee7a910ecdb363dd24f98be9b4d6882c8c5acefe028c37e8ddba9bf4 -size 26855 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 7dcdbd29109f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c700f4b35bccd9b6470577cdf0371eb676cbf87079a8781be62ca3568d3ba3a0 -size 26853 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 77052c324b36..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_128_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:aa3c774433b0d9cf611e2f799838502fb9507a2dc6209965443712ba62891e48 -size 24943 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index bcb5633fcfe0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:212dcbe594de4031d77bd45905cc940bd412fc072867a831e464654a12a147c5 -size 19866 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 9bf14c10f3eb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e8a3e6529c98b518a2f82aa66838dbc4770b3e14ca61af869ed33f7da80519b9 -size 12750 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 46e3c13fca19..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9f05110ca5bf8a0e18316517628507662deda10da3b5e2b602ed2b26113ec11e -size 20588 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 1028b4598d32..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:581937bade414be645106dd64c9e2dfef1b717436acb2d91aabd01080494021e -size 22013 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 957a28ca88f6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:74868b2b954782c8a6cc43a133ef4805ae02839d55fe5e8fd644a87b6f3d277c -size 11390 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index bb55aac9bd58..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:20bee43fc14bd2e686e010a8427df66d79327c7a47496aeb4740cdd6e3c97789 -size 21018 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index d06fb1fe3c51..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a3de447a2220863440d3832db4547a0bab1c92c3dbf88d3b77278f307c7609e1 -size 12869 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 4069a55cc69a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e8ebfd2050947e2e8ee906d449c4b01ac206cdf30537e735abeb207ae30b461d -size 21916 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 623c5fc5b5f8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7e7de811041326b1e20ca8690d58469a008a2e32fe26311685d043032bb81101 -size 24636 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index fd950730fc92..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:57a4db7f2cb28cf1944f221454cc2b9019016ea42555e6f450daec3f313b932e -size 11521 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 8c8d4c2fa6e5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9bce183858efc5e85cd13d62c3ec62c7da176f1548c68ac29906e26ae1d4c6c5 -size 23280 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index fac1a05a7841..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e6e41f2fb4de81421d6c2d1d6dcda97e9c318d95271df509824128232c845052 -size 22455 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index c4c0f1a3eb4a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:988a70f7cd15e04712003f870a776a4a8a18807f54d0eea02f8364a99a97a87f -size 20891 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index f25ffe27bbad..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a4044c3a7ee9935266167c37bd02e6c104f51ffb91bc4966ab26b8952ce3784a -size 12823 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index e57791b6ff58..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0f320a1518c3ced054c08b02a486886c3645ca86f4a8d30fb681aef6aedbcfdc -size 21793 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 66ece5f0b9e5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:667c30e51723b0fd761044f7e48661bc7f6168e74b6a56e5ad832c9ece45592f -size 23273 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 6867035607ff..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_e4m3_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:18999b023981e78eb6d10fb2559c114b061b53af3f6e3ab6dee73f16b47702c5 -size 11464 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index ac7e82a33aab..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:304256b4afd8702873e11da931a816bed669bc88389d8d359eed0b98296b00ee -size 31170 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index f1ca00828d3c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:55bea4ae44ef3fa683b74f94b3aaf7c277e9ac30ca275aae093b9eaf04a65667 -size 26552 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index b9bd46313286..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2d3c53763f68984475c48fa4fd2cbd7f6ddbbdc356389c4129a6c24cddeb3dd5 -size 26550 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 1a41c3f1edb8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f9c2bdb78a407a974082c520cbbf9c3398ed1f541bc4a9a8783c995b55df3180 -size 27892 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 956463af9ab5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:304d5ddd5686f9ebe1d94a9eb9be733ae7c002def145ab4d1bae061e84726a98 -size 22984 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 7413a99da612..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5b7716b04457d02be0de1d0c70152b53dfc4833f0bef6b44c91205715d6323ce -size 30063 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 064de339bb88..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b03902c69eeb75b079ddbe28f227720c6dec64f293e5b53f4a45710b0ee3e06c -size 27440 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index d211002113df..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:19cf087ad79161be79815827242a30526df784bf22758945641a2925d6b559c9 -size 27426 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 6244d6b6c360..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:74ece06f420494d82df85f68b53ce1444b77213f66631ff1368cdafd17e2ec61 -size 24574 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 8920a7bb309e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:71510b82031b13f3446ea11b639d3c8178ce46a3edb7e00cef399d9b8d32b089 -size 33111 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index a6e9d44f8b72..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:eb491b8b75f81d95f9255fbf4a69616075e546fa4fe0ce630a698edfde8b3a94 -size 26956 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 230cbe76f8c5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ec7fb2c023cfb09d96b1ede67aa48d2e4100eb1c6cb7056c5ff4f853f888f840 -size 26956 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 3400f03b73bb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:67e240f065b6cc36996f0efa35597f4a3e9fd4e60a5d8e9845c2c174d706eb35 -size 28989 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index f254eaf6c555..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5d0f3140f6dfb06eedff4ffd0db69ad440bd98ed651b59925f3a853af1e5dc27 -size 24263 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 181128e842cb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e1c91d526b0ec96874c8dcb18c88c3e33e377d657478881dacd4bc1566781f45 -size 34992 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 19870f1ecf2a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1a911d0bf5f306e81ad63a505146b229903a71dc4f8cf4cf28bcf7b2e55dec45 -size 33237 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index c3f67c5873d7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:00cbe5b5149c6adb7fdf03008844ae2c3f35b17ba42e5b10895c8348baada242 -size 33233 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index b874851e3cef..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:74929437659293d2899b91509e0001bd352a84ae5016e8ca61b7ad63a27d0a5e -size 29881 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index b120b9672663..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d15c42876f70b71ee1603c8de73e2a7ec5e8426552a42720730e612bf4f41893 -size 27659 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 4bbad9d12055..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e730a13fdd11338b693a4e624c4e2cb8800818aaedea4912f70d51226b109b40 -size 25663 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 382f42617889..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7c33c965aaafc2b374ef5ea09b20feb69db2b6a2e264b5e53961961bb53795ed -size 33035 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 42b15a09a80a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fb1eb424ee1cb9787d64cc021b6014136b95c9e48c103422b75c1eb29726089a -size 25539 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 623aa9be19f2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9214b04351bb8cba30ebac5ce201c9e0b2239f7abafcf7ea3a3cfc825ce0ce07 -size 25543 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index d91bb7c8de14..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c7174bbc2ac1ab76ed6a059fa4467b5529a8b93306a46cd160aae7dc5fa05ea0 -size 28856 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 650a5df3cbd7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:048dfd047a54964280ead76d31d77dbcdb5bd24e930a90debfa872d8ce114957 -size 23449 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 36450293b071..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ab20933997ae5f7d00f0aa1912db16395603cd78b8f8b9bc0d50e9bfed5a369a -size 33385 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 9b4f584346b3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7b857ffdb0cdf4dc19cd0c0c4c0dbc4c33d52e376e193fa742abd58c6c54f980 -size 32129 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 7c8847cbba93..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:16bb169dccd98a85d82618e64dddb1083a0b393f38427f491e654ca8c55e4c54 -size 32121 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 527d3524f21c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_fp16_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:81064161c4868425cef912ef6d70d74861f6ce50cd49b798d64cb9be9cdc6b69 -size 28166 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 76be685a4894..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:95aab2c029a694933ad4f83a98a705abb11b09a0c5f95a3220795c8ccb9e2070 -size 32161 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index ba88850a4789..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f50d2ddd4907e2669bc894c71404030f23af83428f07684f206707a7bfdcce60 -size 25896 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index bc74ac48aa1e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:45cedeb310d04e724496ec0049b9c33736d10a088357f89047230901486b3d8b -size 25889 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index da6686ee74c4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ca30fe9fc4051b80d4f73ca8982cf1b285956009f92ac1e07f017fc7d451617e -size 31046 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index b023c8444f39..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:712a783c42af7b999fe8710aeb9276ca188eaaad8264b0acc9e1a47868be02c2 -size 29764 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 1ce03c2b8bd7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:182395b93a31a6885eab88f708d5ec524cf110dc69a8c342cce4936014b93110 -size 27686 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index cab73b639295..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0f7c672691cab18c7c3168c35ffa6b60a0f908351d7e43ea3131f67332036934 -size 26345 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 9606cd602de3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:08b56055d4539e6321a663868517dd91ebf6204b887a5586389dce91a364ad26 -size 26347 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 073e6d549595..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2b0d4508232de3959dcc2f5e3b0f8a1418fa83f25c7d010ba4d4a6bbb24aa0be -size 25042 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index e9fcd3368a02..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:47b28281d99ee7cf1c565456206e91ed1ab4b5320b8031d852a935a4a2ed9854 -size 33653 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 1349f3c86194..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:571d157c8a7d09be46aa5f7de47a0c29bab4c3b93057b1fd8dc3afd5cd7ce23f -size 27736 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 29b78daf6711..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f4dc8e55bbaffefa68b2bb58841a9b7f47706707be0d4e7b58c47f6fa502dc0d -size 27736 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 27071cf5ef83..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3c3ff1c9c6d40ede8486e51205c004584ba17521e4050487ecd88a1fc378307b -size 30918 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index c38626bff00f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f65ebefc8a27a2926f2b19fe8c3d0eb3e2a1c142db8cadddb4ae4984698dc245 -size 30740 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index 19139f7845b2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dfaf74d7c41f5f70251de85349bb78386d6e10e7d28083ccd4090ddeccd3d437 -size 32440 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index 7212e4cbf5fc..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b903ea3c5a5e571b1aa2bb5e33d885026d83fe3bce15954d9bf8c60850e1d340 -size 32336 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index e2ab34610ce0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5b8d0e4282bb0f89ef4e0bcf081f0de6075a7f858d5143ccb35ae61d630bb7cc -size 32332 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 7b3ed23b1dca..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_128_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bd9e32cb2d7df3973bd9bba639290d25971abdfd50a558ff4c1103e65ad9b27b -size 29454 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 3f658975a29d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_16_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d7eef1112581bac3ff1ceb70b2174c3b1d5d9290a042977089d13f3d7138b591 -size 32418 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index 8b3c8e9aeff1..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_32_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:49f733fa100d14921b0028a49aac62010c5a46a16c266259bcffbb664be98c3d -size 31252 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 3c86bb1a4dfb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9218c5d21ddb01fa4c8e37b5a7f92351769916ee1c930805064c871588a3e277 -size 33771 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 33233f34353a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:21d38b15dc84a17d3b8da836794ebd7b799da363d7b0de8dbe638a52c2251cde -size 27275 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 531d87d0d484..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:863db8b2970d5420cbc08a97ea09963c779891aba8ca8d34192754daa44b4bb7 -size 27274 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 381823bf27de..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_16_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:eb13cdea66e274df2cdc55848c0b6cc189ea2878a907222e4cf3cc156a84fb25 -size 30792 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst deleted file mode 100644 index c68af1aaf84f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c60eb04e260d8625aa812852b49397aef54a48cdeb12fd20e7c39df20a35f8cb -size 30824 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst deleted file mode 100644 index dc48ba8c2959..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ca8e4c9dc0d3aeba1c033d40642342e245a8a5457a6721067d6a52b07c7ee5ef -size 29948 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst deleted file mode 100644 index ed48f55f27b9..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8ebdaa8c1c0a39ae239c22e8f7dd58eaaa0fd278e8d71f67836e9487b79a1de6 -size 29937 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst deleted file mode 100644 index 7b5524ab2bcd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:339e04d1111ed4736f90df7102b017298df9f28a86359e697b2b68a439e9ba2e -size 29936 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst deleted file mode 100644 index 549bf24e3943..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_1_kvt_int8_pagedKV_64_nqpkv_8_m_8_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:00ba03fd2c16415368d642dc846abcd6b41c7336259389dbbd556e269cfeea99 -size 29988 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 353d948ec2f5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5a87193b379797ad1f5198274e2c70a330adfbb4d0c06ef0aa3d20a4736ca7ca -size 22437 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index 2c49d207a2bb..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:da7a59f1b4e9ab55a41fb62a43ea9a952cb57f457cefe23f8c4e835bfa4091ab -size 20194 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index 3ba82be4de2c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:88e33f849437a46a8e42e6a770c3731125bcf56991150a279ee03b049e0a1d97 -size 19852 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index f417b69ea556..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:165b1ba3c64d3605b9069c7699725ca679f99bfe1cc9ddc5e7cbd6d02a3fe403 -size 23345 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 2c2ec88b278f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d3cb8f3233969982424a58310690ff37f65f9391ab42e523e06c850ee1617153 -size 23368 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 5d019da05afc..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0e55ee13e26ff564792b23146a3934c7b4750bc519ce7ddc8ea32b0e057adebe -size 23026 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index f5bceda9252d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:62d7a09fdaca4e6ca0e423f10037e3d00804a5d350f29cfb2d2c96e088ad51c2 -size 20012 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index 18f73bf32995..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:09c153000d1c317729a85f713a66587129099b561666b6bc7ad82f50e629fa2e -size 19493 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index b02aa617ba38..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_e4m3_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:35b88609305422f653506735d82741eaf944e5d4ce246de9fd4515c739dea7e1 -size 23407 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index dc0d0028c3e5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5caf83bbc3049bbe9123f1f4b47622f6d9f90488a79e3770ac540168870452bf -size 23976 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst deleted file mode 100644 index b77af7f2bdd3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e4b2f297cc4a505033a1f988d58fea4f0eb5a7a105ab66badcd18c2b1dfaa9ae -size 31174 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst deleted file mode 100644 index 4d926ece6a9c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fc5370c886af097566956b1d722a56a4a01a20eb25d3f03728e810204ca12b0d -size 29192 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index 14129c2e24b0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6aa3cceedbb7074048d791aef348e159036feab94d96a885666860f4ff69df47 -size 29190 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index a03d0b8bc797..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:47832f05aa4e6fb5f7d7bd74f3f2cc33030adddf5b3944d698f3f75803bc70f8 -size 27230 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 8ae994a7bbe4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b91243fb7b6363ad50b55ab4aaf4e229ad9f130449b492d795e51c522b281b91 -size 24363 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index ddf08bbf8da5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a12de8345b15d6e3b67f974a207bfb37e57d41fd8311233fbae80962e36e7d37 -size 24770 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 9037c40fc1a1..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5d931ac7180df39dd8b14ad787cced646ffae20ff12b7246bca047e89e5d3dbf -size 24455 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst deleted file mode 100644 index 15c00b0873f8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ad19b521a386f26354ad964a112acf17177cd142826c583e9d2f3e54ca5e55d3 -size 30177 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst deleted file mode 100644 index 62ad7284aab4..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:063ea4ac5f17881f38352b6573b7609822dbfb05b7201842b5dc28128bf402b6 -size 28522 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index d849fc39f8c1..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dad6c67c0e0808823e876c5654736547b98a1e1da51f03217cfbb1c7970f4ec6 -size 28515 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index f6769bdb40e0..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f460ad62a9b92f80a19ecbafc2f547ce82c03c8ec3069bda45ba88abed75880c -size 27117 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 829f77233fe2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_fp16_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ece891909de812218fde3636683250354fd580b6aa4e9ce5cf4a51a791b110a2 -size 25025 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 040c2c4d309c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d970eecda36ee5ebb8514bc6751a047305c330139a1fdb0a7fa8b7b99def1a9e -size 28887 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst deleted file mode 100644 index 497bdef9a59d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2d3a807cec9ea4214052046cc69ffca433ffdb43f6e21b6c2760a01784d0a305 -size 25242 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst deleted file mode 100644 index fdc2c5759eb2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:869a3855877ad1add6a840e9fa2693635844bc6ac5c2c9c111ed2362eab2b486 -size 24951 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index 22d36b9b217e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b58245fe727c85ef5acb3ce1f2f44a252243f06813b68c0d37d38f9ea720f8d1 -size 24958 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index 3c94e085e7f2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0abd58544c493b471bc8ebf24d28ff344d11b23d45dfb9790eacb4f87c962db9 -size 23179 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index ac3c5fcab6d3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_128_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f3efaf8ae644c35e4e7f098468a4322b588229c1abea97c3361d5c8c6f165f81 -size 29716 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index bb922be4a8ca..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_16_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:854be568da48806b5b349e5c61a4cb0cb43adbc9c0cbd850d0f2e46fbf0e757b -size 29856 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index 89a7615c76f2..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_32_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:28aa67aebe69d1874f7af16b3ce460d87fe851a5712ba6ef881e0f0dc3c8867c -size 29888 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst deleted file mode 100644 index fb9dc7403bc1..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e3b40db76cff6429421699fe07f0312a5cfe7d855a3a7f89ffb65334bc7b8625 -size 25163 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst deleted file mode 100644 index 05059da8f930..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:963ef09c66a4bc6cec0e40354368ed3fe2386927f47345469d8b1d47412bce0b -size 24749 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst deleted file mode 100644 index b3f879b24eb3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d456e5928debbb8eae40738b3633f8247cc1426cbecee0f056a1b87650d25b6d -size 24751 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst deleted file mode 100644 index fdfbac7590a7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_1_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:504728dc36c880ccbbda95aa0adec6dfc7dc7ff00df0c8e77a9da571dd285c7a -size 22737 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst deleted file mode 100644 index fe4ccc992191..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_256_beam_4_kvt_int8_pagedKV_64_nqpkv_1_m_4_sm_120.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7d1a4fa2cc81f2beb0fa169c3934d831209d5f5d0990789815790b2dd84aa7b7 -size 30079 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index b0711465db2e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3f34da5fcdea3e7789f9e01712ab92286db576164809b2304ae27e3e7a7e310b -size 22447 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 3850106bab51..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e135896bdece46bb3e4bf712f535e094904eb1d8174338ef0b9c3f45cf31ec9b -size 22204 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 0e6b08e75772..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1b0d11604445a899f4e3c2281c1831c3cafedf4ffcd3654931a37d1cf73a7118 -size 28887 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 427a237cab78..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f4377982cb15868c0ef998a711990992496cc6c5d9a5cfedd2a8676447620a50 -size 27745 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index aa4204343764..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:61f7821dbc3b0a8ecb5c311eec172378b3c0618329072dfbbe384ad5b074e47b -size 21369 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 45a3f8b223b7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5d81f90170b04c3327a945941785893d361c0cd8b9334ad9d9433e2ee74aa0c9 -size 20474 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 5e75cd28b970..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3904b901baf0c3035e788facf1053c42b9fbd4c7b6f2d3a3359702dc05704c1b -size 27721 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 50288b57b5ba..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_e4m3_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:742b413c52985b7a85c333f6de081134cbc492d2e7823ac8acd6b02fcc03e426 -size 26299 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 7dd85f51e0e8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:481e3b383c2bf3734cd0de89a911df6e3f040bd008e48c921b75177ad18dda7d -size 28686 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 65dc5c84566c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:006d511a3673b8e31b2f0a7369bdc4892c7c992812a5fc45cd62b462030b92b9 -size 23605 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 202f994f51d7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:34a93811a926ee1195fb5c46ca4821e01072f4c305430e8ae8726f03d35090bb -size 23608 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 6b915e362038..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7030a17d463de6234ab125bd07df3b7a47fc65ea5c26c5b0ca3da73ed3658bc4 -size 27368 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 7e75b8906cc6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1e1d08996edfa8a2542217c78345c4a3c23ddcc68e94b8467d42449d66171305 -size 34511 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 0b16b1b70bc6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ad9c70b05de7996eec471deeb0ca0d46ab995f35d41789b276f49ea8269b61aa -size 30366 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 0b74700e627d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f798d79ba741916aed0849d0f5c5538f016f1221d0b8f4f0d69d5c3a8d775844 -size 30357 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 342df6e7c5a7..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b4a8827cfb2a2687cbcbcb2327f7bcacaa8516d1e190a84760298a09ea0a6bde -size 32151 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 7d2cc30b93cf..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5bd236b87b4b44702a3feceee929efd07815200efd53719194162315a9ae9d24 -size 25215 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 57fe979714f3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1cb514566ddb560cfd00f7a073e2c50078125518e3ab12c04296563892a45b60 -size 22991 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index e7fb56d56790..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:cc7e74e2a1cd236a24c6730ba65f7488ba5a887fd242d99c5ea044760ae4f82f -size 22991 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 6c99c53ffa72..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:23caa8e2f0598d171849b8fa50faa965fde23fa9f237c2e4027180d4b476407b -size 24118 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 8852286117da..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:467d6c9a69de91d08d7701b2f376da5e0927c427b6e5612142b0d986232865fb -size 31793 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 98750fbc874d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:46b7981c5ef1f79e170ae5abcbdf18991763c1ae4dd6745084565bfedbee91c6 -size 29513 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index 43cd85d09287..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5abaf3caa5c800e3622f96071933e3547a7534e7b10fb608b4489c9c98c4d91c -size 29507 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 9982e9dfd72e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_fp16_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9e7f2b867de196e679a86589bb789ecdcb009ec23d49437434a6ea84510028a8 -size 29521 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 790d52399b45..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f57f12cdc08485f6d2c608a8edd06772ad67a5607fe817fef9b5fabb75e1356a -size 25880 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 366b22f7d38f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:75c58b4786458c88c2965e4fc56afcabde668ecdf6faecbe6b99e5980d4480fc -size 25105 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index c19476a937dd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:229953e38c28b10e6899450e792c40f956b05bc00d64209e55109caf5e828f89 -size 25106 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index 8fd72ed451d8..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d1f34857192ec98557b57fcd07b6943b25b397edd3a136d37e395e7da8c14c9a -size 24591 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index c46cba6702bd..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8a860f4c1cf2db49a3d80109f62111aadefcabdba5fa11636de3a171b90bee48 -size 31685 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index 2fdfc0e3f46d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:7c73c0b299f1fd4af9e008c84ca890d4acc6a2ee1a0b0f27c280807e9270f358 -size 32076 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index b3b9734df567..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d57b1fb3ef3ea3d2d53068ccf38a32733e7b00a153ca978747950ccdbef8c1e4 -size 32064 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 96bf84d97f02..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_32_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:dad33a77221d6f9b91061d26b3e1bf552bc22a74c42cce7a246f56e2167f2d3d -size 30531 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst deleted file mode 100644 index 838c9952a7c6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a17364961c66d0a533fbe49b6e71f88052c9873f75300a743291f2a664430ead -size 24066 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst deleted file mode 100644 index 74fb8c7070a6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:8b5ce7a73bf6daf011ad627e61fd9e1623c189d7f5f8f8b0d812d0fcd5e1c2e3 -size 24259 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst deleted file mode 100644 index 0ef6e14009b5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1a1e7cb2e69bcb7f255e128c65762c71adb373fef8deae21e1114495886f5481 -size 24260 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst deleted file mode 100644 index edeedb9d247c..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_16_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:44184652f7fb2cc9bb717d7229292d892cfdc7c518baef826a5d35b04cebcbe2 -size 23269 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst deleted file mode 100644 index 073d251a51e6..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_80.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4ed47af0b7d0bee76ad41748461b0b54dfde81cf8d737578ef552215ed11a3ec -size 30082 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst deleted file mode 100644 index db7d90274741..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_86.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a0d90372610ce4f857a9fc26649ea8c5dd0214e63fd0ee2885ef863706b8cc55 -size 30719 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst deleted file mode 100644 index a644f7f1dcea..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_89.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0821dec81b08cfde934266e1f20e4fff4ab9138889c5148b57030f61f5526a24 -size 30723 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst deleted file mode 100644 index 6f577bb16c2e..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_dt_fp16_d_64_beam_1_kvt_int8_pagedKV_64_nqpkv_0_m_32_sm_90.cubin.tar.zst +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9fc2921aa12401375ce8ebd46f94cb9cf628294e6e7ef734db4858f66d7f2117 -size 29340 diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.cpp b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.cpp deleted file mode 100644 index 8ac26a0cc88f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.cpp +++ /dev/null @@ -1,57 +0,0 @@ -/* - * Copyright (c) 2020-2023, NVIDIA CORPORATION. All rights reserved. - * - * Licensed under the Apache License, Version 2.0 (the "License"); - * you may not use this file except in compliance with the License. - * You may obtain a copy of the License at - * - * http://www.apache.org/licenses/LICENSE-2.0 - * - * Unless required by applicable law or agreed to in writing, software - * distributed under the License is distributed on an "AS IS" BASIS, - * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. - * See the License for the specific language governing permissions and - * limitations under the License. - */ -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.h" -#include "tensorrt_llm/common/config.h" - -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/decoderXQAImplJIT.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplPrecompiled.h" - -#include -#include -#include - -TRTLLM_NAMESPACE_BEGIN - -namespace kernels -{ - -template <> -void DecoderXQAImpl::run( - XQAParams const& xqa_params, KVLinearBuffer const& kv_linear_buffer, cudaStream_t const& stream) -{ - runWithKVLinearBuffer(xqa_params, kv_linear_buffer, stream); -} - -template <> -void DecoderXQAImpl::run(XQAParams const& xqa_params, KVBlockArray const& kv_block_array, cudaStream_t const& stream) -{ - runWithKVBlockArray(xqa_params, kv_block_array, stream); -} - -std::unique_ptr DecoderXQAImpl::create(DecoderXQARunner* runner, ImplType implType) -{ - switch (implType) - { - case ImplType::kPrecompiled: return std::make_unique(runner); - case ImplType::kJIT: return std::make_unique(runner); - } - // Shouldn't reach here. - TLLM_THROW("Unknown DecoderXQAImpl::ImplType"); -} - -} // namespace kernels - -TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.h b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.h deleted file mode 100644 index 7d39f36da22f..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.h +++ /dev/null @@ -1,89 +0,0 @@ -/* - * Copyright (c) 2020-2023, NVIDIA CORPORATION. All rights reserved. - * - * Licensed under the Apache License, Version 2.0 (the "License"); - * you may not use this file except in compliance with the License. - * You may obtain a copy of the License at - * - * http://www.apache.org/licenses/LICENSE-2.0 - * - * Unless required by applicable law or agreed to in writing, software - * distributed under the License is distributed on an "AS IS" BASIS, - * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. - * See the License for the specific language governing permissions and - * limitations under the License. - */ -#pragma once -#include "tensorrt_llm/common/config.h" -#include - -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/xqaParams.h" -#include "tensorrt_llm/kernels/kvCacheUtils.h" - -TRTLLM_NAMESPACE_BEGIN - -namespace kernels -{ - -// Forward declaration to avoid cyclic dependency. -class DecoderXQARunner; - -/** - * The underlying XQA implementation called from DecoderXQARunner. - * - * We need this layer of abstraction for abstracting out implementation details. Two possible implementations: - * 1. Precompiled, i.e. kernels are compiled and saved as cubins in advance. - * 2. JIT, i.e. kernels are compiled on the fly via NVRTC. - */ -class DecoderXQAImpl -{ -public: - // TODO: shouldUse()/prepare() should be templated with KVCacheBuffer. - // Whether it is beneficial to use this XQA codepath. - // - // forConfigurePlugin: whether this method is called in configure plugin phase. - virtual bool shouldUse(XQAParams const& xqaParams, bool forConfigurePlugin) = 0; - // Prepares for the kernel running. Must be called before calling run. - virtual void prepare(XQAParams const& xqa_params) = 0; - // Run XQA kernel with KVCacheBuffer. - // - // Sub-classes should implement runWithKVLinearBuffer and runWithKVBlockArray. - template - void run(XQAParams const& xqa_params, KVCacheBuffer const& kv_cache_buffer, cudaStream_t const& stream); - - enum class ImplType - { - kPrecompiled = 0, - kJIT = 1, - }; - // Needs runner pointer for accessing resources in DecoderXQARunner class. - static std::unique_ptr create(DecoderXQARunner* runner, ImplType implType); - - virtual ~DecoderXQAImpl() = default; - -protected: - DecoderXQAImpl(DecoderXQARunner* runner) - : mRunner(runner) - { - } - - virtual void runWithKVLinearBuffer( - XQAParams const& xqa_params, KVLinearBuffer const& kv_linear_buffer, cudaStream_t const& stream) - = 0; - virtual void runWithKVBlockArray( - XQAParams const& xqa_params, KVBlockArray const& kv_block_array, cudaStream_t const& stream) - = 0; - - DecoderXQARunner* mRunner; -}; - -enum class XQAKernelType : int32_t -{ - kAMPERE_WARP_SPECIALIZED = 0, - kHOPPER_WARP_SPECIALIZED = 1, - kSM120_MLA = 2 -}; - -} // namespace kernels - -TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.cpp b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.cpp deleted file mode 100644 index 13aef6daaf9a..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.cpp +++ /dev/null @@ -1,69 +0,0 @@ -/* - * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. - * - * Licensed under the Apache License, Version 2.0 (the "License"); - * you may not use this file except in compliance with the License. - * You may obtain a copy of the License at - * - * http://www.apache.org/licenses/LICENSE-2.0 - * - * Unless required by applicable law or agreed to in writing, software - * distributed under the License is distributed on an "AS IS" BASIS, - * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. - * See the License for the specific language governing permissions and - * limitations under the License. - * - * Common utils to be shared between Precompiled and JIT implementation. - */ -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.h" -#include "tensorrt_llm/common/config.h" - -TRTLLM_NAMESPACE_BEGIN - -namespace kernels -{ - -uint32_t getKernelMTileSize( - uint32_t headGrpSize, bool isSpecDec, uint32_t qSeqLen, bool isXqaJit, bool supportQGMMA, bool supportMLA) -{ - if (!isSpecDec) - { - return headGrpSize; - } - if (isXqaJit && (supportQGMMA || supportMLA)) // HMMA (mha.cu) goes to the heuristic below - { - return 64; - } - uint32_t const gemmM = qSeqLen * headGrpSize; - return gemmM < 16 ? 16 : 32; -} - -XQAKernelRuntimeHashKey getRuntimeHashKeyFromXQAParams(XQAParams const& xqaParams, bool isXqaJit, int SM) -{ - unsigned int head_size = xqaParams.head_size; - unsigned int num_q_heads = xqaParams.num_q_heads; - unsigned int num_kv_heads = xqaParams.num_kv_heads; - TLLM_CHECK_WITH_INFO(num_q_heads % num_kv_heads == 0, "numQHeads should be multiple of numKVHeads."); - unsigned int num_q_heads_over_kv = num_q_heads / num_kv_heads; - unsigned int beam_width = xqaParams.beam_width; - - unsigned int qSeqLen = static_cast(xqaParams.generation_input_length); - // MultiQueryToken kernels can support any num_q_heads_over_kv that is power of 2. - unsigned int kernel_num_q_heads_over_kv = xqaParams.multi_query_tokens ? 0 : num_q_heads_over_kv; - bool supportQGMMA = jit::supportConfigQGMMA(xqaParams, SM, true); - bool supportMLA = jit::supportConfigMLA(xqaParams, SM, true); - unsigned int kernel_m_tilesize = getKernelMTileSize( - num_q_heads_over_kv, xqaParams.multi_query_tokens, qSeqLen, isXqaJit, supportQGMMA, supportMLA); - - bool const includesRotaryDim = isXqaJit && jit::appliesRoPEInXqaKernel(xqaParams, supportQGMMA); - // precompiled XQA does not use is_fp8_output as hashing key - return {xqaParams.kv_cache_data_type, head_size, beam_width, kernel_num_q_heads_over_kv, kernel_m_tilesize, - xqaParams.paged_kv_cache ? static_cast(xqaParams.tokens_per_block) : 0, xqaParams.paged_kv_cache, - xqaParams.multi_query_tokens, isXqaJit ? xqaParams.is_fp8_output : false, - isXqaJit ? std::optional(xqaParams.position_embedding_type) : std::nullopt, - includesRotaryDim ? std::optional(xqaParams.rotary_embedding_dim) : std::nullopt}; -} - -} // namespace kernels - -TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObj.cpp b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObj.cpp index b57eec1b147b..dc2eb84d9e69 100644 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObj.cpp +++ b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObj.cpp @@ -1,5 +1,5 @@ /* - * Copyright (c) 2020-2023, NVIDIA CORPORATION. All rights reserved. + * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. * * Licensed under the Apache License, Version 2.0 (the "License"); * you may not use this file except in compliance with the License. @@ -20,7 +20,7 @@ #include "tensorrt_llm/common/config.h" #include "tensorrt_llm/common/cudaDriverWrapper.h" #include "tensorrt_llm/common/cudaUtils.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.h" +#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerUtils.h" #include TRTLLM_NAMESPACE_BEGIN diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObj.h b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObj.h index 3cb176407f88..2be3e9bac39f 100644 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObj.h +++ b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObj.h @@ -1,5 +1,5 @@ /* - * Copyright (c) 2020-2023, NVIDIA CORPORATION. All rights reserved. + * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. * * Licensed under the Apache License, Version 2.0 (the "License"); * you may not use this file except in compliance with the License. @@ -19,7 +19,7 @@ #include #include "tensorrt_llm/common/cudaDriverWrapper.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.h" +#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerUtils.h" TRTLLM_NAMESPACE_BEGIN diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObjRegistry.h b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObjRegistry.h index 2eb9ef89dbc2..304725b68614 100644 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObjRegistry.h +++ b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObjRegistry.h @@ -1,5 +1,5 @@ /* - * Copyright (c) 2020-2023, NVIDIA CORPORATION. All rights reserved. + * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. * * Licensed under the Apache License, Version 2.0 (the "License"); * you may not use this file except in compliance with the License. @@ -19,7 +19,7 @@ #include "compileEngine.h" #include "serializationUtils.h" #include "tensorrt_llm/common/config.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.h" +#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerUtils.h" #include #include diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/decoderXQAImplJIT.cpp b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/decoderXQAImplJIT.cpp deleted file mode 100644 index 881a17a05405..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/decoderXQAImplJIT.cpp +++ /dev/null @@ -1,561 +0,0 @@ -/* - * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. - * - * Licensed under the Apache License, Version 2.0 (the "License"); - * you may not use this file except in compliance with the License. - * You may obtain a copy of the License at - * - * http://www.apache.org/licenses/LICENSE-2.0 - * - * Unless required by applicable law or agreed to in writing, software - * distributed under the License is distributed on an "AS IS" BASIS, - * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. - * See the License for the specific language governing permissions and - * limitations under the License. - */ - -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/decoderXQAImplJIT.h" -#include "compileEngine.h" -#include "tensorrt_llm/common/assert.h" -#include "tensorrt_llm/common/config.h" -#include "tensorrt_llm/common/envUtils.h" -#include "tensorrt_llm/common/utils.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_cubin.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAConstants.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/kernelUtils.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/tensorMapUtils.h" -#include "tensorrt_llm/kernels/unfusedAttentionKernels.h" -#include "tensorrt_llm/kernels/xqaDispatcher.h" - -namespace -{ - -using ::tensorrt_llm::kernels::XQAKernelRuntimeHashKey; -using ::tensorrt_llm::kernels::XQAParams; -using ::tensorrt_llm::kernels::XQAKernelMetaInfo; - -XQAKernelRuntimeHashKey getRuntimeHashKeyFromKernelMeta(XQAKernelMetaInfo const& kernelMeta) -{ - return {kernelMeta.mKVDataType, kernelMeta.mHeadDim, kernelMeta.mBeamWidth, kernelMeta.mNumQHeadsOverKV, - kernelMeta.mMTileSize, kernelMeta.mTokensPerPage, kernelMeta.mPagedKVCache, kernelMeta.mMultiQueryTokens, false, - std::nullopt, std::nullopt}; -} - -} // anonymous namespace - -TRTLLM_NAMESPACE_BEGIN - -namespace kernels -{ - -DecoderXQAImplJIT::DecoderXQAImplJIT(DecoderXQARunner* runner) - : DecoderXQAImpl(runner) - , mDriver(tensorrt_llm::common::CUDADriverWrapper::getInstance()) - , mResource(DecoderXQARunner::getResourceGlobal()) - , mForceXQA(tensorrt_llm::common::forceXQAKernels()) - , mSM(tensorrt_llm::common::getSMVersion()) -{ -} - -bool DecoderXQAImplJIT::needHMMASpecDec(XQAParams const& xqaParams, bool forConfigurePlugin) const -{ - - return xqaParams.multi_query_tokens && !jit::supportConfigQGMMA(xqaParams, mSM, forConfigurePlugin) - && jit::supportConfigHMMA(xqaParams, mSM, forConfigurePlugin) - && !jit::supportConfigMLA(xqaParams, mSM, forConfigurePlugin); -} - -bool DecoderXQAImplJIT::supportConfig(XQAParams const& xqaParams, bool forConfigurePlugin) const -{ - - return jit::supportConfigQGMMA(xqaParams, mSM, forConfigurePlugin) - || jit::supportConfigHMMA(xqaParams, mSM, forConfigurePlugin) - || jit::supportConfigMLA(xqaParams, mSM, forConfigurePlugin); -} - -bool DecoderXQAImplJIT::mayHavePerfGain(XQAParams const& xqaParams) const -{ - // NOTE: only XQA supports multi_query_tokens (Medusa mode). - if (mForceXQA || xqaParams.multi_query_tokens) - { - return true; - } - // Always prefer XQA-based MLA over FMHA-base MLA for now. - if (xqaParams.isMLA()) - { - return true; - } - int num_kv_heads = xqaParams.num_kv_heads; - int batch_size = static_cast(xqaParams.batch_size); - int multi_block_count = 1; - if (xqaParams.multi_block_mode) - { - int history_length = xqaParams.max_past_kv_length; - // Always use at least 1 block regardless of history length - multi_block_count = std::max(1, history_length / kMinHistoryTokensPerBlock); - } - int block_count = num_kv_heads * batch_size * multi_block_count; - return static_cast(block_count) * kEnableMinBlockFactor >= static_cast(mRunner->mMultiProcessorCount); -} - -bool DecoderXQAImplJIT::shouldUse(XQAParams const& umbrellaXQAParams, bool forConfigurePlugin) -{ - if (forConfigurePlugin) - { - for (int beam_width = 1; beam_width <= umbrellaXQAParams.beam_width; ++beam_width) - { - XQAParams actualXQAParams = umbrellaXQAParams; - actualXQAParams.beam_width = beam_width; - if (supportConfig(actualXQAParams, forConfigurePlugin)) - { - return true; - } - } - TLLM_LOG_DEBUG("JIT XQA is not used: no supported configuration found for any beam_width"); - return false; - } - else - { - auto const& xqaParams = umbrellaXQAParams; - bool isConfigSupported = supportConfig(xqaParams, forConfigurePlugin); - if (!isConfigSupported) - { - TLLM_LOG_DEBUG("JIT XQA is not used: unsupported configuration"); - return false; - } - bool hasPerfGain = mayHavePerfGain(xqaParams); - if (!hasPerfGain) - { - if (!xqaParams.is_fp8_output && xqaParams.kv_cache_data_type == DATA_TYPE_E4M3 - && (xqaParams.data_type == DATA_TYPE_BF16 || xqaParams.data_type == DATA_TYPE_FP16)) - { - TLLM_LOG_DEBUG( - "JIT XQA is selected in the generation phase for fp16/bf16 input and e4m3 kv cache because MMHA " - "does not support this combination."); - return true; - } - TLLM_LOG_DEBUG("JIT XQA is not used: maybe no performance gain"); - return false; - } - return true; - } -} - -jit::CubinObjKey DecoderXQAImplJIT::getCubinObjKeyFromXQAParams(XQAParams const& xqaParams) const -{ - XQAKernelLoadHashKey loadKey; - loadKey.data_type = xqaParams.data_type; - loadKey.sm = mSM; - - XQAKernelRuntimeHashKey runtimeKey = getRuntimeHashKeyFromXQAParams(xqaParams, true, mSM); - return {loadKey, runtimeKey}; -} - -void DecoderXQAImplJIT::prepareForActualXQAParams(XQAParams const& xqaParams) -{ - jit::CubinObjKey currentKey = getCubinObjKeyFromXQAParams(xqaParams); - - jit::CompileEngine compileEngine(mSM, xqaParams); - - auto registryGlobal = mResource->getCubinObjRegistry(); - - if (supportConfig(xqaParams, true)) - { - jit::CubinObjKey key = getCubinObjKeyFromXQAParams(xqaParams); - registryGlobal->insertCubinIfNotExists(key, &compileEngine, /*initialize=*/true); - } -} - -void DecoderXQAImplJIT::prepare(XQAParams const& umbrellaXQAParams) -{ - for (int beam_width = 1; beam_width <= umbrellaXQAParams.beam_width; ++beam_width) - { - XQAParams actualXQAParams = umbrellaXQAParams; - actualXQAParams.beam_width = beam_width; - prepareForActualXQAParams(actualXQAParams); - if (needHMMASpecDec(umbrellaXQAParams, true)) - { - actualXQAParams.generation_input_length = 16; // a WAR to generate tileSize=32 JIT cubin - prepareForActualXQAParams(actualXQAParams); - } - } -} - -void DecoderXQAImplJIT::runWithKVLinearBuffer( - XQAParams const& xqaParams, KVLinearBuffer const& kv_linear_buffer, cudaStream_t const& stream) -{ - runDispatchKVCacheBuffer(xqaParams, kv_linear_buffer, stream); -} - -void DecoderXQAImplJIT::runWithKVBlockArray( - XQAParams const& xqaParams, KVBlockArray const& kv_block_array, cudaStream_t const& stream) -{ - runDispatchKVCacheBuffer(xqaParams, kv_block_array, stream); -} - -#define XQA_KERNEL_RUN(DATA_TYPE) \ - runImpl(xqa_params, kv_cache_buffer, mRunner->mMultiProcessorCount, stream) - -template -void DecoderXQAImplJIT::runDispatchKVCacheBuffer( - XQAParams const& xqa_params, KVCacheBuffer const& kv_cache_buffer, cudaStream_t const& stream) -{ - if (mRunner->mDataType == DATA_TYPE_FP16) - { - XQA_KERNEL_RUN(__half); - } - else - { - XQA_KERNEL_RUN(__nv_bfloat16); - } -} - -#undef XQA_KERNEL_RUN - -namespace -{ -struct SpecDecParams -{ - uint32_t qSeqLen; - uint32_t const* qCuSeqLens; // [nbReq + 1] - using MaskType = uint32_t; - MaskType const* mask; // [nbReq][qSeqLen][divUp(qSeqLen, 32)] or [qCuSeqLen[nbReq]][divUp(qSeqLen, 32)] -}; -} // namespace - -template -void DecoderXQAImplJIT::runImpl(XQAParams const& xqaParams, KVCacheBuffer const& kv_cache_buffer, - int multiprocessor_count, cudaStream_t const& stream) const -{ - jit::CubinObjKey const key = getCubinObjKeyFromXQAParams(xqaParams); - jit::CubinObj const* const cubinObj = mResource->getCubinObjRegistry()->getCubin(key); - TLLM_CHECK(cubinObj != nullptr && cubinObj->isInitialized()); - bool const isSpecDec = xqaParams.multi_query_tokens; - bool const isSkipSoftmax = xqaParams.skip_softmax_threshold_scale_factor != 0; - bool const isHMMAKernel = (cubinObj->getKernelType() == XQAKernelType::kAMPERE_WARP_SPECIALIZED); - bool const isGMMAKernel = (cubinObj->getKernelType() == XQAKernelType::kHOPPER_WARP_SPECIALIZED); - bool const isMLAKernel = (cubinObj->getKernelType() == XQAKernelType::kSM120_MLA); - TLLM_CHECK_WITH_INFO(!isSpecDec || isGMMAKernel || isHMMAKernel - || (isMLAKernel && !xqaParams.spec_decoding_is_generation_length_variable), - "speculative decoding is available for GMMA/MLA kernel only in JIT path for now. For MLA, the input sequence " - "length must be uniform and draft tokens must be linear."); - TLLM_CHECK_DEBUG(isGMMAKernel == jit::supportConfigQGMMA(xqaParams, mSM, false)); - // @fixme: also embed these compile-time flags in cubin directly - // Whether RoPE is fused into the XQA kernel. - // * If applyRoPEInXqaKernel is true, XQA kernel applies RoPE AND performs SDPA. - // * If applyRoPEInXqaKernel is false, a separate kernel applies RoPE (see invokeQKVPreprocessing), then XQA kernel - // performs SDPA. - // In this case, xqa_q_input_ptr (see below) serves as the scratch space to store intermediate RoPE output. - - bool const applyRoPEInXqaKernel = jit::appliesRoPEInXqaKernel(xqaParams, isGMMAKernel); - - unsigned int head_size = xqaParams.head_size; - int num_q_heads = xqaParams.num_q_heads; - int num_kv_heads = xqaParams.num_kv_heads; - TLLM_CHECK_WITH_INFO(num_q_heads % num_kv_heads == 0, "numQHeads should be multiple of numKVHeads."); - unsigned int num_q_heads_over_kv = num_q_heads / num_kv_heads; - unsigned int beam_width = xqaParams.beam_width; - unsigned int batch_beam_size = xqaParams.batch_size * beam_width; - - const KvCacheDataType cache_type = xqaParams.kv_cache_quant_mode.hasInt8KvCache() - ? KvCacheDataType::INT8 - : (xqaParams.kv_cache_quant_mode.hasFp8KvCache() ? KvCacheDataType::FP8 : KvCacheDataType::BASE); - - XQALaunchParam launchParams; - bool const isFp8Out = xqaParams.is_fp8_output; - bool const needOutputCvt = false; - void* inputScratch = nullptr; - buildXQALaunchParams(launchParams, inputScratch, needOutputCvt, xqaParams, kv_cache_buffer); - if (needOutputCvt) - { - launchParams.output = inputScratch; - } - - // NOTE: MHA kernels should read kv cache that has already been appended with new tokens' kv cache. - void* xqa_q_input_ptr = (applyRoPEInXqaKernel ? nullptr : inputScratch); - if (!applyRoPEInXqaKernel) - { - if (!xqaParams.isMLA()) - { - // Build cu_seqlens, padding_offset, and rotary inv freq tensors - BuildDecoderInfoParams decoder_params{}; - decoder_params.seqQOffsets = launchParams.cu_seq_lens; - decoder_params.seqQLengths = xqaParams.spec_decoding_generation_lengths; - decoder_params.seqKVLengths = xqaParams.sequence_lengths; - decoder_params.tokensInfo = launchParams.tokens_info; - decoder_params.batchSize = int(batch_beam_size); - decoder_params.maxQSeqLength = xqaParams.generation_input_length; - decoder_params.numTokens = xqaParams.total_num_input_tokens; - decoder_params.removePadding = true; - TLLM_CHECK_WITH_INFO(!xqaParams.multi_query_tokens || xqaParams.spec_decoding_generation_lengths != nullptr, - "Spec_decoding_generation_lengths must be provided."); - // Rotary embedding inv_freq buffer. - decoder_params.rotaryEmbeddingScale = xqaParams.rotary_embedding_scale; - decoder_params.rotaryEmbeddingBase = xqaParams.rotary_embedding_base; - decoder_params.rotaryEmbeddingDim = xqaParams.rotary_embedding_dim; - decoder_params.rotaryScalingType = xqaParams.rotary_embedding_scale_type; - decoder_params.rotaryEmbeddingInvFreq = launchParams.rotary_inv_freq_buf; - decoder_params.rotaryEmbeddingInvFreqCache = xqaParams.rotary_embedding_inv_freq_cache; - decoder_params.rotaryEmbeddingMaxPositions = xqaParams.rotary_embedding_max_positions; - // The rotary_embedding_inv_freq_cache for QKVPreprocessing. - // Use the xqaParams.rotary_embedding_inv_freq_cache input when the buildDecoderInfoKernel is skipped. - float const* rotary_inv_freq_buf = xqaParams.rotary_embedding_inv_freq_cache; - if (decoder_params.isBuildDecoderInfoKernelNeeded() || xqaParams.multi_query_tokens) - { - rotary_inv_freq_buf = launchParams.rotary_inv_freq_buf; - invokeBuildDecoderInfo(decoder_params, stream); - } - sync_check_cuda_error(stream); - - // The preprocessing kernel that applies RoPE and updates kv cache. - QKVPreprocessingParams preprocessingParams; - memset(&preprocessingParams, 0, sizeof(preprocessingParams)); - // Set parameters. - preprocessingParams.qkv_input = static_cast(const_cast(xqaParams.qkv)); - preprocessingParams.q_output = static_cast(xqa_q_input_ptr); - preprocessingParams.kv_cache_buffer = kv_cache_buffer; - preprocessingParams.kv_cache_block_scales_buffer = {}; - preprocessingParams.qkv_bias = static_cast(xqaParams.qkv_bias); - // Buffers. - preprocessingParams.logn_scaling = xqaParams.logn_scaling_ptr; - preprocessingParams.tokens_info = launchParams.tokens_info; - preprocessingParams.seq_lens = xqaParams.spec_decoding_generation_lengths; - preprocessingParams.cache_seq_lens = xqaParams.sequence_lengths; - preprocessingParams.cu_seq_lens = xqaParams.multi_query_tokens ? launchParams.cu_seq_lens : nullptr; - preprocessingParams.rotary_embedding_inv_freq = rotary_inv_freq_buf; - preprocessingParams.rotary_coef_cache_buffer = xqaParams.rotary_cos_sin; - preprocessingParams.qkv_scale_orig_quant = xqaParams.kv_scale_orig_quant; - preprocessingParams.spec_decoding_position_offsets = xqaParams.spec_decoding_position_offsets; - preprocessingParams.mrope_position_deltas = xqaParams.mrope_position_deltas; - // Scalar parameters. - preprocessingParams.batch_size = int(batch_beam_size); - preprocessingParams.max_input_seq_len = xqaParams.generation_input_length; - preprocessingParams.max_kv_seq_len = xqaParams.max_past_kv_length; - preprocessingParams.cyclic_kv_cache_len = xqaParams.cyclic_attention_window_size; - preprocessingParams.sink_token_len = xqaParams.sink_token_length; - preprocessingParams.token_num = xqaParams.total_num_input_tokens; - preprocessingParams.remove_padding = true; - preprocessingParams.cross_attention = false; - preprocessingParams.head_num = xqaParams.num_q_heads; - preprocessingParams.kv_head_num = xqaParams.num_kv_heads; - preprocessingParams.qheads_per_kv_head = xqaParams.num_q_heads / xqaParams.num_kv_heads; - preprocessingParams.size_per_head = xqaParams.head_size; - preprocessingParams.rotary_embedding_dim = xqaParams.rotary_embedding_dim; - preprocessingParams.rotary_embedding_base = xqaParams.rotary_embedding_base; - preprocessingParams.rotary_scale_type = xqaParams.rotary_embedding_scale_type; - preprocessingParams.rotary_embedding_scale = xqaParams.rotary_embedding_scale; - preprocessingParams.rotary_embedding_max_positions = xqaParams.rotary_embedding_max_positions; - preprocessingParams.position_embedding_type = xqaParams.position_embedding_type; - preprocessingParams.position_shift_enabled = xqaParams.position_shift_enabled; - preprocessingParams.cache_type = cache_type; - preprocessingParams.separate_q_kv_output = true; - preprocessingParams.quantized_fp8_output = false; - preprocessingParams.generation_phase = true; - preprocessingParams.multi_processor_count = multiprocessor_count; - preprocessingParams.rotary_vision_start = xqaParams.rotary_vision_start; - preprocessingParams.rotary_vision_length = xqaParams.rotary_vision_length; - - invokeQKVPreprocessing(preprocessingParams, stream); - sync_check_cuda_error(stream); - } - else - { - xqa_q_input_ptr = xqaParams.quant_q_buffer_ptr; - } - } - - auto const makeSpecDecParams = [&]() -> SpecDecParams - { - auto const qSeqLen = static_cast(xqaParams.generation_input_length); - uint32_t maxQSeqLen = xqaParams.spec_decoding_is_generation_length_variable - ? xqaParams.spec_decoding_max_generation_length - : qSeqLen; - return {.qSeqLen = maxQSeqLen, - .qCuSeqLens = reinterpret_cast(launchParams.cu_seq_lens), - .mask = reinterpret_cast(xqaParams.spec_decoding_packed_mask)}; - }; - - constexpr uint32_t kMAX_NB_KERNEL_PARAMS = 19; - uint32_t idxNextParam = 0; - void* kernelParams[kMAX_NB_KERNEL_PARAMS]; - auto appendParam = [&](auto* p) mutable - { - TLLM_CHECK(idxNextParam < kMAX_NB_KERNEL_PARAMS); - kernelParams[idxNextParam++] = const_cast(static_cast(p)); - }; - void const* const kernel_input_tokens = (applyRoPEInXqaKernel ? launchParams.qkv : xqa_q_input_ptr); - if (isMLAKernel) - { - CUtensorMap const tensorMapQ = makeTensorMapForXqaMlaQ(mDriver, xqaParams, kernel_input_tokens); - appendParam(&tensorMapQ); - CUtensorMap const tensorMapK = makeTensorMapForXqaMlaKVCache(mDriver, xqaParams, kv_cache_buffer, true); - appendParam(&tensorMapK); - CUtensorMap const tensorMapV = makeTensorMapForXqaMlaKVCache(mDriver, xqaParams, kv_cache_buffer, false); - appendParam(&tensorMapV); - appendParam(&launchParams.qScale); - appendParam(&launchParams.output); - appendParam(&launchParams.kvCacheParams); - appendParam(&launchParams.batch_size); - appendParam(&launchParams.kv_scale_quant_orig); - appendParam(&launchParams.scratch); - appendParam(&launchParams.semaphores); - uint32_t const multi_block = computeMultiBlockCountForMLA(xqaParams, multiprocessor_count); - std::byte* const partialResults = static_cast(launchParams.scratch) - + xqaMlaCgaXBufSize * multi_block * xqaParams.total_num_input_tokens; - appendParam(&partialResults); - kernelParams[idxNextParam] = nullptr; // one extra nullptr at end as guard. - uint32_t const inputSeqLen = (xqaParams.multi_query_tokens || xqaParams.isMLA()) - ? static_cast(xqaParams.generation_input_length) - : 1U; - dim3 const dimGrid{4 * inputSeqLen, multi_block, xqaParams.batch_size}; - dim3 const blockDim(128 * 3, 1, 1); - cubinObj->launch(dimGrid, blockDim, stream, kernelParams); - } - else if (isSpecDec && isHMMAKernel) - { - // MultiQueryTokens (generation_input_length > 1) need extra parameters (like qSeqLen, headGrpSize, and - // mask). Input parameters for MultiQueryTokens kernels. - unsigned int headGrpSize = num_q_heads_over_kv; - // Use mTileSize = 16 kernels when qSeqLen <= 16. - unsigned int qSeqLen = static_cast(xqaParams.generation_input_length); - unsigned int mTileSize = qSeqLen <= 16 ? 16 : 32; - unsigned int nbTokenBlocksPerGrp = divUp(qSeqLen * headGrpSize, mTileSize); - unsigned int maxQSeqLen = xqaParams.spec_decoding_is_generation_length_variable ? // true for ReDrafter - xqaParams.spec_decoding_max_generation_length - : qSeqLen; - - appendParam(&maxQSeqLen); - appendParam(&launchParams.num_k_heads); - appendParam(&headGrpSize); - appendParam(&launchParams.cu_seq_lens); - bool const allowSlidingWindow - = !(isSpecDec && xqaParams.is_spec_dec_tree); // sliding windows does not support spec dec with tree-based - // token, only chained tokens - if (allowSlidingWindow) - { - appendParam(&launchParams.slidingWindowSize); - } - appendParam(&launchParams.qScale); - appendParam(&launchParams.output); - if (isFp8Out && !needOutputCvt) - { - appendParam(&launchParams.rcpOutScale); - } - appendParam(&kernel_input_tokens); - appendParam(&xqaParams.spec_decoding_packed_mask); - appendParam(&xqaParams.attention_sinks); - appendParam(&launchParams.kvCacheParams); - if (xqaParams.beam_width > 1) - { - appendParam(&launchParams.beamSearchParams.value()); - } - appendParam(&launchParams.batch_size); - appendParam(&launchParams.kv_scale_quant_orig); - appendParam(&launchParams.semaphores); - appendParam(&launchParams.scratch); - - uint32_t multi_block = 1; - // if (xqaParams.multi_block_mode) - // { - // multi_block = computeMultiBlockCount(xqaParams, xqaParams.batch_size, multiprocessor_count); - // } - auto const gridDim = (dim3{multi_block, xqaParams.num_kv_heads * nbTokenBlocksPerGrp, xqaParams.batch_size}); - dim3 const blockDim(128, 1, 2); - - cubinObj->launch(gridDim, blockDim, stream, kernelParams); - } - else - { - appendParam(&launchParams.num_k_heads); - bool const allowSlidingWindow - = !(isSpecDec && xqaParams.is_spec_dec_tree); // sliding windows does not support spec dec with tree-based - // token, only chained tokens - if (allowSlidingWindow) - { - appendParam(&launchParams.slidingWindowSize); - } - appendParam(&launchParams.qScale); - appendParam(&launchParams.output); - if (isFp8Out && !needOutputCvt) - { - appendParam(&launchParams.rcpOutScale); - } - appendParam(&kernel_input_tokens); - if (applyRoPEInXqaKernel) - { - appendParam(&launchParams.ropeCosSin); - } - appendParam(&xqaParams.attention_sinks); - appendParam(&launchParams.kvCacheParams); - if (xqaParams.beam_width > 1) - { - appendParam(&launchParams.beamSearchParams.value()); - } - appendParam(&launchParams.batch_size); - appendParam(&launchParams.kv_scale_quant_orig); - CUtensorMap tensorMap{}; - if (isGMMAKernel) - { - tensorMap = makeTensorMapForHopperXqaKVCache(mDriver, xqaParams, kv_cache_buffer); - appendParam(&tensorMap); - } - uint32_t specDecBlocks = 1; - SpecDecParams specDecParams{}; - if (isSpecDec) - { - TLLM_CHECK_WITH_INFO( - isGMMAKernel, "speculative decoding is available for GMMA kernel only in JIT path for now."); - TLLM_CHECK_DEBUG_WITH_INFO(xqaParams.max_past_kv_length + 1 <= xqaParams.cyclic_attention_window_size, - "SWA and speculative decoding cannot be used at the same time for now."); - specDecParams = makeSpecDecParams(); - appendParam(&specDecParams); - specDecBlocks = divUp(specDecParams.qSeqLen, 64 / num_q_heads_over_kv); - } - if (isSkipSoftmax) - { - TLLM_CHECK_WITH_INFO(isGMMAKernel, "skip softmax is only supported for GMMA kernel for now."); - TLLM_CHECK_WITH_INFO(!isSpecDec, "skip softmax is not supported with spec dec for now."); - appendParam(&xqaParams.skip_softmax_threshold_scale_factor); -#ifdef SKIP_SOFTMAX_STAT - appendParam(&xqaParams.skip_softmax_total_blocks); - appendParam(&xqaParams.skip_softmax_skipped_blocks); -#endif - } - appendParam(&launchParams.semaphores); - appendParam(&launchParams.scratch); - kernelParams[idxNextParam] = nullptr; // one extra nullptr at end as guard. - uint32_t multi_block = 1; - if (xqaParams.multi_block_mode) - { - if (isSpecDec && isGMMAKernel) - { - multi_block = computeMultiBlockCountSpecDecGMMA( - xqaParams, xqaParams.batch_size, multiprocessor_count, specDecBlocks); - } - else if (!isSpecDec) - { - multi_block = computeMultiBlockCount(xqaParams, xqaParams.batch_size, multiprocessor_count); - } - } - uint32_t const nbKVHeads = xqaParams.num_kv_heads; - auto const gridDim = (isGMMAKernel ? dim3{specDecBlocks, multi_block, nbKVHeads * xqaParams.batch_size} - : dim3{multi_block, nbKVHeads, xqaParams.batch_size}); - dim3 const blockDim(128, 1, isGMMAKernel ? 3 : 2); - cubinObj->launch(gridDim, blockDim, stream, kernelParams); - } - sync_check_cuda_error(stream); - - if (needOutputCvt) - { - tensorrt_llm::kernels::invokeConversion<__nv_fp8_e4m3, T>(static_cast<__nv_fp8_e4m3*>(xqaParams.output), - static_cast(launchParams.output), - xqaParams.head_size * xqaParams.num_q_heads * xqaParams.total_num_input_tokens, xqaParams.fp8_out_scale, - stream); - sync_check_cuda_error(stream); - } -} - -} // namespace kernels - -TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/decoderXQAImplJIT.h b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/decoderXQAImplJIT.h deleted file mode 100644 index 902ec0b809a5..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/decoderXQAImplJIT.h +++ /dev/null @@ -1,80 +0,0 @@ -/* - * Copyright (c) 2020-2023, NVIDIA CORPORATION. All rights reserved. - * - * Licensed under the Apache License, Version 2.0 (the "License"); - * you may not use this file except in compliance with the License. - * You may obtain a copy of the License at - * - * http://www.apache.org/licenses/LICENSE-2.0 - * - * Unless required by applicable law or agreed to in writing, software - * distributed under the License is distributed on an "AS IS" BASIS, - * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. - * See the License for the specific language governing permissions and - * limitations under the License. - */ -#pragma once -#include "tensorrt_llm/common/config.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.h" - -#include "compileEngine.h" -#include "cubinObjRegistry.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.h" -#include "tensorrt_llm/kernels/trtllmGenKernels/fmha/fmhaRunner.h" -#include "tensorrt_llm/plugins/common/plugin.h" -#include - -TRTLLM_NAMESPACE_BEGIN - -namespace kernels -{ - -class DecoderXQARunnerResource; - -class DecoderXQAImplJIT : public DecoderXQAImpl -{ -public: - DecoderXQAImplJIT(DecoderXQARunner* runner); - - bool shouldUse(XQAParams const& xqaParams, bool forConfigurePlugin) override; - void prepare(XQAParams const& xqaParams) override; - - ~DecoderXQAImplJIT() override = default; - -protected: - void runWithKVLinearBuffer( - XQAParams const& xqaParams, KVLinearBuffer const& kv_linear_buffer, cudaStream_t const& stream) override; - void runWithKVBlockArray( - XQAParams const& xqaParams, KVBlockArray const& kv_block_array, cudaStream_t const& stream) override; - -private: - std::shared_ptr mDriver; - std::shared_ptr mResource; - - //! Whether DecoderXQAImplJIT needs to compile 2 sets (tilesize = 16, 32) kernels for spec-dec - bool needHMMASpecDec(XQAParams const& xqaParams, bool forConfigurePlugin) const; - - //! Whether DecoderXQAImplJIT supports xqaParams. - bool supportConfig(XQAParams const& xqaParams, bool forConfigurePlugin) const; - //! Whether DecoderXQAImplJIT has perf gain over the default (non-XQA-optimized) implementation. - bool mayHavePerfGain(XQAParams const& xqaParams) const; - - void prepareForActualXQAParams(XQAParams const& xqaParams); - - template - void runImpl(XQAParams const& xqaParams, KVCacheBuffer const& kv_cache_buffer, int multiprocessor_count, - cudaStream_t const& stream) const; - - template - void runDispatchKVCacheBuffer( - XQAParams const& xqa_params, KVCacheBuffer const& kv_cache_buffer, cudaStream_t const& stream); - - bool mForceXQA; - int mSM; - - jit::CubinObjKey getCubinObjKeyFromXQAParams(XQAParams const& xqaParams) const; -}; - -} // namespace kernels - -TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplPrecompiled.cpp b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplPrecompiled.cpp deleted file mode 100644 index 50bbbff6201d..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplPrecompiled.cpp +++ /dev/null @@ -1,569 +0,0 @@ -/* - * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. - * - * Licensed under the Apache License, Version 2.0 (the "License"); - * you may not use this file except in compliance with the License. - * You may obtain a copy of the License at - * - * http://www.apache.org/licenses/LICENSE-2.0 - * - * Unless required by applicable law or agreed to in writing, software - * distributed under the License is distributed on an "AS IS" BASIS, - * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. - * See the License for the specific language governing permissions and - * limitations under the License. - */ -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplPrecompiled.h" - -#include "tensorrt_llm/common/config.h" -#include "tensorrt_llm/common/cudaDriverWrapper.h" -#include "tensorrt_llm/common/envUtils.h" -#include "tensorrt_llm/common/workspace.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_cubin.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAConstants.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/tensorMapUtils.h" -#include "tensorrt_llm/kernels/kvCacheUtils.h" -#include "tensorrt_llm/kernels/unfusedAttentionKernels.h" -#include -#include -#include -#include -#include - -using namespace tensorrt_llm::common; - -TRTLLM_NAMESPACE_BEGIN - -namespace kernels -{ - -class XQAKernelList -{ -public: - using TKernelMeta = XQAKernelMetaInfo; - - XQAKernelList(Data_type type, unsigned int sm) - : mDriver(tensorrt_llm::common::CUDADriverWrapper::getInstance()) - , mDataType(type) - , mKernelMetaCount(sXqaKernelMetaInfoSize) - , mKernelMeta(&sXqaKernelMetaInfo[0]) - , mSM(sm) - { - mForceXQA = forceXQAKernels(); - } - - void loadXQAKernels() - { - if (!mFunctions.empty()) - { - return; - } - for (unsigned int i = 0; i < mKernelMetaCount; ++i) - { - auto const& kernelMeta = mKernelMeta[i]; - if (kernelMeta.mSM != mSM || kernelMeta.mDataType != mDataType) - continue; - - // Cubins for kernels that would take the JIT path are removed from kernelMeta. - if (kernelMeta.mCubin == nullptr) - continue; - - CUlibrary hlib{0}; - auto findLibIter = mCuLibs.find(kernelMeta.mCubin); - if (findLibIter != mCuLibs.end()) - { - hlib = findLibIter->second; - } - else - { - TLLM_CU_CHECK( - mDriver->cuLibraryLoadData(&hlib, kernelMeta.mCubin, nullptr, nullptr, 0, nullptr, nullptr, 0)); - mCuLibs.insert(std::make_pair(kernelMeta.mCubin, hlib)); - } - - XQAKernelFuncInfo funcInfo{}; - funcInfo.mMetaInfoIndex = i; - TLLM_CU_CHECK(mDriver->cuLibraryGetKernel(&funcInfo.mDeviceFunction, hlib, kernelMeta.mFuncName)); - funcInfo.mSharedMemBytes = getGlobalVar(mDriver, hlib, "smemSize", true).value(); - funcInfo.mKernelType = getGlobalVar(mDriver, hlib, "kernelType", false) - .value_or(XQAKernelType::kAMPERE_WARP_SPECIALIZED); - - /* Set 46KB threshold here because we have to take static/driver shared memory into consideration. */ - if (funcInfo.mSharedMemBytes >= 46 * 1024) - { - CUdevice dev; - TLLM_CU_CHECK(mDriver->cuCtxGetDevice(&dev)); - TLLM_CU_CHECK(mDriver->cuKernelSetAttribute(CU_FUNC_ATTRIBUTE_MAX_DYNAMIC_SHARED_SIZE_BYTES, - funcInfo.mSharedMemBytes, funcInfo.mDeviceFunction, dev)); - } - XQAKernelRuntimeHashKey hash_key{kernelMeta.mKVDataType, kernelMeta.mHeadDim, kernelMeta.mBeamWidth, - kernelMeta.mNumQHeadsOverKV, kernelMeta.mMTileSize, kernelMeta.mTokensPerPage, kernelMeta.mPagedKVCache, - kernelMeta.mMultiQueryTokens, false, std::nullopt, std::nullopt}; - - mFunctions.insert(std::make_pair(hash_key, funcInfo)); - } - } - - bool supportConfig(XQAParams const& xqaParams) const - { - unsigned int head_size = xqaParams.head_size; - int num_q_heads = xqaParams.num_q_heads; - int num_kv_heads = xqaParams.num_kv_heads; - TLLM_CHECK_WITH_INFO(num_q_heads % num_kv_heads == 0, "numQHeads should be multiple of numKVHeads."); - unsigned int num_q_heads_over_kv = num_q_heads / num_kv_heads; - unsigned int beam_width = xqaParams.beam_width; - // MultiQueryToken kernels can support any num_q_heads_over_kv that is power of 2. - unsigned int kernel_num_q_heads_over_kv = xqaParams.multi_query_tokens ? 0 : num_q_heads_over_kv; - unsigned int m_tilesize; - if (xqaParams.multi_query_tokens) - { - // MultiQueryToken kernels can handle either 16/32 for M direction per CTA. - m_tilesize = xqaParams.generation_input_length <= 16 ? 16 : 32; - } - else - { - m_tilesize = num_q_heads_over_kv; - } - - // precompiled XQA does not support param is_fp8_output in hash key - XQAKernelRuntimeHashKey hash_key - = {xqaParams.kv_cache_data_type, head_size, beam_width, kernel_num_q_heads_over_kv, m_tilesize, - xqaParams.paged_kv_cache ? static_cast(xqaParams.tokens_per_block) : 0, - xqaParams.paged_kv_cache, xqaParams.multi_query_tokens, 0, /* xqa jit param is_fp8_output */ - std::nullopt, /* position_embedding_type */ std::nullopt /* rotary_embedding_dim */}; - auto const findIter = mFunctions.find(hash_key); - return findIter != mFunctions.end(); - } - - bool mayHavePerfGain(XQAParams const& xqaParams, int multiprocessor_count) const - { - // NOTE: only XQA supports multi_query_tokens (Medusa mode). - if (mForceXQA || xqaParams.multi_query_tokens) - { - return true; - } - int num_kv_heads = xqaParams.num_kv_heads; - int batch_size = static_cast(xqaParams.batch_size); - int multi_block_count = 1; - if (xqaParams.multi_block_mode) - { - int history_length = xqaParams.max_past_kv_length; - multi_block_count = history_length / kMinHistoryTokensPerBlock; - } - int block_count = num_kv_heads * batch_size * multi_block_count; - return static_cast(block_count) * kEnableMinBlockFactor >= static_cast(multiprocessor_count); - } - - template - void run(XQAParams const& xqaParams, KVCacheBuffer const& kv_cache_buffer, int multiprocessor_count, - cudaStream_t const& stream) const - { - unsigned int head_size = xqaParams.head_size; - int num_q_heads = xqaParams.num_q_heads; - int num_kv_heads = xqaParams.num_kv_heads; - TLLM_CHECK_WITH_INFO(num_q_heads % num_kv_heads == 0, "numQHeads should be multiple of numKVHeads."); - unsigned int num_q_heads_over_kv = num_q_heads / num_kv_heads; - unsigned int beam_width = xqaParams.beam_width; - unsigned int batch_beam_size = xqaParams.batch_size * beam_width; - - const KvCacheDataType cache_type = xqaParams.kv_cache_quant_mode.hasInt8KvCache() - ? KvCacheDataType::INT8 - : (xqaParams.kv_cache_quant_mode.hasFp8KvCache() ? KvCacheDataType::FP8 : KvCacheDataType::BASE); - - XQALaunchParam launchParams; - bool const needOutputCvt = (xqaParams.fp8_out_scale != nullptr); - void* inputScratch = nullptr; - buildXQALaunchParams(launchParams, inputScratch, needOutputCvt, xqaParams, kv_cache_buffer); - - // Build cu_seqlens, padding_offset, and rotary inv freq tensors - BuildDecoderInfoParams decoder_params{}; - decoder_params.seqQOffsets = launchParams.cu_seq_lens; - decoder_params.seqQLengths = xqaParams.spec_decoding_generation_lengths; - decoder_params.seqKVLengths = xqaParams.sequence_lengths; - decoder_params.tokensInfo = launchParams.tokens_info; - decoder_params.batchSize = int(batch_beam_size); - decoder_params.maxQSeqLength = xqaParams.generation_input_length; - decoder_params.numTokens = xqaParams.total_num_input_tokens; - decoder_params.removePadding = true; - TLLM_CHECK_WITH_INFO(!xqaParams.multi_query_tokens || xqaParams.spec_decoding_generation_lengths != nullptr, - "Spec_decoding_generation_lengths must be provided."); - // Rotary embedding inv_freq buffer. - decoder_params.rotaryEmbeddingScale = xqaParams.rotary_embedding_scale; - decoder_params.rotaryEmbeddingBase = xqaParams.rotary_embedding_base; - decoder_params.rotaryEmbeddingDim = xqaParams.rotary_embedding_dim; - decoder_params.rotaryScalingType = xqaParams.rotary_embedding_scale_type; - decoder_params.rotaryEmbeddingInvFreq = launchParams.rotary_inv_freq_buf; - decoder_params.rotaryEmbeddingInvFreqCache = xqaParams.rotary_embedding_inv_freq_cache; - decoder_params.rotaryEmbeddingMaxPositions = xqaParams.rotary_embedding_max_positions; - // The rotary_embedding_inv_freq_cache for QKVPreprocessing. - // Use the xqaParams.rotary_embedding_inv_freq_cache input when the buildDecoderInfoKernel is skipped. - float const* rotary_inv_freq_buf = xqaParams.rotary_embedding_inv_freq_cache; - if (decoder_params.isBuildDecoderInfoKernelNeeded() || xqaParams.multi_query_tokens) - { - rotary_inv_freq_buf = launchParams.rotary_inv_freq_buf; - invokeBuildDecoderInfo(decoder_params, stream); - } - sync_check_cuda_error(stream); - - // IDEA: Store rotary_processed Q buffer to output buffer. - // NOTE: MHA kernels should read kv cache that has already been appended with new tokens' kv cache. - void* xqa_q_input_ptr = inputScratch; - // The preprocessing kernel that applies RoPE and updates kv cache. - QKVPreprocessingParams preprocessingParams; - memset(&preprocessingParams, 0, sizeof(preprocessingParams)); - // Set parameters. - preprocessingParams.qkv_input = static_cast(const_cast(xqaParams.qkv)); - preprocessingParams.q_output = static_cast(xqa_q_input_ptr); - preprocessingParams.kv_cache_buffer = kv_cache_buffer; - preprocessingParams.kv_cache_block_scales_buffer = {}; - preprocessingParams.qkv_bias = static_cast(xqaParams.qkv_bias); - // Buffers. - preprocessingParams.logn_scaling = xqaParams.logn_scaling_ptr; - preprocessingParams.tokens_info = launchParams.tokens_info; - preprocessingParams.seq_lens = xqaParams.spec_decoding_generation_lengths; - preprocessingParams.cache_seq_lens = xqaParams.sequence_lengths; - preprocessingParams.cu_seq_lens = xqaParams.multi_query_tokens ? launchParams.cu_seq_lens : nullptr; - preprocessingParams.rotary_embedding_inv_freq = rotary_inv_freq_buf; - preprocessingParams.rotary_coef_cache_buffer = xqaParams.rotary_cos_sin; - preprocessingParams.qkv_scale_orig_quant = xqaParams.kv_scale_orig_quant; - preprocessingParams.spec_decoding_position_offsets = xqaParams.spec_decoding_position_offsets; - preprocessingParams.mrope_position_deltas = xqaParams.mrope_position_deltas; - // Scalar parameters. - preprocessingParams.batch_size = int(batch_beam_size); - preprocessingParams.max_input_seq_len = xqaParams.generation_input_length; - preprocessingParams.max_kv_seq_len = xqaParams.max_past_kv_length; - preprocessingParams.cyclic_kv_cache_len = xqaParams.cyclic_attention_window_size; - preprocessingParams.sink_token_len = xqaParams.sink_token_length; - preprocessingParams.token_num = xqaParams.total_num_input_tokens; - preprocessingParams.remove_padding = true; - preprocessingParams.cross_attention = false; - preprocessingParams.head_num = xqaParams.num_q_heads; - preprocessingParams.kv_head_num = xqaParams.num_kv_heads; - preprocessingParams.qheads_per_kv_head = xqaParams.num_q_heads / xqaParams.num_kv_heads; - preprocessingParams.size_per_head = xqaParams.head_size; - preprocessingParams.rotary_embedding_dim = xqaParams.rotary_embedding_dim; - preprocessingParams.rotary_embedding_base = xqaParams.rotary_embedding_base; - preprocessingParams.rotary_scale_type = xqaParams.rotary_embedding_scale_type; - preprocessingParams.rotary_embedding_scale = xqaParams.rotary_embedding_scale; - preprocessingParams.rotary_embedding_max_positions = xqaParams.rotary_embedding_max_positions; - preprocessingParams.position_embedding_type = xqaParams.position_embedding_type; - preprocessingParams.position_shift_enabled = xqaParams.position_shift_enabled; - preprocessingParams.cache_type = cache_type; - preprocessingParams.separate_q_kv_output = true; - preprocessingParams.quantized_fp8_output = false; - preprocessingParams.generation_phase = true; - preprocessingParams.multi_processor_count = multiprocessor_count; - preprocessingParams.rotary_vision_start = xqaParams.rotary_vision_start; - preprocessingParams.rotary_vision_length = xqaParams.rotary_vision_length; - - invokeQKVPreprocessing(preprocessingParams, stream); - sync_check_cuda_error(stream); - - XQAKernelRuntimeHashKey hash_key = getRuntimeHashKeyFromXQAParams(xqaParams, false, mSM); - auto const findIter = mFunctions.find(hash_key); - - TLLM_CHECK_WITH_INFO(findIter != mFunctions.end(), "XQAKernelFunc not found."); - - auto const& kernelMeta = mKernelMeta[findIter->second.mMetaInfoIndex]; - const CUfunction func = reinterpret_cast(findIter->second.mDeviceFunction); - unsigned int const shared_mem_bytes = findIter->second.mSharedMemBytes; - auto const kernelType = findIter->second.mKernelType; - - if (xqaParams.multi_query_tokens) - { - // MultiQueryTokens (generation_input_length > 1) need extra parameters (like qSeqLen, headGrpSize, and - // mask). Input parameters for MultiQueryTokens kernels. - unsigned int headGrpSize = num_q_heads_over_kv; - // Use mTileSize = 16 kernels when qSeqLen <= 16. - unsigned int qSeqLen = static_cast(xqaParams.generation_input_length); - unsigned int mTileSize = qSeqLen <= 16 ? 16 : 32; - unsigned int nbTokenBlocksPerGrp = divUp(qSeqLen * headGrpSize, mTileSize); - int const* maskPtr = xqaParams.spec_decoding_packed_mask; - int const* cuQSeqLens = launchParams.cu_seq_lens; - unsigned int maxQSeqLen = xqaParams.spec_decoding_is_generation_length_variable ? // true for ReDrafter - xqaParams.spec_decoding_max_generation_length - : qSeqLen; - // TODO: merge SingleQueryToken params and MultiQueryTokens params into one kernelParams. - void* kernelParams[] = {&maxQSeqLen, &launchParams.num_k_heads, &headGrpSize, &cuQSeqLens, - &launchParams.output, &xqa_q_input_ptr, &maskPtr, &launchParams.kvCacheParams, &launchParams.batch_size, - &launchParams.kv_scale_quant_orig, &launchParams.scratch}; - // precompiled XQA Spec-dec kernel does not support multi-block mode - int multi_block = 1; - TLLM_CU_CHECK(mDriver->cuLaunchKernel(func, multi_block, xqaParams.num_kv_heads * nbTokenBlocksPerGrp, - xqaParams.batch_size, 128, 1, 2, shared_mem_bytes, stream, kernelParams, nullptr)); - } - else - { - bool const isGmmaKernel = (kernelType == XQAKernelType::kHOPPER_WARP_SPECIALIZED); - TLLM_CHECK(isGmmaKernel - == (mSM == kSM_90 && xqaParams.kv_cache_data_type == XQADataType::DATA_TYPE_E4M3 - && xqaParams.beam_width == 1)); - constexpr uint32_t kMAX_NB_KERNEL_PARAMS = 11; - uint32_t const maxNbKernelParams = (isGmmaKernel ? 11 : 10); - uint32_t idxNextParam = 0; - void* kernelParams[kMAX_NB_KERNEL_PARAMS]; - auto appendParam = [&](auto* p) mutable - { - TLLM_CHECK(idxNextParam < maxNbKernelParams); - kernelParams[idxNextParam++] = p; - }; - appendParam(&launchParams.num_k_heads); - appendParam(&launchParams.output); - appendParam(&xqa_q_input_ptr); - appendParam(&launchParams.kvCacheParams); - if (xqaParams.beam_width > 1) - { - appendParam(&launchParams.beamSearchParams.value()); - } - appendParam(&launchParams.batch_size); - appendParam(&launchParams.kv_scale_quant_orig); - CUtensorMap tensorMap{}; - if (isGmmaKernel) - { - tensorMap = makeTensorMapForHopperXqaKVCache(mDriver, xqaParams, kv_cache_buffer); - appendParam(&tensorMap); - } - appendParam(&launchParams.semaphores); - appendParam(&launchParams.scratch); - kernelParams[idxNextParam] = nullptr; // one extra nullptr at end as guard. - int multi_block = 1; - if (xqaParams.multi_block_mode) - { - multi_block = computeMultiBlockCount(xqaParams, xqaParams.batch_size, multiprocessor_count); - } - TLLM_CU_CHECK(mDriver->cuLaunchKernel(func, multi_block, xqaParams.num_kv_heads, xqaParams.batch_size, 128, - 1, isGmmaKernel ? 3 : 2, shared_mem_bytes, stream, kernelParams, nullptr)); - } - - sync_check_cuda_error(stream); - - if (needOutputCvt) - { - tensorrt_llm::kernels::invokeConversion<__nv_fp8_e4m3, T>(static_cast<__nv_fp8_e4m3*>(xqaParams.output), - static_cast(launchParams.output), - xqaParams.head_size * xqaParams.num_q_heads * xqaParams.total_num_input_tokens, xqaParams.fp8_out_scale, - stream); - sync_check_cuda_error(stream); - } - } - -protected: - std::shared_ptr mDriver; - - Data_type mDataType; - TKernelMeta const* mKernelMeta; - unsigned int mKernelMetaCount; - unsigned int mSM; - std::unordered_map mCuLibs; - - bool mForceXQA = false; - - struct XQAKernelFuncInfo - { - unsigned int mMetaInfoIndex; - unsigned int mSharedMemBytes; - CUkernel mDeviceFunction; - XQAKernelType mKernelType; - }; - - std::unordered_map mFunctions; -}; - -class XQAKernelLoader -{ -public: - XQAKernelList const* getXQAKernels(Data_type type, unsigned int sm) - { - static std::mutex s_mutex; - std::lock_guard lg(s_mutex); - - XQAKernelLoadHashKey hash_key{type, sm}; - - auto const findIter = mKernels.find(hash_key); - if (findIter == mKernels.end()) - { - XQAKernelList* newKernel = new XQAKernelList{type, sm}; - newKernel->loadXQAKernels(); - mKernels.insert(std::make_pair(hash_key, std::unique_ptr(newKernel))); - return newKernel; - } - return findIter->second.get(); - } - - static XQAKernelLoader& Get() - { - static std::unique_ptr s_factory[32] = {nullptr}; - int const device_id = tensorrt_llm::common::getDevice(); - TLLM_CHECK_WITH_INFO(device_id < 32, "Invalid device_id %d (must be < 32)", device_id); - if (s_factory[device_id] == nullptr) - { - s_factory[device_id] = std::make_unique(XQAKernelLoader()); - } - - return *(s_factory[device_id]); - } - -private: - XQAKernelLoader() = default; - - std::unordered_map, XQAKernelLoadHasher> mKernels; -}; - -inline XQAKernelList const* getXQAKernels(Data_type type, unsigned int sm) -{ - if (sm == kSM_121) - { - sm = kSM_120; - } - return XQAKernelLoader::Get().getXQAKernels(type, sm); -} - -#define XQA_KERNEL_RUN(DATA_TYPE) \ - xqa_kernel->template run(xqa_params, kv_cache_buffer, multi_processor_count, stream); - -template -void DecoderXQAImplPrecompiled::runDispatchBuffer( - XQAParams const& xqa_params, KVCacheBuffer const& kv_cache_buffer, cudaStream_t const& stream) -{ - XQAKernelList const* xqa_kernel = getXQAKernels(mRunner->mDataType, tensorrt_llm::common::getSMVersion()); - int multi_processor_count = mRunner->mMultiProcessorCount; - if (mRunner->mDataType == DATA_TYPE_FP16) - { - XQA_KERNEL_RUN(__half); - } - else - { - XQA_KERNEL_RUN(__nv_bfloat16); - } -} - -#undef XQA_KERNEL_RUN - -#define SUPPORT_RETURN_FALSE(X) \ - { \ - TLLM_LOG_DEBUG("XQA is not used. Reason: %s", X); \ - return false; \ - } - -bool DecoderXQAImplPrecompiled::shouldUse(XQAParams const& xqaParams, bool forConfigurePlugin) -{ - if (!(xqaParams.data_type == DATA_TYPE_FP16 || xqaParams.data_type == DATA_TYPE_BF16)) - { - SUPPORT_RETURN_FALSE("data type"); - } - bool const isGPTJBeam4Kernel = (xqaParams.head_size == 256 && xqaParams.beam_width == 4 && xqaParams.paged_kv_cache - && (xqaParams.tokens_per_block == 64 || xqaParams.tokens_per_block == 128)); - if (xqaParams.head_size != 64 && xqaParams.head_size != 128 && xqaParams.head_size != 256 && !isGPTJBeam4Kernel) - { - SUPPORT_RETURN_FALSE("head_size"); - } - if (xqaParams.unidirectional != 1) - { - SUPPORT_RETURN_FALSE("unidirectional"); - } - if (xqaParams.q_scaling != 1.0f) - { - SUPPORT_RETURN_FALSE("q_scaling"); - } - if (xqaParams.mask_type != tensorrt_llm::kernels::AttentionMaskType::CAUSAL) - { - SUPPORT_RETURN_FALSE("mask_type"); - } - if (xqaParams.cross_attention) - { - SUPPORT_RETURN_FALSE("cross_attention"); - } - // Only support 32/64/128 tokens per block. - if (xqaParams.paged_kv_cache && xqaParams.tokens_per_block != 32 && xqaParams.tokens_per_block != 64 - && xqaParams.tokens_per_block != 128) - { - SUPPORT_RETURN_FALSE("paged_kv_cache"); - } - if (xqaParams.beam_width != 1 && !isGPTJBeam4Kernel) - { - SUPPORT_RETURN_FALSE("beam_width"); - } - if (xqaParams.cyclic_attention_window_size != xqaParams.max_attention_window_size) - { - SUPPORT_RETURN_FALSE("cyclic_attention_window_size != max_attention_window_size"); - } - if (xqaParams.position_shift_enabled || xqaParams.sink_token_length > 0) - { - SUPPORT_RETURN_FALSE("streaming-llm"); - } - if (xqaParams.skip_softmax_threshold_scale_factor != 0) - { - SUPPORT_RETURN_FALSE("skip_softmax_threshold_scale_factor"); - } - - // OPTIMIZE: For the standard generation-phase MHA, there are still extra limitations. - // NOTE: Medusa mode = Multi_query_tokens > 1. - int const nbQHeads = xqaParams.num_q_heads; - int const nbKVHeads = xqaParams.num_kv_heads; - int const nbQHeadsPerKV = nbQHeads / nbKVHeads; - // MultiQueryTokens mode (Medusa mode) can support any nbQHeadsPerKV. - if (!xqaParams.multi_query_tokens) - { - if (nbQHeadsPerKV != 16 && nbQHeadsPerKV != 8 && nbQHeadsPerKV != 1) - { - SUPPORT_RETURN_FALSE("nbHeads"); - } - } - - if (!forConfigurePlugin) - { - // Inference time checks. - if (xqaParams.host_past_key_value_lengths == nullptr) - { - SUPPORT_RETURN_FALSE("host_past_key_value_lengths"); - } - for (int i = 0; i < xqaParams.batch_size; ++i) - { - // Only checks for non-medusa case, because medusa may not accept all tokens in host_past_key_value_lengths. - // FIXME(perkzz): medusa should check for sliding-window attention. - if (!xqaParams.multi_query_tokens - && xqaParams.host_past_key_value_lengths[i] + 1 > xqaParams.max_attention_window_size) - { - SUPPORT_RETURN_FALSE("sliding window attention"); - } - } - } - - XQAKernelList const* xqa_kernel = getXQAKernels(mRunner->mDataType, tensorrt_llm::common::getSMVersion()); - bool supportConfig = xqa_kernel->supportConfig(xqaParams); - if (!supportConfig) - { - SUPPORT_RETURN_FALSE("supportConfig"); - } - bool mayHavePerfGain = xqa_kernel->mayHavePerfGain(xqaParams, mRunner->mMultiProcessorCount); - if (!mayHavePerfGain) - { - SUPPORT_RETURN_FALSE("mayHavePerfGain"); - } - return true; -} - -#undef SUPPORT_RETURN_FALSE - -void DecoderXQAImplPrecompiled::prepare(XQAParams const&) -{ - // Intentionally do nothing. -} - -void DecoderXQAImplPrecompiled::runWithKVLinearBuffer( - XQAParams const& xqa_params, KVLinearBuffer const& kv_linear_buffer, cudaStream_t const& stream) -{ - runDispatchBuffer(xqa_params, kv_linear_buffer, stream); -} - -void DecoderXQAImplPrecompiled::runWithKVBlockArray( - XQAParams const& xqa_params, KVBlockArray const& kv_block_array, cudaStream_t const& stream) -{ - runDispatchBuffer(xqa_params, kv_block_array, stream); -} - -} // namespace kernels - -TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplPrecompiled.h b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplPrecompiled.h deleted file mode 100644 index 7f48b47468b3..000000000000 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplPrecompiled.h +++ /dev/null @@ -1,52 +0,0 @@ -/* - * Copyright (c) 2020-2023, NVIDIA CORPORATION. All rights reserved. - * - * Licensed under the Apache License, Version 2.0 (the "License"); - * you may not use this file except in compliance with the License. - * You may obtain a copy of the License at - * - * http://www.apache.org/licenses/LICENSE-2.0 - * - * Unless required by applicable law or agreed to in writing, software - * distributed under the License is distributed on an "AS IS" BASIS, - * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. - * See the License for the specific language governing permissions and - * limitations under the License. - */ -#pragma once -#include "tensorrt_llm/common/config.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.h" - -TRTLLM_NAMESPACE_BEGIN - -namespace kernels -{ - -class DecoderXQAImplPrecompiled : public DecoderXQAImpl -{ -public: - DecoderXQAImplPrecompiled(DecoderXQARunner* runner) - : DecoderXQAImpl(runner) - { - } - - bool shouldUse(XQAParams const& xqaParams, bool forConfigurePlugin) override; - void prepare(XQAParams const& xqa_params) override; - - ~DecoderXQAImplPrecompiled() override = default; - -protected: - void runWithKVLinearBuffer( - XQAParams const& xqa_params, KVLinearBuffer const& kv_linear_buffer, cudaStream_t const& stream) override; - void runWithKVBlockArray( - XQAParams const& xqa_params, KVBlockArray const& kv_block_array, cudaStream_t const& stream) override; - -private: - template - void runDispatchBuffer( - XQAParams const& xqa_params, KVCacheBuffer const& kv_cache_buffer, cudaStream_t const& stream); -}; - -} // namespace kernels - -TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.cpp b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.cpp index d9dc79662f61..a443e618f241 100644 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.cpp +++ b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.cpp @@ -1,5 +1,5 @@ /* - * Copyright (c) 2020-2023, NVIDIA CORPORATION. All rights reserved. + * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. * * Licensed under the Apache License, Version 2.0 (the "License"); * you may not use this file except in compliance with the License. @@ -16,21 +16,18 @@ #include "decoderXQARunner.h" -#include -#include - #include -#include +#include -#include "tensorrt_llm/common/config.h" -#include "tensorrt_llm/common/cudaUtils.h" +#include "tensorrt_llm/common/assert.h" #include "tensorrt_llm/common/envUtils.h" -#include "tensorrt_llm/common/workspace.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/cubin/xqa_kernel_cubin.h" #include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAConstants.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImpl.h" +#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/compileEngine.h" +#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/kernelUtils.h" +#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/tensorMapUtils.h" #include "tensorrt_llm/kernels/kvCacheUtils.h" #include "tensorrt_llm/kernels/unfusedAttentionKernels.h" +#include "tensorrt_llm/kernels/xqaDispatcher.h" TRTLLM_NAMESPACE_BEGIN @@ -38,74 +35,91 @@ namespace kernels { DecoderXQARunner::DecoderXQARunner( - const XQADataType data_type, int num_heads, int num_kv_heads, int head_size, bool multi_block_mode) - : mDataType(data_type) - , mNumHeads(num_heads) - , mNumKVHeads(num_kv_heads) - , mHeadSize(head_size) - , mMultiBlockMode(multi_block_mode) + XQADataType const dataType, int numHeads, int numKVHeads, int headSize, bool multiBlockMode) + : mDataType(dataType) + , mNumHeads(numHeads) + , mNumKVHeads(numKVHeads) + , mHeadSize(headSize) + , mMultiBlockMode(multiBlockMode) + , mMultiProcessorCount(tensorrt_llm::common::getMultiProcessorCount()) + , mDriver(tensorrt_llm::common::CUDADriverWrapper::getInstance()) + , mResource(DecoderXQARunner::getResourceGlobal()) + , mForceXQA(tensorrt_llm::common::forceXQAKernels()) + , mSM(tensorrt_llm::common::getSMVersion()) { - mMultiProcessorCount = tensorrt_llm::common::getMultiProcessorCount(); - - // TODO: needs both impls because medusa kernels haven't been migrated to JIT yet (which should be). - // mJITImpl/mPrecompiledImpl assignments must be the last lines of this constructor. DecoderXQAImpl::create() relies - // on *this being fully initialized. - mJITImpl = DecoderXQAImpl::create(this, DecoderXQAImpl::ImplType::kJIT); - mPrecompiledImpl = DecoderXQAImpl::create(this, DecoderXQAImpl::ImplType::kPrecompiled); } DecoderXQARunner::~DecoderXQARunner() = default; -namespace +bool DecoderXQARunner::shouldUse(XQAParams const& umbrellaXQAParams, bool forConfigurePlugin) { - -template -constexpr inline T divUp(T a, T b) -{ - return (a + b - 1) / b; -} - -template -constexpr inline T roundUp(T a, T b) -{ - return divUp(a, b) * b; -} - -} // namespace - -DecoderXQAImpl* DecoderXQARunner::getImplFromXQAParams(XQAParams const& xqaParams, bool for_configure_plugin) -{ - int const smVersion = tensorrt_llm::common::getSMVersion(); - - std::optional envEnableXQAJIT = tensorrt_llm::common::getEnvEnableXQAJIT(); - if (envEnableXQAJIT.has_value()) + if (forConfigurePlugin) { - return envEnableXQAJIT.value() ? mJITImpl.get() : mPrecompiledImpl.get(); + for (int beamWidth = 1; beamWidth <= umbrellaXQAParams.beam_width; ++beamWidth) + { + XQAParams actualXQAParams = umbrellaXQAParams; + actualXQAParams.beam_width = beamWidth; + if (supportConfig(actualXQAParams, forConfigurePlugin)) + { + return true; + } + } + TLLM_LOG_DEBUG("JIT XQA is not used: no supported configuration found for any beam_width"); + return false; } else { - // uses JIT by default - return mJITImpl.get(); + auto const& xqaParams = umbrellaXQAParams; + bool isConfigSupported = supportConfig(xqaParams, forConfigurePlugin); + if (!isConfigSupported) + { + TLLM_LOG_DEBUG("JIT XQA is not used: unsupported configuration"); + return false; + } + bool hasPerfGain = mayHavePerfGain(xqaParams); + if (!hasPerfGain) + { + if (!xqaParams.is_fp8_output && xqaParams.kv_cache_data_type == DATA_TYPE_E4M3 + && (xqaParams.data_type == DATA_TYPE_BF16 || xqaParams.data_type == DATA_TYPE_FP16)) + { + TLLM_LOG_DEBUG( + "JIT XQA is selected in the generation phase for fp16/bf16 input and e4m3 kv cache because MMHA " + "does not support this combination."); + return true; + } + TLLM_LOG_DEBUG("JIT XQA is not used: maybe no performance gain"); + return false; + } + return true; } } -bool DecoderXQARunner::shouldUse(XQAParams const& xqa_params, bool for_configure_plugin) +void DecoderXQARunner::prepare(XQAParams const& umbrellaXQAParams) { - return getImplFromXQAParams(xqa_params, for_configure_plugin)->shouldUse(xqa_params, for_configure_plugin); -} - -void DecoderXQARunner::prepareForRun(XQAParams const& xqa_params) -{ - return getImplFromXQAParams(xqa_params, true)->prepare(xqa_params); + for (int beamWidth = 1; beamWidth <= umbrellaXQAParams.beam_width; ++beamWidth) + { + XQAParams actualXQAParams = umbrellaXQAParams; + actualXQAParams.beam_width = beamWidth; + prepareForActualXQAParams(actualXQAParams); + if (needHMMASpecDec(umbrellaXQAParams, true)) + { + actualXQAParams.generation_input_length = 16; // a WAR to generate tileSize=32 JIT cubin + prepareForActualXQAParams(actualXQAParams); + } + } } template -void DecoderXQARunner::run( - XQAParams const& xqa_params, KVCacheBuffer const& kv_cache_buffer, cudaStream_t const& stream) +void DecoderXQARunner::run(XQAParams const& xqaParams, KVCacheBuffer const& kvCacheBuffer, cudaStream_t const& stream) { - return getImplFromXQAParams(xqa_params, false)->run(xqa_params, kv_cache_buffer, stream); + runDispatchKVCacheBuffer(xqaParams, kvCacheBuffer, stream); } +template void DecoderXQARunner::run( + XQAParams const& xqaParams, KVLinearBuffer const& kvCacheBuffer, cudaStream_t const& stream); +template void DecoderXQARunner::run( + XQAParams const& xqaParams, KVBlockArray const& kvCacheBuffer, cudaStream_t const& stream); + std::shared_ptr DecoderXQARunner::getResourceGlobal() { static std::mutex sMutex; @@ -121,45 +135,431 @@ std::shared_ptr DecoderXQARunner::getResourceGlobal() return ret; } -template void DecoderXQARunner::run( - XQAParams const& xqa_params, KVLinearBuffer const& kv_linear_buffer, cudaStream_t const& stream); -template void DecoderXQARunner::run( - XQAParams const& xqa_params, KVBlockArray const& kv_block_array, cudaStream_t const& stream); - -//// DecoderXQARunner::Resource -DecoderXQARunnerResource::DecoderXQARunnerResource() - : mCubinObjRegistry(std::make_unique()) +bool DecoderXQARunner::needHMMASpecDec(XQAParams const& xqaParams, bool forConfigurePlugin) const { + + return xqaParams.multi_query_tokens && !jit::supportConfigQGMMA(xqaParams, mSM, forConfigurePlugin) + && jit::supportConfigHMMA(xqaParams, mSM, forConfigurePlugin) + && !jit::supportConfigMLA(xqaParams, mSM, forConfigurePlugin); } -DecoderXQARunnerResource::DecoderXQARunnerResource(DecoderXQARunnerResource const& other) - : mCubinObjRegistry(other.mCubinObjRegistry->clone()) +bool DecoderXQARunner::supportConfig(XQAParams const& xqaParams, bool forConfigurePlugin) const { + + return jit::supportConfigQGMMA(xqaParams, mSM, forConfigurePlugin) + || jit::supportConfigHMMA(xqaParams, mSM, forConfigurePlugin) + || jit::supportConfigMLA(xqaParams, mSM, forConfigurePlugin); } -DecoderXQARunnerResource& DecoderXQARunnerResource::operator=(DecoderXQARunnerResource const& other) +bool DecoderXQARunner::mayHavePerfGain(XQAParams const& xqaParams) const { - if (this == &other) + // NOTE: only XQA supports multi_query_tokens (Medusa mode). + if (mForceXQA || xqaParams.multi_query_tokens) { - return *this; + return true; } - mCubinObjRegistry = other.mCubinObjRegistry->clone(); - return *this; + // Always prefer XQA-based MLA over FMHA-base MLA for now. + if (xqaParams.isMLA()) + { + return true; + } + int numKVHeads = xqaParams.num_kv_heads; + int batchSize = static_cast(xqaParams.batch_size); + int multiBlockCount = 1; + if (xqaParams.multi_block_mode) + { + int historyLength = xqaParams.max_past_kv_length; + // Always use at least 1 block regardless of history length + multiBlockCount = std::max(1, historyLength / kMinHistoryTokensPerBlock); + } + int blockCount = numKVHeads * batchSize * multiBlockCount; + return static_cast(blockCount) * kEnableMinBlockFactor >= static_cast(mMultiProcessorCount); } -DecoderXQARunnerResource::DecoderXQARunnerResource(void const* buffer, size_t buffer_size) - : mCubinObjRegistry(std::make_unique(buffer, buffer_size)) +jit::CubinObjKey DecoderXQARunner::getCubinObjKeyFromXQAParams(XQAParams const& xqaParams) const { + XQAKernelLoadHashKey loadKey; + loadKey.data_type = xqaParams.data_type; + loadKey.sm = mSM; + + XQAKernelRuntimeHashKey runtimeKey = getRuntimeHashKeyFromXQAParams(xqaParams, mSM); + return {loadKey, runtimeKey}; } -size_t DecoderXQARunnerResource::getSerializationSize() const noexcept +void DecoderXQARunner::prepareForActualXQAParams(XQAParams const& xqaParams) { - return mCubinObjRegistry->getSerializationSize(); + jit::CubinObjKey currentKey = getCubinObjKeyFromXQAParams(xqaParams); + + jit::CompileEngine compileEngine(mSM, xqaParams); + + auto registryGlobal = mResource->getCubinObjRegistry(); + + if (supportConfig(xqaParams, true)) + { + jit::CubinObjKey key = getCubinObjKeyFromXQAParams(xqaParams); + registryGlobal->insertCubinIfNotExists(key, &compileEngine, /*initialize=*/true); + } } -void DecoderXQARunnerResource::serialize(void* buffer, size_t buffer_size) const noexcept +#define XQA_KERNEL_RUN(DATA_TYPE) \ + runImpl(xqaParams, kvCacheBuffer, mMultiProcessorCount, stream) + +template +void DecoderXQARunner::runDispatchKVCacheBuffer( + XQAParams const& xqaParams, KVCacheBuffer const& kvCacheBuffer, cudaStream_t const& stream) { - mCubinObjRegistry->serialize(buffer, buffer_size); + if (mDataType == DATA_TYPE_FP16) + { + XQA_KERNEL_RUN(__half); + } + else + { + XQA_KERNEL_RUN(__nv_bfloat16); + } +} + +#undef XQA_KERNEL_RUN + +namespace +{ +struct SpecDecParams +{ + uint32_t qSeqLen; + uint32_t const* qCuSeqLens; // [nbReq + 1] + using MaskType = uint32_t; + MaskType const* mask; // [nbReq][qSeqLen][divUp(qSeqLen, 32)] or [qCuSeqLen[nbReq]][divUp(qSeqLen, 32)] +}; +} // namespace + +template +void DecoderXQARunner::runImpl(XQAParams const& xqaParams, KVCacheBuffer const& kvCacheBuffer, int multiprocessorCount, + cudaStream_t const& stream) const +{ + jit::CubinObjKey const key = getCubinObjKeyFromXQAParams(xqaParams); + jit::CubinObj const* const cubinObj = mResource->getCubinObjRegistry()->getCubin(key); + TLLM_CHECK(cubinObj != nullptr && cubinObj->isInitialized()); + bool const isSpecDec = xqaParams.multi_query_tokens; + bool const isSkipSoftmax = xqaParams.skip_softmax_threshold_scale_factor != 0; + bool const isHMMAKernel = (cubinObj->getKernelType() == XQAKernelType::kAMPERE_WARP_SPECIALIZED); + bool const isGMMAKernel = (cubinObj->getKernelType() == XQAKernelType::kHOPPER_WARP_SPECIALIZED); + bool const isMLAKernel = (cubinObj->getKernelType() == XQAKernelType::kSM120_MLA); + TLLM_CHECK_WITH_INFO(!isSpecDec || isGMMAKernel || isHMMAKernel + || (isMLAKernel && !xqaParams.spec_decoding_is_generation_length_variable), + "speculative decoding is available for GMMA/MLA kernel only in JIT path for now. For MLA, the input sequence " + "length must be uniform and draft tokens must be linear."); + TLLM_CHECK_DEBUG(isGMMAKernel == jit::supportConfigQGMMA(xqaParams, mSM, false)); + // @fixme: also embed these compile-time flags in cubin directly + // Whether RoPE is fused into the XQA kernel. + // * If applyRoPEInXqaKernel is true, XQA kernel applies RoPE AND performs SDPA. + // * If applyRoPEInXqaKernel is false, a separate kernel applies RoPE (see invokeQKVPreprocessing), then XQA kernel + // performs SDPA. + // In this case, xqaQInputPtr (see below) serves as the scratch space to store intermediate RoPE output. + + bool const applyRoPEInXqaKernel = jit::appliesRoPEInXqaKernel(xqaParams, isGMMAKernel); + + int numQHeads = xqaParams.num_q_heads; + int numKVHeads = xqaParams.num_kv_heads; + TLLM_CHECK_WITH_INFO(numQHeads % numKVHeads == 0, "numQHeads should be multiple of numKVHeads."); + unsigned int numQHeadsOverKV = numQHeads / numKVHeads; + unsigned int beamWidth = xqaParams.beam_width; + unsigned int batchBeamSize = xqaParams.batch_size * beamWidth; + + const KvCacheDataType cacheType = xqaParams.kv_cache_quant_mode.hasInt8KvCache() + ? KvCacheDataType::INT8 + : (xqaParams.kv_cache_quant_mode.hasFp8KvCache() ? KvCacheDataType::FP8 : KvCacheDataType::BASE); + + XQALaunchParam launchParams; + bool const isFp8Out = xqaParams.is_fp8_output; + bool const needOutputCvt = false; + void* inputScratch = nullptr; + buildXQALaunchParams(launchParams, inputScratch, needOutputCvt, xqaParams, kvCacheBuffer); + if (needOutputCvt) + { + launchParams.output = inputScratch; + } + + // NOTE: MHA kernels should read kv cache that has already been appended with new tokens' kv cache. + void* xqaQInputPtr = (applyRoPEInXqaKernel ? nullptr : inputScratch); + if (!applyRoPEInXqaKernel) + { + if (!xqaParams.isMLA()) + { + // Build cu_seqlens, padding_offset, and rotary inv freq tensors + BuildDecoderInfoParams decoderParams{}; + decoderParams.seqQOffsets = launchParams.cu_seq_lens; + decoderParams.seqQLengths = xqaParams.spec_decoding_generation_lengths; + decoderParams.seqKVLengths = xqaParams.sequence_lengths; + decoderParams.tokensInfo = launchParams.tokens_info; + decoderParams.batchSize = int(batchBeamSize); + decoderParams.maxQSeqLength = xqaParams.generation_input_length; + decoderParams.numTokens = xqaParams.total_num_input_tokens; + decoderParams.removePadding = true; + TLLM_CHECK_WITH_INFO(!xqaParams.multi_query_tokens || xqaParams.spec_decoding_generation_lengths != nullptr, + "Spec_decoding_generation_lengths must be provided."); + // Rotary embedding inv_freq buffer. + decoderParams.rotaryEmbeddingScale = xqaParams.rotary_embedding_scale; + decoderParams.rotaryEmbeddingBase = xqaParams.rotary_embedding_base; + decoderParams.rotaryEmbeddingDim = xqaParams.rotary_embedding_dim; + decoderParams.rotaryScalingType = xqaParams.rotary_embedding_scale_type; + decoderParams.rotaryEmbeddingInvFreq = launchParams.rotary_inv_freq_buf; + decoderParams.rotaryEmbeddingInvFreqCache = xqaParams.rotary_embedding_inv_freq_cache; + decoderParams.rotaryEmbeddingMaxPositions = xqaParams.rotary_embedding_max_positions; + // The rotary_embedding_inv_freq_cache for QKVPreprocessing. + // Use the xqaParams.rotary_embedding_inv_freq_cache input when the buildDecoderInfoKernel is skipped. + float const* rotaryInvFreqBuf = xqaParams.rotary_embedding_inv_freq_cache; + if (decoderParams.isBuildDecoderInfoKernelNeeded() || xqaParams.multi_query_tokens) + { + rotaryInvFreqBuf = launchParams.rotary_inv_freq_buf; + invokeBuildDecoderInfo(decoderParams, stream); + } + sync_check_cuda_error(stream); + + // The preprocessing kernel that applies RoPE and updates kv cache. + QKVPreprocessingParams preprocessingParams; + memset(&preprocessingParams, 0, sizeof(preprocessingParams)); + // Set parameters. + preprocessingParams.qkv_input = static_cast(const_cast(xqaParams.qkv)); + preprocessingParams.q_output = static_cast(xqaQInputPtr); + preprocessingParams.kv_cache_buffer = kvCacheBuffer; + preprocessingParams.kv_cache_block_scales_buffer = {}; + preprocessingParams.qkv_bias = static_cast(xqaParams.qkv_bias); + // Buffers. + preprocessingParams.logn_scaling = xqaParams.logn_scaling_ptr; + preprocessingParams.tokens_info = launchParams.tokens_info; + preprocessingParams.seq_lens = xqaParams.spec_decoding_generation_lengths; + preprocessingParams.cache_seq_lens = xqaParams.sequence_lengths; + preprocessingParams.cu_seq_lens = xqaParams.multi_query_tokens ? launchParams.cu_seq_lens : nullptr; + preprocessingParams.rotary_embedding_inv_freq = rotaryInvFreqBuf; + preprocessingParams.rotary_coef_cache_buffer = xqaParams.rotary_cos_sin; + preprocessingParams.qkv_scale_orig_quant = xqaParams.kv_scale_orig_quant; + preprocessingParams.spec_decoding_position_offsets = xqaParams.spec_decoding_position_offsets; + preprocessingParams.mrope_position_deltas = xqaParams.mrope_position_deltas; + // Scalar parameters. + preprocessingParams.batch_size = int(batchBeamSize); + preprocessingParams.max_input_seq_len = xqaParams.generation_input_length; + preprocessingParams.max_kv_seq_len = xqaParams.max_past_kv_length; + preprocessingParams.cyclic_kv_cache_len = xqaParams.cyclic_attention_window_size; + preprocessingParams.sink_token_len = xqaParams.sink_token_length; + preprocessingParams.token_num = xqaParams.total_num_input_tokens; + preprocessingParams.remove_padding = true; + preprocessingParams.cross_attention = false; + preprocessingParams.head_num = xqaParams.num_q_heads; + preprocessingParams.kv_head_num = xqaParams.num_kv_heads; + preprocessingParams.qheads_per_kv_head = xqaParams.num_q_heads / xqaParams.num_kv_heads; + preprocessingParams.size_per_head = xqaParams.head_size; + preprocessingParams.rotary_embedding_dim = xqaParams.rotary_embedding_dim; + preprocessingParams.rotary_embedding_base = xqaParams.rotary_embedding_base; + preprocessingParams.rotary_scale_type = xqaParams.rotary_embedding_scale_type; + preprocessingParams.rotary_embedding_scale = xqaParams.rotary_embedding_scale; + preprocessingParams.rotary_embedding_max_positions = xqaParams.rotary_embedding_max_positions; + preprocessingParams.position_embedding_type = xqaParams.position_embedding_type; + preprocessingParams.position_shift_enabled = xqaParams.position_shift_enabled; + preprocessingParams.cache_type = cacheType; + preprocessingParams.separate_q_kv_output = true; + preprocessingParams.quantized_fp8_output = false; + preprocessingParams.generation_phase = true; + preprocessingParams.multi_processor_count = multiprocessorCount; + preprocessingParams.rotary_vision_start = xqaParams.rotary_vision_start; + preprocessingParams.rotary_vision_length = xqaParams.rotary_vision_length; + + invokeQKVPreprocessing(preprocessingParams, stream); + sync_check_cuda_error(stream); + } + else + { + xqaQInputPtr = xqaParams.quant_q_buffer_ptr; + } + } + + auto const makeSpecDecParams = [&]() -> SpecDecParams + { + auto const qSeqLen = static_cast(xqaParams.generation_input_length); + uint32_t maxQSeqLen = xqaParams.spec_decoding_is_generation_length_variable + ? xqaParams.spec_decoding_max_generation_length + : qSeqLen; + return {.qSeqLen = maxQSeqLen, + .qCuSeqLens = reinterpret_cast(launchParams.cu_seq_lens), + .mask = reinterpret_cast(xqaParams.spec_decoding_packed_mask)}; + }; + + constexpr uint32_t kMAX_NB_KERNEL_PARAMS = 19; + uint32_t idxNextParam = 0; + void* kernelParams[kMAX_NB_KERNEL_PARAMS]; + auto appendParam = [&](auto* p) mutable + { + TLLM_CHECK(idxNextParam < kMAX_NB_KERNEL_PARAMS); + kernelParams[idxNextParam++] = const_cast(static_cast(p)); + }; + void const* const kernelInputTokens = (applyRoPEInXqaKernel ? launchParams.qkv : xqaQInputPtr); + if (isMLAKernel) + { + CUtensorMap const tensorMapQ = makeTensorMapForXqaMlaQ(mDriver, xqaParams, kernelInputTokens); + appendParam(&tensorMapQ); + CUtensorMap const tensorMapK = makeTensorMapForXqaMlaKVCache(mDriver, xqaParams, kvCacheBuffer, true); + appendParam(&tensorMapK); + CUtensorMap const tensorMapV = makeTensorMapForXqaMlaKVCache(mDriver, xqaParams, kvCacheBuffer, false); + appendParam(&tensorMapV); + appendParam(&launchParams.qScale); + appendParam(&launchParams.output); + appendParam(&launchParams.kvCacheParams); + appendParam(&launchParams.batch_size); + appendParam(&launchParams.kv_scale_quant_orig); + appendParam(&launchParams.scratch); + appendParam(&launchParams.semaphores); + uint32_t const multiBlock = computeMultiBlockCountForMLA(xqaParams, multiprocessorCount); + std::byte* const partialResults = static_cast(launchParams.scratch) + + xqaMlaCgaXBufSize * multiBlock * xqaParams.total_num_input_tokens; + appendParam(&partialResults); + kernelParams[idxNextParam] = nullptr; // one extra nullptr at end as guard. + uint32_t const inputSeqLen = (xqaParams.multi_query_tokens || xqaParams.isMLA()) + ? static_cast(xqaParams.generation_input_length) + : 1U; + dim3 const dimGrid{4 * inputSeqLen, multiBlock, xqaParams.batch_size}; + dim3 const blockDim(128 * 3, 1, 1); + cubinObj->launch(dimGrid, blockDim, stream, kernelParams); + } + else if (isSpecDec && isHMMAKernel) + { + // MultiQueryTokens (generation_input_length > 1) need extra parameters (like qSeqLen, headGrpSize, and + // mask). Input parameters for MultiQueryTokens kernels. + unsigned int headGrpSize = numQHeadsOverKV; + // Use mTileSize = 16 kernels when qSeqLen <= 16. + unsigned int qSeqLen = static_cast(xqaParams.generation_input_length); + unsigned int mTileSize = qSeqLen <= 16 ? 16 : 32; + unsigned int nbTokenBlocksPerGrp = divUp(qSeqLen * headGrpSize, mTileSize); + unsigned int maxQSeqLen = xqaParams.spec_decoding_is_generation_length_variable ? // true for ReDrafter + xqaParams.spec_decoding_max_generation_length + : qSeqLen; + + appendParam(&maxQSeqLen); + appendParam(&launchParams.num_k_heads); + appendParam(&headGrpSize); + appendParam(&launchParams.cu_seq_lens); + bool const allowSlidingWindow + = !(isSpecDec && xqaParams.is_spec_dec_tree); // sliding windows does not support spec dec with tree-based + // token, only chained tokens + if (allowSlidingWindow) + { + appendParam(&launchParams.slidingWindowSize); + } + appendParam(&launchParams.qScale); + appendParam(&launchParams.output); + if (isFp8Out && !needOutputCvt) + { + appendParam(&launchParams.rcpOutScale); + } + appendParam(&kernelInputTokens); + appendParam(&xqaParams.spec_decoding_packed_mask); + appendParam(&xqaParams.attention_sinks); + appendParam(&launchParams.kvCacheParams); + if (xqaParams.beam_width > 1) + { + appendParam(&launchParams.beamSearchParams.value()); + } + appendParam(&launchParams.batch_size); + appendParam(&launchParams.kv_scale_quant_orig); + appendParam(&launchParams.semaphores); + appendParam(&launchParams.scratch); + + uint32_t multiBlock = 1; + // if (xqaParams.multi_block_mode) + // { + // multiBlock = computeMultiBlockCount(xqaParams, xqaParams.batch_size, multiprocessorCount); + // } + auto const gridDim = (dim3{multiBlock, xqaParams.num_kv_heads * nbTokenBlocksPerGrp, xqaParams.batch_size}); + dim3 const blockDim(128, 1, 2); + + cubinObj->launch(gridDim, blockDim, stream, kernelParams); + } + else + { + appendParam(&launchParams.num_k_heads); + bool const allowSlidingWindow + = !(isSpecDec && xqaParams.is_spec_dec_tree); // sliding windows does not support spec dec with tree-based + // token, only chained tokens + if (allowSlidingWindow) + { + appendParam(&launchParams.slidingWindowSize); + } + appendParam(&launchParams.qScale); + appendParam(&launchParams.output); + if (isFp8Out && !needOutputCvt) + { + appendParam(&launchParams.rcpOutScale); + } + appendParam(&kernelInputTokens); + if (applyRoPEInXqaKernel) + { + appendParam(&launchParams.ropeCosSin); + } + appendParam(&xqaParams.attention_sinks); + appendParam(&launchParams.kvCacheParams); + if (xqaParams.beam_width > 1) + { + appendParam(&launchParams.beamSearchParams.value()); + } + appendParam(&launchParams.batch_size); + appendParam(&launchParams.kv_scale_quant_orig); + CUtensorMap tensorMap{}; + if (isGMMAKernel) + { + tensorMap = makeTensorMapForHopperXqaKVCache(mDriver, xqaParams, kvCacheBuffer); + appendParam(&tensorMap); + } + uint32_t specDecBlocks = 1; + SpecDecParams specDecParams{}; + if (isSpecDec) + { + TLLM_CHECK_WITH_INFO( + isGMMAKernel, "speculative decoding is available for GMMA kernel only in JIT path for now."); + TLLM_CHECK_DEBUG_WITH_INFO(xqaParams.max_past_kv_length + 1 <= xqaParams.cyclic_attention_window_size, + "SWA and speculative decoding cannot be used at the same time for now."); + specDecParams = makeSpecDecParams(); + appendParam(&specDecParams); + specDecBlocks = divUp(specDecParams.qSeqLen, 64 / numQHeadsOverKV); + } + if (isSkipSoftmax) + { + TLLM_CHECK_WITH_INFO(isGMMAKernel, "skip softmax is only supported for GMMA kernel for now."); + TLLM_CHECK_WITH_INFO(!isSpecDec, "skip softmax is not supported with spec dec for now."); + appendParam(&xqaParams.skip_softmax_threshold_scale_factor); +#ifdef SKIP_SOFTMAX_STAT + appendParam(&xqaParams.skip_softmax_total_blocks); + appendParam(&xqaParams.skip_softmax_skipped_blocks); +#endif + } + appendParam(&launchParams.semaphores); + appendParam(&launchParams.scratch); + kernelParams[idxNextParam] = nullptr; // one extra nullptr at end as guard. + uint32_t multiBlock = 1; + if (xqaParams.multi_block_mode) + { + if (isSpecDec && isGMMAKernel) + { + multiBlock = computeMultiBlockCountSpecDecGMMA( + xqaParams, xqaParams.batch_size, multiprocessorCount, specDecBlocks); + } + else if (!isSpecDec) + { + multiBlock = computeMultiBlockCount(xqaParams, xqaParams.batch_size, multiprocessorCount); + } + } + uint32_t const nbKVHeads = xqaParams.num_kv_heads; + auto const gridDim = (isGMMAKernel ? dim3{specDecBlocks, multiBlock, nbKVHeads * xqaParams.batch_size} + : dim3{multiBlock, nbKVHeads, xqaParams.batch_size}); + dim3 const blockDim(128, 1, isGMMAKernel ? 3 : 2); + cubinObj->launch(gridDim, blockDim, stream, kernelParams); + } + sync_check_cuda_error(stream); + + if (needOutputCvt) + { + tensorrt_llm::kernels::invokeConversion<__nv_fp8_e4m3, T>(static_cast<__nv_fp8_e4m3*>(xqaParams.output), + static_cast(launchParams.output), + xqaParams.head_size * xqaParams.num_q_heads * xqaParams.total_num_input_tokens, xqaParams.fp8_out_scale, + stream); + sync_check_cuda_error(stream); + } } } // namespace kernels diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.h b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.h index b53bd4a94e0b..7c9fc09ea5a6 100644 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.h +++ b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunner.h @@ -1,5 +1,5 @@ /* - * Copyright (c) 2020-2023, NVIDIA CORPORATION. All rights reserved. + * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. * * Licensed under the Apache License, Version 2.0 (the "License"); * you may not use this file except in compliance with the License. @@ -16,20 +16,13 @@ #pragma once -#include -#include +#include "decoderXQARunnerResource.h" -#include "tensorrt_llm/common/assert.h" #include "tensorrt_llm/common/config.h" #include "tensorrt_llm/common/cudaUtils.h" -#include "tensorrt_llm/common/quantization.h" #include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObjRegistry.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/decoderXQAImplJIT.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplPrecompiled.h" #include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/xqaParams.h" -#include "tensorrt_llm/kernels/gptKernels.h" #include "tensorrt_llm/kernels/kvCacheUtils.h" -#include "tensorrt_llm/kernels/multiHeadAttentionCommon.h" using namespace tensorrt_llm::common; @@ -38,73 +31,55 @@ TRTLLM_NAMESPACE_BEGIN namespace kernels { -template -struct XQADispatchHelper -{ - static constexpr bool CanSupport = false; -}; - -template <> -struct XQADispatchHelper<__half, KVLinearBuffer> -{ - static constexpr bool CanSupport = true; -}; - -template <> -struct XQADispatchHelper<__half, KVBlockArray> -{ - static constexpr bool CanSupport = true; -}; - -#ifdef ENABLE_BF16 -template <> -struct XQADispatchHelper<__nv_bfloat16, KVLinearBuffer> -{ - static constexpr bool CanSupport = true; -}; - -template <> -struct XQADispatchHelper<__nv_bfloat16, KVBlockArray> -{ - static constexpr bool CanSupport = true; -}; -#endif - -class DecoderXQARunnerResource; - class DecoderXQARunner { public: - DecoderXQARunner( - const XQADataType data_type, int num_heads, int num_kv_heads, int head_size, bool multi_block_mode); + DecoderXQARunner(XQADataType const dataType, int numHeads, int numKVHeads, int headSize, bool multiBlockMode); ~DecoderXQARunner(); /** * \param[in] xqaParams the xqaParams to be tested against. * \param[in] forConfigurePlugin indicates whether this method is called in configurePlugin, or in * enqueueGeneration. + * TODO: shouldUse()/prepare() should be templated with KVCacheBuffer. + * Whether it is beneficial to use this XQA codepath. */ bool shouldUse(XQAParams const& xqaParams, bool forConfigurePlugin); - - void prepare(XQAParams const& xqa_params) - { - this->prepareForRun(xqa_params); - } + // Prepares for the kernel running. Must be called before calling run. + void prepare(XQAParams const& xqaParams); template - void dispatch(XQAParams const& xqa_params, KVCacheBuffer const& kv_cache_buffer, cudaStream_t const& stream) + void dispatch(XQAParams const& xqaParams, KVCacheBuffer const& kvCacheBuffer, cudaStream_t const& stream) { sync_check_cuda_error(stream); - this->run(xqa_params, kv_cache_buffer, stream); + this->run(xqaParams, kvCacheBuffer, stream); } static std::shared_ptr getResourceGlobal(); private: - void prepareForRun(XQAParams const& xqa_params); + template + void run(XQAParams const& xqaParams, KVCacheBuffer const& kvCacheBuffer, cudaStream_t const& stream); + + //! Whether DecoderXQARunner needs to compile 2 sets (tilesize = 16, 32) kernels for spec-dec + bool needHMMASpecDec(XQAParams const& xqaParams, bool forConfigurePlugin) const; + + //! Whether DecoderXQARunner supports xqaParams. + bool supportConfig(XQAParams const& xqaParams, bool forConfigurePlugin) const; + //! Whether DecoderXQARunner has perf gain over the default (non-XQA-optimized) implementation. + bool mayHavePerfGain(XQAParams const& xqaParams) const; + + jit::CubinObjKey getCubinObjKeyFromXQAParams(XQAParams const& xqaParams) const; + + void prepareForActualXQAParams(XQAParams const& xqaParams); template - void run(XQAParams const& xqa_params, KVCacheBuffer const& kv_cache_buffer, cudaStream_t const& stream); + void runDispatchKVCacheBuffer( + XQAParams const& xqaParams, KVCacheBuffer const& kvCacheBuffer, cudaStream_t const& stream); + + template + void runImpl(XQAParams const& xqaParams, KVCacheBuffer const& kvCacheBuffer, int multiprocessorCount, + cudaStream_t const& stream) const; static constexpr int kMaxBeamWidth = 4; @@ -114,47 +89,10 @@ class DecoderXQARunner int mHeadSize; bool mMultiBlockMode; int mMultiProcessorCount; - - std::unique_ptr mJITImpl, mPrecompiledImpl; - DecoderXQAImpl* getImplFromXQAParams(XQAParams const& params, bool for_configure_plugin); - - friend DecoderXQAImplPrecompiled; - friend DecoderXQAImplJIT; -}; - -class DecoderXQARunnerResource -{ -public: - DecoderXQARunnerResource(); - DecoderXQARunnerResource(DecoderXQARunnerResource const& other); - DecoderXQARunnerResource& operator=(DecoderXQARunnerResource const& other); - DecoderXQARunnerResource(DecoderXQARunnerResource&& other) = default; - DecoderXQARunnerResource& operator=(DecoderXQARunnerResource&& other) = default; - // Construct from a serialized buffer. - DecoderXQARunnerResource(void const* buffer, size_t buffer_size); - ~DecoderXQARunnerResource() = default; - - // When initialize is true, initialize cubins. - void merge(DecoderXQARunnerResource const& other, bool initialize) - { - getCubinObjRegistry()->merge(*other.getCubinObjRegistry(), initialize); - } - - jit::CubinObjRegistry* getCubinObjRegistry() - { - return mCubinObjRegistry.get(); - } - - jit::CubinObjRegistry const* getCubinObjRegistry() const - { - return mCubinObjRegistry.get(); - } - - size_t getSerializationSize() const noexcept; - void serialize(void* buffer, size_t buffer_size) const noexcept; - -private: - std::unique_ptr mCubinObjRegistry; + std::shared_ptr mDriver; + std::shared_ptr mResource; + bool mForceXQA; + int mSM; }; } // namespace kernels diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerResource.cpp b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerResource.cpp new file mode 100644 index 000000000000..01517220b448 --- /dev/null +++ b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerResource.cpp @@ -0,0 +1,65 @@ +/* + * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. + * + * Licensed under the Apache License, Version 2.0 (the "License"); + * you may not use this file except in compliance with the License. + * You may obtain a copy of the License at + * + * http://www.apache.org/licenses/LICENSE-2.0 + * + * Unless required by applicable law or agreed to in writing, software + * distributed under the License is distributed on an "AS IS" BASIS, + * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. + * See the License for the specific language governing permissions and + * limitations under the License. + */ + +#include "decoderXQARunnerResource.h" + +#include + +#include "tensorrt_llm/common/config.h" + +TRTLLM_NAMESPACE_BEGIN + +namespace kernels +{ + +DecoderXQARunnerResource::DecoderXQARunnerResource() + : mCubinObjRegistry(std::make_unique()) +{ +} + +DecoderXQARunnerResource::DecoderXQARunnerResource(DecoderXQARunnerResource const& other) + : mCubinObjRegistry(other.mCubinObjRegistry->clone()) +{ +} + +DecoderXQARunnerResource& DecoderXQARunnerResource::operator=(DecoderXQARunnerResource const& other) +{ + if (this == &other) + { + return *this; + } + mCubinObjRegistry = other.mCubinObjRegistry->clone(); + return *this; +} + +DecoderXQARunnerResource::DecoderXQARunnerResource(void const* buffer, size_t buffer_size) + : mCubinObjRegistry(std::make_unique(buffer, buffer_size)) +{ +} + +size_t DecoderXQARunnerResource::getSerializationSize() const noexcept +{ + return mCubinObjRegistry->getSerializationSize(); +} + +void DecoderXQARunnerResource::serialize(void* buffer, size_t buffer_size) const noexcept +{ + mCubinObjRegistry->serialize(buffer, buffer_size); +} + +} // namespace kernels + +TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerResource.h b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerResource.h new file mode 100644 index 000000000000..62e3a5abab15 --- /dev/null +++ b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerResource.h @@ -0,0 +1,67 @@ +/* + * Copyright (c) 2020-2026, NVIDIA CORPORATION. All rights reserved. + * + * Licensed under the Apache License, Version 2.0 (the "License"); + * you may not use this file except in compliance with the License. + * You may obtain a copy of the License at + * + * http://www.apache.org/licenses/LICENSE-2.0 + * + * Unless required by applicable law or agreed to in writing, software + * distributed under the License is distributed on an "AS IS" BASIS, + * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied. + * See the License for the specific language governing permissions and + * limitations under the License. + */ + +#pragma once + +#include +#include + +#include "tensorrt_llm/common/config.h" +#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplJIT/cubinObjRegistry.h" + +TRTLLM_NAMESPACE_BEGIN + +namespace kernels +{ + +class DecoderXQARunnerResource +{ +public: + DecoderXQARunnerResource(); + DecoderXQARunnerResource(DecoderXQARunnerResource const& other); + DecoderXQARunnerResource& operator=(DecoderXQARunnerResource const& other); + DecoderXQARunnerResource(DecoderXQARunnerResource&& other) = default; + DecoderXQARunnerResource& operator=(DecoderXQARunnerResource&& other) = default; + // Construct from a serialized buffer. + DecoderXQARunnerResource(void const* buffer, size_t buffer_size); + ~DecoderXQARunnerResource() = default; + + // When initialize is true, initialize cubins. + void merge(DecoderXQARunnerResource const& other, bool initialize) + { + getCubinObjRegistry()->merge(*other.getCubinObjRegistry(), initialize); + } + + jit::CubinObjRegistry* getCubinObjRegistry() + { + return mCubinObjRegistry.get(); + } + + jit::CubinObjRegistry const* getCubinObjRegistry() const + { + return mCubinObjRegistry.get(); + } + + size_t getSerializationSize() const noexcept; + void serialize(void* buffer, size_t buffer_size) const noexcept; + +private: + std::unique_ptr mCubinObjRegistry; +}; + +} // namespace kernels + +TRTLLM_NAMESPACE_END diff --git a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.h b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerUtils.h similarity index 61% rename from cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.h rename to cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerUtils.h index 38b315387929..0038a47e668b 100644 --- a/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.h +++ b/cpp/tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerUtils.h @@ -13,7 +13,7 @@ * See the License for the specific language governing permissions and * limitations under the License. * - * Common utils to be shared between Precompiled and JIT implementation. + * Common utils for the JIT XQA implementation. */ #pragma once #include "decoderXQAConstants.h" @@ -36,6 +36,13 @@ TRTLLM_NAMESPACE_BEGIN namespace kernels { +enum class XQAKernelType : int32_t +{ + kAMPERE_WARP_SPECIALIZED = 0, + kHOPPER_WARP_SPECIALIZED = 1, + kSM120_MLA = 2 +}; + struct XQAKernelLoadHashKey { Data_type data_type; @@ -69,12 +76,9 @@ struct XQAKernelRuntimeHashKey bool paged_kv_cache; bool multi_query_tokens; bool is_fp8_output; - std::optional position_embedding_type; - // Rotary embedding dim (head elements RoPE is applied to). Only meaningful for the JIT path, - // where it selects between full- and partial-rotary cubins (which bake ROPE_ELEMS in). Left as - // std::nullopt for the precompiled path, whose kernels never apply RoPE in-kernel and are thus - // rotary-agnostic (RoPE handled by invokeQKVPreprocessing). - std::optional rotary_embedding_dim; + PositionEmbeddingType position_embedding_type; + // Number of head elements RoPE is applied to. A value of 0 means rotary dim is not part of this key. + int rotary_embedding_dim; bool operator==(XQAKernelRuntimeHashKey const& other) const { @@ -87,36 +91,70 @@ struct XQAKernelRuntimeHashKey } }; -uint32_t getKernelMTileSize( - uint32_t headGrpSize, bool isSpecDec, uint32_t qSeqLen, bool isXqaJit, bool supportQGMMA, bool supportMLA); +inline uint32_t getKernelMTileSize( + uint32_t headGrpSize, bool isSpecDec, uint32_t qSeqLen, bool supportQGMMA, bool supportMLA) +{ + if (!isSpecDec) + { + return headGrpSize; + } + if (supportQGMMA || supportMLA) // HMMA (mha.cu) goes to the heuristic below + { + return 64; + } + uint32_t const gemmM = qSeqLen * headGrpSize; + return gemmM < 16 ? 16 : 32; +}; -XQAKernelRuntimeHashKey getRuntimeHashKeyFromXQAParams(XQAParams const& xqaParams, bool isXqaJit, int SM); +inline XQAKernelRuntimeHashKey getRuntimeHashKeyFromXQAParams(XQAParams const& xqaParams, int SM) +{ + unsigned int headSize = xqaParams.head_size; + unsigned int numQHeads = xqaParams.num_q_heads; + unsigned int numKVHeads = xqaParams.num_kv_heads; + TLLM_CHECK_WITH_INFO(numQHeads % numKVHeads == 0, "numQHeads should be multiple of numKVHeads."); + unsigned int numQHeadsOverKV = numQHeads / numKVHeads; + unsigned int beamWidth = xqaParams.beam_width; + + unsigned int qSeqLen = static_cast(xqaParams.generation_input_length); + // MultiQueryToken kernels can support any numQHeadsOverKV that is power of 2. + unsigned int kernelNumQHeadsOverKV = xqaParams.multi_query_tokens ? 0 : numQHeadsOverKV; + bool supportQGMMA = jit::supportConfigQGMMA(xqaParams, SM, true); + bool supportMLA = jit::supportConfigMLA(xqaParams, SM, true); + unsigned int kernelMTilesize + = getKernelMTileSize(numQHeadsOverKV, xqaParams.multi_query_tokens, qSeqLen, supportQGMMA, supportMLA); + + bool const includesRotaryDim = jit::appliesRoPEInXqaKernel(xqaParams, supportQGMMA); + return {xqaParams.kv_cache_data_type, headSize, beamWidth, kernelNumQHeadsOverKV, kernelMTilesize, + xqaParams.paged_kv_cache ? static_cast(xqaParams.tokens_per_block) : 0, xqaParams.paged_kv_cache, + xqaParams.multi_query_tokens, xqaParams.is_fp8_output, xqaParams.position_embedding_type, + includesRotaryDim ? xqaParams.rotary_embedding_dim : 0}; +} struct XQAKernelRuntimeHasher { size_t operator()(XQAKernelRuntimeHashKey const& s) const { - size_t key = s.kv_data_type; - key <<= 16; // 16 - key ^= s.head_size; - key <<= 8; // 24 + size_t key = s.kv_data_type; // 6 + key <<= 6; // 12 + key ^= s.head_size / 16; + key <<= 8; // 20 key ^= s.num_q_heads_per_kv; - key <<= 8; // 32 + key <<= 8; // 28 key ^= s.beam_size; - key <<= 6; // 38 + key <<= 6; // 34 key ^= s.m_tilesize; - key <<= 10; // 48 + key <<= 10; // 44 key ^= s.tokens_per_page; - key <<= 1; // 49 + key <<= 1; // 45 key ^= s.paged_kv_cache; - key <<= 1; // 50 + key <<= 1; // 46 key ^= s.multi_query_tokens; - key <<= 1; // 51 + key <<= 1; // 47 key ^= s.is_fp8_output; - key <<= 8; - key ^= static_cast(s.position_embedding_type.value_or(static_cast(-1))); - key <<= 9; // rotary dims are <= 256; 0 distinguishes the std::nullopt (precompiled) case - key ^= static_cast(s.rotary_embedding_dim.value_or(0)); + key <<= 6; // 53 + key ^= static_cast(s.position_embedding_type); + key <<= 9; // 62; rotary dims are <= 256, 0 means not used. + key ^= static_cast(s.rotary_embedding_dim); return key; } }; @@ -129,15 +167,15 @@ struct XQAKernelFullHashKey XQAKernelFullHashKey() = default; - XQAKernelFullHashKey(XQAKernelLoadHashKey const& load_key, XQAKernelRuntimeHashKey const& runtime_key) - : load_key(load_key) - , runtime_key(runtime_key) + XQAKernelFullHashKey(XQAKernelLoadHashKey const& loadKey, XQAKernelRuntimeHashKey const& runtimeKey) + : load_key(loadKey) + , runtime_key(runtimeKey) { } - XQAKernelFullHashKey(void const* buffer, size_t buffer_size) + XQAKernelFullHashKey(void const* buffer, size_t bufferSize) { - TLLM_CHECK(sizeof(*this) <= buffer_size); + TLLM_CHECK(sizeof(*this) <= bufferSize); memcpy(this, buffer, sizeof(*this)); } @@ -151,9 +189,9 @@ struct XQAKernelFullHashKey return sizeof(*this); } - void serialize(void* buffer, size_t buffer_size) const + void serialize(void* buffer, size_t bufferSize) const { - TLLM_CHECK(sizeof(*this) <= buffer_size); + TLLM_CHECK(sizeof(*this) <= bufferSize); memcpy(buffer, this, sizeof(*this)); } }; @@ -186,10 +224,10 @@ struct KVCache // NOTE: max_num_blocks_per_sequence for paged kv cache. uint32_t capacity = 0; - KVCache(KVBlockArray& kv_cache_buffer) + KVCache(KVBlockArray& kvCacheBuffer) { - poolPtr = kv_cache_buffer.mPrimaryPoolPtr; - blockIndices = reinterpret_cast(kv_cache_buffer.data); + poolPtr = kvCacheBuffer.mPrimaryPoolPtr; + blockIndices = reinterpret_cast(kvCacheBuffer.data); } KVCache() = default; @@ -204,9 +242,9 @@ struct KVCache // NOTE: max_sequence_length for linear kv cache. uint32_t capacity = 0; - KVCache(KVLinearBuffer& kv_cache_buffer) + KVCache(KVLinearBuffer& kvCacheBuffer) { - data = kv_cache_buffer.data; + data = kvCacheBuffer.data; } KVCache() = default; @@ -249,7 +287,7 @@ struct XQALaunchParam // Setup launch params and ioScratch. ioScratch is for RoPE and output type conversion. template void buildXQALaunchParams(XQALaunchParam& launchParams, void*& inputScratch, bool hasOutputScratch, - XQAParams const& params, KVCacheBuffer kv_cache_buffer) + XQAParams const& params, KVCacheBuffer kvCacheBuffer) { TLLM_CHECK_WITH_INFO( params.data_type == DATA_TYPE_FP16 || params.data_type == DATA_TYPE_BF16 || params.data_type == DATA_TYPE_E4M3, @@ -267,41 +305,41 @@ void buildXQALaunchParams(XQALaunchParam& launchParams, void*& in launchParams.semaphores = params.semaphores; // The workspace alignment. - auto const multi_block_workspace_alignment = tensorrt_llm::common::roundUp( + auto const multiBlockWorkspaceAlignment = tensorrt_llm::common::roundUp( sizeof(half) * params.head_size * (params.num_q_heads / params.num_kv_heads) * params.beam_width, 128); // Workspace. int8_t* workspace = reinterpret_cast(params.workspaces); - unsigned int batch_beam_size = params.batch_size * params.beam_width; - const size_t cu_seqlens_size = sizeof(int) * (batch_beam_size + 1); - const size_t cu_kv_seqlens_size = sizeof(int) * (batch_beam_size + 1); - const size_t rotary_inv_freq_size = sizeof(float) * batch_beam_size * params.rotary_embedding_dim / 2; - const size_t tokens_info_size = sizeof(int2) * params.total_num_input_tokens; - const size_t kv_block_offsets_size - = sizeof(int) * batch_beam_size * 2 * params.max_blocks_per_sequence * params.num_kv_heads; - const size_t seq_lengths_size = sizeof(int) * batch_beam_size * params.num_kv_heads; + unsigned int batchBeamSize = params.batch_size * params.beam_width; + const size_t cuSeqlensSize = sizeof(int) * (batchBeamSize + 1); + const size_t cuKvSeqlensSize = sizeof(int) * (batchBeamSize + 1); + const size_t rotaryInvFreqSize = sizeof(float) * batchBeamSize * params.rotary_embedding_dim / 2; + const size_t tokensInfoSize = sizeof(int2) * params.total_num_input_tokens; + const size_t kvBlockOffsetsSize + = sizeof(int) * batchBeamSize * 2 * params.max_blocks_per_sequence * params.num_kv_heads; + const size_t seqLengthsSize = sizeof(int) * batchBeamSize * params.num_kv_heads; launchParams.cu_seq_lens = reinterpret_cast(workspace); - workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, cu_seqlens_size); + workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, cuSeqlensSize); launchParams.cu_kv_seq_lens = reinterpret_cast(workspace); - workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, cu_kv_seqlens_size); + workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, cuKvSeqlensSize); launchParams.rotary_inv_freq_buf = reinterpret_cast(workspace); - workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, rotary_inv_freq_size); + workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, rotaryInvFreqSize); launchParams.tokens_info = reinterpret_cast(workspace); - workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, tokens_info_size); + workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, tokensInfoSize); // Only used for trtllm-gen kernels. - size_t const bmm1_scale_size = sizeof(float) * 2; - size_t const bmm2_scale_size = sizeof(float); + size_t const bmm1ScaleSize = sizeof(float) * 2; + size_t const bmm2ScaleSize = sizeof(float); launchParams.bmm1_scale_ptr = reinterpret_cast(workspace); - workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, bmm1_scale_size); + workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, bmm1ScaleSize); launchParams.bmm2_scale_ptr = reinterpret_cast(workspace); - workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, bmm2_scale_size); + workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, bmm2ScaleSize); // Used for block sparse attention if (params.use_sparse_attention_gen_paged) { launchParams.sparse_kv_block_offsets = reinterpret_cast(workspace); - workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, kv_block_offsets_size); + workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, kvBlockOffsetsSize); launchParams.sparse_seq_lengths = reinterpret_cast(workspace); - workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, seq_lengths_size); + workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, seqLengthsSize); } inputScratch = workspace; if (hasOutputScratch) @@ -311,18 +349,18 @@ void buildXQALaunchParams(XQALaunchParam& launchParams, void*& in // Only used for output conversion. launchParams.output = workspace; workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, - 2 * params.head_size * params.num_q_heads * params.total_num_input_tokens, multi_block_workspace_alignment); + 2 * params.head_size * params.num_q_heads * params.total_num_input_tokens, multiBlockWorkspaceAlignment); } else { workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, - 2 * params.head_size * params.num_q_heads * params.total_num_input_tokens, multi_block_workspace_alignment); + 2 * params.head_size * params.num_q_heads * params.total_num_input_tokens, multiBlockWorkspaceAlignment); } workspace = tensorrt_llm::common::nextWorkspacePtrWithAlignment(workspace, - 2 * params.head_size * params.num_q_heads * params.total_num_input_tokens, multi_block_workspace_alignment); + 2 * params.head_size * params.num_q_heads * params.total_num_input_tokens, multiBlockWorkspaceAlignment); launchParams.scratch = reinterpret_cast(workspace); - launchParams.kvCacheParams = KVCache(kv_cache_buffer); + launchParams.kvCacheParams = KVCache(kvCacheBuffer); launchParams.kvCacheParams.sequence_lengths = params.sequence_lengths; launchParams.kvCacheParams.capacity = params.paged_kv_cache ? params.max_blocks_per_sequence : params.max_attention_window_size; @@ -363,73 +401,72 @@ std::optional getGlobalVar(std::shared_ptr{std::move(ret)}; } -inline int computeMultiBlockCount(XQAParams const& xqaParams, int batch_size, int multiprocessor_count) +inline int computeMultiBlockCount(XQAParams const& xqaParams, int batchSize, int multiprocessorCount) { auto const userSpecified = tensorrt_llm::common::getEnvXqaBlocksPerSequence(); if (userSpecified.has_value()) { return userSpecified.value(); } - int multi_block_count = 1; - int num_kv_heads = xqaParams.num_kv_heads; - int history_length = xqaParams.max_past_kv_length; + int multiBlockCount = 1; + int numKVHeads = xqaParams.num_kv_heads; + int historyLength = xqaParams.max_past_kv_length; int32_t const maxNbSubSeq = getXqaMaxNumSubSeq(xqaParams.isMLA()); - multi_block_count = history_length / kMinHistoryTokensPerBlock; + multiBlockCount = historyLength / kMinHistoryTokensPerBlock; // avoid using too many blocks for one sequence, otherwise the final reduction may dominate. - multi_block_count = std::min(multi_block_count, static_cast(std::round(std::sqrt(multi_block_count * 8.F)))); - multi_block_count = std::max(multi_block_count, 1); + multiBlockCount = std::min(multiBlockCount, static_cast(std::round(std::sqrt(multiBlockCount * 8.F)))); + multiBlockCount = std::max(multiBlockCount, 1); // adjust to kTargetWaveFactor, as already initialized using kMinHistoryTokensPerBlock, only need to decrease. - double wave_count = (double) batch_size * num_kv_heads * multi_block_count / (double) multiprocessor_count; - double adj_factor = wave_count / (double) kTargetWaveFactor; - if (adj_factor > 1.0) + double waveCount = (double) batchSize * numKVHeads * multiBlockCount / (double) multiprocessorCount; + double adjFactor = waveCount / (double) kTargetWaveFactor; + if (adjFactor > 1.0) { - multi_block_count = floor(multi_block_count / adj_factor); + multiBlockCount = floor(multiBlockCount / adjFactor); } - multi_block_count = std::max(multi_block_count, 1); + multiBlockCount = std::max(multiBlockCount, 1); // Add limitation due to reserved workspace size. // When batch_size is large, multi-block is useless anyway. So large workspace is not useful and we can set a hard // limit for workspace size (computed from maxNbSubSeq). - multi_block_count = std::max(std::min(multi_block_count, maxNbSubSeq / batch_size), 1); + multiBlockCount = std::max(std::min(multiBlockCount, maxNbSubSeq / batchSize), 1); - TLLM_CHECK_WITH_INFO(multi_block_count >= 1, "MultiBlock count should be larger than 1"); - TLLM_CHECK_WITH_INFO( - multi_block_count == 1 || batch_size * multi_block_count <= maxNbSubSeq, "Insufficient workspace"); - return multi_block_count; + TLLM_CHECK_WITH_INFO(multiBlockCount >= 1, "MultiBlock count should be larger than 1"); + TLLM_CHECK_WITH_INFO(multiBlockCount == 1 || batchSize * multiBlockCount <= maxNbSubSeq, "Insufficient workspace"); + return multiBlockCount; } -inline int computeMultiBlockCountForMLA(XQAParams const& xqaParams, int multiprocessor_count) +inline int computeMultiBlockCountForMLA(XQAParams const& xqaParams, int multiprocessorCount) { return 1; // disable multi-block for MLA kernel for now. } inline int computeMultiBlockCountSpecDecGMMA( - XQAParams const& xqaParams, int batch_size, int multiprocessor_count, int specDecBlocks) + XQAParams const& xqaParams, int batchSize, int multiprocessorCount, int specDecBlocks) { auto const userSpecified = tensorrt_llm::common::getEnvXqaBlocksPerSequence(); if (userSpecified.has_value()) { return userSpecified.value(); } - int multi_block_count = 1; + int multiBlockCount = 1; - int num_kv_heads = xqaParams.num_kv_heads; - int history_length = xqaParams.max_past_kv_length; + int numKVHeads = xqaParams.num_kv_heads; + int historyLength = xqaParams.max_past_kv_length; // skip tuning for large BS or short ISL case. - if (batch_size > 32 || history_length < 2048) + if (batchSize > 32 || historyLength < 2048) { - return multi_block_count; + return multiBlockCount; } - // gridDim = dim3{specDecBlocks, multi_block, nbKVHeads * xqaParams.batch_size} - int single_block_count = specDecBlocks * num_kv_heads * batch_size; - double wave_count = (double) single_block_count / (double) multiprocessor_count; + // gridDim = dim3{specDecBlocks, multiBlock, nbKVHeads * xqaParams.batch_size} + int singleBlockCount = specDecBlocks * numKVHeads * batchSize; + double waveCount = (double) singleBlockCount / (double) multiprocessorCount; // Multi block tuning for low CTA: populating CTAs to at most 1 wave of SMs - if (wave_count < 1) + if (waveCount < 1) { auto highestPowerof2 = [](int x) { @@ -442,52 +479,52 @@ inline int computeMultiBlockCountSpecDecGMMA( }; // calculate the maximum blocks to be populated at most 1 wave - multi_block_count = floor(multiprocessor_count / single_block_count); - // make multi_block_count a power of 2 for tuning convenience. - multi_block_count = highestPowerof2(multi_block_count); - // make multi_block_count at most 64 and at least 1. - multi_block_count = std::min(multi_block_count, 64); - multi_block_count = std::max(multi_block_count, 1); - - // tune only when original CTA is too small, multi_block_count is too big, and history length < 2^16 + multiBlockCount = floor(multiprocessorCount / singleBlockCount); + // make multiBlockCount a power of 2 for tuning convenience. + multiBlockCount = highestPowerof2(multiBlockCount); + // make multiBlockCount at most 64 and at least 1. + multiBlockCount = std::min(multiBlockCount, 64); + multiBlockCount = std::max(multiBlockCount, 1); + + // tune only when original CTA is too small, multiBlockCount is too big, and history length < 2^16 // For Hopper, most cases there are 114, 132, 144 SMs. For H20 about 78. - // single_block_count = [1..8] - // multi_block_count = [16,32,64,128] - // history_length = [1024..65536] - if (single_block_count <= 8 && multi_block_count >= 16 && history_length < 65536) + // singleBlockCount = [1..8] + // multiBlockCount = [16,32,64,128] + // historyLength = [1024..65536] + if (singleBlockCount <= 8 && multiBlockCount >= 16 && historyLength < 65536) { - if (history_length < 2048) + if (historyLength < 2048) { // for history length < 2048 and low CTA, scaling is not effective, so we set a hard limit to - // multi_block_count = 4 - multi_block_count = std::min(multi_block_count, 4); + // multiBlockCount = 4 + multiBlockCount = std::min(multiBlockCount, 4); } - else if (history_length < 65536) + else if (historyLength < 65536) { - // at single_block == 8, multi_block_count can only be 16. (SM / 8 ~= 16) + // at singleBlock == 8, multiBlockCount can only be 16. (SM / 8 ~= 16) // tune only 2048 <= kvlen < 8192 - if (single_block_count == 8 && history_length <= 8192) + if (singleBlockCount == 8 && historyLength <= 8192) { - multi_block_count >>= 1; + multiBlockCount >>= 1; } else { auto getLog2 = [](int x) { return x ? 31 - __builtin_clz(x) : -1; }; - auto history_length_log2 = getLog2(history_length); - // Adjust multi_block_count based on history length using formula: - // shift_amount = 3 - (log2(history_length) - 10) / 2 + auto historyLengthLog2 = getLog2(historyLength); + // Adjust multiBlockCount based on history length using formula: + // shift_amount = 3 - (log2(historyLength) - 10) / 2 // This gives us: - // - history_length in [2^11, 2^12): shift by 3 - // - history_length in [2^13, 2^14): shift by 2 - // - history_length in [2^15, 2^16): shift by 1 - multi_block_count >>= 3 - (history_length_log2 - 10) / 2; + // - historyLength in [2^11, 2^12): shift by 3 + // - historyLength in [2^13, 2^14): shift by 2 + // - historyLength in [2^15, 2^16): shift by 1 + multiBlockCount >>= 3 - (historyLengthLog2 - 10) / 2; } } } - TLLM_CHECK_WITH_INFO((multi_block_count * single_block_count) <= multiprocessor_count, + TLLM_CHECK_WITH_INFO((multiBlockCount * singleBlockCount) <= multiprocessorCount, "The adjusted MultiBlock exceed number of SMs, adding additional wave may result to perf drop."); } - return multi_block_count; + return multiBlockCount; } } // namespace kernels diff --git a/cpp/tensorrt_llm/kernels/xqaDispatcher.cpp b/cpp/tensorrt_llm/kernels/xqaDispatcher.cpp index 37f248687e91..1223e057a3ae 100644 --- a/cpp/tensorrt_llm/kernels/xqaDispatcher.cpp +++ b/cpp/tensorrt_llm/kernels/xqaDispatcher.cpp @@ -17,7 +17,7 @@ #include "xqaDispatcher.h" #include "tensorrt_llm/common/config.h" #include "tensorrt_llm/common/cudaUtils.h" -#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQAImplCommon.h" +#include "tensorrt_llm/kernels/decoderMaskedMultiheadAttention/decoderXQARunnerUtils.h" #include "tensorrt_llm/kernels/sparseAttentionKernels.h" #include "tensorrt_llm/kernels/unfusedAttentionKernels.h" #include