diff --git a/tensorrt_llm/_torch/models/modeling_kimi_k25.py b/tensorrt_llm/_torch/models/modeling_kimi_k25.py index a216e916df0f..8eed050eafe2 100644 --- a/tensorrt_llm/_torch/models/modeling_kimi_k25.py +++ b/tensorrt_llm/_torch/models/modeling_kimi_k25.py @@ -1517,6 +1517,11 @@ class KimiK25ForConditionalGeneration(PreTrainedModel): _LANG_PREFIX = "language_model." + @classmethod + def get_model_defaults(cls, llm_args: Any) -> dict: + """Use the C++ KV cache manager V2 by default.""" + return {"kv_cache_config": {"use_kv_cache_manager_v2": True}} + @classmethod def get_preferred_transceiver_runtime( cls,