Skip to content

scheduler: skip speculative decoding when all scheduled requests need <=1 output token - #438

Closed
malaiwah wants to merge 1526 commits into
local-inference-lab:mainfrom
malaiwah:feature/skip-spec-decode-1tok-signed
Closed

malaiwah wants to merge 1526 commits into
local-inference-lab:mainfrom
malaiwah:feature/skip-spec-decode-1tok-signed

Conversation

@malaiwah

Copy link
Copy Markdown

Supersedes #437 — same one-line-scope change, but rebased onto current main, DCO signed-off, and ruff check/ruff format clean. #437 could never go green: its commit was unsigned (signoff-commit hook) and the condition tripped ruff's "combine if statements using and" plus a format diff. Both are fixed here.

What

When a batch contains only new requests (no running ones) and every one of them
has max_tokens <= 1, set num_spec_tokens_to_schedule = 0. Speculative
decoding cannot help a 1-token output — the draft pass and verification are pure
overhead.

Why it matters

Beyond the obvious max_tokens=1 API calls, this is the shape of every
prefill-throughput benchmark and every embedding-style/classification request,
so the overhead shows up in a lot of measurements.

Measured on RTX 5090 (31.4 GiB), Qwen3.8-27B EXL3, MTP=6:

before after
1-token request latency 141 ms 127 ms
2051-token prefill bench 7445 tok/s 7635 tok/s (+2.5%)
TG on normal requests 189.8 tok/s 189.8 tok/s (unchanged)

The guard is strictly conservative: it only fires when no running request is
scheduled, so an in-flight multi-token generation can never lose its draft
tokens.

Note on CI

pre-run-check gates on a ready/verified label or an author with 4+
merged PRs, so this will sit red until a maintainer applies a label — nothing in
the diff can satisfy it. Everything within my control (DCO, ruff, format,
rebase) is green.

BabyDrangoner and others added 30 commits August 12, 2026 14:27
…P8 UE8M0 packed path to group_size 128 (vllm-project#51359)

Signed-off-by: BabyDrangoner <148877251+BabyDrangoner@users.noreply.github.com>
Signed-off-by: kiroxu <148877251+BabyDrangoner@users.noreply.github.com>
Co-authored-by: Copilot <223556219+Copilot@users.noreply.github.com>
Co-authored-by: Wentao Ye <44945378+yewentao256@users.noreply.github.com>
Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
…ce improvement (vllm-project#51311)

Signed-off-by: yewentao256 <zhyanwentao@126.com>
Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
…47808)

Signed-off-by: Lucas Wilkinson <lwilkins@redhat.com>
Signed-off-by: Lucas Wilkinson <LucasWilkinson@users.noreply.github.com>
Signed-off-by: Benjamin Chislett <chislett.ben@gmail.com>
Signed-off-by: Lucas Wilkinson <wilkinson.lucas@gmail.com>
Signed-off-by: Nick Hill <nickhill123@gmail.com>
Co-authored-by: OpenAI Codex <codex@openai.com>
Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com>
Co-authored-by: Benjamin Chislett <chislett.ben@gmail.com>
Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
Co-authored-by: Nick Hill <nickhill123@gmail.com>
Co-authored-by: OpenAI Codex <noreply@openai.com>
vllm-project#49139)

Signed-off-by: fxfxfxfxfxfxfxfx <227935476@qq.com>
Co-authored-by: Michael Goin <mgoin64@gmail.com>
Signed-off-by: Tyler Michael Smith <tlrmchlsmth@gmail.com>
…2035)

Signed-off-by: Yongye Zhu <zyy1102000@gmail.com>
Co-authored-by: Kimi Code <noreply@moonshot.ai>
Signed-off-by: yewentao256 <zhyanwentao@126.com>
Signed-off-by: Andreas Karatzas <akaratza@amd.com>
Co-authored-by: OpenAI Codex <codex@openai.com>
…cs groups instead of UNKNOWN (vllm-project#51218)

Signed-off-by: Yifan Jiang <19356972+yifjiang@users.noreply.github.com>
Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
Co-authored-by: Yifan Qiao <yifanqiao@inferact.ai>
…llm-project#51821)

Signed-off-by: Stefan Koncarevic <Stefan.Koncarevic@amd.com>
Co-authored-by: Andreas Karatzas <akaratza@amd.com>
Signed-off-by: khluu <khluu000@gmail.com>
Co-authored-by: OpenAI Codex <noreply@openai.com>
…t#51624)

Signed-off-by: Akash kaothalkar <akash.kaothalkar@ibm.com>
Co-authored-by: Akash kaothalkar <akash.kaothalkar@ibm.com>
Co-authored-by: Antigravity <antigravity@google.com>
Signed-off-by: jdebache <jdebache@nvidia.com>
…k granularity (vllm-project#51614)

Signed-off-by: Ziqi Fan <ziqif@nvidia.com>
)

Signed-off-by: Nick Hill <nickhill123@gmail.com>
Signed-off-by: Lucas Wilkinson <lwilkins@redhat.com>
Co-authored-by: OpenAI Codex <codex@openai.com>
…#52024)

Signed-off-by: simondanielsson <simon.danielsson99@hotmail.com>
Co-authored-by: Andreas Karatzas <akaratza@amd.com>
Signed-off-by: Yan Ma <yan.ma@intel.com>
Co-authored-by: Kunshang Ji <kunshang.ji@intel.com>
…ct#51772)

Signed-off-by: Yongye Zhu <zyy1102000@gmail.com>
Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com>
Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
Signed-off-by: Ovidiu Mara <ovidium@nvidia.com>
…ject#48215)

Signed-off-by: arthurgao2003 <arthurgao2003@gmail.com>
Signed-off-by: Arthur Gao <arthurgao2003@gmail.com>
Signed-off-by: 高杨懿 <15312196+gao-yangyi@user.noreply.gitee.com>
Co-authored-by: Claude Fable 5 <noreply@anthropic.com>
Co-authored-by: 高杨懿 <15312196+gao-yangyi@user.noreply.gitee.com>
Co-authored-by: OpenAI Codex <codex@openai.com>
Co-authored-by: OpenAI Codex <noreply@openai.com>
Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
Signed-off-by: kiroxu <148877251+BabyDrangoner@users.noreply.github.com>
Co-authored-by: Codex <noreply@openai.com>
…ct#50874)

Signed-off-by: tbarnatan <tbarnatan@nvidia.com>
Signed-off-by: zjy0516 <riverclouds.zhu@qq.com>
Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com>
Co-authored-by: zjy0516 <riverclouds.zhu@qq.com>
…project#51251)

Signed-off-by: hotTea <958436561@qq.com>
Signed-off-by: HMCCMH <chenminghaoscu@163.com>
Co-authored-by: HMCCMH <chenminghaoscu@163.com>
stefankoncarevic and others added 24 commits August 18, 2026 16:40
Signed-off-by: Stefan Koncarevic <stefan.koncarevic@amd.com>
…uantize_input (vllm-project#52603)

Signed-off-by: xuebwang-amd <xuebwang@amd.com>
Co-authored-by: Claude Opus 5 <noreply@anthropic.com>
Signed-off-by: Summer Yang <girasoleyang@gmail.com>
Signed-off-by: Andreas Karatzas <akaratza@amd.com>
…-project#52810)

Signed-off-by: Andreas Karatzas <Andreas.Karatzas@amd.com>
Co-authored-by: OpenAI Codex <codex@openai.com>
Signed-off-by: Andreas Karatzas <akaratza@amd.com>
Signed-off-by: Andreas Karatzas <Andreas.Karatzas@amd.com>
Co-authored-by: OpenAI Codex <codex@openai.com>
…ject#51875)

Signed-off-by: Russell Bryant <rbryant@redhat.com>
Co-authored-by: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Signed-off-by: Woosuk Kwon <woosuk@inferact.ai>
Co-authored-by: OpenAI Codex <codex@openai.com>
…ject#52842)

Signed-off-by: Thomas Parnell <tpa@zurich.ibm.com>
Signed-off-by: Kevin Luu <51931015+khluu@users.noreply.github.com>
Co-authored-by: Thomas Parnell <tpa@zurich.ibm.com>
Co-authored-by: Claude <noreply@anthropic.com>
vllm-project#52702)

Signed-off-by: Itay Etelis <itay.etelis@ibm.com>
Co-authored-by: Itay Etelis <itay.etelis@ibm.com>
Signed-off-by: zhenwei-intel <zhenwei.liu@intel.com>
Signed-off-by: Chaojun Zhang <chaojun.zhang@intel.com>
Signed-off-by: Oxygen56 <jiangth99@163.com>
Signed-off-by: mayuyuace <qiming1.zhang@intel.com>
Signed-off-by: Qiming Zhang <qiming1.zhang@intel.com>
…m-bench (vllm-project#51863)

Signed-off-by: Tyler Michael Smith <tlrmchlsmth@gmail.com>
Co-authored-by: OpenAI Codex <codex@openai.com>
Signed-off-by: Nick Hill <nickhill123@gmail.com>
Signed-off-by: mayuyuace <qiming1.zhang@intel.com>
Signed-off-by: Matthew Bonanni <mbonanni@redhat.com>
Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
…roject#52706)

Signed-off-by: Davis Wertheimer <davis.wertheimer@ibm.com>
Signed-off-by: Harry Mellor <19981378+hmellor@users.noreply.github.com>
Co-authored-by: Claude <noreply@anthropic.com>
Co-authored-by: Harry Mellor <19981378+hmellor@users.noreply.github.com>
…ath + MTP (vllm-project#46514)

Signed-off-by: Mikhail Kostryukov <mike@triptrack.net>
Co-authored-by: Claude <noreply@anthropic.com>
Co-authored-by: mergify[bot] <37929162+mergify[bot]@users.noreply.github.com>
… ≤1 output token

When scheduled_new_reqs is non-empty, scheduled_running_reqs is empty, and
every new request has max_tokens <= 1, set num_spec_tokens_to_schedule = 0.
Speculative decoding is useless for 1-token outputs; draft generation +
verification adds measurable latency.

Measured on RTX 5090 (31.4 GB), MTP=6:
  - 1-token-prompt request latency 141ms→127ms (−14ms)
  - 2000-token prefill benchmark +2.5% (7445→7635 tok/s)
  - TG for normal requests unchanged (189.8 tok/s)

(cherry picked from commit 43e8693)
Signed-off-by: Michel Belleau <michel.belleau@malaiwah.com>
@coderabbitai

coderabbitai Bot commented Aug 19, 2026

Copy link
Copy Markdown

Important

Review skipped

Too many files!

This PR contains 2995 files, which is 2895 over the limit of 100.

To get a review, reduce the PR to 100 files or fewer by splitting it into smaller PRs or changing its base branch.

Upgrade to a paid plan to raise the limit.

Usage-priced reviews support at most 300 files.

⚙️ Run configuration

Configuration used: Organization UI

Review profile: CHILL

Plan: Pro Plus

Run ID: 1553dbb5-b6c7-4b16-b596-53640ec2132e

📥 Commits

Reviewing files that changed from the base of the PR and between e12b91b and 993d3d3.

⛔ Files ignored due to path filters (5)
  • docs/assets/benchmarking/latency-metrics-speculative-decoding-dark.svg is excluded by !**/*.svg
  • docs/assets/benchmarking/latency-metrics-speculative-decoding-light.svg is excluded by !**/*.svg
  • docs/assets/contributing/dockerfile-stages-dependency.png is excluded by !**/*.png
  • rust/Cargo.lock is excluded by !**/*.lock
  • tests/multimodal/assets/unsupported_8k_h264.mp4 is excluded by !**/*.mp4
📒 Files selected for processing (2995)
  • .buildkite/amd-disagg/cluster.sh
  • .buildkite/amd-disagg/models.yaml
  • .buildkite/amd-disagg/pipeline-disagg.yaml
  • .buildkite/amd-disagg/run-slurm-disagg-test.sh
  • .buildkite/amd-disagg/run_xPyD_disagg.slurm
  • .buildkite/amd-disagg/vllm_disagg.sh
  • .buildkite/check-torch-abi.py
  • .buildkite/ci_config.yaml
  • .buildkite/ci_config_rocm.yaml
  • .buildkite/hardware_tests/amd.yaml
  • .buildkite/hardware_tests/cpu.yaml
  • .buildkite/hardware_tests/intel_xpu_ci/test-intel.yaml
  • .buildkite/image_build/image_build.sh
  • .buildkite/image_build/image_build_arm64.sh
  • .buildkite/image_build/image_build_cpu.sh
  • .buildkite/image_build/image_build_torch_nightly.sh
  • .buildkite/intel_jobs/basic_correctness.yaml
  • .buildkite/intel_jobs/benchmarks_intel.yaml
  • .buildkite/intel_jobs/engine_intel.yaml
  • .buildkite/intel_jobs/kernels_intel.yaml
  • .buildkite/intel_jobs/lora_intel.yaml
  • .buildkite/intel_jobs/misc_intel.yaml
  • .buildkite/intel_jobs/model_executor_intel.yaml
  • .buildkite/intel_jobs/model_runner_v2_intel.yaml
  • .buildkite/intel_jobs/models_distributed_intel.yaml
  • .buildkite/intel_jobs/models_multimodal_intel.yaml
  • .buildkite/intel_jobs/quantization.yaml
  • .buildkite/intel_jobs/samplers_intel.yaml
  • .buildkite/intel_jobs/test-intel.yaml
  • .buildkite/lm-eval-harness/configs/Meta-Llama-4-Maverick-17B-128E-Instruct-FP8.yaml
  • .buildkite/lm-eval-harness/test_lm_eval_correctness.py
  • .buildkite/performance-benchmarks/tests/serving-tests.json
  • .buildkite/release-pipeline.yaml
  • .buildkite/scripts/annotate-build-artifact.sh
  • .buildkite/scripts/build-macos-wheel.sh
  • .buildkite/scripts/check-ray-compatibility.sh
  • .buildkite/scripts/ci-bake-rocm.sh
  • .buildkite/scripts/generate-and-upload-nightly-index.sh
  • .buildkite/scripts/generate-nightly-index.py
  • .buildkite/scripts/hardware_ci/run-amd-test.sh
  • .buildkite/scripts/hardware_ci/run-cpu-compatibility-test.sh
  • .buildkite/scripts/hardware_ci/run-cpu-test-arm.sh
  • .buildkite/scripts/hardware_ci/run-gh200-test.sh
  • .buildkite/scripts/hardware_ci/run-intel-ci-test.sh
  • .buildkite/scripts/hardware_ci/run-intel-test.sh
  • .buildkite/scripts/install-kv-connectors.sh
  • .buildkite/scripts/publish-release-images.sh
  • .buildkite/scripts/rocm/build-ci-base.sh
  • .buildkite/scripts/rocm/build-test-image.sh
  • .buildkite/scripts/rocm/refresh-base-image.sh
  • .buildkite/scripts/rocm/smoke-test-image.sh
  • .buildkite/scripts/run-rust-frontend-cargo-ci.sh
  • .buildkite/scripts/trigger-ci-build.sh
  • .buildkite/scripts/upload-nightly-wheels.sh
  • .buildkite/scripts/upload-rocm-wheels.sh
  • .buildkite/scripts/xpu/create-xpu-ecr-manifest.sh
  • .buildkite/scripts/xpu/publish-triton-shim.sh
  • .buildkite/scripts/xpu/push-nightly-builds-xpu.sh
  • .buildkite/test-amd.yaml
  • .buildkite/test_areas/attention.yaml
  • .buildkite/test_areas/basic_correctness.yaml
  • .buildkite/test_areas/benchmarks.yaml
  • .buildkite/test_areas/compile.yaml
  • .buildkite/test_areas/cuda.yaml
  • .buildkite/test_areas/disaggregated.yaml
  • .buildkite/test_areas/disaggregated_mooncake.yaml
  • .buildkite/test_areas/distributed.yaml
  • .buildkite/test_areas/docker.yaml
  • .buildkite/test_areas/e2e_integration.yaml
  • .buildkite/test_areas/engine.yaml
  • .buildkite/test_areas/entrypoints.yaml
  • .buildkite/test_areas/expert_parallelism.yaml
  • .buildkite/test_areas/fault_tolerance.yaml
  • .buildkite/test_areas/jit_monitor.yaml
  • .buildkite/test_areas/kernels.yaml
  • .buildkite/test_areas/lm_eval.yaml
  • .buildkite/test_areas/lora.yaml
  • .buildkite/test_areas/misc.yaml
  • .buildkite/test_areas/model_executor.yaml
  • .buildkite/test_areas/model_runner_v2.yaml
  • .buildkite/test_areas/models_basic.yaml
  • .buildkite/test_areas/models_distributed.yaml
  • .buildkite/test_areas/models_language.yaml
  • .buildkite/test_areas/models_multimodal.yaml
  • .buildkite/test_areas/plugins.yaml
  • .buildkite/test_areas/pytorch.yaml
  • .buildkite/test_areas/quantization.yaml
  • .buildkite/test_areas/ray_compat.yaml
  • .buildkite/test_areas/rust_frontend.yaml
  • .buildkite/test_areas/rust_frontend_cargo.yaml
  • .buildkite/test_areas/samplers.yaml
  • .buildkite/test_areas/spec_decode.yaml
  • .buildkite/test_areas/torch_abi.yaml
  • .buildkite/test_areas/weight_loading.yaml
  • .dockerignore
  • .github/CODEOWNERS
  • .github/mergify.yml
  • .github/workflows/add_label_automerge.yml
  • .github/workflows/buf.yml
  • .github/workflows/issue_autolabel.yml
  • .github/workflows/new_pr_bot.yml
  • .github/workflows/notify-ci-authorized.yml
  • .github/workflows/pre-commit.yml
  • .github/workflows/record-ci-approval.yml
  • .github/workflows/run-ci-command.yml
  • .github/workflows/scripts/run_ci_command.py
  • .github/workflows/scripts/test_run_ci_command.py
  • .gitignore
  • .markdownlint.yaml
  • .pre-commit-config.yaml
  • .yapfignore
  • CMakeLists.txt
  • README.md
  • benchmarks/attention_benchmarks/benchmark.py
  • benchmarks/attention_benchmarks/common.py
  • benchmarks/attention_benchmarks/configs/mla_sparse_masked_mha_vs_mqa.yaml
  • benchmarks/attention_benchmarks/configs/mla_sparse_mha_vs_mqa.yaml
  • benchmarks/attention_benchmarks/mla_runner.py
  • benchmarks/kernels/bench_cp_gather_fp8.py
  • benchmarks/kernels/benchmark_cp_gather.py
  • benchmarks/kernels/benchmark_fused_q_cutedsl.py
  • benchmarks/kernels/benchmark_inkling_qkvr_prep.py
  • benchmarks/kernels/benchmark_k3_cutedsl_residual.py
  • benchmarks/kernels/benchmark_kimi_k3_gemm_rs.py
  • benchmarks/kernels/benchmark_kimi_k3_kda_decode.py
  • benchmarks/kernels/benchmark_kimi_k3_latent_moe_tail.py
  • benchmarks/kernels/benchmark_kimi_k3_sp_collectives.py
  • benchmarks/kernels/benchmark_moe.py
  • benchmarks/kernels/benchmark_rdna_hybrid_w4a16_gemm.py
  • benchmarks/kernels/benchmark_relu_squared.py
  • benchmarks/kernels/benchmark_selective_state_update.py
  • benchmarks/kernels/benchmark_thinking_budget.py
  • benchmarks/kernels/benchmark_vit_aiter_fp8_attn.py
  • benchmarks/kernels/cpu/benchmark_cpu_attn.py
  • benchmarks/replayssm/e2e_decode_speedup.py
  • cmake/cpu_extension.cmake
  • cmake/external_projects/deepgemm.cmake
  • cmake/external_projects/flashkda.cmake
  • cmake/external_projects/flashmla.cmake
  • cmake/external_projects/fmha_sm100.cmake
  • cmake/external_projects/qutlass.cmake
  • cmake/external_projects/tml_fa4.cmake
  • cmake/external_projects/triton_kernels.cmake
  • cmake/external_projects/vllm_flash_attn.cmake
  • cmake/patches/pytorch_stable_string.patch
  • cmake/utils.cmake
  • csrc/cache.h
  • csrc/core/scalar_type.hpp
  • csrc/cpu/cpu_arch_macros.h
  • csrc/cpu/cpu_attn.cpp
  • csrc/cpu/cpu_attn_fp8.hpp
  • csrc/cpu/cpu_attn_vec.hpp
  • csrc/cpu/cpu_fused_moe.cpp
  • csrc/cpu/cpu_fused_moe_activations.hpp
  • csrc/cpu/cpu_fused_moe_int8.cpp
  • csrc/cpu/cpu_types_arm.hpp
  • csrc/cpu/cpu_types_riscv_impl.hpp
  • csrc/cpu/cpu_types_scalar.hpp
  • csrc/cpu/cpu_types_vsx.hpp
  • csrc/cpu/cpu_types_vxe.hpp
  • csrc/cpu/cpu_types_x86.hpp
  • csrc/cpu/mamba_cpu.cpp
  • csrc/cpu/mamba_kernels.hpp
  • csrc/cpu/micro_gemm/cpu_micro_gemm_impl.hpp
  • csrc/cpu/micro_gemm/cpu_micro_gemm_int8_neon.hpp
  • csrc/cpu/micro_gemm/cpu_micro_gemm_neon.hpp
  • csrc/cpu/micro_gemm/cpu_micro_gemm_vec.hpp
  • csrc/cpu/micro_gemm/cpu_micro_gemm_vsx.hpp
  • csrc/cpu/mla_decode.cpp
  • csrc/cpu/sgl-kernels/bmm.cpp
  • csrc/cpu/sgl-kernels/common.h
  • csrc/cpu/sgl-kernels/conv.cpp
  • csrc/cpu/sgl-kernels/decode.cpp
  • csrc/cpu/sgl-kernels/extend.cpp
  • csrc/cpu/sgl-kernels/fla.cpp
  • csrc/cpu/sgl-kernels/flash_attn.h
  • csrc/cpu/sgl-kernels/gemm.cpp
  • csrc/cpu/sgl-kernels/gemm.h
  • csrc/cpu/sgl-kernels/gemm_fp8.cpp
  • csrc/cpu/sgl-kernels/mla_cache.cpp
  • csrc/cpu/sgl-kernels/moe.cpp
  • csrc/cpu/sgl-kernels/moe.h
  • csrc/cpu/sgl-kernels/moe_fp8.cpp
  • csrc/cpu/sgl-kernels/moe_int8.cpp
  • csrc/cpu/sgl-kernels/vec.h
  • csrc/cpu/torch_bindings.cpp
  • csrc/cpu/utils.hpp
  • csrc/cumem_allocator.cpp
  • csrc/custom_all_gather_reduce_scatter.cuh
  • csrc/custom_all_reduce.cuh
  • csrc/custom_collective_common.cuh
  • csrc/flashkda_registration.cpp
  • csrc/fs_io.cpp
  • csrc/libtorch_stable/activation_kernels.cu
  • csrc/libtorch_stable/attention/dcp_utils/dcp_direct_a2a_lse_reduce.cu
  • csrc/libtorch_stable/attention/dcp_utils/dcp_direct_common.cuh
  • csrc/libtorch_stable/attention/dcp_utils/dcp_direct_kv_gather.cu
  • csrc/libtorch_stable/attention/dcp_utils/dcp_direct_q_gather.cu
  • csrc/libtorch_stable/attention/merge_attn_states.cu
  • csrc/libtorch_stable/cache_kernels.cu
  • csrc/libtorch_stable/cooperative_topk.cuh
  • csrc/libtorch_stable/custom_all_gather_reduce_scatter.cu
  • csrc/libtorch_stable/custom_all_gather_reduce_scatter_ops.cpp
  • csrc/libtorch_stable/custom_all_reduce.cu
  • csrc/libtorch_stable/dispatch_utils.h
  • csrc/libtorch_stable/dsv3_fused_a_gemm.cu
  • csrc/libtorch_stable/fp32_router_gemm.cu
  • csrc/libtorch_stable/fp32_router_gemm_entry.cu
  • csrc/libtorch_stable/fused_kimi_k3_mla_key_concat_kv_cache_kernel.cu
  • csrc/libtorch_stable/fused_minimax_m3_qknorm_rope_kv_insert_kernel.cu
  • csrc/libtorch_stable/gdn/fused_gdn_decode_kernel.cu
  • csrc/libtorch_stable/kimi_k3/attn_res_kernel.cu
  • csrc/libtorch_stable/kimi_k3/fused_kda_decode_kernel.cu
  • csrc/libtorch_stable/kimi_k3/fused_kda_decode_kernel_rocm.cu
  • csrc/libtorch_stable/layernorm_kernels.cu
  • csrc/libtorch_stable/layernorm_quant_kernels.cu
  • csrc/libtorch_stable/moe/grouped_topk_kernels.cu
  • csrc/libtorch_stable/moe/moeTopKFuncs.cuh
  • csrc/libtorch_stable/moe/moe_align_sum_kernels.cu
  • csrc/libtorch_stable/moe/moe_ops.h
  • csrc/libtorch_stable/moe/topk_softmax_kernels.cu
  • csrc/libtorch_stable/moe/topk_softplus_sqrt_kernels.cu
  • csrc/libtorch_stable/moe/torch_bindings.cpp
  • csrc/libtorch_stable/ngram_embedding_kernels.cu
  • csrc/libtorch_stable/nvfp4_kv_cache_kernels.cu
  • csrc/libtorch_stable/ops.h
  • csrc/libtorch_stable/persistent_topk.cuh
  • csrc/libtorch_stable/quantization/awq/gemm_kernels.cu
  • csrc/libtorch_stable/quantization/fp4/nvfp4_blockwise_moe_kernel.cu
  • csrc/libtorch_stable/quantization/fp4/nvfp4_quant_kernels.cu
  • csrc/libtorch_stable/quantization/fused_kernels/fused_layernorm_dynamic_per_token_quant.cu
  • csrc/libtorch_stable/quantization/fused_kernels/quant_conversions.cuh
  • csrc/libtorch_stable/quantization/marlin/marlin_int4_fp8_preprocess.cu
  • csrc/libtorch_stable/torch_bindings.cpp
  • csrc/ops.h
  • csrc/quantization/w8a8/fp8/nvidia/quant_utils.cuh
  • csrc/quickreduce/base.h
  • csrc/quickreduce/quick_reduce.h
  • csrc/rocm/attention.cu
  • csrc/rocm/ops.h
  • csrc/rocm/skinny_gemms_int4.cu
  • csrc/rocm/torch_bindings.cpp
  • csrc/spinloop.cpp
  • docker/Dockerfile
  • docker/Dockerfile.cpu
  • docker/Dockerfile.rocm
  • docker/Dockerfile.rocm_base
  • docker/Dockerfile.rocm_base_gfx1250
  • docker/Dockerfile.rocm_gfx1250
  • docker/Dockerfile.s390x
  • docker/Dockerfile.xpu
  • docker/ci-rocm.hcl
  • docker/docker-bake-rocm.hcl
  • docker/versions.json
  • docs/.nav.yml
  • docs/benchmarking/README.md
  • docs/benchmarking/cli.md
  • docs/cli/.nav.yml
  • docs/cli/bench/latency.md
  • docs/cli/bench/mm_processor.md
  • docs/cli/bench/serve.md
  • docs/cli/bench/sweep/plot.md
  • docs/cli/bench/sweep/plot_pareto.md
  • docs/cli/bench/sweep/serve.md
  • docs/cli/bench/sweep/serve_workload.md
  • docs/cli/bench/throughput.md
  • docs/cli/chat.md
  • docs/cli/complete.md
  • docs/cli/json_tip.inc.md
  • docs/cli/launch/render.md
  • docs/cli/run-batch.md
  • docs/cli/serve.md
  • docs/configuration/engine_args.md
  • docs/configuration/env_vars.md
  • docs/configuration/serve_args.md
  • docs/contributing/README.md
  • docs/contributing/ci/nightly_builds.md
  • docs/contributing/ci/update_pytorch_version.md
  • docs/contributing/dockerfile/dockerfile.md
  • docs/contributing/jit_kernel_warmup.md
  • docs/contributing/model/transcription.md
  • docs/contributing/profiling.md
  • docs/deployment/docker.md
  • docs/deployment/frameworks/crusoe.md
  • docs/deployment/integrations/llm-d.md
  • docs/deployment/k8s.md
  • docs/design/attention_backends.md
  • docs/design/cuda_graphs_multimodal.md
  • docs/design/custom_op.md
  • docs/design/fused_moe_modular_kernel.md
  • docs/design/fusions.md
  • docs/design/metrics.md
  • docs/design/mm_processing.md
  • docs/design/model_runner_v2.md
  • docs/design/moe_kernel_features.md
  • docs/design/nixl_kv_cache_lease.md
  • docs/design/nixl_kv_push_connector.md
  • docs/features/batch_invariance.md
  • docs/features/disagg_prefill.md
  • docs/features/kv_offloading_usage.md
  • docs/features/mooncake_connector_usage.md
  • docs/features/mooncake_store_connector_usage.md
  • docs/features/multimodal_inputs.md
  • docs/features/nixl_connector_compatibility.md
  • docs/features/nixl_connector_usage.md
  • docs/features/quantization/b12x.md
  • docs/features/quantization/bnb.md
  • docs/features/quantization/fp8_vit_attn.md
  • docs/features/quantization/modelopt.md
  • docs/features/quantization/online.md
  • docs/features/quantization/quantized_kvcache.md
  • docs/features/reasoning_outputs.md
  • docs/features/sleep_mode.md
  • docs/features/speculative_decoding/README.md
  • docs/features/speculative_decoding/adaptive_verification.md
  • docs/features/speculative_decoding/draft_model.md
  • docs/features/speculative_decoding/mlp.md
  • docs/features/speculative_decoding/n_gram.md
  • docs/getting_started/installation/cpu.arm.inc.md
  • docs/getting_started/installation/cpu.md
  • docs/getting_started/installation/cpu.s390x.inc.md
  • docs/getting_started/installation/cpu.x86.inc.md
  • docs/getting_started/installation/gpu.cuda.inc.md
  • docs/getting_started/installation/gpu.rocm.inc.md
  • docs/getting_started/installation/gpu.xpu.inc.md
  • docs/getting_started/quickstart.md
  • docs/governance/committers.md
  • docs/governance/process.md
  • docs/mkdocs/gen_files/generate_argparse.py
  • docs/mkdocs/gen_files/generate_attention_backends.py
  • docs/mkdocs/gen_files/generate_examples.py
  • docs/mkdocs/gen_files/generate_metrics.py
  • docs/mkdocs/gen_files/generated_content.py
  • docs/mkdocs/hooks/url_schemes.py
  • docs/mkdocs/javascript/reo.js
  • docs/mkdocs/overrides/main.html
  • docs/models/hardware_supported_models/cpu.md
  • docs/models/hardware_supported_models/xpu.md
  • docs/models/pooling_models/README.md
  • docs/models/pooling_models/embed.md
  • docs/models/pooling_models/scoring.md
  • docs/models/pooling_models/specific_models.md
  • docs/models/pooling_models/token_classify.md
  • docs/models/supported_models.md
  • docs/pre_run_check.sh
  • docs/serving/expert_parallel_deployment.md
  • docs/serving/offline_inference.md
  • docs/serving/online_serving/README.md
  • docs/serving/online_serving/derenderer.md
  • docs/serving/online_serving/openai_compatible_server.md
  • docs/serving/online_serving/renderer.md
  • docs/serving/online_serving/speech_to_text.md
  • docs/training/async_rl.md
  • docs/training/sampling_mask.md
  • docs/training/weight_transfer/README.md
  • docs/training/weight_transfer/base.md
  • docs/training/weight_transfer/ipc.md
  • docs/training/weight_transfer/nccl.md
  • docs/usage/metrics.md
  • docs/usage/security.md
  • docs/usage/v1_guide.md
  • examples/deployment/chart-helm/Chart.yaml
  • examples/deployment/chart-helm/templates/_helpers.tpl
  • examples/deployment/chart-helm/templates/deployment.yaml
  • examples/deployment/chart-helm/templates/hpa.yaml
  • examples/deployment/chart-helm/templates/service.yaml
  • examples/deployment/chart-helm/tests/deployment_test.yaml
  • examples/deployment/chart-helm/tests/hpa_test.yaml
  • examples/deployment/chart-helm/tests/service_test.yaml
  • examples/deployment/chart-helm/values.schema.json
  • examples/disaggregated/disaggregated_encoder/disagg_1e1pd_example.sh
  • examples/disaggregated/disaggregated_encoder/disagg_epd_proxy.py
  • examples/disaggregated/disaggregated_serving/moriio_toy_proxy_server.py
  • examples/features/kv_events/kv_events_subscriber.py
  • examples/features/lora/lora_with_quantization_offline.py
  • examples/generate/multimodal/vision_language_multi_image_offline.py
  • examples/generate/multimodal/vision_language_offline.py
  • examples/rl/rlhf_async_new_apis.py
  • examples/rl/rlhf_http_ipc.py
  • examples/rl/rlhf_http_nccl.py
  • examples/rl/rlhf_ipc.py
  • examples/rl/rlhf_ipc_fsdp_ep.py
  • examples/rl/rlhf_nccl.py
  • examples/rl/rlhf_nccl_fsdp_ep.py
  • examples/rl/rlhf_sparse_nccl.py
  • examples/tool_chat_template_muse_glimmer.jinja
  • mkdocs.yaml
  • pyproject.toml
  • requirements/build/cpu.txt
  • requirements/build/cuda.txt
  • requirements/build/rust.txt
  • requirements/build/tpu.txt
  • requirements/common.txt
  • requirements/cpu.txt
  • requirements/cuda.txt
  • requirements/kv_connectors.txt
  • requirements/rocm.txt
  • requirements/test/cpu.txt
  • requirements/test/cuda.in
  • requirements/test/cuda.txt
  • requirements/test/nightly-torch.txt
  • requirements/test/rocm.in
  • requirements/test/rocm.txt
  • requirements/test/xpu.in
  • requirements/test/xpu.txt
  • requirements/tpu.txt
  • requirements/xpu.txt
  • rust/.config/nextest.toml
  • rust/Cargo.toml
  • rust/README.md
  • rust/proto/README.md
  • rust/proto/buf.md
  • rust/proto/buf.yaml
  • rust/proto/control.proto
  • rust/proto/inference.proto
  • rust/src/bench/AGENTS.md
  • rust/src/bench/CLAUDE.md
  • rust/src/bench/Cargo.toml
  • rust/src/bench/README.md
  • rust/src/bench/src/backends/mod.rs
  • rust/src/bench/src/backends/openai_chat.rs
  • rust/src/bench/src/backends/openai_completions.rs
  • rust/src/bench/src/backends/pooling.rs
  • rust/src/bench/src/backends/streaming.rs
  • rust/src/bench/src/benchmark.rs
  • rust/src/bench/src/cli.rs
  • rust/src/bench/src/compare.rs
  • rust/src/bench/src/config.rs
  • rust/src/bench/src/datasets/custom.rs
  • rust/src/bench/src/datasets/hf_dataset.rs
  • rust/src/bench/src/datasets/mod.rs
  • rust/src/bench/src/datasets/multi_turn.rs
  • rust/src/bench/src/datasets/prefix_repetition.rs
  • rust/src/bench/src/datasets/progress.rs
  • rust/src/bench/src/datasets/random.rs
  • rust/src/bench/src/datasets/random_mm.rs
  • rust/src/bench/src/datasets/random_rerank.rs
  • rust/src/bench/src/datasets/sharegpt.rs
  • rust/src/bench/src/datasets/sonnet.rs
  • rust/src/bench/src/datasets/sonnet.txt
  • rust/src/bench/src/datasets/speed_bench.rs
  • rust/src/bench/src/error.rs
  • rust/src/bench/src/hub.rs
  • rust/src/bench/src/lib.rs
  • rust/src/bench/src/main.rs
  • rust/src/bench/src/metrics/calculator.rs
  • rust/src/bench/src/metrics/mod.rs
  • rust/src/bench/src/metrics/steady_state.rs
  • rust/src/bench/src/multi_run.rs
  • rust/src/bench/src/multi_turn.rs
  • rust/src/bench/src/output/console.rs
  • rust/src/bench/src/output/json.rs
  • rust/src/bench/src/output/mod.rs
  • rust/src/bench/src/rate_control.rs
  • rust/src/bench/src/ready_checker.rs
  • rust/src/bench/src/sweep.rs
  • rust/src/bench/src/tiktoken.rs
  • rust/src/bench/src/tokenizer.rs
  • rust/src/build-info/Cargo.toml
  • rust/src/build-info/src/lib.rs
  • rust/src/chat/Cargo.toml
  • rust/src/chat/examples/external_engine_chat_qwen.rs
  • rust/src/chat/src/backend/hf.rs
  • rust/src/chat/src/backend/mod.rs
  • rust/src/chat/src/error.rs
  • rust/src/chat/src/event.rs
  • rust/src/chat/src/lib.rs
  • rust/src/chat/src/multimodal.rs
  • rust/src/chat/src/multimodal/audio.rs
  • rust/src/chat/src/multimodal/expand.rs
  • rust/src/chat/src/multimodal/image.rs
  • rust/src/chat/src/multimodal/item.rs
  • rust/src/chat/src/multimodal/tensor.rs
  • rust/src/chat/src/multimodal/video.rs
  • rust/src/chat/src/output/default/mod.rs
  • rust/src/chat/src/output/default/structural_tag.rs
  • rust/src/chat/src/output/default/unified.rs
  • rust/src/chat/src/output/harmony/mod.rs
  • rust/src/chat/src/output/harmony/tests.rs
  • rust/src/chat/src/output/mod.rs
  • rust/src/chat/src/output/structured.rs
  • rust/src/chat/src/parser/mod.rs
  • rust/src/chat/src/parser/reasoning/mod.rs
  • rust/src/chat/src/parser/reasoning/tests.rs
  • rust/src/chat/src/parser/tool/mod.rs
  • rust/src/chat/src/parser/tool/tests.rs
  • rust/src/chat/src/parser/unified.rs
  • rust/src/chat/src/renderer/deepseek_v32/encoding.rs
  • rust/src/chat/src/renderer/deepseek_v32/fixtures/test_input_developer_tools.json
  • rust/src/chat/src/renderer/deepseek_v32/fixtures/test_output_developer_tools.txt
  • rust/src/chat/src/renderer/deepseek_v32/mod.rs
  • rust/src/chat/src/renderer/deepseek_v32/tests.rs
  • rust/src/chat/src/renderer/deepseek_v4/encoding.rs
  • rust/src/chat/src/renderer/deepseek_v4/fixtures/test_input_developer_tools.json
  • rust/src/chat/src/renderer/deepseek_v4/fixtures/test_output_developer_tools.txt
  • rust/src/chat/src/renderer/deepseek_v4/mod.rs
  • rust/src/chat/src/renderer/deepseek_v4/tests.rs
  • rust/src/chat/src/renderer/harmony/encoding.rs
  • rust/src/chat/src/renderer/harmony/mod.rs
  • rust/src/chat/src/renderer/harmony/tests.rs
  • rust/src/chat/src/renderer/hf/error.rs
  • rust/src/chat/src/renderer/hf/format.rs
  • rust/src/chat/src/renderer/hf/mod.rs
  • rust/src/chat/src/renderer/hf/template.rs
  • rust/src/chat/src/renderer/hf/tojson.rs
  • rust/src/chat/src/renderer/hf/value.rs
  • rust/src/chat/src/renderer/inkling/fixtures/text_audio_input.json
  • rust/src/chat/src/renderer/inkling/fixtures/text_audio_output.txt
  • rust/src/chat/src/renderer/inkling/fixtures/text_image_input.json
  • rust/src/chat/src/renderer/inkling/fixtures/text_image_output.txt
  • rust/src/chat/src/renderer/inkling/fixtures/tool_declare_input.json
  • rust/src/chat/src/renderer/inkling/fixtures/tool_declare_output.txt
  • rust/src/chat/src/renderer/inkling/fixtures/tool_round_trip_input.json
  • rust/src/chat/src/renderer/inkling/fixtures/tool_round_trip_output.txt
  • rust/src/chat/src/renderer/inkling/mod.rs
  • rust/src/chat/src/renderer/inkling/tests.rs
  • rust/src/chat/src/renderer/kimi_k3/encoding.rs
  • rust/src/chat/src/renderer/kimi_k3/fixtures/controls_thinking_off_input.json
  • rust/src/chat/src/renderer/kimi_k3/fixtures/controls_thinking_off_output.txt
  • rust/src/chat/src/renderer/kimi_k3/fixtures/dynamic_only_tool_declare_input.json
  • rust/src/chat/src/renderer/kimi_k3/fixtures/dynamic_only_tool_declare_output.txt
  • rust/src/chat/src/renderer/kimi_k3/fixtures/dynamic_system_tool_declare_input.json
  • rust/src/chat/src/renderer/kimi_k3/fixtures/dynamic_system_tool_declare_output.txt
  • rust/src/chat/src/renderer/kimi_k3/fixtures/history_preserve_and_image_input.json
  • rust/src/chat/src/renderer/kimi_k3/fixtures/history_preserve_and_image_output.txt
  • rust/src/chat/src/renderer/kimi_k3/fixtures/tools_history_and_required_input.json
  • rust/src/chat/src/renderer/kimi_k3/fixtures/tools_history_and_required_output.txt
  • rust/src/chat/src/renderer/kimi_k3/mod.rs
  • rust/src/chat/src/renderer/kimi_k3/tests.rs
  • rust/src/chat/src/renderer/mod.rs
  • rust/src/chat/src/renderer/selection.rs
  • rust/src/chat/src/renderer/test_utils.rs
  • rust/src/chat/src/request.rs
  • rust/src/chat/src/stream.rs
  • rust/src/chat/tests/chat.rs
  • rust/src/chat/tests/roundtrip.rs
  • rust/src/cmd/Cargo.toml
  • rust/src/cmd/src/cli.rs
  • rust/src/cmd/src/cli/tests.rs
  • rust/src/cmd/src/cli/unsupported.rs
  • rust/src/cmd/src/main.rs
  • rust/src/engine-core-client/examples/external_engine_logprobs.rs
  • rust/src/engine-core-client/examples/external_engine_utility_call.rs
  • rust/src/engine-core-client/src/client.rs
  • rust/src/engine-core-client/src/client/imp.rs
  • rust/src/engine-core-client/src/client/state.rs
  • rust/src/engine-core-client/src/client/stream.rs
  • rust/src/engine-core-client/src/coordinator/bootstrap.rs
  • rust/src/engine-core-client/src/coordinator/external.rs
  • rust/src/engine-core-client/src/coordinator/handle.rs
  • rust/src/engine-core-client/src/coordinator/inproc.rs
  • rust/src/engine-core-client/src/coordinator/mod.rs
  • rust/src/engine-core-client/src/error.rs
  • rust/src/engine-core-client/src/lib.rs
  • rust/src/engine-core-client/src/metrics.rs
  • rust/src/engine-core-client/src/mock_engine.rs
  • rust/src/engine-core-client/src/protocol/dtype.rs
  • rust/src/engine-core-client/src/protocol/handshake.rs
  • rust/src/engine-core-client/src/protocol/logprobs.rs
  • rust/src/engine-core-client/src/protocol/logprobs/array.rs
  • rust/src/engine-core-client/src/protocol/logprobs/tests.rs
  • rust/src/engine-core-client/src/protocol/logprobs/wire.rs
  • rust/src/engine-core-client/src/protocol/lora.rs
  • rust/src/engine-core-client/src/protocol/mod.rs
  • rust/src/engine-core-client/src/protocol/multimodal.rs
  • rust/src/engine-core-client/src/protocol/output.rs
  • rust/src/engine-core-client/src/protocol/request.rs
  • rust/src/engine-core-client/src/protocol/sampling.rs
  • rust/src/engine-core-client/src/protocol/stats.rs
  • rust/src/engine-core-client/src/protocol/structured_outputs.rs
  • rust/src/engine-core-client/src/protocol/tensor.rs
  • rust/src/engine-core-client/src/protocol/utility.rs
  • rust/src/engine-core-client/src/runtime.rs
  • rust/src/engine-core-client/src/test_utils.rs
  • rust/src/engine-core-client/src/tests/client.rs
  • rust/src/engine-core-client/src/tests/mod.rs
  • rust/src/engine-core-client/src/tests/python_compat.py
  • rust/src/engine-core-client/src/transport.rs
  • rust/src/llm/examples/external_engine_smoke.rs
  • rust/src/llm/src/error.rs
  • rust/src/llm/src/inflight.rs
  • rust/src/llm/src/lib.rs
  • rust/src/llm/src/log_stats.rs
  • rust/src/llm/src/output.rs
  • rust/src/llm/src/request.rs
  • rust/src/llm/src/request_metrics.rs
  • rust/src/llm/tests/generate.rs
  • rust/src/managed-engine/src/cli.rs
  • rust/src/managed-engine/src/lib.rs
  • rust/src/managed-engine/src/process.rs
  • rust/src/metrics/src/api_server.rs
  • rust/src/metrics/src/lib.rs
  • rust/src/metrics/src/request.rs
  • rust/src/metrics/src/scheduler.rs
  • rust/src/mock-engine/src/engine.rs
  • rust/src/mock-engine/src/io.rs
  • rust/src/mock-engine/src/lib.rs
  • rust/src/mock-engine/src/main.rs
  • rust/src/mock-engine/src/tests.rs
  • rust/src/parser/benches/deepseek_v3.rs
  • rust/src/parser/benches/deepseek_v31.rs
  • rust/src/parser/benches/deepseek_v32.rs
  • rust/src/parser/benches/gemma4.rs
  • rust/src/parser/benches/glm45_moe.rs
  • rust/src/parser/benches/granite4.rs
  • rust/src/parser/benches/kimi_k2.rs
  • rust/src/parser/benches/llama3_json.rs
  • rust/src/parser/benches/minimax_m2.rs
  • rust/src/parser/benches/qwen3_coder.rs
  • rust/src/parser/benches/qwen3_xml.rs
  • rust/src/parser/benches/utils/adapter.rs
  • rust/src/parser/benches/utils/mod.rs
  • rust/src/parser/python/src/lib.rs
  • rust/src/parser/src/lib.rs
  • rust/src/parser/src/reasoning/cohere_cmd.rs
  • rust/src/parser/src/reasoning/deepseek_r1.rs
  • rust/src/parser/src/reasoning/delimited.rs
  • rust/src/parser/src/reasoning/kimi.rs
  • rust/src/parser/src/reasoning/minimax_m3.rs
  • rust/src/parser/src/reasoning/mod.rs
  • rust/src/parser/src/reasoning/qwen3.rs
  • rust/src/parser/src/reasoning/seed_oss.rs
  • rust/src/parser/src/reasoning/step3p5.rs
  • rust/src/parser/src/reasoning/tests.rs
  • rust/src/parser/src/tool/deepseek_dsml/deepseek_v32.rs
  • rust/src/parser/src/tool/deepseek_dsml/deepseek_v4.rs
  • rust/src/parser/src/tool/deepseek_dsml/mod.rs
  • rust/src/parser/src/tool/deepseek_json/deepseek_v3.rs
  • rust/src/parser/src/tool/deepseek_json/deepseek_v31.rs
  • rust/src/parser/src/tool/deepseek_json/mod.rs
  • rust/src/parser/src/tool/error.rs
  • rust/src/parser/src/tool/glm_xml/glm45_moe.rs
  • rust/src/parser/src/tool/glm_xml/glm47_moe.rs
  • rust/src/parser/src/tool/glm_xml/mod.rs
  • rust/src/parser/src/tool/hy_v3.rs
  • rust/src/parser/src/tool/json/granite4.rs
  • rust/src/parser/src/tool/json/hermes.rs
  • rust/src/parser/src/tool/json/internlm2.rs
  • rust/src/parser/src/tool/json/llama.rs
  • rust/src/parser/src/tool/json/mistral.rs
  • rust/src/parser/src/tool/json/mod.rs
  • rust/src/parser/src/tool/json/phi4mini.rs
  • rust/src/parser/src/tool/json/qwen.rs
  • rust/src/parser/src/tool/kimi_k2.rs
  • rust/src/parser/src/tool/minimax_m2.rs
  • rust/src/parser/src/tool/minimax_m3.rs
  • rust/src/parser/src/tool/mod.rs
  • rust/src/parser/src/tool/parameters.rs
  • rust/src/parser/src/tool/qwen_coder.rs
  • rust/src/parser/src/tool/seed_oss.rs
  • rust/src/parser/src/tool/test_utils.rs
  • rust/src/parser/src/tool/tests.rs
  • rust/src/parser/src/unified/combined.rs
  • rust/src/parser/src/unified/gemma4.rs
  • rust/src/parser/src/unified/inkling.rs
  • rust/src/parser/src/unified/kimi_k3.rs
  • rust/src/parser/src/unified/kimi_k3/structural_tag.rs
  • rust/src/parser/src/unified/mod.rs
  • rust/src/parser/src/utils.rs
  • rust/src/server/Cargo.toml
  • rust/src/server/build.rs
  • rust/src/server/examples/external_engine_openai_qwen.rs
  • rust/src/server/src/config.rs
  • rust/src/server/src/error.rs
  • rust/src/server/src/grpc/control.rs
  • rust/src/server/src/grpc/convert.rs
  • rust/src/server/src/grpc/health.rs
  • rust/src/server/src/grpc/inference.rs
  • rust/src/server/src/grpc/mod.rs
  • rust/src/server/src/grpc/tests.rs
  • rust/src/server/src/lib.rs
  • rust/src/server/src/listener.rs
  • rust/src/server/src/lora.rs
  • rust/src/server/src/middleware/auth.rs
  • rust/src/server/src/middleware/cors.rs
  • rust/src/server/src/middleware/load.rs
  • rust/src/server/src/middleware/metrics.rs
  • rust/src/server/src/middleware/mod.rs
  • rust/src/server/src/middleware/offload.rs
  • rust/src/server/src/middleware/request_id.rs
  • rust/src/server/src/render.rs
  • rust/src/server/src/routes.rs
  • rust/src/server/src/routes/abort_requests.rs
  • rust/src/server/src/routes/cache.rs
  • rust/src/server/src/routes/collective_rpc.rs
  • rust/src/server/src/routes/health.rs
  • rust/src/server/src/routes/http_client_tests.rs
  • rust/src/server/src/routes/inference/generate.rs
  • rust/src/server/src/routes/inference/generate/convert.rs
  • rust/src/server/src/routes/inference/generate/types.rs
  • rust/src/server/src/routes/inference/generate/validate.rs
  • rust/src/server/src/routes/inference/mod.rs
  • rust/src/server/src/routes/load.rs
  • rust/src/server/src/routes/lora.rs
  • rust/src/server/src/routes/metrics.rs
  • rust/src/server/src/routes/openai/chat_completions.rs
  • rust/src/server/src/routes/openai/chat_completions/convert.rs
  • rust/src/server/src/routes/openai/chat_completions/types.rs
  • rust/src/server/src/routes/openai/chat_completions/validate.rs
  • rust/src/server/src/routes/openai/completions.rs
  • rust/src/server/src/routes/openai/completions/convert.rs
  • rust/src/server/src/routes/openai/completions/types.rs
  • rust/src/server/src/routes/openai/completions/validate.rs
  • rust/src/server/src/routes/openai/mod.rs
  • rust/src/server/src/routes/openai/models.rs
  • rust/src/server/src/routes/openai/utils/logprobs.rs
  • rust/src/server/src/routes/openai/utils/mod.rs
  • rust/src/server/src/routes/openai/utils/structured_outputs.rs
  • rust/src/server/src/routes/openai/utils/types.rs
  • rust/src/server/src/routes/openai/utils/usage.rs
  • rust/src/server/src/routes/openai/utils/validated_json.rs
  • rust/src/server/src/routes/pause.rs
  • rust/src/server/src/routes/profile.rs
  • rust/src/server/src/routes/render.rs
  • rust/src/server/src/routes/server_info.rs
  • rust/src/server/src/routes/sleep.rs
  • rust/src/server/src/routes/tests.rs
  • rust/src/server/src/routes/tokenize.rs
  • rust/src/server/src/routes/tokenize/types.rs
  • rust/src/server/src/routes/version.rs
  • rust/src/server/src/routes/world_size.rs
  • rust/src/server/src/runtime.rs
  • rust/src/server/src/server_info.rs
  • rust/src/server/src/state.rs
  • rust/src/server/src/tls.rs
  • rust/src/server/src/tls_tests.rs
  • rust/src/server/src/utils.rs
  • rust/src/text/src/backend/hf/config.rs
  • rust/src/text/src/backend/hf/mod.rs
  • rust/src/text/src/backend/hf/model_files.rs
  • rust/src/text/src/backend/mod.rs
  • rust/src/text/src/error.rs
  • rust/src/text/src/lib.rs
  • rust/src/text/src/lower.rs
  • rust/src/text/src/lower/logprobs.rs
  • rust/src/text/src/lower/sampling.rs
  • rust/src/text/src/lower/token_ids.rs
  • rust/src/text/src/output/decoded.rs
  • rust/src/text/src/output/logprobs.rs
  • rust/src/text/src/output/mod.rs
  • rust/src/text/src/request.rs
  • rust/src/tokenizer/benches/hf.rs
  • rust/src/tokenizer/benches/tiktoken.rs
  • rust/src/tokenizer/src/byte_level_decode.rs
  • rust/src/tokenizer/src/error.rs
  • rust/src/tokenizer/src/hf.rs
  • rust/src/tokenizer/src/hf/added_tokens.rs
  • rust/src/tokenizer/src/incremental.rs
  • rust/src/tokenizer/src/lib.rs
  • rust/src/tokenizer/src/tekken.rs
  • rust/src/tokenizer/src/test_utils.rs
  • rust/src/tokenizer/src/tiktoken.rs
  • rust/src/tracing/Cargo.toml
  • rust/src/tracing/src/lib.rs
  • scripts/autotune_helion_kernels.py
  • scripts/benchmark_helion_kernels.py
  • setup.py
  • tests/basic_correctness/test_basic_correctness.py
  • tests/basic_correctness/test_cpu_offload.py
  • tests/basic_correctness/test_mem.py
  • tests/benchmarks/test_skip_tokenizer_init.py
  • tests/benchmarks/test_throughput_cli.py
  • tests/compile/correctness_e2e/test_async_tp.py
  • tests/compile/correctness_e2e/test_sequence_parallel.py
  • tests/compile/fullgraph/test_basic_correctness.py
  • tests/compile/fullgraph/test_full_cudagraph.py
  • tests/compile/fullgraph/test_full_graph.py
  • tests/compile/fusions_e2e/conftest.py
  • tests/compile/fusions_e2e/models.py
  • tests/compile/fusions_e2e/test_tp2_ar_rms.py
  • tests/compile/passes/distributed/test_async_tp.py
  • tests/compile/passes/distributed/test_fusion_all_reduce.py
  • tests/compile/passes/test_fusion.py
  • tests/compile/passes/test_fusion_attn.py
  • tests/compile/passes/test_mla_attn_quant_fusion.py
  • tests/compile/passes/test_qk_norm_rope_fusion.py
  • tests/compile/passes/test_rmsnorm_reshape_fusion.py
  • tests/compile/passes/test_rocm_aiter_qk_norm_rope_kvcache_fusion.py
  • tests/compile/passes/test_rope_kvcache_fusion.py
  • tests/compile/passes/test_silu_mul_quant_fusion.py
  • tests/compile/test_aot_compile.py
  • tests/compile/test_compile_ranges.py
  • tests/compile/test_config.py
  • tests/compile/test_dynamic_shapes_compilation.py
  • tests/compile/test_graph_partition.py
  • tests/config/test_bailing_mtp_config.py
  • tests/config/test_config_utils.py
  • tests/config/test_model_arch_config.py
  • tests/config/test_multimodal_config.py
  • tests/config/test_speculative_draft_hf_overrides.py
  • tests/config/test_speculative_draft_max_position_embeddings.py
  • tests/conftest.py
  • tests/cuda/test_cuda_context.py
  • tests/detokenizer/test_check_stop_strings.py
  • tests/distributed/test_comm_ops.py
  • tests/distributed/test_context_parallel.py
  • tests/distributed/test_dcp_a2a.py
  • tests/distributed/test_dcp_direct_a2a_lse_reduce.py
  • tests/distributed/test_elastic_ep.py
  • tests/distributed/test_eplb_algo.py
  • tests/distributed/test_eplb_execute.py
  • tests/distributed/test_eplb_fused_moe_layer.py
  • tests/distributed/test_eplb_fused_moe_layer_dep_nvfp4.py
  • tests/distributed/test_eplb_quant_scale_consistency.py
  • tests/distributed/test_events.py
  • tests/distributed/test_file_store.py
  • tests/distributed/test_kimi_linear_context_parallel.py
  • tests/distributed/test_kv_cache_events.py
  • tests/distributed/test_mnnvl_alltoall.py
  • tests/distributed/test_multiproc_executor.py
  • tests/distributed/test_packed_tensor.py
  • tests/distributed/test_pipeline_parallel.py
  • tests/distributed/test_pynccl.py
  • tests/distributed/test_quick_all_reduce.py
  • tests/distributed/test_rocm_quick_reduce.py
  • tests/distributed/test_shm_broadcast.py
  • tests/distributed/test_weight_transfer.py
  • tests/engine/test_arg_utils.py
  • tests/engine/test_short_mm_context.py
  • tests/entrypoints/anthropic/test_anthropic_messages_conversion.py
  • tests/entrypoints/anthropic/test_messages.py
  • tests/entrypoints/cohere/__init__.py
  • tests/entrypoints/cohere/test_api_router.py
  • tests/entrypoints/cohere/test_chat_v2.py
  • tests/entrypoints/cohere/test_cohere_chat_message.py
  • tests/entrypoints/cohere/test_protocol.py
  • tests/entrypoints/cohere/test_registry_and_args.py
  • tests/entrypoints/cohere/test_serving_conversion.py
  • tests/entrypoints/cohere/test_serving_streaming.py
  • tests/entrypoints/conftest.py
  • tests/entrypoints/generate/generative_scoring/test_generative_scoring.py
  • tests/entrypoints/llm/offline_mode/test_offline_mode.py
  • tests/entrypoints/llm/test_chat.py
  • tests/entrypoints/llm/test_collective_rpc.py
  • tests/entrypoints/llm/test_generate.py
  • tests/entrypoints/llm/test_gpu_utilization.py
  • tests/entrypoints/llm/test_prompt_validation.py
  • tests/entrypoints/llm/test_struct_output_generate.py
  • tests/entrypoints/multimodal/conftest.py
  • tests/entrypoints/multimodal/llm/test_chat.py
  • tests/entrypoints/multimodal/llm/test_mm_cache_external_injection.py
  • tests/entrypoints/multimodal/llm/test_mm_cache_stats.py
  • tests/entrypoints/multimodal/llm/test_mm_embeds_only.py
  • tests/entrypoints/multimodal/openai/chat_completion/test_audio.py
  • tests/entrypoints/multimodal/openai/chat_completion/test_chat_completion_with_mixed_audio_embeds.py
  • tests/entrypoints/multimodal/openai/chat_completion/test_chat_completion_with_mixed_image_embeds.py
  • tests/entrypoints/multimodal/openai/chat_completion/test_default_mm_loras.py
  • tests/entrypoints/multimodal/openai/chat_completion/test_video.py
  • tests/entrypoints/multimodal/openai/chat_completion/test_vision.py
  • tests/entrypoints/openai/chat_completion/test_batched_chat_completions.py
  • tests/entrypoints/openai/chat_completion/test_chat.py
  • tests/entrypoints/openai/chat_completion/test_chat_completion.py
  • tests/entrypoints/openai/chat_completion/test_chat_error.py
  • tests/entrypoints/openai/chat_completion/test_completion_with_function_calling.py
  • tests/entrypoints/openai/chat_completion/test_extra_content_fields.py
  • tests/entrypoints/openai/chat_completion/test_include_reasoning.py
  • tests/entrypoints/openai/chat_completion/test_logprob_token_ids.py
  • tests/entrypoints/openai/chat_completion/test_non_object_body_validation.py
  • tests/entrypoints/openai/chat_completion/test_serving_chat.py
  • tests/entrypoints/openai/chat_completion/test_thinking_token_budget.py
  • tests/entrypoints/openai/chat_completion/test_thinking_token_budget_validation.py
  • tests/entrypoints/openai/completion/test_completion.py
  • tests/entrypoints/openai/completion/test_completion_error.py
  • tests/entrypoints/openai/completion/test_prompt_validation.py
  • tests/entrypoints/openai/completion/test_shutdown.py
  • tests/entrypoints/openai/responses/test_harmony.py
  • tests/entrypoints/openai/responses/test_parsable_context.py
  • tests/entrypoints/openai/responses/test_responses_utils.py
  • tests/entrypoints/openai/responses/test_sampling_params.py
  • tests/entrypoints/openai/responses/test_serving_responses.py
  • tests/entrypoints/openai/responses/test_simple.py
  • tests/entrypoints/openai/test_dp_supervisor.py
  • tests/entrypoints/openai/test_openai_schema.py
  • tests/entrypoints/openai/test_render_parity.py
  • tests/entrypoints/openai/test_return_routed_experts.py
  • tests/entrypoints/openai/test_session_id.py
  • tests/entrypoints/openai/test_stop_token_ids.py
  • tests/entrypoints/openai/test_uds.py
  • tests/entrypoints/pooling/basic/test_encode.py
  • tests/entrypoints/pooling/basic/test_tiling_engine.py
  • tests/entrypoints/pooling/basic/test_truncation.py
  • tests/entrypoints/pooling/classify/test_offline.py
  • tests/entrypoints/pooling/classify/test_online_vision.py
  • tests/entrypoints/pooling/embed/conftest.py
  • tests/entrypoints/pooling/embed/test_correctness_mteb.py
  • tests/entrypoints/pooling/embed/test_io_processor.py
  • tests/entrypoints/pooling/embed/test_offline.py
  • tests/entrypoints/pooling/embed/test_online.py
  • tests/entrypoints/pooling/embed/test_online_dimensions.py
  • tests/entrypoints/pooling/embed/test_online_long_text.py
  • tests/entrypoints/pooling/embed/test_protocol.py
  • tests/entrypoints/pooling/reward/test_token_reward_offline.py
  • tests/entrypoints/pooling/scoring/test_bi_encoder_offline.py
  • tests/entrypoints/pooling/scoring/test_bi_encoder_online.py
  • tests/entrypoints/pooling/scoring/test_cross_encoder_correctness_mteb.py
  • tests/entrypoints/pooling/scoring/test_cross_encoder_offline.py
  • tests/entrypoints/pooling/scoring/test_cross_encoder_online.py
  • tests/entrypoints/pooling/scoring/test_cross_encoder_online_vision.py
  • tests/entrypoints/pooling/scoring/test_jina_ranking_io_processor_unit.py
  • tests/entrypoints/pooling/scoring/test_late_interaction_offline.py
  • tests/entrypoints/pooling/scoring/test_late_interaction_offline_vision.py
  • tests/entrypoints/pooling/scoring/test_utils.py
  • tests/entrypoints/pooling/scoring/util.py
  • tests/entrypoints/pooling/test_factories.py
  • tests/entrypoints/pooling/test_io_processor.py
  • tests/entrypoints/pooling/token_classify/test_offline.py
  • tests/entrypoints/pooling/token_embed/test_offline.py
  • tests/entrypoints/scale_out/derender/test_derender.py
  • tests/entrypoints/scale_out/derender/test_derender_parity.py
  • tests/entrypoints/scale_out/derender/test_derender_stream.py
  • tests/entrypoints/scale_out/token_in_token_out/test_generate_stream.py
  • tests/entrypoints/scale_out/token_in_token_out/test_serving_multimodal_tokens.py
  • tests/entrypoints/scale_out/token_in_token_out/test_serving_tokens.py
  • tests/entrypoints/serve/dev/rlhf/conftest.py
  • tests/entrypoints/serve/dev/rlhf/state_transitions/__init__.py
  • tests/entrypoints/serve/dev/rlhf/state_transitions/test_pause_resume.py
  • tests/entrypoints/serve/exception_handling/__init__.py
  • tests/entrypoints/serve/exception_handling/test_error_sanitization.py
  • tests/entrypoints/serve/exception_handling/test_http_status_metrics.py
  • tests/entrypoints/serve/exception_handling/test_validation_exception_handler.py
  • tests/entrypoints/serve/instrumentator/test_basic.py
  • tests/entrypoints/serve/lora/test_serving_models.py
  • tests/entrypoints/serve/middleware/__init__.py
  • tests/entrypoints/serve/middleware/test_authentication_middleware.py
  • tests/entrypoints/serve/middleware/test_optional_middleware.py
  • tests/entrypoints/serve/sagemaker/conftest.py
  • tests/entrypoints/serve/tokenize/test_serving_tokenization.py
  • tests/entrypoints/serve/utils/test_api_utils.py
  • tests/entrypoints/serve/utils/test_request_logger.py
  • tests/entrypoints/speech_to_text/conftest.py
  • tests/entrypoints/speech_to_text/correctness/test_transcription_api_correctness.py
  • tests/entrypoints/speech_to_text/realtime/test_realtime_validation.py
  • tests/entrypoints/speech_to_text/test_speech_to_text_cancellation.py
  • tests/entrypoints/speech_to_text/transcription/test_chunk_timestamp_offset.py
  • tests/entrypoints/speech_to_text/transcription/test_transcription_inter_chunk_spacing.py
  • tests/entrypoints/speech_to_text/transcription/test_transcription_validation.py
  • tests/entrypoints/speech_to_text/transcription/test_transcription_validation_whisper.py
  • tests/entrypoints/speech_to_text/translation/test_translation_validation.py
  • tests/entrypoints/tool_parsers/test_hermes_tool_parser.py
  • tests/entrypoints/unit_tests/_api_server_spawn_workers.py
  • tests/entrypoints/unit_tests/test_api_server_process_manager.py
  • tests/entrypoints/unit_tests/test_chat_utils.py
  • tests/entrypoints/unit_tests/test_non_object_body_validation.py
  • tests/entrypoints/weight_transfer/test_weight_transfer_llm.py
  • tests/evals/gpt_oss/configs/gpt-oss-20b-xpu-baseline.yaml
  • tests/evals/gpt_oss/configs/gpt-oss-20b-xpu-triton-attn.yaml
  • tests/evals/gpt_oss/configs/models-xpu.txt
  • tests/evals/gsm8k/configs/DeepSeek-V4-Flash-DSpark-confidence-TP4.yaml
  • tests/evals/gsm8k/configs/DeepSeek-V4-Flash-NVFP4.yaml
  • tests/evals/gsm8k/configs/DeepSeek-V4-Pro-NVFP4.yaml
  • tests/evals/gsm8k/configs/GLM-5.2-NVFP4-TP1-PCP4-EP.yaml
  • tests/evals/gsm8k/configs/GLM-5.2-NVFP4-TP2-PCP2-EP.yaml
  • tests/evals/gsm8k/configs/Laguna-XS.2-NVFP4.yaml
  • tests/evals/gsm8k/configs/Qwen1.5-MoE-A2.7B-Chat-INT8.yaml
  • tests/evals/gsm8k/configs/Qwen3-1.7B-MXFP4.yaml
  • tests/evals/gsm8k/configs/Qwen3-30B-A3B-MXFP4-AITER-TP2-online.yaml
  • tests/evals/gsm8k/configs/Qwen3-30B-A3B-MXFP4-AITER-TP2.yaml
  • tests/evals/gsm8k/configs/Qwen3.5-35B-A3B-DEP2.yaml
  • tests/evals/gsm8k/configs/Qwen3.5-35B-A3B-MXFP4-AITER-TP2.yaml
  • tests/evals/gsm8k/configs/Qwen3.5-35B-A3B-MXFP4-EMU-TP2.yaml
  • tests/evals/gsm8k/configs/Qwen3.5-397B-A17B-NVFP4-DEP2-MTP.yaml
  • tests/evals/gsm8k/configs/Qwen3.5-397B-A17B-NVFP4-DEP2.yaml
  • tests/evals/gsm8k/configs/gemma-4-E4B-it-qat-mobile-ct.yaml
  • tests/evals/gsm8k/configs/humming/NVIDIA-Nemotron-3-Nano-30B-A3B-NVFP4-humming.yaml
  • tests/evals/gsm8k/configs/humming/Qwen3-4B-mixed-quant-RTN-humming.yaml
  • tests/evals/gsm8k/configs/humming/config-a100-shard-0.txt
  • tests/evals/gsm8k/configs/humming/config-a100-shard-1.txt
  • tests/evals/gsm8k/configs/humming/config-a100-shard-2.txt
  • tests/evals/gsm8k/configs/humming/config-act-int8.txt
  • tests/evals/gsm8k/configs/humming/config-h100-shard-0.txt
  • tests/evals/gsm8k/configs/humming/config-h100-shard-1.txt
  • tests/evals/gsm8k/configs/humming/config-h100-shard-2.txt
  • tests/evals/gsm8k/configs/humming/config.txt
  • tests/evals/gsm8k/configs/models-blackwell.txt
  • tests/evals/gsm8k/configs/models-gfx950-large.txt
  • tests/evals/gsm8k/configs/models-mi3xx-fp8-and-mixed.txt
  • tests/evals/gsm8k/configs/models-pcp.txt
  • tests/evals/gsm8k/configs/models-spec-decode.txt
  • tests/evals/gsm8k/configs/moe-refactor-dp-ep/Qwen3-30B-A3B-BF16-triton.yaml
  • tests/evals/gsm8k/configs/moe-refactor/DeepSeek-V4-Flash-deepgemm-mega-moe.yaml
  • tests/evals/gsm8k/configs/moe-refactor/Llama-4-Scout-Fp8-ModelOpt-marlin.yaml
  • tests/evals/gsm8k/configs/moe-refactor/Qwen3-30B-A3B-Fp8-AutoFp8-marlin.yaml
  • tests/evals/gsm8k/configs/moe-refactor/Qwen3-30B-A3B-Fp8-CT-Block-marlin.yaml
  • tests/evals/gsm8k/configs/moe-refactor/Qwen3-30B-A3B-Fp8-CT-Channel-marlin.yaml
  • tests/evals/gsm8k/configs/moe-refactor/Qwen3-30B-A3B-NvFp4-CT-marlin.yaml
  • tests/evals/gsm8k/configs/moe-refactor/Qwen3-30B-A3B-NvFp4-ModelOpt-marlin.yaml
  • tests/evals/gsm8k/configs/moe-refactor/config-b200-shard-0.txt
  • tests/evals/gsm8k/configs/moe-refactor/config-b200-shard-1.txt
  • tests/evals/gsm8k/configs/moe-refactor/config-b200-shard-2.txt
  • tests/evals/gsm8k/configs/moe-refactor/config-b200-shard-3.txt
  • tests/evals/gsm8k/gsm8k_eval.py
  • tests/evals/gsm8k/test_gsm8k_correctness.py
  • tests/evals/gsm8k/test_gsm8k_offloading.py
  • tests/jit_monitor/__init__.py
  • tests/jit_monitor/conftest.py
  • tests/jit_monitor/test_hooks.py
  • tests/jit_monitor/test_hooks_gpu.py
  • tests/jit_monitor/test_no_runtime_jit.py
  • tests/kernels/attention/test_aiter_flash_attn.py
  • tests/kernels/attention/test_amx_mla.py
  • tests/kernels/attention/test_attention.py
  • tests/kernels/attention/test_attention_selector.py
  • tests/kernels/attention/test_cache.py
  • tests/kernels/attention/test_cpu_attn.py
  • tests/kernels/attention/test_cutlass_mla_decode.py
  • tests/kernels/attention/test_deepgemm_attention.py
  • tests/kernels/attention/test_flashinfer_trtllm_attention.py
  • tests/kernels/attention/test_flashmla.py
  • tests/kernels/attention/test_flashmla_sparse.py
  • tests/kernels/attention/test_kimi_k3_mla_fused_epilogue.py
  • tests/kernels/attention/test_kimi_k3_mla_key_concat_kv_cache.py
  • tests/kernels/attention/test_merge_attn_states.py
  • tests/kernels/attention/test_mha_attn.py
  • tests/kernels/attention/test_minimax_m3.py
  • tests/kernels/attention/test_minimax_m3_msa_cutlass_sparse_decode.py
  • tests/kernels/attention/test_mla_cross_layer_kernel_equivalence.py
  • tests/kernels/attention/test_prefix_prefill.py
  • tests/kernels/attention/test_rocm_aiter_fa.py
  • tests/kernels/attention/test_rocm_aiter_mla_causal_verify_mask.py
  • tests/kernels/attention/test_rocm_aiter_mla_decode.py
  • tests/kernels/attention/test_rocm_aiter_mla_decode_metadata.py
  • tests/kernels/attention/test_rocm_aiter_mla_fp8_prefill.py
  • tests/kernels/attention/test_rocm_aiter_mla_fp8_support.py
  • tests/kernels/attention/test_rocm_aiter_mla_head_padding.py
  • tests/kernels/attention/test_rocm_aiter_mla_op_registration.py
  • tests/kernels/attention/test_rocm_aiter_mla_sparse_metadata_sync.py
  • tests/kernels/attention/test_rocm_aiter_unified_attn.py
  • tests/kernels/attention/test_rocm_triton_attn_dsv4.py
  • tests/kernels/attention/test_triton_decode_attention.py
  • tests/kernels/attention/test_triton_unified_attention.py
  • tests/kernels/attention/test_triton_unified_attention_diffkv.py
  • tests/kernels/attention/test_use_trtllm_attention.py
  • tests/kernels/attention/test_xpu_mla_sparse.py
  • tests/kernels/conftest.py
  • tests/kernels/core/test_activation.py
  • tests/kernels/core/test_fused_embed_norm.py
  • tests/kernels/core/test_fused_q_kv_rmsnorm.py
  • tests/kernels/core/test_fused_qk_norm_rope.py
  • tests/kernels/core/test_fused_quant_layernorm.py
  • tests/kernels/core/test_fused_rms_norm_gated.py
  • tests/kernels/core/test_layernorm.py
  • tests/kernels/core/test_mrope.py
  • tests/kernels/core/test_rocm_aiter_ops.py
  • tests/kernels/core/test_rotary_embedding_mla_cache_fused.py
  • tests/kernels/core/test_vit_fp8_attn.py
  • tests/kernels/core/test_vit_fp8_scaling.py
  • tests/kernels/helion/test_benchmark_script.py
  • tests/kernels/helion/test_rms_norm_per_block_quant.py
  • tests/kernels/ir/test_layernorm.py
  • tests/kernels/mamba/cpu/test_cpu_gdn_ops.py
  • tests/kernels/mamba/test_causal_conv1d.py
  • tests/kernels/mamba/test_gdn_forward_core_split.py
  • tests/kernels/mamba/test_gdn_fused_mtp.py
  • tests/kernels/mamba/test_gdn_prefill_cutedsl.py
  • tests/kernels/mamba/test_mamba_ssm.py
  • tests/kernels/mamba/test_memcpy_u64_tiled.py
  • tests/kernels/mamba/test_precopy_mamba_align.py
  • tests/kernels/mamba/test_replayssm_prefill_decode_equivalence_mamba2.py
  • tests/kernels/mamba/test_replayssm_standard_decode_mamba2.py
  • tests/kernels/mamba/test_ssu_dispatch.py
  • tests/kernels/mamba/utils.py
  • tests/kernels/moe/parallel_utils.py
  • tests/kernels/moe/test_batched_moe.py
  • tests/kernels/moe/test_block_fp8.py
  • tests/kernels/moe/test_block_int8.py
  • tests/kernels/moe/test_cpu_fused_moe.py
  • tests/kernels/moe/test_cpu_quant_fused_moe.py
  • tests/kernels/moe/test_cutlass_moe.py
  • tests/kernels/moe/test_deepep_moe.py
  • tests/kernels/moe/test_deepep_v2_moe.py
  • tests/kernels/moe/test_deepgemm.py
  • tests/kernels/moe/test_flashinfer_b12x_moe.py
  • tests/kernels/moe/test_flashinfer_cutedsl_layout.py
  • tests/kernels/moe/test_flashinfer_cutedsl_nvfp4_moe.py
  • tests/kernels/moe/test_flashinfer_moe.py
  • tests/kernels/moe/test_grouped_topk.py
  • tests/kernels/moe/test_modular_oai_triton_moe.py
  • tests/kernels/moe/test_moe.py
  • tests/kernels/moe/test_moe_align_block_size.py
  • tests/kernels/moe/test_moe_layer.py
  • tests/kernels/moe/test_moe_weight_loading_padded.py
  • tests/kernels/moe/test_mxfp8_aiter_backend_selection.py
  • tests/kernels/moe/test_ocp_mx_moe.py
  • tests/kernels/moe/test_rocm_aiter_moe.py
  • tests/kernels/moe/test_routed_experts_capture_monolithic.py
  • tests/kernels/moe/test_routing.py
  • tests/kernels/moe/test_routing_simulator.py
  • tests/kernels/moe/test_shared_fused_moe_routed_transform.py
  • tests/kernels/moe/test_silu_mul_fp8_quant_deep_gemm.py
  • tests/kernels/moe/test_topk_softplus_sqrt.py
  • tests/kernels/moe/test_triton_moe_no_act_mul.py
  • tests/kernels/moe/test_triton_moe_ptpc_fp8.py
  • tests/kernels/moe/test_unquantized_backend_selection.py
  • tests/kernels/moe/test_zen_cpu_fused_moe.py
  • tests/kernels/moe/test_zero_expert_moe.py
  • tests/kernels/quantization/test_aiter_hipb_mm_linear_kernel.py
  • tests/kernels/quantization/test_block_fp8.py
  • tests/kernels/quantization/test_block_int8.py
  • tests/kernels/quantization/test_fp8_quant_group.py
  • tests/kernels/quantization/test_int4_emulation_moe.py
  • tests/kernels/quantization/test_int8_kernel.py
  • tests/kernels/quantization/test_marlin_tile_padding.py
  • tests/kernels/quantization/test_mxfp4_kernel_selection.py
  • tests/kernels/quantization/test_mxfp6_kernel_selection.py
  • tests/kernels/quantization/test_nvfp4_emulation.py
  • tests/kernels/quantization/test_quant_op_schema.py
  • tests/kernels/quantization/test_rdna_hybrid_w4a16.py
  • tests/kernels/quantization/test_rocm_aiter_grouped_quant.py
  • tests/kernels/quantization/test_rocm_fp8.py
  • tests/kernels/quantization/test_rocm_mxfp4.py
  • tests/kernels/quantization/test_rocm_skinny_gemms.py
  • tests/kernels/quantization/test_triton_scaled_mm.py
  • tests/kernels/quantization/test_triton_w4a16.py
  • tests/kernels/quantization/test_w4a16_kernel_selection.py
  • tests/kernels/test_bf16_skinny_gemm.py
  • tests/kernels/test_bf16x3_router_gemm_cutedsl.py
  • tests/kernels/test_cache_kernels.py
  • tests/kernels/test_compressor_kv_cache.py
  • tests/kernels/test_cp_gather_fp8.py
  • tests/kernels/test_fla_layernorm_guard.py
  • tests/kernels/test_flex_attention.py
  • tests/kernels/test_fp32_router_gemm.py
  • tests/kernels/test_fused_deepseek_v32_norm_rope.py
  • tests/kernels/test_fused_gdn_post_conv.py
  • tests/kernels/test_fused_inv_rope_fp8_quant.py
  • tests/kernels/test_fused_minimax_m3_qknorm_rope_kv_insert.py
  • tests/kernels/test_fused_recurrent_packed_decode.py
  • tests/kernels/test_fused_sigmoid_gating_delta_rule.py
  • tests/kernels/test_gate_linear_rocm_dispatch.py
  • tests/kernels/test_kda.py
  • tests/kernels/test_kimi_k3_gemm_rs.py
  • tests/kernels/test_ll_bf16_gemm.py
  • tests/kernels/test_mhc_kernels.py
  • tests/kernels/test_mhc_tilelang_jit.py
  • tests/kernels/test_minimax_m3_amd_ops.py
  • tests/kernels/test_minimax_m3_sparse_attn_fp8_scale.py
  • tests/kernels/test_top_k_per_row.py
  • tests/kernels/turboquant/__init__.py
  • tests/kernels/turboquant/test_flydsl_turboquant_decode.py
  • tests/kernels/utils.py
  • tests/lora/conftest.py
  • tests/lora/test_default_mm_loras.py
  • tests/lora/test_fused_moe_lora_kernel.py
  • tests/lora/test_gemma4_tp.py
  • tests/lora/test_gptoss_tp.py
  • tests/lora/test_layers.py
  • tests/lora/test_layers_utils.py
  • tests/lora/test_lora_manager.py
  • tests/lora/test_moe_lora_align_sum.py
  • tests/lora/test_peft_helper.py
  • tests/lora/test_punica_ops.py
  • tests/lora/test_punica_ops_fp8.py
  • tests/lora/test_qwenvl.py
  • tests/lora/test_worker.py
  • tests/model_executor/kernels/test_b12x_linear.py
  • tests/model_executor/layers/test_fused_shared_expert.py
  • tests/model_executor/layers/test_mla_short_prefill_indexer.py
  • tests/model_executor/layers/test_pooler_methods.py
  • tests/model_executor/layers/test_rocm_unquantized_gemm.py
  • tests/model_executor/model_loader/instanttensor_loader/test_weight_utils.py
  • tests/model_executor/model_loader/runai_streamer_loader/test_runai_model_streamer_s3.py
  • tests/model_executor/model_loader/tensorizer_loader/test_tensorizer.py
  • tests/model_executor/model_loader/test_ep_weight_filter.py
  • tests/model_executor/model_loader/test_filter_duplicate_safetensors.py
  • tests/model_executor/model_loader/test_mtp_validation.py
  • tests/model_executor/model_loader/test_reload.py
  • tests/model_executor/model_loader/test_sharded_state_loader.py
  • tests/model_executor/test_b12x_warmup.py
  • tests/model_executor/test_jit_warmup.py
  • tests/model_executor/test_routed_experts_capture.py
  • tests/model_executor/test_utils.py
  • tests/models/deepseek_v32/test_sequence_parallel.py
  • tests/models/inkling/rocm/conftest.py
  • tests/models/inkling/rocm/test_model_alignment.py
  • tests/models/inkling/rocm/test_mxfp4_load.py
  • tests/models/inkling/rocm/test_rel_attention.py
  • tests/models/inkling/rocm/test_rocm_mtp_input_fusion.py
  • tests/models/inkling/rocm/test_sconv_cache_layout.py
  • tests/models/inkling/test_contract_validation.py
  • tests/models/inkling/test_fa4_rel_attention.py
  • tests/models/inkling/test_fa4_warmup.py
  • tests/models/inkling/test_mm_towers.py
  • tests/models/inkling/test_moe_weight_layout.py
  • tests/models/inkling/test_mtp_input_fusion.py
  • tests/models/inkling/test_qkvr_prep.py
  • tests/models/inkling/test_sconv_metadata.py
  • tests/models/kimi_k3/__init__.py
  • tests/models/kimi_k3/test_amd_attn_res.py
  • tests/models/kimi_k3/test_amd_kda_decode.py
  • tests/models/kimi_k3/test_amd_latent_moe_runner.py
  • tests/models/kimi_k3/test_attn_res.py
  • tests/models/kimi_k3/test_aux_attn_res_stream.py
  • tests/models/kimi_k3/test_eagle3.py
  • tests/models/kimi_k3/test_kda.py
  • tests/models/kimi_k3/test_kda_metadata.py
  • tests/models/kimi_k3/test_latent_moe_tail.py
  • tests/models/kimi_k3/test_mla_prefill_context.py
  • tests/models/kimi_k3/test_sequence_parallel.py
  • tests/models/language/generation/conftest.py
  • tests/models/language/generation/test_common.py
  • tests/models/language/generation/test_gdn_sleep_wake.py
  • tests/models/language/generation/test_granite.py
  • tests/models/language/generation/test_hybrid.py
  • tests/models/language/generation/test_mistral.py
  • tests/models/language/generation_ppl_test/ppl_utils.py
  • tests/models/language/generation_ppl_test/test_gpt.py
  • tests/models/language/generation_ppl_test/test_qwen.py
  • tests/models/language/pooling/conftest.py
  • tests/models/language/pooling/test_all_pooling_plus_chunked_prefill.py
  • tests/models/language/pooling/test_classification.py
  • tests/models/language/pooling/test_colbert.py
  • tests/models/language/pooling/test_embedding.py
  • tests/models/language/pooling/test_gritlm.py
  • tests/models/language/pooling/test_jina_embeddings_v5.py
  • tests/models/language/pooling/test_jina_reranker_v3.py
  • tests/models/language/pooling/test_multi_vector_retrieval.py
  • tests/models/language/pooling/test_reward.py
  • tests/models/language/pooling/test_splade_sparse_pooler.py
  • tests/models/language/pooling/test_token_classification.py
  • tests/models/language/pooling/test_truncation_control.py
  • tests/models/language/pooling_mteb_test/mteb_embed_utils.py
  • tests/models/language/pooling_mteb_test/test_jina.py
  • tests/models/multimodal/conftest.py
  • tests/models/multimodal/generation/test_common.py
  • tests/models/multimodal/generation/test_gemma_ragged_audio.py
  • tests/models/multimodal/generation/test_granite_speech.py
  • tests/models/multimodal/generation/test_mm_prefix_lm.py
  • tests/models/multimodal/generation/test_phi4mm.py
  • tests/models/multimodal/generation/test_qwen2_5_vl.py
  • tests/models/multimodal/generation/test_qwen2_vl.py
  • tests/models/multimodal/generation/test_transformers_audio.py
  • tests/models/multimodal/generation/test_vit_backend_functionality.py
  • tests/models/multimodal/generation/test_vit_cudagraph.py
  • tests/models/multimodal/generation/test_voxtral_realtime.py
  • tests/models/multimodal/generation/test_whisper.py
  • tests/models/multimodal/generation/vlm_utils/case_filtering.py
  • tests/models/multimodal/generation/vlm_utils/model_utils.py
  • tests/models/multimodal/generation/vlm_utils/runners.py
  • tests/models/multimodal/generation/vlm_utils/types.py
  • tests/models/multimodal/generation_ppl_test/__init__.py
  • tests/models/multimodal/generation_ppl_test/ppl_utils.py
  • tests/models/multimodal/generation_ppl_test/test_qwen.py
  • tests/models/multimodal/pooling/conftest.py
  • tests/models/multimodal/pooling/test_clip.py
  • tests/models/multimodal/pooling/test_colmodernvbert.py
  • tests/models/multimodal/pooling/test_colpali.py
  • tests/models/multimodal/pooling/test_colqwen3_5.py
  • tests/models/multimodal/pooling/test_intern_vit.py
  • tests/models/multimodal/pooling/test_jinavl_reranker.py
  • tests/models/multimodal/pooling/test_llama_nemotron_vl.py
  • tests/models/multimodal/pooling/test_radio.py
  • tests/models/multimodal/pooling/test_siglip.py
  • tests/models/multimodal/processing/test_audio_in_video.py
  • tests/models/multimodal/processing/test_common.py
  • tests/models/multimodal/processing/test_cosmos3_edge.py
  • tests/models/multimodal/processing/test_gemma4.py
  • tests/models/multimodal/processing/test_gemma4_unified.py
  • tests/models/multimodal/processing/test_glm4_1v.py
  • tests/models/multimodal/processing/test_llava_next_video.py
  • tests/models/multimodal/processing/test_minicpmv.py
  • tests/models/multimodal/processing/test_moss_audio.py
  • tests/models/multimodal/processing/test_moss_transcribe_diarize.py
  • tests/models/multimodal/processing/test_qwen2_5_omni_embed.py
  • tests/models/multimodal/processing/test_qwen2_vl.py
  • tests/models/multimodal/processing/test_transformers.py
  • tests/models/multimodal/processing/test_transformers_audio.py
  • tests/models/multimodal/processing/test_transformers_image.py
  • tests/models/multimodal/test_mapping.py
  • tests/models/multimodal/test_mimo_v2_omni.py
  • tests/models/multimodal/test_nano_nemotron_vl.py
  • tests/models/quantization/test_awq.py
  • tests/models/quantization/test_fp8.py
  • tests/models/quantization/test_gpt_oss.py
  • tests/models/quantization/test_mxfp8.py
  • tests/models/quantization/test_per_token_kv_cache.py
  • tests/models/registry.py
  • tests/models/test_adapters.py
  • tests/models/test_deepseek_v4_mega_moe.py
  • tests/models/test_dspark_mla.py
  • tests/models/test_initialization.py
  • tests/models/test_qwen3_5_mtp_config.py
  • tests/models/test_registry.py
  • tests/models/test_vision.py
  • tests/models/transformers/fusers/test_linear.py
  • tests/models/transformers/fusers/test_mla.py
  • tests/models/transformers/fusers/test_moe.py
  • tests/models/transformers/fusers/test_rms_norm.py
  • tests/models/transformers/test_backend.py
  • tests/models/transformers/test_layer_registry.py
  • tests/models/utils.py
  • tests/multimodal/media/test_audio.py
  • tests/multimodal/media/test_connector.py
  • tests/multimodal/media/test_image.py
  • tests/multimodal/media/test_unprocessable_entity_error.py
  • tests/multimodal/media/test_video.py
  • tests/multimodal/test_audio.py
  • tests/multimodal/test_cache.py
  • tests/multimodal/test_gpu_ipc_memory.py
  • tests/multimodal/test_hasher.py
  • tests/multimodal/test_processing.py
  • tests/multimodal/test_utils.py
  • tests/multimodal/test_vidcom2.py
  • tests/multimodal/test_video.py
  • tests/parser/engine/conftest.py
  • tests/parser/engine/test_deepseek_v4.py
  • tests/parser/engine/test_delegating_replay.py
  • tests/parser/engine/test_engine.py
  • tests/parser/engine/test_gemma4_streaming_reasoning.py
  • tests/parser/engine/test_inkling.py
  • tests/parser/engine/test_ling3.py
  • tests/parser/engine/test_nemotron_v3.py
  • tests/parser/engine/test_parser_engine.py
  • tests/parser/engine/test_qwen3.py
  • tests/parser/engine/test_replay.py
  • tests/parser/engine/test_token_id_scanner.py
  • tests/parser/engine/trace_builder.py
  • tests/parser/mistral/__init__.py
  • tests/parser/mistral/test_reasoning.py
  • tests/parser/mistral/test_tool_calls.py
  • tests/parser/test_harmony.py
  • tests/parser/test_include_reasoning.py
  • tests/parser/test_parse.py
  • tests/parser/test_streaming.py
  • tests/plugins/bge_m3_sparse_plugin/bge_m3_sparse_processor/sparse_embeddings_processor.py
  • tests/plugins/prithvi_io_processor_plugin/prithvi_io_processor/prithvi_processor.py
  • tests/plugins/vllm_add_dummy_platform/vllm_add_dummy_platform/dummy_platform.py
  • tests/plugins/vllm_add_dummy_stat_logger/dummy_stat_logger/dummy_stat_logger.py
  • tests/plugins_tests/bitsandbytes/__init__.py
  • tests/plugins_tests/bitsandbytes/test_bitsandbytes.py
  • tests/plugins_tests/bitsandbytes/test_transformers.py
  • tests/plugins_tests/gguf/test_gguf_plugin_multimodal.py
  • tests/plugins_tests/lora_resolvers/test_filesystem_resolver.py
  • tests/plugins_tests/lora_resolvers/test_hf_hub_resolver.py
  • tests/plugins_tests/test_bge_m3_sparse_io_processor_plugins.py
  • tests/plugins_tests/test_oot_registration_offline.py
  • tests/quantization/test_auto_gptq.py
  • tests/quantization/test_auto_round.py
  • tests/quantization/test_compressed_tensors.py
  • tests/quantization/test_experts_int8.py
  • tests/quantization/test_fp8.py
  • tests/quantization/test_gfx950_moe.py
  • tests/quantization/test_humming_ignore.py
  • tests/quantization/test_int8_moe_oracle.py
  • tests/quantization/test_modelopt.py
  • tests/quantization/test_moe_wna16.py
  • tests/quantization/test_online.py
  • tests/quantization/test_online_mxfp4.py
  • tests/quantization/test_per_token_kv_cache.py
  • tests/quantization/test_quark.py
  • tests/quantization/test_torchao.py
  • tests/quantization/test_trtllm_nvfp4_hidden_dim_padding.py
  • tests/quantization/test_turboquant.py
  • tests/quantization/utils.py
  • tests/reasoning/test_cohere_command_reasoning_parser.py
  • tests/reasoning/test_gemma4_reasoning_parser.py
  • tests/reasoning/test_gptoss_reasoning_parser.py
  • tests/reasoning/test_kimi_k3_reasoning_parser.py
  • tests/reasoning/test_mistral_reasoning_parser.py
  • tests/renderers/test_chat_utils_prompt_embeds.py
  • tests/renderers/test_cohere.py
  • tests/renderers/test_completions.py
  • tests/renderers/test_inkling.py
  • tests/renderers/test_kimi_k3.py
  • tests/renderers/test_process_multi_modal_uuids.py
  • tests/renderers/test_sparse_tensor_concurrent_race.py
  • tests/rocm/aiter/test_mla_fp8_support_check.py
  • tests/samplers/test_beam_search.py
  • tests/samplers/test_non_finite_params.py
  • tests/spec_decode/test_custom_proposer.py
  • tests/standalone_tests/python_only_compile.sh
  • tests/test_cmake_utils.py
  • tests/test_config.py
  • tests/test_envs.py
  • tests/test_jit_monitor.py
  • tests/test_pooling_params.py
  • tests/test_quantization_revision_pin.py
  • tests/test_request_input_bounds.py
  • tests/test_sampling_params.py
  • tests/test_tensorizer_revision_pin.py
  • tests/test_zen_cpu_platform_detection.py
  • tests/tokenizers_/test_deepseek_v4.py
  • tests/tokenizers_/test_detokenize.py
  • tests/tokenizers_/test_mistral.py
  • tests/tokenizers_/test_registry.py
  • tests/tool_parsers/test_cohere_command_tool_parser.py
  • tests/tool_parsers/test_dots_tool_parser.py
  • tests/tool_parsers/test_internlm2_tool_parser.py
  • tests/tool_parsers/test_jamba_tool_parser.py
  • tests/tool_parsers/test_kimi_k3_named_tool_choice.py
  • tests/tool_parsers/test_lfm2_tool_parser.py
  • tests/tool_parsers/test_minicpm5xml_tool_parser.py
  • tests/tool_parsers/test_minimax_m2_tool_parser.py
  • tests/tool_parsers/test_minimax_m3_tool_parser.py
  • tests/tool_parsers/test_qwen3coder_tool_parser.py
  • tests/tool_parsers/test_structural_tag_registry.py
  • tests/tool_parsers/test_utils.py
  • tests/tool_use/conftest.py
  • tests/tool_use/mistral/conftest.py
  • tests/tool_use/mistral/test_mistral_tool_calls.py
  • tests/tool_use/test_chat_completion_request_validations.py
  • tests/tool_use/test_kimi_k3_tool_parser.py
  • tests/tool_use/test_muse_glimmer.py
  • tests/tool_use/test_muse_glimmer_parse_delta.py
  • tests/tool_use/test_responses_request_validations.py
  • tests/tools/test_docker_build_metadata_args.py
  • tests/transformers_utils/test_config.py
  • tests/transformers_utils/test_dspark_mla_config.py
  • tests/transformers_utils/test_muse_glimmer_config.py
  • tests/transformers_utils/test_processor.py
  • tests/utils.py
  • tests/utils_/test_argparse_utils.py
  • tests/utils_/test_gpu_sync_debug.py
  • tests/utils_/test_mem_utils.py
  • tests/utils_/test_network_utils.py
  • tests/utils_/test_serial_utils.py
  • tests/utils_/test_torch_utils.py
  • tests/v1/attention/test_attention_backends.py
  • tests/v1/attention/test_attention_splitting.py
  • tests/v1/attention/test_backend_per_kind.py
  • tests/v1/attention/test_cpu_mla_backend.py
  • tests/v1/attention/test_dspark_noncausal_sparse_mla.py
  • tests/v1/attention/test_flashinfer_dcp_spec_reorder.py
  • tests/v1/attention/test_flashinfer_mla_dcp.py
  • tests/v1/attention/test_flashinfer_sparse_mla_sm120_api.py
  • tests/v1/attention/test_group_head_counts.py
  • tests/v1/attention/test_group_sliding_window.py
  • tests/v1/attention/test_indexer_dcp_localize.py
  • tests/v1/attention/test_indexer_deepseek_v4_slot_mapping.py
  • tests/v1/attention/test_indexer_native_next_n.py
  • tests/v1/attention/test_mamba_update_block_table.py
  • tests/v1/attention/test_mla_backends.py
  • tests/v1/attention/test_mla_context_chunks.py
  • tests/v1/attention/test_mla_noncausal.py
  • tests/v1/attention/test_mla_prefill_registry.py
  • tests/v1/attention/test_mla_prefill_selector.py
  • tests/v1/attention/test_mm_prefix.py
  • tests/v1/attention/test_replayssm_metadata_builder.py
  • tests/v1/attention/test_rocm_aiter_mla_fp8_decode_routing.py
  • tests/v1/attention/test_rocm_aiter_mla_mtp_split.py
  • tests/v1/attention/test_rocm_attention_backends_selection.py
  • tests/v1/attention/test_sparse_mla_backends.py
  • tests/v1/attention/test_sparse_mla_mask.py
  • tests/v1/attention/test_trtllm_attention_integration.py
  • tests/v1/attention/utils.py
  • tests/v1/core/prefix_cache/test_partial_prefix_cache_hits.py
  • tests/v1/core/prefix_cache/test_partial_prefix_cache_primitives.py
  • tests/v1/core/test_async_scheduler.py
  • tests/v1/core/test_contiguous_kv_packing.py
  • tests/v1/core/test_deferred_block_free.py
  • tests/v1/core/test_encoder_cache_manager.py
  • tests/v1/core/test_kv_cache_utils.py
  • tests/v1/core/test_mamba_align_chunk_split.py
  • tests/v1/core/test_prefix_caching.py
  • tests/v1/core/test_priority_preemption_bug.py
  • tests/v1/core/test_scheduler.py
  • tests/v1/core/test_single_type_kv_cache_manager.py
  • tests/v1/core/utils.py
  • tests/v1/cudagraph/test_breakable_cudagraph.py
  • tests/v1/cudagraph/test_cudagraph_manager.py
  • tests/v1/cudagraph/test_cudagraph_mode.py
  • tests/v1/cudagraph/test_encoder_cudagraph.py
  • tests/v1/determinism/test_batch_invariance.py
  • tests/v1/determinism/test_cutlass_batch_invariance.py
  • tests/v1/determinism/test_nvfp4_batch_invariant.py
  • tests/v1/determinism/test_nvfp4_batch_invariant_scaled_mm.py
  • tests/v1/determinism/test_online_batch_invariance.py
  • tests/v1/determinism/test_rms_norm_batch_invariant.py
  • tests/v1/determinism/utils.py
  • tests/v1/distributed/test_async_llm_dp.py
  • tests/v1/distributed/test_dbo.py
  • tests/v1/distributed/test_dense_dp_world_size.py
  • tests/v1/distributed/test_eagle_dp.py
  • tests/v1/distributed/test_internal_lb_dp.py
  • tests/v1/e2e/general/test_attention_backend_per_kind.py
  • tests/v1/e2e/general/test_context_length.py
  • tests/v1/e2e/general/test_correctness_sliding_window.py
  • tests/v1/e2e/general/test_kv_sharing_fast_prefill.py
  • tests/v1/e2e/general/test_mamba_prefix_cache.py
  • tests/v1/e2e/general/test_min_tokens.py
  • tests/v1/e2e/general/test_streaming_input.py
  • tests/v1/e2e/spec_decode/acceptance_rates/__init__.py
  • tests/v1/e2e/spec_decode/acceptance_rates/dflash/__init__.py
  • tests/v1/e2e/spec_decode/acceptance_rates/dflash/test_dflash.py
  • tests/v1/e2e/spec_decode/acceptance_rates/dspark/__init__.py
  • tests/v1/e2e/spec_decode/acceptance_rates/dspark/test_dspark.py
  • tests/v1/e2e/spec_decode/acceptance_rates/mtp_other/__init__.py
  • tests/v1/e2e/spec_decode/acceptance_rates/mtp_other/test_medusa.py
  • tests/v1/e2e/spec_decode/acceptance_rates/mtp_other/test_mtp.py
  • tests/v1/e2e/spec_decode/acceptance_rates/mtp_other/test_synthetic.py
  • tests/v1/e2e/spec_decode/acceptance_rates/utils.py
  • tests/v1/e2e/spec_decode/conftest.py
  • tests/v1/e2e/spec_decode/draft_model/__init__.py
  • tests/v1/e2e/spec_decode/draft_model/test_async.py
  • tests/v1/e2e/spec_decode/draft_model/test_draft_model.py
  • tests/v1/e2e/spec_decode/draft_model/test_lora.py
  • tests/v1/e2e/spec_decode/eagle/__init__.py
  • tests/v1/e2e/spec_decode/eagle/test_eagle_correctness.py
  • tests/v1/e2e/spec_decode/eagle/utils.py
  • tests/v1/e2e/spec_decode/mtp/__init__.py
  • tests/v1/e2e/spec_decode/mtp/test_mtp.py
  • tests/v1/e2e/spec_decode/ngram_suffix/__init__.py
  • tests/v1/e2e/spec_decode/ngram_suffix/test_ngram_suffix.py
  • tests/v1/e2e/spec_decode/speculators/__init__.py
  • tests/v1/e2e/spec_decode/speculators/test_speculators.py
  • tests/v1/e2e/spec_decode/test_laguna_dflash.py
  • tests/v1/e2e/spec_decode/test_mtp_parallel_load.py
  • tests/v1/e2e/spec_decode/test_spec_decode.py
  • tests/v1/e2e/spec_decode/utils.py
  • tests/v1/e2e/test_replayssm_decode.py
  • tests/v1/ec_connector/integration/run_epd_correctness_test.sh
  • tests/v1/ec_connector/integration/test_epd_correctness.py
  • tests/v1/ec_connector/unit/cpu/scheduler/test_embedding_cache.py
  • tests/v1/ec_connector/unit/cpu/scheduler/test_scheduler.py
  • tests/v1/ec_connector/unit/cpu/scheduler/test_step_tracker.py
  • tests/v1/ec_connector/unit/cpu/test_connector.py
  • tests/v1/ec_connector/unit/cpu/test_ec_shared_region.py
  • tests/v1/ec_connector/unit/cpu/worker/test_worker.py
  • tests/v1/ec_connector/unit/test_ec_cpu_connector.py
  • tests/v1/ec_connector/unit/test_ec_output_aggregator.py
  • tests/v1/ec_connector/unit/test_ec_transfer_params.py
  • tests/v1/ec_connector/unit/test_metadata.py
  • tests/v1/ec_connector/unit/test_worker_ec_connector.py
  • tests/v1/engine/test_async_llm.py
  • tests/v1/engine/test_core_engine_actor_manager.py
  • tests/v1/engine/test_engine_args.py
  • tests/v1/engine/test_engine_core_client.py
  • tests/v1/engine/test_iteration_logging.py
  • tests/v1/engine/test_output_processor.py
  • tests/v1/engine/test_parallel_sampling.py
  • tests/v1/engine/test_startup_watch_processes.py
  • tests/v1/executor/test_executor.py
  • tests/v1/executor/test_multiproc_executor_timeout.py
  • tests/v1/executor/test_ray_utils.py
  • tests/v1/fault_tolerance/__init__.py
  • tests/v1/fault_tolerance/test_fault_tolerance_e2e.py
  • tests/v1/kv_connector/mooncake_integration/__init__.py
  • tests/v1/kv_connector/mooncake_integration/config_sweep_accuracy_test.sh
  • tests/v1/kv_connector/mooncake_integration/run_accuracy_test.sh
  • tests/v1/kv_connector/mooncake_integration/test_accuracy.py
  • tests/v1/kv_connector/mooncake_integration/test_mooncake_imports.py
  • tests/v1/kv_connector/nixl_integration/config_sweep_accuracy_test.sh
  • tests/v1/kv_connector/nixl_integration/run_accuracy_test.sh
  • tests/v1/kv_connector/nixl_integration/run_edge_case_test.sh
  • tests/v1/kv_connector/nixl_integration/run_multi_connector_accuracy_test.sh
  • tests/v1/kv_connector/nixl_integration/spec_decode_acceptance_test.sh
  • tests/v1/kv_connector/nixl_integration/test_accuracy.py
  • tests/v1/kv_connector/nixl_integration/test_nixl_imports.py
  • tests/v1/kv_connector/unit/offloading_connector/test_canonical_mapping.py
  • tests/v1/kv_connector/unit/offloading_connector/test_config.py
  • tests/v1/kv_connector/unit/offloading_connector/test_events.py
  • tests/v1/kv_connector/unit/offloading_connector/test_metrics.py
  • tests/v1/kv_connector/unit/offloading_connector/test_scheduler.py
  • tests/v1/kv_connector/unit/offloading_connector/test_worker.py
  • tests/v1/kv_connector/unit/offloading_connector/utils.py
  • tests/v1/kv_connector/unit/test_bidirectional_kv_transfer.py
  • tests/v1/kv_connector/unit/test_example_connector.py
  • tests/v1/kv_connector/unit/test_handshake_pp_aggregation.py
  • tests/v1/kv_connector/unit/test_mooncake_connector.py
  • tests/v1/kv_connector/unit/test_mooncake_store_connector.py
  • tests/v1/kv_connector/unit/test_mooncake_store_coordinator.py
  • tests/v1/kv_connector/unit/test_mooncake_store_hma_e2e.py
  • tests/v1/kv_connector/unit/test_mooncake_store_prepare_values.py
  • tests/v1/kv_connector/unit/test_mooncake_store_scheduler.py
  • tests/v1/kv_connector/unit/test_mooncake_store_worker.py
  • tests/v1/kv_connector/unit/test_moriio_connector.py
  • tests/v1/kv_connector/unit/test_moriio_kv_layout.py
  • tests/v1/kv_connector/unit/test_moriio_proxy_routing.py
  • tests/v1/kv_connector/unit/test_moriio_routing.py
  • tests/v1/kv_connector/unit/test_moriio_routing_fairness.py
  • tests/v1/kv_connector/unit/test_moriio_toy_proxy_server.py
  • tests/v1/kv_connector/unit/test_moriio_tp_ack.py
  • tests/v1/kv_connector/unit/test_moriio_unmap.py
  • tests/v1/kv_connector/unit/test_multi_connector.py
  • tests/v1/kv_connector/unit/test_nixl_connector.py
  • tests/v1/kv_connector/unit/test_nixl_connector_hma.py
  • tests/v1/kv_connector/unit/test_nixl_desc_geometry.py
  • tests/v1/kv_connector/unit/test_nixl_push_connector.py
  • tests/v1/kv_connector/unit/test_nixl_rocm_gpu_mem_diag.py
  • tests/v1/kv_connector/unit/test_offloading_connector.py
  • tests/v1/kv_connector/unit/test_tp_mapping.py
  • tests/v1/kv_connector/unit/test_transfer_topology_sharded.py
  • tests/v1/kv_connector/unit/utils.py
  • tests/v1/kv_offload/cpu/__init__.py
  • tests/v1/kv_offload/cpu/policies/__init__.py
  • tests/v1/kv_offload/cpu/policies/test_factory.py
  • tests/v1/kv_offload/cpu/test_canonical_layout.py
  • tests/v1/kv_offload/cpu/test_gpu_worker.py
  • tests/v1/kv_offload/cpu/test_manager.py
  • tests/v1/kv_offload/cpu/test_shared_offload_region.py
  • tests/v1/kv_offload/test_factory.py
  • tests/v1/kv_offload/test_file_mapper.py
  • tests/v1/kv_offload/tiering/p2p/p2p_connector_proxy.py
  • tests/v1/kv_offload/tiering/p2p/run_accuracy_test.sh
  • tests/v1/kv_offload/tiering/p2p/test_data_transport.py
  • tests/v1/kv_offload/tiering/p2p/test_manager.py
  • tests/v1/kv_offload/tiering/p2p/test_sessions.py
  • tests/v1/kv_offload/tiering/p2p/test_zmq_transport.py
  • tests/v1/kv_offload/tiering/test_async_lookup.py
  • tests/v1/kv_offload/tiering/test_factory.py
  • tests/v1/kv_offload/tiering/test_fs_tier.py
  • tests/v1/kv_offload/tiering/test_metrics.py
  • tests/v1/kv_offload/tiering/test_obj_tier.py
  • tests/v1/kv_offload/tiering/test_tiering_offloading.py
  • tests/v1/logits_processors/test_correctness.py
  • tests/v1/logits_processors/test_custom_offline.py
  • tests/v1/logits_processors/utils.py
  • tests/v1/metrics/test_stats.py
  • tests/v1/sample/test_head_dtype.py
  • tests/v1/sample/test_logprobs.py
  • tests/v1/sample/test_sampling_params_e2e.py
  • tests/v1/sample/test_thinking_budget_state.py
  • tests/v1/sample/test_topk_topp_sampler.py
  • tests/v1/shutdown/test_delete.py
  • tests/v1/shutdown/test_processor_error.py
  • tests/v1/simple_kv_offload/test_scheduler.py
  • tests/v1/simple_kv_offload/test_worker.py
  • tests/v1/spec_decode/test_adaptive_verification.py
  • tests/v1/spec_decode/test_dflash_causality.py
  • tests/v1/spec_decode/test_dflash_prepare_inputs.py
  • tests/v1/spec_decode/test_dspark_topk.py
  • tests/v1/spec_decode/test_dynamic_sd_cug.py
  • tests/v1/spec_decode/test_eagle_draft_attn_metadata.py
  • tests/v1/spec_decode/test_llm_base_proposer.py
  • tests/v1/spec_decode/test_llm_base_proposer_sampling.py
  • tests/v1/spec_decode/test_max_len.py
  • tests/v1/spec_decode/test_mtp_structured_output.py
  • tests/v1/spec_decode/test_rejection_sampler_utils.py
  • tests/v1/streaming_input/test_gpu_model_runner_streaming.py
  • tests/v1/streaming_input/test_gpu_model_runner_v2_streaming.py
  • tests/v1/streaming_input/test_scheduler_streaming.py
  • tests/v1/structured_output/test_backend_xgrammar_stop_tokens.py
  • tests/v1/structured_output/test_outlines_cache.py
  • tests/v1/structured_output/test_reasoning_structured_output.py
  • tests/v1/structured_output/test_validation.py
  • tests/v1/test_kv_cache_spec_registry.py
  • tests/v1/test_outputs.py
  • tests/v1/test_request.py
  • tests/v1/test_serial_utils.py
  • tests/v1/test_tensor_ipc_queue.py
  • tests/v1/worker/test_attn_utils.py
  • tests/v1/worker/test_cp_utils.py
  • tests/v1/worker/test_dsv4_packed_zeroer_geometry.py
  • tests/v1/worker/test_encoder_runner.py
  • tests/v1/worker/test_gpu_autoregressive_speculator.py
  • tests/v1/worker/test_gpu_bad_words.py
  • tests/v1/worker/test_gpu_batch_ordering.py
  • tests/v1/worker/test_gpu_block_table.py
  • tests/v1/worker/test_gpu_gumbel_sample.py
  • tests/v1/worker/test_gpu_input_batch.py
  • tests/v1/worker/test_gpu_input_batch_v2.py
  • tests/v1/worker/test_gpu_model_runner.py
  • tests/v1/worker/test_gpu_model_runner_mm_gather.py
  • tests/v1/worker/test_gpu_model_runner_v2.py
  • tests/v1/worker/test_gpu_model_runner_v2_eplb.py
  • tests/v1/worker/test_gpu_profiler.py
  • tests/v1/worker/test_gpu_rejection_sampler_chunking.py
  • tests/v1/worker/test_gpu_sampler_flags.py
  • tests/v1/worker/test_gpu_thinking_budget.py
  • tests/v1/worker/test_gpu_warmup_blocks.py
  • tests/v1/worker/test_gpu_worker.py
  • tests/v1/worker/test_gpu_worker_weight_transfer.py
  • tests/v1/worker/test_jit_warmup_migration.py
  • tests/v1/worker/test_kv_block_zeroer.py
  • tests/v1/worker/test_mamba_hybrid_model_state.py
  • tests/v1/worker/test_mamba_utils.py
  • tests/v1/worker/test_prompt_embeds_state.py
  • tests/v1/worker/test_workspace.py
  • tools/build_rust.py
  • tools/ep_kernels/README.md
  • tools/ep_kernels/install_python_libraries.sh
  • tools/install_deepgemm.sh
  • tools/pre_commit/check_forbidden_imports.py
  • tools/pre_commit/check_spdx_header.py
  • tools/pre_commit/mypy.py
  • tools/pre_commit/update-dockerfile-graph.sh
  • tools/recipes/README.md
  • tools/recipes/recipe_json_to_vllm_config.py
  • use_existing_torch.py
  • vllm/_aiter_ops.py
  • vllm/_custom_ops.py
  • vllm/_xpu_ops.py
  • vllm/benchmarks/datasets/datasets.py
  • vllm/benchmarks/latency.py
  • vllm/benchmarks/lib/endpoint_request_func.py
  • vllm/benchmarks/serve.py
  • vllm/benchmarks/throughput.py
  • vllm/collect_env.py
  • vllm/compilation/backends.py
  • vllm/compilation/caching.py
  • vllm/compilation/passes/fusion/add_rms_fusion.py
  • vllm/compilation/passes/fusion/allreduce_rms_fusion.py
  • vllm/compilation/passes/fusion/matcher_utils.py
  • vllm/compilation/passes/fusion/qk_norm_rope_fusion.py
  • vllm/compilation/passes/fusion/qk_norm_rope_kvcache_fusion.py
  • vllm/compilation/passes/fusion/rocm_aiter_fusion.py
  • vllm/compilation/passes/fusion/rope_kvcache_fusion.py
  • vllm/compilation/passes/fx_utils.py
  • vllm/compilation/passes/pass_manager.py
  • vllm/compilation/passes/vllm_inductor_pass.py
  • vllm/config/__init__.py
  • vllm/config/attention.py
  • vllm/config/cache.py
  • vllm/config/compilation.py
  • vllm/config/ec_manager_config.py
  • vllm/config/ec_transfer.py
  • vllm/config/fault_tolerance.py
  • vllm/config/kernel.py
  • vllm/config/load.py
  • vllm/config/lora.py
  • vllm/config/mamba.py
  • vllm/config/model.py
  • vllm/config/model_arch.py
  • vllm/config/multimodal.py
  • vllm/config/parallel.py
  • vllm/config/pooler.py
  • vllm/config/profiler.py
  • vllm/config/quantization.py
  • vllm/config/reasoning.py
  • vllm/config/scheduler.py
  • vllm/config/speculative.py
  • vllm/config/utils.py
  • vllm/config/vllm.py
  • vllm/cute_utils/__init__.py
  • vllm/cute_utils/_tcgen05.py
  • vllm/cute_utils/cvt.py
  • vllm/cute_utils/mbarrier.py
  • vllm/device_allocator/__init__.py
  • vllm/device_allocator/cumem.py
  • vllm/device_allocator/xpumem.py
  • vllm/distributed/device_communicators/all2all.py
  • vllm/distributed/device_communicators/all_reduce_utils.py
  • vllm/distributed/device_communicators/base_device_communicator.py
  • vllm/distributed/device_communicators/cpu_communicator.py
  • vllm/distributed/device_communicators/cuda_communicator.py
  • vllm/distributed/device_communicators/custom_all_reduce.py
  • vllm/distributed/device_communicators/flashinfer_all_reduce.py
  • vllm/distributed/device_communicators/pynccl_allocator.py
  • vllm/distributed/device_communicators/pynccl_wrapper.py
  • vllm/distributed/device_communicators/shm_broadcast.py
  • vllm/distributed/device_communicators/symm_mem.py
  • vllm/distributed/device_communicators/xpu_communicator.py
  • vllm/distributed/ec_transfer/ec_connector/base.py
  • vllm/distributed/ec_transfer/ec_connector/cpu/__init__.py
  • vllm/distributed/ec_transfer/ec_connector/cpu/common.py
  • vllm/distributed/ec_transfer/ec_connector/cpu/connector.py
  • vllm/distributed/ec_transfer/ec_connector/cpu/ec_shared_region.py
  • vllm/distributed/ec_transfer/ec_connector/cpu/scheduler/__init__.py
  • vllm/distributed/ec_transfer/ec_connector/cpu/scheduler/embedding_cache.py
  • vllm/distributed/ec_transfer/ec_connector/cpu/scheduler/step_tracker.py
  • vllm/distributed/ec_transfer/ec_connector/cpu/worker/__init__.py
  • vllm/distributed/ec_transfer/ec_connector/cpu/worker/descriptor_buffers.py
  • vllm/distributed/ec_transfer/ec_connector/example_connector.py
  • vllm/distributed/ec_transfer/ec_connector/factory.py
  • vllm/distributed/ec_transfer/ec_connector/utils.py
  • vllm/distributed/elastic_ep/elastic_execute.py
  • vllm/distributed/elastic_ep/elastic_state.py
  • vllm/distributed/elastic_ep/standby_state.py
  • vllm/distributed/eplb/eplb_communicator.py
  • vllm/distributed/eplb/eplb_state.py
  • vllm/distributed/eplb/rebalance_execute.py
  • vllm/distributed/kv_events.py
  • vllm/distributed/kv_transfer/kv_connector/utils.py
  • vllm/distributed/kv_transfer/kv_connector/v1/base.py
  • vllm/distributed/kv_transfer/kv_connector/v1/example_connector.py
  • vllm/distributed/kv_transfer/kv_connector/v1/mooncake/mooncake_connector.py
  • vllm/distributed/kv_transfer/kv_connector/v1/mooncake/mooncake_utils.py
  • vllm/distributed/kv_transfer/kv_connector/v1/mooncake/store/connector.py
  • vllm/distributed/kv_transfer/kv_connector/v1/mooncake/store/coordinator.py
  • vllm/distributed/kv_transfer/kv_connector/v1/mooncake/store/data.py
  • vllm/distributed/kv_transfer/kv_connector/v1/mooncake/store/protocol.py
  • vllm/distributed/kv_transfer/kv_connector/v1/mooncake/store/scheduler.py
  • vllm/distributed/kv_transfer/kv_connector/v1/mooncake/store/worker.py
  • vllm/distributed/kv_transfer/kv_connector/v1/moriio/moriio_common.py
  • vllm/distributed/kv_transfer/kv_connector/v1/moriio/moriio_connector.py
  • vllm/distributed/kv_transfer/kv_connector/v1/moriio/moriio_engine.py
  • vllm/distributed/kv_transfer/kv_connector/v1/moriio/moriio_layout.py
  • vllm/distributed/kv_transfer/kv_connector/v1/multi_connector.py
  • vllm/distributed/kv_transfer/kv_connector/v1/nixl/base_scheduler.py
  • vllm/distributed/kv_transfer/kv_connector/v1/nixl/base_worker.py
  • vllm/distributed/kv_transfer/kv_connector/v1/nixl/connector.py
  • vllm/distributed/kv_transfer/kv_connector/v1/nixl/metadata.py
  • vllm/distributed/kv_transfer/kv_connector/v1/nixl/pull_scheduler.py
  • vllm/distributed/kv_transfer/kv_connector/v1/nixl/pull_worker.py
  • vllm/distributed/kv_transfer/kv_connector/v1/nixl/push_scheduler.py
  • vllm/distributed/kv_transfer/kv_connector/v1/nixl/push_worker.py
  • vllm/distributed/kv_transfer/kv_connector/v1/offloading/canonical_mapping.py
  • vllm/distributed/kv_transfer/kv_connector/v1/offloading/config.py
  • vllm/distributed/kv_transfer/kv_connector/v1/offloading/events.py
  • vllm/distributed/kv_transfer/kv_connector/v1/offloading/metrics.py
  • vllm/distributed/kv_transfer/kv_connector/v1/offloading/scheduler.py
  • vllm/distributed/kv_transfer/kv_connector/v1/offloading/worker.py
  • vllm/distributed/kv_transfer/kv_connector/v1/offloading_connector.py
  • vllm/distributed/kv_transfer/kv_connector/v1/simple_cpu_offload_connector.py
  • vllm/distributed/nixl_utils.py
  • vllm/distributed/parallel_state.py
  • vllm/distributed/stateless_coordinator.py
  • vllm/distributed/weight_transfer/__init__.py
  • vllm/distributed/weight_transfer/base.py
  • vllm/distributed/weight_transfer/clients.py
  • vllm/distributed/weight_transfer/factory.py
  • vllm/distributed/weight_transfer/ipc_engine.py
  • vllm/distributed/weight_transfer/nccl_common.py
  • vllm/distributed/weight_transfer/nccl_engine.py
  • vllm/distributed/weight_transfer/packed_tensor.py
  • vllm/distributed/weight_transfer/sparse_nccl_engine.py
  • vllm/engine/arg_utils.py
  • vllm/engine/protocol.py
  • vllm/entrypoints/anthropic/api_router.py
  • vllm/entrypoints/anthropic/protocol.py
  • vllm/entrypoints/anthropic/serving.py
  • vllm/entrypoints/chat_utils.py
  • vllm/entrypoints/cli/benchmark/main.py
  • vllm/entrypoints/cli/benchmark/mm_processor.py
  • vllm/entrypoints/cli/launch.py
  • vllm/entrypoints/cli/main.py
  • vllm/entrypoints/cli/serve.py
  • vllm/entrypoints/cohere/__init__.py
  • vllm/entrypoints/cohere/api_router.py
  • vllm/entrypoints/cohere/cohere_chat_message.py
  • vllm/entrypoints/cohere/protocol.py
  • vllm/entrypoints/cohere/serving.py
  • vllm/entrypoints/generate/api_router.py
  • vllm/entrypoints/generate/base/serving.py
  • vllm/entrypoints/generate/beam_search/offline.py
  • vllm/entrypoints/generate/beam_search/online.py
  • vllm/entrypoints/launcher.py
  • vllm/entrypoints/launchers/__init__.py
  • vllm/entrypoints/launchers/api_server/__init__.py
  • vllm/entrypoints/launchers/api_server/routers.py
  • vllm/entrypoints/llm.py
  • vllm/entrypoints/openai/api_server.py
  • vllm/entrypoints/openai/chat_completion/batch_serving.py
  • vllm/entrypoints/openai/chat_completion/protocol.py
  • vllm/entrypoints/openai/chat_completion/serving.py
  • vllm/entrypoints/openai/cli_args.py
  • vllm/entrypoints/openai/completion/protocol.py
  • vllm/entrypoints/openai/completion/serving.py
  • vllm/entrypoints/openai/dp_supervisor.py
  • vllm/entrypoints/openai/engine/protocol.py
  • vllm/entrypoints/openai/models/serving.py
  • vllm/entrypoints/openai/responses/context.py
  • vllm/entrypoints/openai/responses/protocol.py
  • vllm/entrypoints/openai/responses/serving.py
  • vllm/entrypoints/openai/responses/utils.py
  • vllm/entrypoints/openai/run_batch.py
  • vllm/entrypoints/pooling/base/io_processor.py
  • vllm/entrypoints/pooling/base/protocol.py
  • vllm/entrypoints/pooling/base/serving.py
  • vllm/entrypoints/pooling/classify/api_router.py
  • vllm/entrypoints/pooling/classify/protocol.py
  • vllm/entrypoints/pooling/embed/api_router.py
  • vllm/entrypoints/pooling/embed/io_processor.py
  • vllm/entrypoints/pooling/embed/protocol.py
  • vllm/entrypoints/pooling/embed/serving.py
  • vllm/entrypoints/pooling/factories.py
  • vllm/entrypoints/pooling/offline.py
  • vllm/entrypoints/pooling/pooling/api_router.py
  • vllm/entrypoints/pooling/pooling/io_processor.py
  • vllm/entrypoints/pooling/pooling/protocol.py
  • vllm/entrypoints/pooling/pooling/serving.py
  • vllm/entrypoints/pooling/scoring/api_router.py
  • vllm/entrypoints/pooling/scoring/io_processor.py
  • vllm/entrypoints/pooling/scoring/serving.py
  • vllm/entrypoints/pooling/scoring/utils.py
  • vllm/entrypoints/pooling/typing.py
  • vllm/entrypoints/scale_out/derender/api_router.py
  • vllm/entrypoints/scale_out/derender/serving.py
  • vllm/entrypoints/scale_out/token_in_token_out/protocol.py
  • vllm/entrypoints/scale_out/token_in_token_out/serving.py
  • vllm/entrypoints/serve/__init__.py
  • vllm/entrypoints/serve/dev/rlhf/api_router.py
  • vllm/entrypoints/serve/elastic_ep/api_router.py
  • vllm/entrypoints/serve/engine/serving.py
  • vllm/entrypoints/serve/engine/typing.py
  • vllm/entrypoints/serve/exception_handling/__init__.py
  • vllm/entrypoints/serve/exception_handling/error_response.py
  • vllm/entrypoints/serve/exception_handling/handlers/__init__.py
  • vllm/entrypoints/serve/exception_handling/handlers/exception.py
  • vllm/entrypoints/serve/exception_handling/handlers/http.py
  • vllm/entrypoints/serve/exception_handling/handlers/validation.py
  • vllm/entrypoints/serve/exception_handling/handlers/vllm_error.py
  • vllm/entrypoints/serve/exception_handling/register.py
  • vllm/entrypoints/serve/exception_handling/utils.py
  • vllm/entrypoints/serve/fault_tolerance/__init__.py
  • vllm/entrypoints/serve/fault_tolerance/api_router.py
  • vllm/entrypoints/serve/middleware/__init__.py
  • vllm/entrypoints/serve/middleware/authenticate.py
  • vllm/entrypoints/serve/middleware/log_response.py
  • vllm/entrypoints/serve/middleware/register.py
  • vllm/entrypoints/serve/middleware/x_request_id.py
  • vllm/entrypoints/serve/tokenize/api_router.py
  • vllm/entrypoints/serve/tokenize/protocol.py
  • vllm/entrypoints/serve/utils/api_utils.py
  • vllm/entrypoints/serve/utils/request_logger.py
  • vllm/entrypoints/serve/utils/server_utils.py
  • vllm/entrypoints/speech_to_text/base/protocol.py
  • vllm/entrypoints/speech_to_text/base/serving.py
  • vllm/entrypoints/speech_to_text/factories.py
  • vllm/entrypoints/speech_to_text/realtime/connection.py
  • vllm/entrypoints/speech_to_text/transcription/protocol.py
  • vllm/entrypoints/speech_to_text/transcription/serving.py
  • vllm/entrypoints/speech_to_text/translation/protocol.py
  • vllm/envs.py
  • vllm/exceptions.py
  • vllm/inputs/engine.py
  • vllm/ir/ops/layernorm.py
  • vllm/kernels/__init__.py
  • vllm/kernels/aiter_ops.py
  • vllm/kernels/helion/__init__.py
  • vllm/kernels/helion/configs/rms_norm_per_block_quant/nvidia_b200.json
  • vllm/kernels/helion/ops/__init__.py
  • vllm/kernels/helion/ops/dynamic_per_token_scaled_fp8_quant.py
  • vllm/kernels/helion/ops/per_token_group_fp8_quant.py
  • vllm/kernels/helion/ops/rms_norm_dynamic_per_token_quant.py
  • vllm/kernels/helion/ops/rms_norm_per_block_quant.py
  • vllm/kernels/helion/ops/silu_and_mul_per_block_quant.py
  • vllm/kernels/triton/qkv_padded_fp8_quant.py
  • vllm/kernels/vllm_c.py
  • vllm/kernels/xpu_ops.py
  • vllm/lora/layers/base.py
  • vllm/lora/layers/fused_moe.py
  • vllm/lora/layers/logits_processor.py
  • vllm/lora/layers/utils.py
  • vllm/lora/layers/vocal_parallel_embedding.py
  • vllm/lora/lora_model.py
  • vllm/lora/lora_weights.py
  • vllm/lora/model_manager.py
  • vllm/lora/ops/triton_ops/fused_moe_lora_op.py
  • vllm/lora/peft_helper.py
  • vllm/lora/punica_wrapper/punica_gpu.py
  • vllm/lora/utils.py
  • vllm/lora/worker_manager.py
  • vllm/model_executor/custom_op.py
  • vllm/model_executor/hw_agnostic/__init__.py
  • vllm/model_executor/hw_agnostic/custom_op.py
  • vllm/model_executor/hw_agnostic/layers/__init__.py
  • vllm/model_executor/hw_agnostic/layers/activation.py
  • vllm/model_executor/hw_agnostic/layers/layernorm.py
  • vllm/model_executor/kernels/linear/__init__.py
  • vllm/model_executor/kernels/linear/base.py
  • vllm/model_executor/kernels/linear/cute_dsl/__init__.py
  • vllm/model_executor/kernels/linear/cute_dsl/_ll_bf16_dotprod.py
  • vllm/model_executor/kernels/linear/cute_dsl/_ll_bf16_splitk.py
  • vllm/model_executor/kernels/linear/cute_dsl/_skinny_gemm.py
  • vllm/model_executor/kernels/linear/cute_dsl/ll_bf16.py
  • vllm/model_executor/kernels/linear/cute_dsl/skinny_gemm.py
  • vllm/model_executor/kernels/linear/mixed_precision/__init__.py
  • vllm/model_executor/kernels/linear/mixed_precision/humming.py
  • vllm/model_executor/kernels/linear/mixed_precision/marlin.py
  • vllm/model_executor/kernels/linear/mixed_precision/rdna_hybrid_w4a16.py
  • vllm/model_executor/kernels/linear/mixed_precision/triton_w4a16.py
  • vllm/model_executor/kernels/linear/mxfp4/aiter.py
  • vllm/model_executor/kernels/linear/mxfp4/b12x.py
  • vllm/model_executor/kernels/linear/mxfp4/base.py
  • vllm/model_executor/kernels/linear/mxfp4/emulation.py
  • vllm/model_executor/kernels/linear/mxfp4/flashinfer.py
  • vllm/model_executor/kernels/linear/mxfp4/humming.py
  • vllm/model_executor/kernels/linear/mxfp4/marlin.py
  • vllm/model_executor/kernels/linear/mxfp4/xpu.py
  • vllm/model_executor/kernels/linear/mxfp6/__init__.py
  • vllm/model_executor/kernels/linear/mxfp6/base.py
  • vllm/model_executor/kernels/linear/mxfp6/emulation.py
  • vllm/model_executor/kernels/linear/mxfp8/b12x.py
  • vllm/model_executor/kernels/linear/mxfp8/flashinfer.py
  • vllm/model_executor/kernels/linear/mxfp8/humming.py
  • vllm/model_executor/kernels/linear/mxfp8/xpu.py
  • vllm/model_executor/kernels/linear/nvfp4/b12x.py
  • vllm/model_executor/kernels/linear/nvfp4/humming.py
  • vllm/model_executor/kernels/linear/scaled_mm/aiter.py
  • vllm/model_executor/kernels/linear/scaled_mm/b12x.py
  • vllm/model_executor/kernels/linear/scaled_mm/cpu.py
  • vllm/model_executor/kernels/linear/scaled_mm/humming.py
  • vllm/model_executor/kernels/linear/scaled_mm/marlin.py
  • vllm/model_executor/kernels/linear/scaled_mm/pytorch.py
  • vllm/model_executor/kernels/linear/scaled_mm/rocm.py
  • vllm/model_executor/kernels/linear/scaled_mm/triton.py
  • vllm/model_executor/kernels/linear/scaled_mm/xpu.py
  • vllm/model_executor/kernels/linear/zentorch_utils.py
  • vllm/model_executor/kernels/mhc/tilelang.py
  • vllm/model_executor/kernels/mhc/tilelang_kernels.py
  • vllm/model_executor/layers/activation.py
  • vllm/model_executor/layers/attention/__init__.py
  • vllm/model_executor/layers/attention/attention.py
  • vllm/model_executor/layers/attention/chunked_local_attention.py
  • vllm/model_executor/layers/attention/mla_attention.py
  • vllm/model_executor/layers/attention/mm_encoder_attention.py
  • vllm/model_executor/layers/attention/pcp.py
  • vllm/model_executor/layers/attention/sparse_mla_attention.py
  • vllm/model_executor/layers/attention/sparse_mla_mask.py
  • vllm/model_executor/layers/attention_layer_base.py
  • vllm/model_executor/layers/batch_invariant.py
  • vllm/model_executor/layers/conv.py
  • vllm/model_executor/layers/fused_allreduce_gemma_rms_norm.py
  • vllm/model_executor/layers/fused_embed_norm.py
  • vllm/model_executor/layers/fused_moe/__init__.py
  • vllm/model_executor/layers/fused_moe/activation.py
  • vllm/model_executor/layers/fused_moe/all2all_utils.py
  • vllm/model_executor/layers/fused_moe/config.py
  • vllm/model_executor/layers/fused_moe/configs/E=256,N=256,device_name=NVIDIA_H20.json
  • vllm/model_executor/layers/fused_moe/configs/E=256,N=512,device_name=NVIDIA_GB10,dtype=fp8_w8a8,block_shape=[128,128].json
  • vllm/model_executor/layers/fused_moe/configs/E=256,N=512,device_name=NVIDIA_H20.json
  • vllm/model_executor/layers/fused_moe/configs/E=512,N=192,device_name=NVIDIA_H20-3e.json
  • vllm/model_executor/layers/fused_moe/configs/E=512,N=512,device_name=NVIDIA_GB10,dtype=fp8_w8a8,block_shape=[128,128].json
  • vllm/model_executor/layers/fused_moe/cpu_fused_moe.py
  • vllm/model_executor/layers/fused_moe/deep_gemm_utils.py
  • vllm/model_executor/layers/fused_moe/experts/aiter_mxfp4_w4a8_moe.py
  • vllm/model_executor/layers/fused_moe/experts/aiter_mxfp8_moe.py
  • vllm/model_executor/layers/fused_moe/experts/batched_deep_gemm_moe.py
  • vllm/model_executor/layers/fused_moe/experts/cpu_int4_moe.py
  • vllm/model_executor/layers/fused_moe/experts/cpu_moe.py
  • vllm/model_executor/layers/fused_moe/experts/cutlass_moe.py
  • vllm/model_executor/layers/fused_moe/experts/deep_gemm_moe.py
  • vllm/model_executor/layers/fused_moe/experts/flashinfer_b12x_moe.py
  • vllm/model_executor/layers/fused_moe/experts/flashinfer_cutedsl_moe.py
  • vllm/model_executor/layers/fused_moe/experts/flashinfer_cutlass_moe.py
  • vllm/model_executor/layers/fused_moe/experts/fused_batched_moe.py
  • vllm/model_executor/layers/fused_moe/experts/fused_humming_moe.py
  • vllm/model_executor/layers/fused_moe/experts/gpt_oss_triton_kernels_moe.py
  • vllm/model_executor/layers/fused_moe/experts/int4_emulation_moe.py
  • vllm/model_executor/layers/fused_moe/experts/lora_context.py
  • vllm/model_executor/layers/fused_moe/experts/lora_experts_mixin.py
  • vllm/model_executor/layers/fused_moe/experts/marlin_moe.py
  • vllm/model_executor/layers/fused_moe/experts/mxfp8_emulation_moe.py
  • vllm/model_executor/layers/fused_moe/experts/mxfp8_native_moe.py
  • vllm/model_executor/layers/fused_moe/experts/ocp_mx_emulation_moe.py
  • vllm/model_executor/layers/fused_moe/experts/rocm_aiter_moe.py
  • vllm/model_executor/layers/fused_moe/experts/triton_moe.py
  • vllm/model_executor/layers/fused_moe/experts/trtllm_bf16_moe.py
  • vllm/model_executor/layers/fused_moe/experts/trtllm_fp8_moe.py
  • vllm/model_executor/layers/fused_moe/experts/trtllm_lora_moe.py
  • vllm/model_executor/layers/fused_moe/experts/trtllm_mxfp4_moe.py
  • vllm/model_executor/layers/fused_moe/experts/trtllm_mxint4_moe.py
  • vllm/model_executor/layers/fused_moe/experts/trtllm_nvfp4_moe.py
  • vllm/model_executor/layers/fused_moe/experts/xpu_moe.py
  • vllm/model_executor/layers/fused_moe/fused_flydsl_moe.py
  • vllm/model_executor/layers/fused_moe/fused_moe.py
  • vllm/model_executor/layers/fused_moe/fused_moe_method_base.py
  • vllm/model_executor/layers/fused_moe/fused_moe_modular_method.py
  • vllm/model_executor/layers/fused_moe/hpc_moe.py
  • vllm/model_executor/layers/fused_moe/layer.py
  • vllm/model_executor/layers/fused_moe/modular_kernel.py
  • vllm/model_executor/layers/fused_moe/moe_output.py
  • vllm/model_executor/layers/fused_moe/oracle/fp8.py
  • vllm/model_executor/layers/fused_moe/oracle/int8.py
  • vllm/model_executor/layers/fused_moe/oracle/int_wna16.py
  • vllm/model_executor/layers/fused_moe/oracle/mxfp4.py
  • vllm/model_executor/layers/fused_moe/oracle/mxfp8.py
  • vllm/model_executor/layers/fused_moe/oracle/nvfp4.py
  • vllm/model_executor/layers/fused_moe/oracle/unquantized.py
  • vllm/model_executor/layers/fused_moe/prepare_finalize/batched.py
  • vllm/model_executor/layers/fused_moe/prepare_finalize/deepep_v2.py
  • vllm/model_executor/layers/fused_moe/prepare_finalize/flashinfer_nvlink_one_sided.py
  • vllm/model_executor/layers/fused_moe/prepare_finalize/nixl_ep.py
  • vllm/model_executor/layers/fused_moe/routed_experts.py
  • vllm/model_executor/layers/fused_moe/routed_experts_capturer.py
  • vllm/model_executor/layers/fused_moe/router/bf16x3_router_gemm_cutedsl.py
  • vllm/model_executor/layers/fused_moe/router/dsv4_topk.py
  • vllm/model_executor/layers/fused_moe/router/fused_topk_bias_router.py
  • vllm/model_executor/layers/fused_moe/router/fused_topk_router.py
  • vllm/model_executor/layers/fused_moe/router/gate_linear.py
  • vllm/model_executor/layers/fused_moe/router/router_factory.py
  • vllm/model_executor/layers/fused_moe/router/routing_simulator_router.py
  • vllm/model_executor/layers/fused_moe/runner/moe_runner.py
  • vllm/model_executor/layers/fused_moe/runner/moe_runner_interface.py
  • vllm/model_executor/layers/fused_moe/runner/shared_experts.py
  • vllm/model_executor/layers/fused_moe/topk_weight_and_reduce.py
  • vllm/model_executor/layers/fused_moe/unquantized_fused_moe_method.py
  • vllm/model_executor/layers/fused_moe/utils.py
  • vllm/model_executor/layers/hpc/rope_norm.py
  • vllm/model_executor/layers/layernorm.py
  • vllm/model_executor/layers/linear.py
  • vllm/model_executor/layers/logits_processor.py
  • vllm/model_executor/layers/mamba/abstract.py
  • vllm/model_executor/layers/mamba/gdn/kimi_gdn_linear_attn.py
  • vllm/model_executor/layers/mamba/gdn/olmo_gdn_linear_attn.py
  • vllm/model_executor/layers/mamba/gdn/qwen_gdn_linear_attn.py
  • vllm/model_executor/layers/mamba/linear/bailing_linear_attn.py
  • vllm/model_executor/layers/mamba/mamba_mixer2.py
  • vllm/model_executor/layers/mamba/mamba_utils.py
  • vllm/model_executor/layers/mamba/ops/causal_conv1d.py
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=128,dstate=256,device_name=Intel(R)_Arc(TM)_Pro_B70_Graphics,cache_dtype=float16.json
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=128,dstate=256,device_name=Intel(R)_Arc(TM)_Pro_B70_Graphics,cache_dtype=float32.json
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=64,dstate=128,device_name=AMD_Instinct_MI325X,cache_dtype=float16.json
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=64,dstate=128,device_name=AMD_Instinct_MI325X,cache_dtype=float32.json
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=64,dstate=128,device_name=AMD_Instinct_MI350_OAM,cache_dtype=float16.json
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=64,dstate=128,device_name=AMD_Instinct_MI350_OAM,cache_dtype=float32.json
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=64,dstate=128,device_name=AMD_Instinct_MI355_OAM,cache_dtype=float16.json
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=64,dstate=128,device_name=AMD_Instinct_MI355_OAM,cache_dtype=float32.json
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=64,dstate=128,device_name=Intel(R)_Arc(TM)_Pro_B70_Graphics,cache_dtype=float16.json
  • vllm/model_executor/layers/mamba/ops/configs/selective_state_update/headdim=64,dstate=128,device_name=Intel(R)_Arc(TM)_Pro_B70_Graphics,cache_dtype=float32.json
  • vllm/model_executor/layers/mamba/ops/cpu/causal_conv1d.py
  • vllm/model_executor/layers/mamba/ops/cpu/gdn_attention.py
  • vllm/model_executor/layers/mamba/ops/cpu/mamba_ssm.py
  • vllm/model_executor/layers/mamba/ops/gather_initial_states.py
  • vllm/model_executor/layers/mamba/ops/gdn_chunk_cutedsl/kernel_kkt_inv_uw.py
  • vllm/model_executor/layers/mamba/ops/mamba_ssm.py
  • vllm/model_executor/layers/mamba/ops/replayssm_config.py
  • vllm/model_executor/layers/mamba/ops/selective_state_update_replayssm_output_only.py
  • vllm/model_executor/layers/mamba/ops/ssd_combined.py
  • vllm/model_executor/layers/mamba/ops/ssu_dispatch.py
  • vllm/model_executor/layers/mamba/short_conv.py
  • vllm/model_executor/layers/mhc.py
  • vllm/model_executor/layers/minimax_rms_norm/rms_norm_tp.py
  • vllm/model_executor/layers/mla.py
  • vllm/model_executor/layers/pooler/tokwise/methods.py
  • vllm/model_executor/layers/quantization/__init__.py
  • vllm/model_executor/layers/quantization/auto_awq.py
  • vllm/model_executor/layers/quantization/auto_gptq.py
  • vllm/model_executor/layers/quantization/base_config.py
  • vllm/model_executor/layers/quantization/bitsandbytes.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_w4a16_flydsl.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_w4a4_mxfp4.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_w4a4_nvfp4.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_w4a8_fp8.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_w8a8_fp8.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_w8a8_int8.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_w8a8_mxfp8.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_wna16.py
  • vllm/model_executor/layers/quantization/compressed_tensors/compressed_tensors_moe/compressed_tensors_moe_wna16_marlin.py
  • vllm/model_executor/layers/quantization/compressed_tensors/schemes/__init__.py
  • vllm/model_executor/layers/quantization/compressed_tensors/schemes/compressed_tensors_w4a4_mxfp4.py
  • vllm/model_executor/layers/quantization/compressed_tensors/schemes/compressed_tensors_w4a8_fp8.py
  • vllm/model_executor/layers/quantization/compressed_tensors/schemes/compressed_tensors_w4a8_int.py
  • vllm/model_executor/layers/quantization/compressed_tensors/schemes/compressed_tensors_w8a16_fp8.py
  • vllm/model_executor/layers/quantization/compressed_tensors/schemes/compressed_tensors_wNa4.py
  • vllm/model_executor/layers/quantization/compressed_tensors/schemes/compressed_tensors_wNa8.py
  • vllm/model_executor/layers/quantization/compressed_tensors/transform/linear.py
  • vllm/model_executor/layers/quantization/compressed_tensors/transform/module.py
  • vllm/model_executor/layers/quantization/compressed_tensors/transform/schemes/linear_qutlass_nvfp4.py
  • vllm/model_executor/layers/quantization/compressed_tensors/triton_scaled_mm.py
  • vllm/model_executor/layers/quantization/compressed_tensors/utils.py
  • vllm/model_executor/layers/quantization/fp8.py
  • vllm/model_executor/layers/quantization/humming.py
  • vllm/model_executor/layers/quantization/inc/config_parser.py
  • vllm/model_executor/layers/quantization/inc/inc.py
  • vllm/model_executor/layers/quantization/inc/schemes/__init__.py
  • vllm/model_executor/layers/quantization/inc/schemes/factory.py
  • vllm/model_executor/layers/quantization/inc/schemes/inc_mxfp4_linear.py
  • vllm/model_executor/layers/quantization/inc/schemes/inc_mxfp4_moe.py
  • vllm/model_executor/layers/quantization/inc/schemes/inc_mxfp4_scheme.py
  • vllm/model_executor/layers/quantization/inc/schemes/inc_mxfp8_linear.py
  • vllm/model_executor/layers/quantization/inc/schemes/inc_mxfp8_scheme.py
  • vllm/model_executor/layers/quantization/inc/schemes/inc_wna16_linear.py
  • vllm/model_executor/layers/quantization/inc/schemes/inc_wna16_scheme.py
  • vllm/model_executor/layers/quantization/input_quant_fp8.py
  • vllm/model_executor/layers/quantization/kv_cache.py
  • vllm/model_executor/layers/quantization/modelopt.py
  • vllm/model_executor/layers/quantization/moe_wna16.py
  • vllm/model_executor/layers/quantization/mxfp4.py
  • vllm/model_executor/layers/quantization/online/base.py
  • vllm/model_executor/layers/quantization/online/fp8.py
  • vllm/model_executor/layers/quantization/online/int8.py
  • vllm/model_executor/layers/quantization/online/moe_base.py
  • vllm/model_executor/layers/quantization/online/mxfp4.py
  • vllm/model_executor/layers/quantization/online/mxfp8.py
  • vllm/model_executor/layers/quantization/online/nvfp4.py
  • vllm/model_executor/layers/quantization/quark/quark.py
  • vllm/model_executor/layers/quantization/quark/quark_moe.py
  • vllm/model_executor/layers/quantization/quark/schemes/__init__.py
  • vllm/model_executor/layers/quantization/quark/schemes/quark_ocp_mx.py
  • vllm/model_executor/layers/quantization/quark/schemes/quark_w4a8_mxfp4_fp8.py
  • vllm/model_executor/layers/quantization/quark/schemes/quark_w8a8_fp8.py
  • vllm/model_executor/layers/quantization/quark/utils.py
  • vllm/model_executor/layers/quantization/qutlass_utils.py
  • vllm/model_executor/layers/quantization/torchao.py
  • vllm/model_executor/layers/quantization/utils/config_utils.py
  • vllm/model_executor/layers/quantization/utils/flashinfer_fp4_moe.py
  • vllm/model_executor/layers/quantization/utils/flashinfer_mxint4_moe.py
  • vllm/model_executor/layers/quantization/utils/flashinfer_utils.py
  • vllm/model_executor/layers/quantization/utils/fp8_utils.py
  • vllm/model_executor/layers/quantization/utils/gptq_utils.py
  • vllm/model_executor/layers/quantization/utils/humming_utils.py
  • vllm/model_executor/layers/quantization/utils/int8_utils.py
  • vllm/model_executor/layers/quantization/utils/marlin_utils.py
  • vllm/model_executor/layers/quantization/utils/marlin_utils_fp4.py
  • vllm/model_executor/layers/quantization/utils/marlin_utils_fp8.py
  • vllm/model_executor/layers/quantization/utils/mxfp4_utils.py
  • vllm/model_executor/layers/quantization/utils/mxfp8_utils.py
  • vllm/model_executor/layers/quantization/utils/nvfp4_emulation_utils.py
  • vllm/model_executor/layers/quantization/utils/ocp_mx_utils.py
  • vllm/model_executor/layers/quantization/utils/quant_utils.py
  • vllm/model_executor/layers/rotary_embedding/mrope.py
  • vllm/model_executor/layers/rotary_embedding/xdrope.py
  • vllm/model_executor/layers/sparse_attn_indexer.py
  • vllm/model_executor/layers/utils.py
  • vllm/model_executor/layers/vocab_parallel_embedding.py
  • vllm/model_executor/model_loader/__init__.py
  • vllm/model_executor/model_loader/bitsandbytes_loader.py
  • vllm/model_executor/model_loader/default_loader.py
  • vllm/model_executor/model_loader/ep_weight_filter.py
  • vllm/model_executor/model_loader/mtp_validation.py
  • vllm/model_executor/model_loader/reload/layerwise.py
  • vllm/model_executor/model_loader/reload/meta.py
  • vllm/model_executor/model_loader/reload/types.py
  • vllm/model_executor/model_loader/reload/utils.py
  • vllm/model_executor/model_loader/tensorizer.py
  • vllm/model_executor/model_loader/utils.py
  • vllm/model_executor/model_loader/weight_utils.py
  • vllm/model_executor/models/AXK1.py
  • vllm/model_executor/models/__init__.py
  • vllm/model_executor/models/adapters.py
  • vllm/model_executor/models/afmoe.py
  • vllm/model_executor/models/aimv2.py
  • vllm/model_executor/models/apertus.py
  • vllm/model_executor/models/arctic.py
  • vllm/model_executor/models/aria.py
  • vllm/model_executor/models/audioflamingo3.py
  • vllm/model_executor/models/bagel.py
  • vllm/model_executor/models/bailing_moe.py
  • vllm/model_executor/models/bailing_moe_linear.py
  • vllm/model_executor/models/bailing_moe_mtp.py
  • vllm/model_executor/models/bailing_moe_v3.py
  • vllm/model_executor/models/bailing_moe_v3_mtp.py
  • vllm/model_executor/models/bee.py
  • vllm/model_executor/models/bert.py
  • vllm/model_executor/models/bert_with_rope.py
  • vllm/model_executor/models/blip2.py
  • vllm/model_executor/models/bloom.py
  • vllm/model_executor/models/chameleon.py
  • vllm/model_executor/models/clip.py
  • vllm/model_executor/models/cohere2_moe.py
  • vllm/model_executor/models/cohere2_vision.py
  • vllm/model_executor/models/cohere_asr.py
  • vllm/model_executor/models/cohere_eagle.py
  • vllm/model_executor/models/colmodernvbert.py
  • vllm/model_executor/models/colpali.py
  • vllm/model_executor/models/colqwen3.py
  • vllm/model_executor/models/colqwen3_5.py
  • vllm/model_executor/models/commandr.py
  • vllm/model_executor/models/config.py
  • vllm/model_executor/models/cosmos3.py
  • vllm/model_executor/models/cosmos3_edge.py
  • vllm/model_executor/models/dbrx.py
  • vllm/model_executor/models/deepencoder.py
  • vllm/model_executor/models/deepencoder2.py
  • vllm/model_executor/models/deepseek_eagle.py
  • vllm/model_executor/models/deepseek_eagle3.py
  • vllm/model_executor/models/deepseek_mtp.py
  • vllm/model_executor/models/deepseek_ocr.py
  • vllm/model_executor/models/deepseek_ocr2.py
  • vllm/model_executor/models/deepseek_v2.py
  • vllm/model_executor/models/deepseek_vl2.py
  • vllm/model_executor/models/diffusion_gemma.py
  • vllm/model_executor/models/dots_ocr.py
  • vllm/model_executor/models/ernie45_moe.py
  • vllm/model_executor/models/ernie45_vl.py
  • vllm/model_executor/models/ernie45_vl_moe.py
  • vllm/model_executor/models/ernie_mtp.py
  • vllm/model_executor/models/exaone.py
  • vllm/model_executor/models/exaone4.py
  • vllm/model_executor/models/exaone4_5_mtp.py
  • vllm/model_executor/models/exaone_moe.py
  • vllm/model_executor/models/exaone_moe_mtp.py
  • vllm/model_executor/models/falcon.py
  • vllm/model_executor/models/fireredasr2.py
  • vllm/model_executor/models/fireredlid.py
  • vllm/model_executor/models/flex_olmo.py
  • vllm/model_executor/models/funasr.py
  • vllm/model_executor/models/funaudiochat.py
  • vllm/model_executor/models/gemma3.py
  • vllm/model_executor/models/gemma3n.py
  • vllm/model_executor/models/gemma3n_mm.py
  • vllm/model_executor/models/gemma4.py
  • vllm/model_executor/models/gemma4_dspark.py
  • vllm/model_executor/models/gemma4_mm.py
  • vllm/model_executor/models/gemma4_mtp.py
  • vllm/model_executor/models/gemma4_unified.py
  • vllm/model_executor/models/glm4.py
  • vllm/model_executor/models/glm4_1v.py
  • vllm/model_executor/models/glm4_moe.py
  • vllm/model_executor/models/glm4_moe_lite.py
  • vllm/model_executor/models/glm4_moe_lite_mtp.py
  • vllm/model_executor/models/glm4_moe_mtp.py
  • vllm/model_executor/models/glm_ocr.py
  • vllm/model_executor/models/glm_ocr_mtp.py
  • vllm/model_executor/models/glmasr.py
  • vllm/model_executor/models/gpt2.py
  • vllm/model_executor/models/gpt_neox.py
  • vllm/model_executor/models/gpt_oss.py
  • vllm/model_executor/models/granite.py
  • vllm/model_executor/models/granite4_vision.py
  • vllm/model_executor/models/granite_speech.py
  • vllm/model_executor/models/granitemoe.py
  • vllm/model_executor/models/granitemoehybrid.py
  • vllm/model_executor/models/granitemoeshared.py
  • vllm/model_executor/models/hrm_text.py
  • vllm/model_executor/models/hunyuan_v1.py
  • vllm/model_executor/models/hunyuan_vision.py
  • vllm/model_executor/models/hy_v3.py
  • vllm/model_executor/models/hy_v3_mtp.py
  • vllm/model_executor/models/hyperclovax.py
  • vllm/model_executor/models/hyperclovax_vision.py
  • vllm/model_executor/models/idefics2_vision_model.py
  • vllm/model_executor/models/idefics3.py
  • vllm/model_executor/models/interfaces.py
  • vllm/model_executor/models/intern_vit.py
  • vllm/model_executor/models/internlm2.py
  • vllm/model_executor/models/interns1.py
  • vllm/model_executor/models/interns1_pro.py
  • vllm/model_executor/models/interns1_vit.py
  • vllm/model_executor/models/interns2_mobius.py
  • vllm/model_executor/models/internvl.py
  • vllm/model_executor/models/iquest_loopcoder.py
  • vllm/model_executor/models/isaac.py
  • vllm/model_executor/models/jamba.py
  • vllm/model_executor/models/jina.py
  • vllm/model_executor/models/kanana_v.py
  • vllm/model_executor/models/keye.py
  • vllm/model_executor/models/keye_vl1_5.py
  • vllm/model_executor/models/kimi_audio.py
  • vllm/model_executor/models/kimi_k25.py
  • vllm/model_executor/models/kimi_k25_vit.py
  • vllm/model_executor/models/kimi_linear.py
  • vllm/model_executor/models/kimi_vl.py
  • vllm/model_executor/models/laguna.py
  • vllm/model_executor/models/lfm2.py
  • vllm/model_executor/models/lfm2_moe.py
  • vllm/model_executor/models/llama.py
  • vllm/model_executor/models/llama4.py
  • vllm/model_executor/models/llama4_eagle.py
  • vllm/model_executor/models/llama_eagle3.py
  • vllm/model_executor/models/llava_next.py
  • vllm/model_executor/models/llava_next_video.py
  • vllm/model_executor/models/llava_onevision2.py
  • vllm/model_executor/models/longcat_flash.py
  • vllm/model_executor/models/longcat_flash_mtp.py
  • vllm/model_executor/models/longcat_flash_ngram.py
  • vllm/model_executor/models/mamba.py
  • vllm/model_executor/models/mellum.py
  • vllm/model_executor/models/mimo.py
  • vllm/model_executor/models/mimo_v2.py
  • vllm/model_executor/models/mimo_v2_omni.py
  • vllm/model_executor/models/minicpm3.py
  • vllm/model_executor/models/minicpm_eagle.py
  • vllm/model_executor/models/minicpmv.py
  • vllm/model_executor/models/minicpmv4_6.py
  • vllm/model_executor/models/minimax_m2.py
  • vllm/model_executor/models/mistral_eagle.py
  • vllm/model_executor/models/mistral_large_3.py
  • vllm/model_executor/models/mistral_large_3_eagle.py
  • vllm/model_executor/models/mixtral.py
  • vllm/model_executor/models/mllama4.py
  • vllm/model_executor/models/modernbert.py
  • vllm/model_executor/models/molmo.py
  • vllm/model_executor/models/molmo2.py
  • vllm/model_executor/models/moonvit.py
  • vllm/model_executor/models/moss_audio.py
  • vllm/model_executor/models/moss_transcribe_diarize.py
  • vllm/model_executor/models/muse_glimmer.py
  • vllm/model_executor/models/nano_nemotron_vl.py
  • vllm/model_executor/models/nemotron.py
  • vllm/model_executor/models/nemotron_h.py
  • vllm/model_executor/models/nemotron_parse.py
  • vllm/model_executor/models/olmo3.py
  • vllm/model_executor/models/olmo_hybrid.py
  • vllm/model_executor/models/olmoe.py
  • vllm/model_executor/models/opencua.py
  • vllm/model_executor/models/openpangu.py
  • vllm/model_executor/models/opt.py
  • vllm/model_executor/models/orion.py
  • vllm/model_executor/models/ouro.py
  • vllm/model_executor/models/ovis.py
  • vllm/model_executor/models/ovis2_5.py
  • vllm/model_executor/models/paddleocr_vl.py
  • vllm/model_executor/models/paligemma.py
  • vllm/model_executor/models/param2moe.py
  • vllm/model_executor/models/phi3v.py
  • vllm/model_executor/models/phi4mm.py
  • vllm/model_executor/models/phi4mm_utils.py
  • vllm/model_executor/models/phimoe.py
  • vllm/model_executor/models/plamo2.py
  • vllm/model_executor/models/qwen2.py
  • vllm/model_executor/models/qwen2_5_omni_thinker.py
  • vllm/model_executor/models/qwen2_5_vl.py
  • vllm/model_executor/models/qwen2_audio.py
  • vllm/model_executor/models/qwen2_moe.py
  • vllm/model_executor/models/qwen2_vl.py
  • vllm/model_executor/models/qwen3.py
  • vllm/model_executor/models/qwen3_5.py
  • vllm/model_executor/models/qwen3_5_mtp.py
  • vllm/model_executor/models/qwen3_asr.py
  • vllm/model_executor/models/qwen3_dflash.py
  • vllm/model_executor/models/qwen3_dspark.py
  • vllm/model_executor/models/qwen3_eagle3.py
  • vllm/model_executor/models/qwen3_moe.py
  • vllm/model_executor/models/qwen3_next.py
  • vllm/model_executor/models/qwen3_next_mtp.py
  • vllm/model_executor/models/qwen3_omni_moe_thinker.py
  • vllm/model_executor/models/qwen3_vl.py
  • vllm/model_executor/models/qwen3_vl_moe.py
  • vllm/model_executor/models/radio.py
  • vllm/model_executor/models/registry.py
  • vllm/model_executor/models/roberta.py
  • vllm/model_executor/models/sarvam.py
  • vllm/model_executor/models/seed_oss.py
  • vllm/model_executor/models/siglip.py
  • vllm/model_executor/models/skyworkr1v.py
  • vllm/model_executor/models/solar.py
  • vllm/model_executor/models/stablelm.py
  • vllm/model_executor/models/step3_text.py
  • vllm/model_executor/models/step3_vl.py
  • vllm/model_executor/models/step3p5.py
  • vllm/model_executor/models/step3p5_mtp.py
  • vllm/model_executor/models/telechat2.py
  • vllm/model_executor/models/terratorch.py
  • vllm/model_executor/models/transformers/__init__.py
  • vllm/model_executor/models/transformers/base.py
  • vllm/model_executor/models/transformers/causal.py
  • vllm/model_executor/models/transformers/fuser.py
  • vllm/model_executor/models/transformers/fusers/__init__.py
  • vllm/model_executor/models/transformers/fusers/base.py
  • vllm/model_executor/models/transformers/fusers/glu.py
  • vllm/model_executor/models/transformers/fusers/mla.py
  • vllm/model_executor/models/transformers/fusers/moe.py
  • vllm/model_executor/models/transformers/fusers/packed_qkv.py
  • vllm/model_executor/models/transformers/fusers/qkv.py
  • vllm/model_executor/models/transformers/fusers/rms_norm.py
  • vllm/model_executor/models/transformers/fx_utils.py
  • vllm/model_executor/models/transformers/layers.py
  • vllm/model_executor/models/transformers/moe.py
  • vllm/model_executor/models/transformers/multimodal.py
  • vllm/model_executor/models/transformers/utils.py
  • vllm/model_executor/models/ultravox.py
  • vllm/model_executor/models/utils.py
  • vllm/model_executor/models/vision.py
  • vllm/model_executor/models/voxtral.py
  • vllm/model_executor/models/whisper.py
  • vllm/model_executor/utils.py
  • vllm/model_executor/warmup/b12x_warmup.py
  • vllm/model_executor/warmup/cutedsl_warmup.py
  • vllm/model_executor/warmup/deep_gemm_warmup.py
  • vllm/model_executor/warmup/deepseek_v4_mhc_warmup.py
  • vllm/model_executor/warmup/fa4_cutedsl_config.py
  • vllm/model_executor/warmup/fa4_cutedsl_warmup.py
  • vllm/model_executor/warmup/jit_warmup.py
  • vllm/model_executor/warmup/jit_warmup_triton_helper.py
  • vllm/model_executor/warmup/kernel_warmup.py
  • vllm/model_executor/warmup/kimi_k3_triton_warmup.py
  • vllm/model_executor/warmup/qwen_triton_warmup.py
  • vllm/model_executor/warmup/sparse_mla_triton_warmup.py
  • vllm/model_executor/warmup/v1_block_table_warmup.py
  • vllm/models/common/__init__.py
  • vllm/models/common/ops/__init__.py
  • vllm/models/common/ops/fused_allreduce_rms_norm.py
  • vllm/models/common/ops/fused_qk_rmsnorm.py
  • vllm/models/common/ops/sequence_parallel.py
  • vllm/models/deepseek_v32/__init__.py
  • vllm/models/deepseek_v32/amd/__init__.py
  • vllm/models/deepseek_v32/amd/model.py
  • vllm/models/deepseek_v32/amd/mtp.py
  • vllm/models/deepseek_v32/amd/rocm.py
  • vllm/models/deepseek_v32/attention.py
  • vllm/models/deepseek_v32/common/__init__.py
  • vllm/models/deepseek_v32/common/kernels.py
  • vllm/models/deepseek_v32/nvidia/glm52_low_latency_gemm.py
  • vllm/models/deepseek_v32/nvidia/model.py
  • vllm/models/deepseek_v32/nvidia/mtp.py
  • vllm/models/deepseek_v32/nvidia/ops/__init__.py
  • vllm/models/deepseek_v32/nvidia/ops/fused_q_cutedsl.py
  • vllm/models/deepseek_v4/__init__.py
  • vllm/models/deepseek_v4/amd/dspark.py
  • vllm/models/deepseek_v4/amd/model.py
  • vllm/models/deepseek_v4/amd/mtp.py
  • vllm/models/deepseek_v4/amd/rocm.py
  • vllm/models/deepseek_v4/attention.py
  • vllm/models/deepseek_v4/common/ops/__init__.py
  • vllm/models/deepseek_v4/common/ops/cache_utils.py
  • vllm/models/deepseek_v4/common/ops/fused_compress_quant_cache.py
  • vllm/models/deepseek_v4/common/ops/fused_indexer_q.py
  • vllm/models/deepseek_v4/common/ops/fused_inv_rope_fp8_quant.py
  • vllm/models/deepseek_v4/compressor.py
  • vllm/models/deepseek_v4/nvidia/dspark.py
  • vllm/models/deepseek_v4/nvidia/flashinfer_sparse.py
  • vllm/models/deepseek_v4/nvidia/flashmla.py
  • vllm/models/deepseek_v4/nvidia/model.py
  • vllm/models/deepseek_v4/nvidia/mtp.py
  • vllm/models/deepseek_v4/nvidia/ops/o_proj.py
  • vllm/models/deepseek_v4/quant_config.py
  • vllm/models/deepseek_v4/sparse_mla.py
  • vllm/models/deepseek_v4/xpu/dspark.py
  • vllm/models/deepseek_v4/xpu/model.py
  • vllm/models/deepseek_v4/xpu/mtp.py
  • vllm/models/deepseek_v4/xpu/xpu_sparse.py
  • vllm/models/dots3_note/__init__.py
  • vllm/models/dots3_note/common/__init__.py
  • vllm/models/dots3_note/common/processor.py
  • vllm/models/dots3_note/common/video.py
  • vllm/models/dots3_note/nvidia/__init__.py
  • vllm/models/dots3_note/nvidia/attention.py
  • vllm/models/dots3_note/nvidia/audio.py
  • vllm/models/dots3_note/nvidia/audio_encoder.py
  • vllm/models/dots3_note/nvidia/model.py
  • vllm/models/dots3_note/nvidia/mtp.py
  • vllm/models/dots3_note/nvidia/multimodal.py
  • vllm/models/dots3_note/nvidia/vision.py
  • vllm/models/dots3_note/nvidia/vision_attention.py
  • vllm/models/dots3_note/nvidia/vision_moe.py
  • vllm/models/inkling/__init__.py
  • vllm/models/inkling/amd/__init__.py
  • vllm/models/inkling/amd/attention.py
  • vllm/models/inkling/amd/layernorm.py
  • vllm/models/inkling/amd/logits_processor.py
  • vllm/models/inkling/amd/mlp.py
  • vllm/models/inkling/amd/model.py
  • vllm/models/inkling/amd/moe.py
  • vllm/models/inkling/amd/mtp.py
  • vllm/models/inkling/amd/ops/__init__.py
  • vllm/models/inkling/amd/ops/fa4_rel_attention.py
  • vllm/models/inkling/amd/ops/fa4_warmup.py
  • vllm/models/inkling/amd/ops/gluon/__init__.py
  • vllm/models/inkling/amd/ops/gluon/rel_mha_decode_gfx950.py
  • vllm/models/inkling/amd/ops/gluon/rel_mha_extend_gfx950.py
  • vllm/models/inkling/amd/ops/gluon/utils.py
  • vllm/models/inkling/amd/ops/lamport.py
  • vllm/models/inkling/amd/ops/mm_towers.py
  • vllm/models/inkling/amd/ops/norm.py
  • vllm/models/inkling/amd/ops/qkvr_prep.py
  • vllm/models/inkling/amd/ops/rel_attention_decode.py
  • vllm/models/inkling/amd/ops/sconv.py
  • vllm/models/inkling/amd/ops/silu_and_mul.py
  • vllm/models/inkling/amd/sconv_swa_attn.py
  • vllm/models/inkling/amd/short_conv.py
  • vllm/models/inkling/common/__init__.py
  • vllm/models/inkling/common/mm_preprocess.py
  • vllm/models/inkling/common/towers.py
  • vllm/models/inkling/configs.py
  • vllm/models/inkling/nvidia/__init__.py
  • vllm/models/inkling/nvidia/attention.py
  • vllm/models/inkling/nvidia/layernorm.py
  • vllm/models/inkling/nvidia/logits_processor.py
  • vllm/models/inkling/nvidia/mlp.py
  • vllm/models/inkling/nvidia/model.py
  • vllm/models/inkling/nvidia/moe.py
  • vllm/models/inkling/nvidia/mtp.py
  • vllm/models/inkling/nvidia/ops/__init__.py
  • vllm/models/inkling/nvidia/ops/fa4_rel_attention.py
  • vllm/models/inkling/nvidia/ops/lamport.py
  • vllm/models/inkling/nvidia/ops/mm_towers.py
  • vllm/models/inkling/nvidia/ops/norm.py
  • vllm/models/inkling/nvidia/ops/qkvr_prep.py
  • vllm/models/inkling/nvidia/ops/sconv.py
  • vllm/models/inkling/nvidia/ops/silu_and_mul.py
  • vllm/models/inkling/nvidia/sconv_swa_attn.py
  • vllm/models/inkling/nvidia/short_conv.py
  • vllm/models/kimi_k3/__init__.py
  • vllm/models/kimi_k3/amd/__init__.py
  • vllm/models/kimi_k3/amd/kda.py
  • vllm/models/kimi_k3/amd/kda_metadata.py
  • vllm/models/kimi_k3/amd/latent_moe_runner.py
  • vllm/models/kimi_k3/amd/linear.py
  • vllm/models/kimi_k3/amd/model.py
  • vllm/models/kimi_k3/amd/mtp.py
  • vllm/models/kimi_k3/amd/ops/__init__.py
  • vllm/models/kimi_k3/amd/ops/attn_res.py
  • vllm/models/kimi_k3/amd/ops/kda_decode.py
  • vllm/models/kimi_k3/amd/ops/third_party/__init__.py
  • vllm/models/kimi_k3/amd/ops/third_party/kda/__init__.py
  • vllm/models/kimi_k3/amd/ops/third_party/kda/chunk.py
  • vllm/models/kimi_k3/amd/ops/third_party/kda/chunk_intra.py
  • vllm/models/kimi_k3/amd/ops/third_party/kda/chunk_intra_token_parallel.py
  • vllm/models/kimi_k3/amd/ops/third_party/kda/fused_recurrent.py
  • vllm/models/kimi_k3/common/__init__.py
  • vllm/models/kimi_k3/common/mm_preprocess.py
  • vllm/models/kimi_k3/common/mtp.py
  • vllm/models/kimi_k3/nvidia/__init__.py
  • vllm/models/kimi_k3/nvidia/dspark_mla.py
  • vllm/models/kimi_k3/nvidia/kda.py
  • vllm/models/kimi_k3/nvidia/kda_metadata.py
  • vllm/models/kimi_k3/nvidia/latent_moe_runner.py
  • vllm/models/kimi_k3/nvidia/low_latency_gemm.py
  • vllm/models/kimi_k3/nvidia/mla.py
  • vllm/models/kimi_k3/nvidia/model.py
  • vllm/models/kimi_k3/nvidia/mtp.py
  • vllm/models/kimi_k3/nvidia/ops/__init__.py
  • vllm/models/kimi_k3/nvidia/ops/attn_res.py
  • vllm/models/kimi_k3/nvidia/ops/cute_dsl/__init__.py
  • vllm/models/kimi_k3/nvidia/ops/cute_dsl/gemm_rs.py
  • vllm/models/kimi_k3/nvidia/ops/cute_dsl/latent_moe_tail/__init__.py
  • vllm/models/kimi_k3/nvidia/ops/cute_dsl/latent_moe_tail/allreduce_rmsnorm_reduce_scatter_early_exit.py
  • vllm/models/kimi_k3/nvidia/ops/cute_dsl/latent_moe_tail/fused_add_multicast_gemm.py
  • vllm/models/kimi_k3/nvidia/ops/cute_dsl/latent_moe_tail/fused_add_multicast_skinny_gemm.py
  • vllm/models/kimi_k3/nvidia/ops/cute_dsl/latent_moe_tail/lamport_copy.py
  • vllm/models/kimi_k3/nvidia/ops/cute_dsl/latent_moe_tail/primitives.py
  • vllm/models/kimi_k3/nvidia/ops/fused_mla_key_concat_kv_cache.py
  • vllm/models/kimi_k3/nvidia/ops/latent_moe_tail.py
  • vllm/models/kimi_k3/nvidia/ops/recoverssm.py
  • vllm/models/kimi_k3/nvidia/ops/third_party/__init__.py
  • vllm/models/kimi_k3/nvidia/ops/third_party/kda/__init__.py
  • vllm/models/kimi_k3/nvidia/ops/third_party/kda/chunk.py
  • vllm/models/kimi_k3/nvidia/ops/third_party/kda/chunk_intra.py
  • vllm/models/kimi_k3/nvidia/ops/third_party/kda/chunk_intra_token_parallel.py
  • vllm/models/kimi_k3/nvidia/ops/third_party/kda/fused_recurrent.py
  • vllm/models/kimi_k3/nvidia/ops/vision_fa4_warmup.py
  • vllm/models/minimax_m3/amd/model.py
  • vllm/models/minimax_m3/amd/mtp.py
  • vllm/models/minimax_m3/amd/ops/sparse_attn.py
  • vllm/models/minimax_m3/amd/ops/sparse_pa.py
  • vllm/models/minimax_m3/amd/sparse_attention_msa.py
  • vllm/models/minimax_m3/common/indexer.py
  • vllm/models/minimax_m3/common/mm_preprocess.py
  • vllm/models/minimax_m3/common/ops/sparse_attn.py
  • vllm/models/minimax_m3/common/sparse_attention.py
  • vllm/models/minimax_m3/nvidia/indexer_msa.py
  • vllm/models/minimax_m3/nvidia/model.py
  • vllm/models/minimax_m3/nvidia/msa_cutlass_sparse_decode.py
  • vllm/models/minimax_m3/nvidia/mtp.py
  • vllm/models/minimax_m3/nvidia/ops/__init__.py
  • vllm/models/minimax_m3/nvidia/ops/index_decode_score.py
  • vllm/models/minimax_m3/nvidia/sparse_attention_msa.py
  • vllm/multimodal/audio.py
  • vllm/multimodal/cache.py
  • vllm/multimodal/encoder_budget.py
  • vllm/multimodal/gpu_ipc_memory.py
  • vllm/multimodal/hasher.py
  • vllm/multimodal/inputs.py
  • vllm/multimodal/media/audio.py
  • vllm/multimodal/media/base.py
  • vllm/multimodal/media/connector.py
  • vllm/multimodal/media/image.py
  • vllm/multimodal/media/video.py
  • vllm/multimodal/parse.py
  • vllm/multimodal/processing/context.py
  • vllm/multimodal/processing/dummy_inputs.py
  • vllm/multimodal/processing/inputs.py
  • vllm/multimodal/processing/processor.py
  • vllm/multimodal/registry.py
  • vllm/multimodal/utils.py
  • vllm/multimodal/video.py
  • vllm/multimodal/video_decoders/__init__.py
  • vllm/multimodal/video_decoders/base.py
  • vllm/multimodal/video_decoders/deepstream.py
  • vllm/multimodal/video_decoders/opencv.py
  • vllm/multimodal/video_decoders/pyav.py
  • vllm/multimodal/video_decoders/pynvvideocodec.py
  • vllm/multimodal/video_decoders/torchcodec.py
  • vllm/multimodal/video_prune/__init__.py
  • vllm/multimodal/video_prune/evs.py
  • vllm/multimodal/video_prune/vidcom2.py
  • vllm/outputs.py
  • vllm/parser/abstract_parser.py
  • vllm/parser/deepseek_v4.py
  • vllm/parser/engine/adapters.py
  • vllm/parser/engine/events.py
  • vllm/parser/engine/incremental_lexer.py
  • vllm/parser/engine/parser_engine.py
  • vllm/parser/engine/parser_engine_config.py
  • vllm/parser/engine/registered_adapters.py
  • vllm/parser/engine/streaming_parser_engine.py
  • vllm/parser/engine/token_id_scanner.py
  • vllm/parser/gemma4.py
  • vllm/parser/harmony.py
  • vllm/parser/inkling.py
  • vllm/parser/kimi_k3.py
  • vllm/parser/ling3.py
  • vllm/parser/minimax_m2.py
  • vllm/parser/mistral.py
  • vllm/parser/parser_manager.py
  • vllm/parser/qwen3.py
  • vllm/platforms/__init__.py
  • vllm/platforms/cpu.py
  • vllm/platforms/cuda.py
  • vllm/platforms/interface.py
  • vllm/platforms/rocm.py
  • vllm/platforms/xpu.py
  • vllm/pooling_params.py
  • vllm/profiler/utils.py
  • vllm/profiler/wrapper.py
  • vllm/ray/ray_env.py
  • vllm/reasoning/__init__.py
  • vllm/reasoning/cohere_command_reasoning_parser.py
  • vllm/reasoning/gptoss_reasoning_parser.py
  • vllm/reasoning/hunyuan_a13b_reasoning_parser.py
  • vllm/reasoning/inkling_reasoning_parser.py
  • vllm/reasoning/kimi_k3_reasoning_parser.py
  • vllm/reasoning/ling3_reasoning_parser.py
  • vllm/reasoning/mistral_reasoning_parser.py
  • vllm/reasoning/muse_glimmer_reasoning_parser.py
  • vllm/renderers/base.py
  • vllm/renderers/cohere.py
  • vllm/renderers/deepseek_v32.py
  • vllm/renderers/deepseek_v4.py
  • vllm/renderers/embed_utils.py
  • vllm/renderers/hf.py
  • vllm/renderers/inkling.py
  • vllm/renderers/inkling_encoding.py
  • vllm/renderers/kimi_k3.py
  • vllm/renderers/online_derenderer.py
  • vllm/renderers/online_renderer.py
  • vllm/renderers/params.py
  • vllm/renderers/registry.py
  • vllm/sampling_params.py
  • vllm/tasks.py
  • vllm/third_party/flash_linear_attention/LICENSE
  • vllm/third_party/flash_linear_attention/__init__.py
  • vllm/third_party/flash_linear_attention/ops/__init__.py
  • vllm/third_party/flash_linear_attention/ops/chunk.py
  • vllm/third_party/flash_linear_attention/ops/chunk_delta_h.py
  • vllm/third_party/flash_linear_attention/ops/chunk_o.py
  • vllm/third_party/flash_linear_attention/ops/chunk_scaled_dot_kkt.py
  • vllm/third_party/flash_linear_attention/ops/cumsum.py
  • vllm/third_party/flash_linear_attention/ops/fused_gdn_prefill_post_conv.py
  • vllm/third_party/flash_linear_attention/ops/fused_norm_gate.py
  • vllm/third_party/flash_linear_attention/ops/fused_recurrent.py
  • vllm/third_party/flash_linear_attention/ops/fused_sigmoid_gating.py
  • vllm/third_party/flash_linear_attention/ops/index.py
  • vllm/third_party/flash_linear_attention/ops/kda.py
  • vllm/third_party/flash_linear_attention/ops/l2norm.py
  • vllm/third_party/flash_linear_attention/ops/layernorm_guard.py
  • vllm/third_party/flash_linear_attention/ops/op.py
  • vllm/third_party/flash_linear_attention/ops/solve_tril.py
  • vllm/third_party/flash_linear_attention/ops/utils.py
  • vllm/third_party/flash_linear_attention/ops/wy_fast.py
  • vllm/tilelang_utils/__init__.py
  • vllm/tokenizers/deepseek_v32.py
  • vllm/tokenizers/deepseek_v32_encoding.py
  • vllm/tokenizers/deepseek_v4.py
  • vllm/tokenizers/deepseek_v4_encoding.py
  • vllm/tokenizers/detokenizer_utils.py
  • vllm/tokenizers/mistral.py
  • vllm/tokenizers/registry.py
  • vllm/tool_parsers/__init__.py
  • vllm/tool_parsers/cohere_command_tool_parser.py
  • vllm/tool_parsers/dots_tool_parser.py
  • vllm/tool_parsers/gemma4_utils.py
  • vllm/tool_parsers/gptoss_tool_parser.py
  • vllm/tool_parsers/inkling_tool_parser.py
  • vllm/tool_parsers/internlm2_tool_parser.py
  • vllm/tool_parsers/jamba_tool_parser.py
  • vllm/tool_parsers/kimi_k3_tool_parser.py
  • vllm/tool_parsers/lfm2_tool_parser.py
  • vllm/tool_parsers/ling3_tool_parser.py
  • vllm/tool_parsers/minicpm5xml_tool_parser.py
  • vllm/tool_parsers/mistral_tool_parser.py
  • vllm/tool_parsers/muse_glimmer_tool_parser.py
  • vllm/tool_parsers/streaming.py
  • vllm/tool_parsers/structural_tag_registry.py
  • vllm/tool_parsers/utils.py
  • vllm/transformers_utils/config.py
  • vllm/transformers_utils/configs/AXK1.py
  • vllm/transformers_utils/configs/__init__.py
  • vllm/transformers_utils/configs/cosmos3_edge.py
  • vllm/transformers_utils/configs/dots3_note.py
  • vllm/transformers_utils/configs/gemma4.py
  • vllm/transformers_utils/configs/hunyuan_vl.py
  • vllm/transformers_utils/configs/k3_dspark.py
  • vllm/transformers_utils/configs/kimi_k3.py
  • vllm/transformers_utils/configs/kimi_linear.py
  • vllm/transformers_utils/configs/muse_glimmer.py
  • vllm/transformers_utils/configs/qwen3_asr.py
  • vllm/transformers_utils/configs/speculators/algos.py
  • vllm/transformers_utils/model_arch_config_convertor.py
  • vllm/transformers_utils/processor.py
  • vllm/transformers_utils/processors/__init__.py
  • vllm/transformers_utils/processors/cosmos3_edge.py
  • vllm/transformers_utils/processors/inkling.py
  • vllm/transformers_utils/processors/kimi_k3.py
  • vllm/transformers_utils/processors/mimo_v2_omni.py
  • vllm/transformers_utils/processors/minicpmo.py
  • vllm/transformers_utils/processors/minimax_m3.py
  • vllm/transformers_utils/processors/muse_glimmer.py
  • vllm/transformers_utils/processors/nano_nemotron_vl.py
  • vllm/transformers_utils/processors/ovis2_5.py
  • vllm/transformers_utils/repo_utils.py
  • vllm/transformers_utils/utils.py
  • vllm/triton_utils/__init__.py
  • vllm/triton_utils/tensor_descriptor.py
  • vllm/usage/usage_lib.py
  • vllm/utils/argparse_utils.py
  • vllm/utils/b12x.py
  • vllm/utils/cache.py
  • vllm/utils/cpu_resource_utils.py
  • vllm/utils/cpu_triton_utils.py
  • vllm/utils/deep_gemm.py
  • vllm/utils/flashinfer.py
  • vllm/utils/gpu_sync_debug.py
  • vllm/utils/humming.py
  • vllm/utils/import_utils.py
  • vllm/utils/jit_monitor.py
  • vllm/utils/mem_utils.py
  • vllm/utils/mistral.py
  • vllm/utils/multi_stream_utils.py
  • vllm/utils/nccl.py
  • vllm/utils/network_utils.py
  • vllm/utils/nvtx_pytorch_hooks.py
  • vllm/utils/ompmultiprocessing.py
  • vllm/utils/serial_utils.py
  • vllm/utils/sparse_utils.py
  • vllm/utils/system_utils.py
  • vllm/utils/torch_utils.py
  • vllm/v1/attention/backend.py
  • vllm/v1/attention/backends/cpu_attn.py
  • vllm/v1/attention/backends/fa_utils.py
  • vllm/v1/attention/backends/flash_attn.py
  • vllm/v1/attention/backends/flash_attn_diffkv.py
  • vllm/v1/attention/backends/flashinfer.py
  • vllm/v1/attention/backends/flex_attention.py
  • vllm/v1/attention/backends/gdn_attn.py
  • vllm/v1/attention/backends/hpc_attn.py
  • vllm/v1/attention/backends/linear_attn.py
  • vllm/v1/attention/backends/mamba2_attn.py
  • vllm/v1/attention/backends/mamba_attn.py
  • vllm/v1/attention/backends/mla/amx_mla.py
  • vllm/v1/attention/backends/mla/compressor_utils.py
  • vllm/v1/attention/backends/mla/cpu_mla.py
  • vllm/v1/attention/backends/mla/flashattn_mla_sparse.py
  • vllm/v1/attention/backends/mla/flashinfer_mla.py
  • vllm/v1/attention/backends/mla/flashinfer_mla_sparse.py
  • vllm/v1/attention/backends/mla/flashinfer_mla_sparse_sm120.py
  • vllm/v1/attention/backends/mla/flashmla.py
  • vllm/v1/attention/backends/mla/flashmla_sparse.py
  • vllm/v1/attention/backends/mla/indexer.py
  • vllm/v1/attention/backends/mla/prefill/aiter_flash_attn.py
  • vllm/v1/attention/backends/mla/prefill/base.py
  • vllm/v1/attention/backends/mla/prefill/cpu_native.py
  • vllm/v1/attention/backends/mla/prefill/flash_attn.py
  • vllm/v1/attention/backends/mla/prefill/flashinfer.py
  • vllm/v1/attention/backends/mla/prefill/registry.py
  • vllm/v1/attention/backends/mla/prefill/selector.py
  • vllm/v1/attention/backends/mla/prefill/tokenspeed_mla.py
  • vllm/v1/attention/backends/mla/prefill/trtllm_ragged.py
  • vllm/v1/attention/backends/mla/rocm_aiter_mla.py
  • vllm/v1/attention/backends/mla/rocm_aiter_mla_sparse.py
  • vllm/v1/attention/backends/mla/sparse_swa.py
  • vllm/v1/attention/backends/mla/sparse_utils.py
  • vllm/v1/attention/backends/mla/tokenspeed_mla.py
  • vllm/v1/attention/backends/mla/triton_mla.py
  • vllm/v1/attention/backends/mla/xpu_mla_sparse.py
  • vllm/v1/attention/backends/recoverssm_metadata.py
  • vllm/v1/attention/backends/registry.py
  • vllm/v1/attention/backends/rocm_aiter_fa.py
  • vllm/v1/attention/backends/rocm_aiter_unified_attn.py
  • vllm/v1/attention/backends/rocm_attn.py
  • vllm/v1/attention/backends/triton_attn.py
  • vllm/v1/attention/backends/triton_attn_diffkv.py
  • vllm/v1/attention/backends/turboquant_attn.py
  • vllm/v1/attention/backends/utils.py
  • vllm/v1/attention/ops/chunked_prefill_paged_decode.py
  • vllm/v1/attention/ops/common.py
  • vllm/v1/attention/ops/dcp_alltoall.py
  • vllm/v1/attention/ops/dcp_utils.py
  • vllm/v1/attention/ops/flydsl_kernels/__init__.py
  • vllm/v1/attention/ops/flydsl_kernels/tq_decode.py
  • vllm/v1/attention/ops/flydsl_kernels/tq_decode_gqa6.py
  • vllm/v1/attention/ops/flydsl_turboquant_decode.py
  • vllm/v1/attention/ops/prefix_prefill.py
  • vllm/v1/attention/ops/rocm_aiter_mla_sparse.py
  • vllm/v1/attention/ops/triton_merge_attn_states.py
  • vllm/v1/attention/ops/triton_prefill_attention.py
  • vllm/v1/attention/ops/triton_reshape_and_cache_flash.py
  • vllm/v1/attention/ops/triton_turboquant_store.py
  • vllm/v1/attention/ops/triton_unified_attention.py
  • vllm/v1/attention/ops/turboquant_soa/__init__.py
  • vllm/v1/attention/ops/turboquant_soa/triton_turboquant_decode.py
  • vllm/v1/attention/ops/turboquant_soa/triton_turboquant_decode_v2.py
  • vllm/v1/attention/ops/turboquant_soa/triton_turboquant_store.py
  • vllm/v1/attention/ops/turboquant_soa/triton_turboquant_unified_attention.py
  • vllm/v1/attention/ops/vit_attn_wrappers.py
  • vllm/v1/attention/ops/xpu_mla_sparse.py
  • vllm/v1/attention/selector.py
  • vllm/v1/core/block_pool.py
  • vllm/v1/core/encoder_cache_manager.py
  • vllm/v1/core/kv_cache_coordinator.py
  • vllm/v1/core/kv_cache_manager.py
  • vllm/v1/core/kv_cache_utils.py
  • vllm/v1/core/sched/async_scheduler.py
  • vllm/v1/core/sched/interface.py
  • vllm/v1/core/sched/output.py
  • vllm/v1/core/sched/scheduler.py
  • vllm/v1/core/single_type_kv_cache_manager.py
  • vllm/v1/engine/__init__.py
  • vllm/v1/engine/async_llm.py
  • vllm/v1/engine/coordinator.py
  • vllm/v1/engine/core.py
  • vllm/v1/engine/core_client.py
  • vllm/v1/engine/detokenizer.py
  • vllm/v1/engine/exceptions.py
  • vllm/v1/engine/input_processor.py
  • vllm/v1/engine/llm_engine.py
  • vllm/v1/engine/output_processor.py
  • vllm/v1/engine/utils.py
  • vllm/v1/executor/abstract.py
  • vllm/v1/executor/multiproc_executor.py
  • vllm/v1/executor/ray_executor.py
  • vllm/v1/executor/ray_utils.py
  • vllm/v1/executor/uniproc_executor.py
  • vllm/v1/fault_tolerance/__init__.py
  • vllm/v1/fault_tolerance/engine_core_sentinel.py
  • vllm/v1/fault_tolerance/utils.py
  • vllm/v1/kv_cache_interface.py
  • vllm/v1/kv_offload/base.py
  • vllm/v1/kv_offload/config.py
  • vllm/v1/kv_offload/cpu/common.py
  • vllm/v1/kv_offload/cpu/gpu_worker.py
  • vllm/v1/kv_offload/cpu/manager.py
  • vllm/v1/kv_offload/cpu/policies/arc.py
  • vllm/v1/kv_offload/cpu/policies/base.py
  • vllm/v1/kv_offload/cpu/policies/factory.py
  • vllm/v1/kv_offload/cpu/policies/lru.py
  • vllm/v1/kv_offload/cpu/shared_offload_region.py
  • vllm/v1/kv_offload/cpu/spec.py
  • vllm/v1/kv_offload/factory.py
  • vllm/v1/kv_offload/file_mapper.py
  • vllm/v1/kv_offload/tiering/async_lookup.py
  • vllm/v1/kv_offload/tiering/base.py
  • vllm/v1/kv_offload/tiering/example/manager.py
  • vllm/v1/kv_offload/tiering/factory.py
  • vllm/v1/kv_offload/tiering/fs/io.py
  • vllm/v1/kv_offload/tiering/fs/manager.py
  • vllm/v1/kv_offload/tiering/fs/thread_pool.py
  • vllm/v1/kv_offload/tiering/manager.py
  • vllm/v1/kv_offload/tiering/metrics.py
  • vllm/v1/kv_offload/tiering/obj/manager.py
  • vllm/v1/kv_offload/tiering/p2p/control/base.py
  • vllm/v1/kv_offload/tiering/p2p/control/zmq.py
  • vllm/v1/kv_offload/tiering/p2p/data/base.py
  • vllm/v1/kv_offload/tiering/p2p/data/nixl.py
  • vllm/v1/kv_offload/tiering/p2p/manager.py
  • vllm/v1/kv_offload/tiering/p2p/session/__init__.py
  • vllm/v1/kv_offload/tiering/p2p/session/client.py
  • vllm/v1/kv_offload/tiering/p2p/session/protocol.py
  • vllm/v1/kv_offload/tiering/p2p/session/server.py
  • vllm/v1/kv_offload/tiering/p2p/session/session.py
  • vllm/v1/kv_offload/tiering/spec.py
  • vllm/v1/metrics/loggers.py
  • vllm/v1/metrics/perf.py
  • vllm/v1/metrics/stats.py
  • vllm/v1/outputs.py
  • vllm/v1/request.py
  • vllm/v1/sample/logits_processor/__init__.py
  • vllm/v1/sample/logits_processor/interface.py
  • vllm/v1/sample/ops/topk_topp_sampler.py
  • vllm/v1/sample/ops/topk_topp_triton.py
  • vllm/v1/sample/rejection_sampler.py
  • vllm/v1/sample/sampler.py
  • vllm/v1/sample/thinking_budget_state.py
  • vllm/v1/simple_kv_offload/disk_backend.py
  • vllm/v1/simple_kv_offload/manager.py
  • vllm/v1/simple_kv_offload/worker.py
  • vllm/v1/spec_decode/dflash.py
  • vllm/v1/spec_decode/extract_hidden_states.py
  • vllm/v1/spec_decode/gemma4.py
  • vllm/v1/spec_decode/llm_base_proposer.py
  • vllm/v1/spec_decode/ngram_proposer_gpu.py
  • vllm/v1/spec_decode/step3p5.py
  • vllm/v1/structured_output/__init__.py
  • vllm/v1/structured_output/backend_guidance.py
  • vllm/v1/structured_output/backend_lm_format_enforcer.py
  • vllm/v1/structured_output/backend_outlines.py
  • vllm/v1/structured_output/backend_types.py
  • vllm/v1/structured_output/backend_xgrammar.py
  • vllm/v1/structured_output/request.py
  • vllm/v1/structured_output/utils.py
  • vllm/v1/utils.py
  • vllm/v1/worker/block_table.py
  • vllm/v1/worker/cp_utils.py
  • vllm/v1/worker/cpu/shm.py
  • vllm/v1/worker/cpu_model_runner.py
  • vllm/v1/worker/cpu_worker.py
  • vllm/v1/worker/dp_utils.py
  • vllm/v1/worker/encoder_cudagraph.py
  • vllm/v1/worker/encoder_cudagraph_defs.py
  • vllm/v1/worker/gpu/async_utils.py
  • vllm/v1/worker/gpu/attn_utils.py
  • vllm/v1/worker/gpu/block_table.py
  • vllm/v1/worker/gpu/cp_utils.py
  • vllm/v1/worker/gpu/cudagraph_utils.py
  • vllm/v1/worker/gpu/dp_utils.py
  • vllm/v1/worker/gpu/ec_connector.py
  • vllm/v1/worker/gpu/eplb_utils.py
  • vllm/v1/worker/gpu/input_batch.py
  • vllm/v1/worker/gpu/lora_utils.py
  • vllm/v1/worker/gpu/mm/encoder_cache.py
  • vllm/v1/worker/gpu/mm/encoder_runner.py
  • vllm/v1/worker/gpu/mm/lora.py
  • vllm/v1/worker/gpu/model_runner.py
  • vllm/v1/worker/gpu/model_states/__init__.py
  • vllm/v1/worker/gpu/model_states/default.py
  • vllm/v1/worker/gpu/model_states/encoder_decoder.py
  • vllm/v1/worker/gpu/model_states/encoder_only.py
  • vllm/v1/worker/gpu/model_states/interface.py
  • vllm/v1/worker/gpu/model_states/mamba_hybrid.py
  • vllm/v1/worker/gpu/model_states/mm_pruning.py
  • vllm/v1/worker/gpu/model_states/prompt_embeds.py
  • vllm/v1/worker/gpu/model_states/recoverssm.py
  • vllm/v1/worker/gpu/pcp_manager.py
  • vllm/v1/worker/gpu/pool/pooling_runner.py
  • vllm/v1/worker/gpu/sample/bad_words.py
  • vllm/v1/worker/gpu/sample/gumbel.py
  • vllm/v1/worker/gpu/sample/logprob.py
  • vllm/v1/worker/gpu/sample/output.py
  • vllm/v1/worker/gpu/sample/prompt_logprob.py
  • vllm/v1/worker/gpu/sample/sampler.py
  • vllm/v1/worker/gpu/sample/thinking_budget.py

You can disable this status message by setting the reviews.review_status to false in the CodeRabbit configuration file.

@malaiwah

Copy link
Copy Markdown
Author

Closing in favour of #439my error, apologies. I branched this from vllm-project/main while targeting this repo's main, and the two have diverged, so the diff is 3035 files / +345k lines instead of the intended 1 file / +9 lines. Completely unreviewable.

#439 is the same change branched correctly from local-inference-lab/main: 1 file, +13 lines, DCO-signed, and verified locally with ruff check, ruff format --check and F821 all clean.

It also documents an interaction I hit afterwards: on the V2 model runner in your newer image, a scheduler-selected spec depth of 0 raises in AutoRegressiveSpeculator.propose and in limit_draft_tokens instead of meaning "propose nothing". Details and the two small fixes are in #439.

@malaiwah malaiwah closed this Aug 19, 2026
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.