diff --git a/.github/scripts/verify_documented_env_vars.py b/.github/scripts/verify_documented_env_vars.py index 6723b99da0..aa060b00c0 100644 --- a/.github/scripts/verify_documented_env_vars.py +++ b/.github/scripts/verify_documented_env_vars.py @@ -74,6 +74,9 @@ "NXRT_SQNBIT_PREFILL_MIN": "referenced in prose about a proposed tuning knob", "ONNX_GENAI_BASE_URL": "client-side variable read by external tooling, not by this workspace", "ONNX_GENAI_SD_PACKAGE": "referenced in prose about a proposed packaging layout", + "ONNX_GENAI_DECODE_GEMV_PROBE_ROWS": "throwaway ceiling-probe flag in " + "2026-08-18-multirow-gemv-ceiling-probe.md, whose method section states the " + "probe was reverted after measuring and is not shipped", } # Uppercase only: the lowercase `onnx_genai_*` names in the docs are Prometheus diff --git a/crates/onnx-runtime-ep-cuda/src/kernels/standard_attention.rs b/crates/onnx-runtime-ep-cuda/src/kernels/standard_attention.rs index eb50ce92c4..1c0bd9a457 100644 --- a/crates/onnx-runtime-ep-cuda/src/kernels/standard_attention.rs +++ b/crates/onnx-runtime-ep-cuda/src/kernels/standard_attention.rs @@ -2125,12 +2125,10 @@ impl StandardAttentionKernel { .saturating_mul(q_heads as u64) .saturating_mul(q_seq as u64); let split_bytes = match split_cfg { - Some((num_splits, _)) => attention_split_scratch_floats( - num_splits, - total_rows_u, - v_head_size as u64, - ) - .saturating_mul(std::mem::size_of::()), + Some((num_splits, _)) => { + attention_split_scratch_floats(num_splits, total_rows_u, v_head_size as u64) + .saturating_mul(std::mem::size_of::()) + } None => 0, }; let mut ws = if capture_workspace_eligible {