diff --git a/components/src/dynamo/sglang/request_handlers/llm/decode_handler.py b/components/src/dynamo/sglang/request_handlers/llm/decode_handler.py index 81579d3fba9d..44d3e3edd984 100644 --- a/components/src/dynamo/sglang/request_handlers/llm/decode_handler.py +++ b/components/src/dynamo/sglang/request_handlers/llm/decode_handler.py @@ -66,6 +66,8 @@ def __init__( generate_endpoint, shutdown_event, ) + # H20 patch: set use_sglang_tokenizer from config + self.use_sglang_tokenizer = False # disagg mode if self.serving_mode == DisaggregationMode.DECODE: logging.info( "Decode worker handler initialized (disaggregated decode mode)" @@ -73,6 +75,21 @@ def __init__( else: logging.info("Decode worker handler initialized (aggregated mode)") + @staticmethod + def _get_guided_decoding_params(guided_decoding=None): + """Stub for guided decoding - not needed for E2E test.""" + return {} + + @staticmethod + def _resolve_lora(request): + """Stub for LoRA resolution.""" + return {} + + @staticmethod + def _session_kwargs(request): + """Stub for session kwargs.""" + return {} + def cleanup(self) -> None: """Shutdown the engine and cleanup resources.""" super().cleanup() @@ -308,7 +325,7 @@ async def generate( **input_param, sampling_params=sampling_params, stream=True, - return_routed_experts=return_routed_experts, + # return_routed_experts=return_routed_experts, bootstrap_host=bootstrap_info["bootstrap_host"], bootstrap_port=bootstrap_info["bootstrap_port"], bootstrap_room=bootstrap_info["bootstrap_room"], @@ -346,7 +363,7 @@ async def generate( video_data=video_data, sampling_params=sampling_params, stream=True, - return_routed_experts=return_routed_experts, + # return_routed_experts=return_routed_experts, external_trace_header=trace_header, rid=trace_id, data_parallel_rank=dp_rank,