diff --git a/vllm_omni/engine/duplex/session/emitter.py b/vllm_omni/engine/duplex/session/emitter.py index 508bc7ef1ce..6ccfcc142ab 100644 --- a/vllm_omni/engine/duplex/session/emitter.py +++ b/vllm_omni/engine/duplex/session/emitter.py @@ -125,7 +125,7 @@ def auto_responds(self) -> bool: extra = getattr(self._ctx.session.config, "extra_body", None) if not isinstance(extra, dict): return False - return extra.get("auto_response") is True or extra.get("full_duplex") is True + return extra.get("auto_response") is True def is_stale_model_output(self, payload: dict[str, object]) -> bool: """Whether ``payload`` belongs to a turn the session has already moved past.""" diff --git a/vllm_omni/model_executor/models/nemotron_voicechat/duplex/serving_adapter.py b/vllm_omni/model_executor/models/nemotron_voicechat/duplex/serving_adapter.py index 16a33ec01f3..1b210728709 100644 --- a/vllm_omni/model_executor/models/nemotron_voicechat/duplex/serving_adapter.py +++ b/vllm_omni/model_executor/models/nemotron_voicechat/duplex/serving_adapter.py @@ -117,9 +117,7 @@ def _render_tool_response(output: str) -> str: def _require_native_full_duplex(config: object) -> None: extra_body = getattr(config, "extra_body", None) - enabled = isinstance(extra_body, dict) and ( - extra_body.get("auto_response") is True or extra_body.get("full_duplex") is True - ) + enabled = isinstance(extra_body, dict) and extra_body.get("auto_response") is True if not enabled: raise ServingRuntimeConfigError( "Nemotron VoiceChat currently supports model-native full-duplex streaming only; " diff --git a/vllm_omni/model_executor/models/qwen3_omni/duplex/plugin.py b/vllm_omni/model_executor/models/qwen3_omni/duplex/plugin.py index 89b2c6ffdf9..09658dfa53f 100644 --- a/vllm_omni/model_executor/models/qwen3_omni/duplex/plugin.py +++ b/vllm_omni/model_executor/models/qwen3_omni/duplex/plugin.py @@ -160,7 +160,7 @@ def create_session_state(self): def validate_client_extra_body(self, extra_body): if not isinstance(extra_body, Mapping): return - if extra_body.get("auto_response") or extra_body.get("full_duplex"): + if extra_body.get("auto_response"): raise DuplexRuntimeConfigError( "Qwen requires server VAD or explicit commits; native auto_response is unsupported" )