diff --git a/tensorrt_llm/_torch/models/modeling_qwen3vl.py b/tensorrt_llm/_torch/models/modeling_qwen3vl.py index 4bdcfc767844..e08a11e5749a 100644 --- a/tensorrt_llm/_torch/models/modeling_qwen3vl.py +++ b/tensorrt_llm/_torch/models/modeling_qwen3vl.py @@ -739,9 +739,11 @@ def forward( # Getting positional embedding rotary_pos_emb = self.rot_pos_emb(grid_thw) + pos_embeds = self.fast_pos_embed_interpolate(grid_thw) # From this point, pure GPU operation hidden_states = self.patch_embed(pixel_values) + hidden_states = hidden_states + pos_embeds seq_len, _ = hidden_states.size() hidden_states = hidden_states.reshape(seq_len, -1) @@ -1139,6 +1141,7 @@ def _get_requests_with_mm_data(self, multimodal_params): "video": "<|vision_start|><|video_pad|><|vision_end|>", }, placeholder_placement=MultimodalPlaceholderPlacement.BEFORE_TEXT, + placeholders_separator="", ), ) class Qwen3VLModel(Qwen3VLModelBase): diff --git a/tensorrt_llm/_torch/models/modeling_qwen3vl_moe.py b/tensorrt_llm/_torch/models/modeling_qwen3vl_moe.py index 74cd16ec69c1..66da3c153e2a 100644 --- a/tensorrt_llm/_torch/models/modeling_qwen3vl_moe.py +++ b/tensorrt_llm/_torch/models/modeling_qwen3vl_moe.py @@ -41,6 +41,7 @@ "video": "<|vision_start|><|video_pad|><|vision_end|>", }, placeholder_placement=MultimodalPlaceholderPlacement.BEFORE_TEXT, + placeholders_separator="", ), ) class Qwen3MoeVLModel(Qwen3VLModelBase):