From 19d8b7f98b563f4a5cd6e6b4b2e57aa354543f0f Mon Sep 17 00:00:00 2001 From: fzyzcjy Date: Sat, 23 Aug 2025 21:53:22 +0800 Subject: [PATCH] cherry pick --- python/sglang/srt/layers/quantization/modelopt_quant.py | 2 ++ 1 file changed, 2 insertions(+) diff --git a/python/sglang/srt/layers/quantization/modelopt_quant.py b/python/sglang/srt/layers/quantization/modelopt_quant.py index 6d3b7695013f..9d7307c16257 100755 --- a/python/sglang/srt/layers/quantization/modelopt_quant.py +++ b/python/sglang/srt/layers/quantization/modelopt_quant.py @@ -1212,11 +1212,13 @@ def process_weights_after_loading(self, layer: torch.nn.Module) -> None: # Process w13 weights w13_blockscale_swizzled = self.swizzle_blockscale(layer.w13_weight_scale) + del layer.w13_weight_scale layer.w13_blockscale_swizzled.data.copy_(w13_blockscale_swizzled) layer.w13_weight = Parameter(layer.w13_weight.data, requires_grad=False) # Process w2 weights w2_blockscale_swizzled = self.swizzle_blockscale(layer.w2_weight_scale) + del layer.w2_weight_scale layer.w2_blockscale_swizzled.data.copy_(w2_blockscale_swizzled) layer.w2_weight = Parameter(layer.w2_weight.data, requires_grad=False)