From 5c97e4bc7ce7e9b58eeb82ac2abde932fb96b784 Mon Sep 17 00:00:00 2001 From: Tianlei Wu Date: Mon, 15 Jun 2026 17:26:18 +0000 Subject: [PATCH] fix gpt-oss rotary cache --- src/python/py/models/builders/gptoss.py | 4 +++- 1 file changed, 3 insertions(+), 1 deletion(-) diff --git a/src/python/py/models/builders/gptoss.py b/src/python/py/models/builders/gptoss.py index abc6bd53b8..8ab4a2b44d 100644 --- a/src/python/py/models/builders/gptoss.py +++ b/src/python/py/models/builders/gptoss.py @@ -53,7 +53,9 @@ def make_layernorm(self, layer_id, layernorm, skip, simple, location): super().make_layernorm(layer_id, layernorm, skip, simple, location) def make_rotary_embedding_caches_from_scratch(self): - inv_freq = self.rope_attrs["theta"] ** (torch.arange(0, self.head_size, 2, dtype=torch.float) / self.head_size) + inv_freq = 1.0 / ( + self.rope_attrs["theta"] ** (torch.arange(0, self.head_size, 2, dtype=torch.float) / self.head_size) + ) inv_freq = self.make_inv_freq_rescaled(inv_freq) t = torch.arange(self.rope_attrs["cache_length"], dtype=torch.float32)