From f2cb95e6e8762e98002bc214224c14906591ac60 Mon Sep 17 00:00:00 2001 From: GrEarl Date: Tue, 28 Jul 2026 04:43:08 +0900 Subject: [PATCH 1/2] convert : fetch tokenizer vocab and remote code with --remote --- convert_hf_to_gguf.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/convert_hf_to_gguf.py b/convert_hf_to_gguf.py index 2c5e62a16fbe..030dbd4c37e9 100755 --- a/convert_hf_to_gguf.py +++ b/convert_hf_to_gguf.py @@ -184,7 +184,7 @@ def main() -> None: if args.remote: hf_repo_id = args.model from huggingface_hub import snapshot_download - allowed_patterns = ["LICENSE", "*.json", "*.md", "*.txt", "tokenizer.model"] + # "*.model" covers tokenizer.model and tiktoken.model; "*.py" is needed\n # because several converters call AutoTokenizer with trust_remote_code=True,\n # which resolves tokenizer code from the model directory.\n allowed_patterns = ["LICENSE", "*.json", "*.md", "*.txt", "*.model", "*.py"] if args.sentence_transformers_dense_modules: # include sentence-transformers dense modules safetensors files allowed_patterns.append("*.safetensors") From c77dee7fec2201716cb8751bfc31f23115bf8666 Mon Sep 17 00:00:00 2001 From: GrEarl Date: Tue, 28 Jul 2026 04:44:13 +0900 Subject: [PATCH 2/2] convert : fix escaped newlines in the previous commit --- convert_hf_to_gguf.py | 5 ++++- 1 file changed, 4 insertions(+), 1 deletion(-) diff --git a/convert_hf_to_gguf.py b/convert_hf_to_gguf.py index 030dbd4c37e9..ef3a70228460 100755 --- a/convert_hf_to_gguf.py +++ b/convert_hf_to_gguf.py @@ -184,7 +184,10 @@ def main() -> None: if args.remote: hf_repo_id = args.model from huggingface_hub import snapshot_download - # "*.model" covers tokenizer.model and tiktoken.model; "*.py" is needed\n # because several converters call AutoTokenizer with trust_remote_code=True,\n # which resolves tokenizer code from the model directory.\n allowed_patterns = ["LICENSE", "*.json", "*.md", "*.txt", "*.model", "*.py"] + # "*.model" covers tokenizer.model and tiktoken.model; "*.py" is needed + # because several converters call AutoTokenizer with trust_remote_code=True, + # which resolves tokenizer code from the model directory. + allowed_patterns = ["LICENSE", "*.json", "*.md", "*.txt", "*.model", "*.py"] if args.sentence_transformers_dense_modules: # include sentence-transformers dense modules safetensors files allowed_patterns.append("*.safetensors")