diff --git a/megatron/training/checkpointing.py b/megatron/training/checkpointing.py index 93e8a8acd6a..b73466ccfde 100644 --- a/megatron/training/checkpointing.py +++ b/megatron/training/checkpointing.py @@ -1449,10 +1449,10 @@ def _set_arg(arg_name, old_arg_name=None, force=False): _set_arg('moe_latent_size', force=True) # Tokenizer args. - _set_arg('tokenizer_type', force=True) # Using checkpoint version might not always be safe (e.g., if running on different cluster). if args.use_tokenizer_model_from_checkpoint_args: _set_arg('tokenizer_model', force=True) + _set_arg('tokenizer_type', force=True) _set_arg('tiktoken_pattern', force=True) _set_arg('padded_vocab_size')