Skip to content
Merged
Changes from 1 commit
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
7 changes: 6 additions & 1 deletion src/transformers/tokenization_utils_fast.py
Original file line number Diff line number Diff line change
Expand Up @@ -824,7 +824,12 @@ def train_new_from_iterator(
kwargs["end_of_word_suffix"] = tokenizer_json["model"]["end_of_word_suffix"]
if tokenizer_json["model"]["type"] == "Unigram" and unk_token is not None:
kwargs["unk_token"] = unk_token
if tokenizer_json["pre_tokenizer"] is not None and tokenizer_json["pre_tokenizer"]["type"] == "ByteLevel":
if tokenizer_json["pre_tokenizer"] is not None \
and tokenizer_json["pre_tokenizer"]["type"] == "ByteLevel" \
or tokenizer_json["pre_tokenizer"]["type"] == "Sequence" and \
"pretokenizers" in tokenizer_json["pre_tokenizer"] and \
any(pretokenizer["type"] == "ByteLevel"
for pretokenizer in tokenizer_json["pre_tokenizer"]["pretokenizers"]):
kwargs["initial_alphabet"] = pre_tokenizers_fast.ByteLevel.alphabet()

trainer_class = MODEL_TO_TRAINER_MAPPING[tokenizer_json["model"]["type"]]
Expand Down