From b06fbc968b980daa313687152114dd1bfd1edaa9 Mon Sep 17 00:00:00 2001 From: Caleb DeLeeuw <143902425+SolshineCode@users.noreply.github.com> Date: Tue, 4 Aug 2026 00:34:30 -0700 Subject: [PATCH] convert : import bytes_to_unicode from convert_slow_tokenizer (#26217) bytes_to_unicode was removed from transformers.models.gpt2.tokenization_gpt2 in huggingface/transformers#40936, but it had already been copied into transformers.convert_slow_tokenizer in huggingface/transformers#30334 (transformers 4.54.1), so import it directly from there. Applies the same fix to chatglm.py. --- conversion/chatglm.py | 2 +- conversion/qwen.py | 2 +- 2 files changed, 2 insertions(+), 2 deletions(-) diff --git a/conversion/chatglm.py b/conversion/chatglm.py index 801913075d..d638550387 100644 --- a/conversion/chatglm.py +++ b/conversion/chatglm.py @@ -81,7 +81,7 @@ class ChatGLMModel(TextModel): @staticmethod def token_bytes_to_string(b): - from transformers.models.gpt2.tokenization_gpt2 import bytes_to_unicode # ty: ignore[unresolved-import] + from transformers.convert_slow_tokenizer import bytes_to_unicode byte_encoder = bytes_to_unicode() return ''.join([byte_encoder[ord(char)] for char in b.decode('latin-1')]) diff --git a/conversion/qwen.py b/conversion/qwen.py index 7e3d8c0d12..b4ae528bf2 100644 --- a/conversion/qwen.py +++ b/conversion/qwen.py @@ -18,7 +18,7 @@ class QwenModel(TextModel): @staticmethod def token_bytes_to_string(b): - from transformers.models.gpt2.tokenization_gpt2 import bytes_to_unicode # ty: ignore[unresolved-import] + from transformers.convert_slow_tokenizer import bytes_to_unicode byte_encoder = bytes_to_unicode() return ''.join([byte_encoder[ord(char)] for char in b.decode('latin-1')])