]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commitdiff
convert : import bytes_to_unicode from convert_slow_tokenizer (#26217)
authorCaleb DeLeeuw <redacted>
Tue, 4 Aug 2026 07:34:30 +0000 (00:34 -0700)
committerGitHub <redacted>
Tue, 4 Aug 2026 07:34:30 +0000 (10:34 +0300)
bytes_to_unicode was removed from transformers.models.gpt2.tokenization_gpt2
in huggingface/transformers#40936, but it had already been copied into
transformers.convert_slow_tokenizer in huggingface/transformers#30334
(transformers 4.54.1), so import it directly from there.

Applies the same fix to chatglm.py.

conversion/chatglm.py
conversion/qwen.py

index 801913075dbc0c547c6fc0b9ecd5354568c3c74e..d6385503877c547fa209918a1bc293887fcaa9a4 100644 (file)
@@ -81,7 +81,7 @@ class ChatGLMModel(TextModel):
 
     @staticmethod
     def token_bytes_to_string(b):
-        from transformers.models.gpt2.tokenization_gpt2 import bytes_to_unicode  # ty: ignore[unresolved-import]
+        from transformers.convert_slow_tokenizer import bytes_to_unicode
         byte_encoder = bytes_to_unicode()
         return ''.join([byte_encoder[ord(char)] for char in b.decode('latin-1')])
 
index 7e3d8c0d12d329c6b0876e99e947fccb61f46cf1..b4ae528bf2d467cd9d1dacdcbb7e59961213ee14 100644 (file)
@@ -18,7 +18,7 @@ class QwenModel(TextModel):
 
     @staticmethod
     def token_bytes_to_string(b):
-        from transformers.models.gpt2.tokenization_gpt2 import bytes_to_unicode  # ty: ignore[unresolved-import]
+        from transformers.convert_slow_tokenizer import bytes_to_unicode
         byte_encoder = bytes_to_unicode()
         return ''.join([byte_encoder[ord(char)] for char in b.decode('latin-1')])