https://github.com/QwenLM/Qwen/blob/main/tokenization_note_zh.md#%E6%99%AE%E9%80%9Atoken
https://huggingface.co/Qwen/Qwen-7B
一、Qwen-7B 介绍
Qwen-7B采用UTF-8字节级别的BPE tokenization方式,并依赖tiktoken
这一高效的软件包执行分词。 Qwen-7B中有两类token,即源于BPE、bytes
类型的普通token和特殊指定、str
类型的特殊token。
from transformers import AutoTokenizertokenizer = AutoTokenizer.from_pretrained('Qwen/Qwen-7B', trust_remote_code=True)
二、词表扩展