5
请解释Tokenization(分词)过程。BPE、WordPiece、SentencePiece的区别是什么?
大模型基础理论中等
📋 面试问题
请解释Tokenization(分词)过程。BPE、WordPiece、SentencePiece的区别是什么?
✅ 期望回答
Tokenization过程:将原始文本切分为模型能处理的token序列(子词/字符级)
三种方法的区别:
- BPE (Byte Pair Encoding):从字符级别出发,统计并合并出现最频繁的字符对,迭代构建词表(GPT-2、RoBERTa使用)
- WordPiece:与BPE类似,但合并标准是互信息最大化(选择使训练数据似然增加最多的合并对),BERT使用。标记子词时用
##前缀 - SentencePiece:直接在原始Unicode文本上操作,将BPE/Unigram应用于raw text而非pre-tokenized词。LLaMA、T5使用
- OOV处理:子词分词天然处理OOV,任何未登录词都可拆解为已知子词
- 多语言:SentencePiece对多语言友好(不依赖语言特定的分词器)
- Special Tokens:
[CLS]、[SEP]、<|endoftext|>、<|im_start|>等控制token
#Tokenization#BPE#SentencePiece