5

请解释Tokenization(分词)过程。BPE、WordPiece、SentencePiece的区别是什么?

大模型基础理论中等

📋 面试问题

请解释Tokenization(分词)过程。BPE、WordPiece、SentencePiece的区别是什么?

✅ 期望回答

Tokenization过程:将原始文本切分为模型能处理的token序列(子词/字符级) 三种方法的区别:
  • BPE (Byte Pair Encoding):从字符级别出发,统计并合并出现最频繁的字符对,迭代构建词表(GPT-2、RoBERTa使用)
  • WordPiece:与BPE类似,但合并标准是互信息最大化(选择使训练数据似然增加最多的合并对),BERT使用。标记子词时用##前缀
  • SentencePiece:直接在原始Unicode文本上操作,将BPE/Unigram应用于raw text而非pre-tokenized词。LLaMA、T5使用

常见关键点:
  • OOV处理:子词分词天然处理OOV,任何未登录词都可拆解为已知子词
  • 多语言:SentencePiece对多语言友好(不依赖语言特定的分词器)
  • Special Tokens:[CLS]、[SEP]、<|endoftext|>、<|im_start|>等控制token
#Tokenization#BPE#SentencePiece