GAME 01 · 分词实验室
HANDS-ON · 动手实验

BPE 分词实验室

BYTE PAIR ENCODING · TOKENIZATION

你是分词器的设计师。观察语料,找出最高频的字符对,合并它们,看着词汇表一步步成长——这正是 GPT、LLaMA 等大模型 token 化的核心原理。

01
观察语料
02
合并字符对
03
词汇表成长
04
切词挑战

📚 训练语料 Corpus

每个词后的数字是它在语料中出现的次数
0
合并轮次
0
词汇表大小
0
候选字符对
0
当前总 token 数

🎯 候选字符对 · 点击选择要合并的对

⭐ 标记的是当前频率最高的"最佳合并"

🗂️ 词汇表 Vocabulary

蓝色=基础字符,粉色=合并产生的新 token
💡

BPE 的核心思想

从"每个字符是一个 token"出发,每轮找出语料中出现频率最高的相邻字符对,把它们合并成一个新的 token 加入词汇表。重复这个过程,词汇表就会从字母长成有意义的子词(subword)。"low""est""er"这类片段会被自动学出来——既不会像单词表那样庞大,也不会像字符那样丢失语义。

⚔️ 切词挑战 · 用学到的词汇表切分新词

点击 token 可以删除(撤销切割)
🎮

挑战规则

输入一个词(最好包含训练中出现过的片段),系统会用你训练出的词汇表进行"贪心最长匹配"切分。试着切出尽可能少的 token——这就是大模型实际 tokenize 你输入的方式!

点击"开始切词"查看结果...