📚 训练语料 Corpus
每个词后的数字是它在语料中出现的次数
0
合并轮次
0
词汇表大小
0
候选字符对
0
当前总 token 数
🎯 候选字符对 · 点击选择要合并的对
⭐ 标记的是当前频率最高的"最佳合并"
你是分词器的设计师。观察语料,找出最高频的字符对,合并它们,看着词汇表一步步成长——这正是 GPT、LLaMA 等大模型 token 化的核心原理。
从"每个字符是一个 token"出发,每轮找出语料中出现频率最高的相邻字符对,把它们合并成一个新的 token 加入词汇表。重复这个过程,词汇表就会从字母长成有意义的子词(subword)。"low""est""er"这类片段会被自动学出来——既不会像单词表那样庞大,也不会像字符那样丢失语义。
输入一个词(最好包含训练中出现过的片段),系统会用你训练出的词汇表进行"贪心最长匹配"切分。试着切出尽可能少的 token——这就是大模型实际 tokenize 你输入的方式!