RNN 必须按时间步依次处理,无法并行,训练速度极慢,难以利用 GPU 的并行能力。
序列越长,早期信息越难保留。即便有 LSTM 的门控机制,长距离依赖仍然是个难题。
反向传播经过大量时间步会梯度消失或爆炸,限制了模型可处理的序列长度。
单向 RNN 只能看过去,无法利用未来上下文,限制了表征能力。
将 token 转换为 dmodel=512 维向量,叠加位置编码后送入网络。
编码器和解码器各堆叠 N=6 层,每层结构相同但参数独立,逐层提取更高层语义。
最终经线性层 + Softmax,输出每个词的概率分布,用于预测下一个 token。
每个输入向量被映射为三种向量:查询、键、值。可以用一个生动的类比来理解它们:
当 dk 较大时,QKT 的点积结果方差会变大,把 Softmax 推到梯度极小的饱和区。除以 √dk 是为了稳定梯度,让训练更平稳。
单个注意力头只能学到一种关系模式。多头机制让不同的头分别关注:
原始论文中 dmodel=512,使用 h=8 个头,每个头维度 dk=dv=64。8 个头并行计算,最后拼接后再做一次线性映射 WO。
总计算量与单头注意力几乎相当,但表征能力大幅提升。这就是"并行关注不同模式"的精髓。
论文使用不同频率的 sin/cos 函数生成位置编码,再与词嵌入相加:
不同维度对应不同频率的波,从高频到低频,编码出"位置指纹"。
对每个位置独立做两层全连接,中间用 ReLU/GELU 激活。维度先扩展到 4 倍(2048)再映射回 dmodel。
每个子层都包裹 Add 操作:将输入直接加到输出上。这缓解了深层网络的梯度消失,让信息顺畅流动。
对每个样本的特征维度做归一化,稳定训练、加速收敛。现代变体常用 RMSNorm 或 Pre-Norm 结构。
BERT(仅编码器):文本分类、命名实体识别、问答系统。双向注意力捕捉完整上下文。
GPT 系列(仅解码器):对话、写作、代码生成。ChatGPT、GPT-4 掀起 AI 革命。
原始 Transformer(编码器-解码器):Google 翻译、DeepL,机器翻译质量飞跃。
ViT 图像分类、DALL·E 文生图、Whisper 语音识别、Sora 视频生成。
Google 团队发表《Attention Is All You Need》,提出完全基于注意力的架构。
OpenAI 与 Google 分别发布 GPT 与 BERT,预训练 + 微调范式确立,NLP 进入新纪元。
展示惊人的少样本学习能力,证明模型规模的力量。
Vision Transformer 证明 Transformer 在视觉领域同样强大,统一了多模态架构。
基于 GPT-3.5 的对话产品风靡全球,AI 真正走入大众视野。
支持图文多模态、长上下文、Agent 智能体,持续推动 AGI 边界。
Transformer 的成功源于一个深刻的设计哲学:用全局注意力替代局部递归。这一改变带来了三重红利——高度并行(训练效率)、长程建模(效果)、可扩展性(scaling law)。当一个架构既能高效训练、又能随规模持续变强时,它注定会定义一个时代。