Transformer 整体架构
EXPLORE +
为什么是 Transformer?
2017 年 Google 在《Attention Is All You Need》中提出 Transformer,它用自注意力机制替代了传统的 RNN/LSTM,解决了长序列建模和并行化训练两大难题。
架构概览
Transformer 采用 Encoder-Decoder 结构(现代 LLM 多只用 Decoder):
- Encoder:将输入序列编码为上下文表示
- Decoder:基于编码表示自回归生成输出
核心组件
| 组件 | 作用 |
|---|---|
| Self-Attention | 让每个位置关注序列中所有位置,捕获全局依赖 |
| Multi-Head Attention | 从多个角度计算注意力,捕获不同类型的关系 |
| Position Encoding | 为模型提供位置信息(Attention 本身不感知顺序) |
| Feed Forward Network | 非线性变换增强表达能力(两层线性 + ReLU) |
| Layer Normalization | 稳定训练,加速收敛(在序列维度做归一化) |
| Residual Connection | 缓解深层网络梯度消失(x + F(x)) |
数据流
输入序列 -→ Embedding + Position Encoding
-→ [Multi-Head Attention + Residual + LayerNorm]
-→ [FFN + Residual + LayerNorm]
-→ × N 层
-→ 输出表示