Transformer 架构手写笔记
手写整理 Transformer 的核心组件:Self-Attention、多头注意力、位置编码与前馈网络,附关键公式。
背景
Transformer 架构由 Google 在 2017 年论文《Attention Is All You Need》中提出,是当前几乎所有大模型的基础。
核心组件
1. 自注意力(Self-Attention)
核心公式:
Attention(Q, K, V) = softmax(QKᵀ / √d_k) · V
其中 Q、K、V 分别由输入乘三个权重矩阵得到,d_k 是缩放因子,防止点积过大导致梯度消失。
2. 多头注意力(Multi-Head Attention)
把注意力分成多个"头"并行计算,每个头关注不同的关系(语法、指代、语义),最后拼接。
3. 位置编码(Positional Encoding)
注意力机制本身不感知顺序,所以需要注入位置信息。原论文使用正弦/余弦函数生成位置编码。
4. 前馈网络与残差连接
每个子层后接 Feed-Forward Network,并采用 残差连接 + LayerNorm:
输出 = LayerNorm(x + Sublayer(x))
一张图理解数据流向
输入序列 → 词嵌入 → 位置编码 → [多头注意力 → 前馈网络] × N 层 → 输出
学习心得
- 从"为什么需要注意力"入手,比直接啃公式更容易理解;
- 用 PyTorch 手写一个单头注意力,比看十遍教程都管用;
- 推荐资源:Jay Alammar 的《The Illustrated Transformer》。
还没有评论,来抢沙发吧~