Transformer 架构手写笔记

手写整理 Transformer 的核心组件:Self-Attention、多头注意力、位置编码与前馈网络,附关键公式。

背景

Transformer 架构由 Google 在 2017 年论文《Attention Is All You Need》中提出,是当前几乎所有大模型的基础。

核心组件

1. 自注意力(Self-Attention)

核心公式:

Attention(Q, K, V) = softmax(QKᵀ / √d_k) · V

其中 Q、K、V 分别由输入乘三个权重矩阵得到,d_k 是缩放因子,防止点积过大导致梯度消失。

2. 多头注意力(Multi-Head Attention)

把注意力分成多个"头"并行计算,每个头关注不同的关系(语法、指代、语义),最后拼接。

3. 位置编码(Positional Encoding)

注意力机制本身不感知顺序,所以需要注入位置信息。原论文使用正弦/余弦函数生成位置编码。

4. 前馈网络与残差连接

每个子层后接 Feed-Forward Network,并采用 残差连接 + LayerNorm

输出 = LayerNorm(x + Sublayer(x))

一张图理解数据流向

输入序列 → 词嵌入 → 位置编码 → [多头注意力 → 前馈网络] × N 层 → 输出

学习心得

  • 从"为什么需要注意力"入手,比直接啃公式更容易理解;
  • 用 PyTorch 手写一个单头注意力,比看十遍教程都管用;
  • 推荐资源:Jay Alammar 的《The Illustrated Transformer》。

评论(0)

还没有评论,来抢沙发吧~

发表评论

评论需审核通过后展示