Transformer

一种基于自注意力机制的深度学习架构,2017 年由 Google 团队在论文《Attention Is All You Need》中提出,彻底改变了自然语言处理领域的范式,成为 GPT、BERT、LLaMA 等所有现代大语言模型的底层骨架。

简介

Transformer 是一种摒弃了传统 RNN(循环神经网络)和 CNN(卷积神经网络)的序列建模架构,完全依赖注意力机制来捕捉输入序列中任意位置之间的依赖关系。它的核心创新在于:不再需要按顺序逐个处理 token,而是让所有 token 同时参与计算——每个 token 都能”看到”序列中的所有其他 token,并根据相关性加权聚合信息。

这一设计解决了 RNN 的两大痛点:(1)长距离依赖问题——RNN 需要信息逐步传递,序列越长信息衰减越严重;Transformer 的注意力可以直接连接任意两个位置;(2)无法并行计算——RNN 必须按时间步顺序处理;Transformer 所有位置可以同时计算,训练效率大幅提升。

Transformer 从最初的机器翻译任务出发,迅速扩展到文本生成(GPT 系列)、文本理解(BERT)、多模态理解(GPT-4V、Gemini)、图像生成(DiT)、语音(Whisper)、蛋白质结构预测(AlphaFold 2)等几乎所有 AI 子领域,成为当代 AI 的通用骨架。

关键信息

  • 类型:深度学习架构
  • 领域:自然语言处理 / 计算机视觉 / 多模态 AI
  • 提出时间:2017 年
  • 提出者:Google Brain 团队(Vaswani et al.)
  • 原始论文:《Attention Is All You Need》
  • 核心机制:自注意力(Self-Attention)、多头注意力(Multi-Head Attention)、位置编码(Positional Encoding)
  • 代表模型:GPT 系列、BERT、LLaMA、DeepSeek、Gemini、Claude

核心特性

1. 自注意力机制(Self-Attention)

Transformer 的灵魂组件。每个 token 都生成三个向量:Q(Query,我在找什么)、K(Key,我的标识是什么)、V(Value,我能提供什么)。每个 token 用自己的 Q 去和所有 token 的 K 做匹配计算,得到注意力权重,再按权重从所有 token 的 V 中加权提取信息,最终每个 token 都获得了一个融合了全局上下文的新表示。

用相亲类比:20 个嘉宾同时参加相亲节目,每人有自己的择偶标准(Q),听完所有人的自我介绍(K)后打分,再按分数高低深聊不同深度(V),最终每人脑子里形成一个综合印象——匹配度高的人信息占比大,不匹配的人信息几乎被忽略。

2. 多头注意力(Multi-Head Attention)

不是只做一次注意力计算,而是同时做多次(通常 8 次或更多),每次关注不同的”维度”——比如一个头关注语义相似性,另一个头关注语法结构,第三个头关注位置关系。最后把多个头的结果拼接起来,获得更丰富的上下文表示。

3. 位置编码(Positional Encoding)

Transformer 并行处理所有 token,天然不知道 token 的先后顺序。位置编码通过给每个 token 加上一个位置信号,让模型知道”这个词在句子的哪个位置”。原始论文使用正弦/余弦函数生成位置编码,后续模型(如 RoPE)使用旋转位置编码。

4. 编码器-解码器结构

原始 Transformer 采用编码器(Encoder)+ 解码器(Decoder)的双塔结构:

  • 编码器:把输入序列编码成上下文表示(BERT 只用编码器)
  • 解码器:基于编码器的输出和已生成的 token,自回归地生成下一个 token(GPT 只用解码器)

5. 前馈网络(FFN)与残差连接

每个注意力层之后接一个前馈网络(通常是两层 MLP),用于对注意力的输出做非线性变换。残差连接(Residual Connection)和层归一化(Layer Normalization)保证梯度稳定传播,使深层 Transformer 可以训练。

不同素材中的观点

  • 2026-06-22-transformer-attention-dating-analogy:作者(数学专业出身、自学 AI)认为多数 Transformer 教程的真正问题不是”太难”而是”只翻译不解释”——把 Query 翻译成”查询”不等于让人理解。他用相亲节目的完整类比拆解了注意力机制:Q 是择偶标准、K 是自我介绍标签、V 是深聊后的真实细节、softmax 是归一化成百分比、自注意力是所有人同时互评。核心洞察:公式 Attention(Q, K, V) = softmax(QKᵀ/√dk)V 翻译成人话就是”每个 token 都拿着自己的标准,对照一遍所有其他 token 的自我介绍,按匹配程度从每个 token 身上吸收不同比例的信息,最终合成一个新的理解”。

实用信息

学习路径建议

  1. 入门:先理解注意力机制的直觉(推荐用类比而非公式),再看 Q/K/V 的含义
  2. 进阶:阅读原始论文《Attention Is All You Need》,重点关注 Figure 1 和 Section 3
  3. 实战:用 Hugging Face Transformers 库加载预训练模型,观察注意力权重可视化

常见误区

  • “多头注意力就是从多个层面看”:这只是字面翻译,实际含义是同时做多次注意力计算,每次学习不同的特征关系
  • “自注意力就是自己看自己”:实际含义是序列中每个 token 同时对所有其他 token 计算注意力,“自”指的是”序列内部”而非”自己对自己”
  • Transformer = 大语言模型:Transformer 是架构,LLM 是基于 Transformer 训练出的具体模型,两者是骨架与成品的关系

相关页面