GPT 架构:Decoder-only 全景
GPT(Generative Pre-trained Transformer)系列采用仅解码器(decoder-only)的 Transformer 结构。与编码器-解码器翻译模型不同,GPT 用因果掩码让每个 token 只能关注前面的内容,按自回归方式逐个生成,成为现代大语言模型的主流骨架。
结构:因果掩码自注意力
解码器层堆叠自注意力与前馈网络,自注意力使用下三角因果掩码(causal mask),第 i 个位置无法看到第 i+1 之后。这样训练时整句可并行计算损失,推理时逐 token 生成。位置编码常用绝对或旋转位置编码(RoPE)。
预训练目标:下一词预测
GPT 以无监督的下一词预测(next-token prediction)为目标,在海量文本上最小化交叉熵。这种简单目标配合规模能涌现出少样本与指令遵循能力,无需为每任务单独标注。
import torch
from transformers import GPT2LMHeadModel, GPT2Tokenizer
tok = GPT2Tokenizer.from_pretrained("gpt2")
model = GPT2LMHeadModel.from_pretrained("gpt2")
ids = tok("人工智能正在", return_tensors="pt")["input_ids"]
out = model.generate(ids, max_new_tokens=20) # 自回归生成
print(tok.decode(out[0]))
为什么主流
decoder-only 结构统一了训练与生成:训练并行、推理自回归,复用同一套权重。相比编码器-解码器,它更易扩展到超大参数与长上下文,因此 GPT、LLaMA、Qwen 等均以之为基。
小结
GPT 用仅解码器 Transformer 与因果掩码实现自回归生成,以下一词预测为统一训练目标,结构简洁且易扩展,是当前大语言模型的事实基础。
参考与延伸阅读
- “Language Models are Few-Shot Learners”(GPT-3, Brown 等, 2020, NeurIPS)。已核验。https://arxiv.org/abs/2005.14165
- Attention Is All You Need(Vaswani 等, 2017)。已核验。https://arxiv.org/abs/1706.03762
- Hugging Face GPT-2 模型文档。已核验。https://huggingface.co/docs/transformers/model_doc/gpt2
本文累计阅读 — 次