Transformer
? 概念页:基于自注意力的神经网络架构,现代大模型的统一基石。本页为 stub。
核心定义
Transformer(Vaswani et al., 2017, “Attention Is All You Need”)是基于自注意力机制的神经网络架构,摒弃了循环/卷积,通过并行注意力计算处理序列。它已成为当代大语言模型(GPT/Claude/Gemini/Qwen 等)的统一底座。
本库相关
- 层次解读:读懂 Transformer 的层次
- 经典论文脉络:张小珺 36 篇论文演义 将 Transformer 列为 AI 史关键节点
- 上位概念:Deep-Learning
? 建议补强:注意力机制原理图、Transformer 变体(Encoder-only/Decoder-only/Encoder-Decoder)对照、与 Mamba 等新架构的对比。