Transformer

概念页:基于自注意力的神经网络架构,现代大模型的统一基石。本页为 stub。

核心定义

Transformer(Vaswani et al., 2017, “Attention Is All You Need”)是基于自注意力机制的神经网络架构,摒弃了循环/卷积,通过并行注意力计算处理序列。它已成为当代大语言模型(GPT/Claude/Gemini/Qwen 等)的统一底座。

本库相关

建议补强:注意力机制原理图、Transformer 变体(Encoder-only/Decoder-only/Encoder-Decoder)对照、与 Mamba 等新架构的对比。