大语言模型架构演进史
从 Transformer 到 MoE,梳理近五年主流 LLM 在架构层面的关键突破与权衡。
2 分钟阅读351 字
一、概述
大语言模型的能力跃迁,本质上是一连串"在固定算力预算下最大化信息密度"的架构选择。本文按时间线梳理 2017 年以来关键节点。
二、关键里程碑
| 年份 | 模型 | 关键变化 |
|---|---|---|
| 2017 | Transformer | 抛弃 RNN,完全依赖自注意力 |
| 2018 | GPT-1 / BERT | 验证大规模预训练 |
| 2019 | GPT-2 / T5 | 规模即能力,Prompt 范式雏形 |
| 2020 | GPT-3 | In-context Learning 出现 |
| 2022 | InstructGPT / ChatGPT | RLHF 让模型"听话" |
| 2023 | LLaMA-2 / Mistral | 开放权重 + GQA |
| 2024 | Mixtral 8x22B | MoE 进入主流视野 |
| 2025 | DeepSeek-V3 / Qwen3 | 细粒度专家 + 长上下文 |
三、核心结构
3.1 标准 Decoder-Only Block
TEXT
┌────────────────────────────┐
input → │ RMSNorm │
│ → Multi-Head Self-Attn │
│ → Residual Add │
│ → RMSNorm │
│ → SwiGLU FFN │
│ → Residual Add │
└────────────────────────────┘
↓
output
3.2 GQA(Grouped-Query Attention)
将 KV 头分组共享,显著降低推理显存:
TS
const GROUP_SIZE = numHeads / numKvHeads
// Q: [B, T, H, D] KV: [B, T, H/GROUP_SIZE, D]
3.3 MoE 路由
TS
function moeTopK(x: Tensor, k = 2): Tensor {
const scores = gate(x) // [B, T, E]
const { values, indices } = topk(scores, k)
return combineExperts(x, indices, values)
}
四、工程权衡
- 稠密 vs 稀疏:MoE 训练 FLOPs 略高,但推理激活量更小,适合在线服务。
- 位置编码:RoPE 已成为事实标准,YaRN、LongRoPE 等扩展使其支持 128K+ 上下文。
- 长上下文:稀疏注意力(Sliding Window + Global Token)在不显著损失质量的情况下,大幅降低显存。
五、总结
LLM 架构演进的清晰主线是:在固定算力下,让模型"看得更全、记得更久、答得更准"。理解这条主线,比记住某个具体模型的参数量更有价值。
推荐阅读: Attention Is All You Need → Scaling Laws for Neural LMs → GShard
文章 slug: llm-architecture-evolution
最后更新: 2026-06-16
版权声明 · CC BY-NC-ND 4.0
署名-非商业性使用-禁止演绎 4.0 国际
评论
由 GitHub Discussions 驱动