大语言模型架构演进史

从 Transformer 到 MoE,梳理近五年主流 LLM 在架构层面的关键突破与权衡。

2 分钟阅读351 字

一、概述

大语言模型的能力跃迁,本质上是一连串"在固定算力预算下最大化信息密度"的架构选择。本文按时间线梳理 2017 年以来关键节点。

二、关键里程碑

年份 模型 关键变化
2017 Transformer 抛弃 RNN,完全依赖自注意力
2018 GPT-1 / BERT 验证大规模预训练
2019 GPT-2 / T5 规模即能力,Prompt 范式雏形
2020 GPT-3 In-context Learning 出现
2022 InstructGPT / ChatGPT RLHF 让模型"听话"
2023 LLaMA-2 / Mistral 开放权重 + GQA
2024 Mixtral 8x22B MoE 进入主流视野
2025 DeepSeek-V3 / Qwen3 细粒度专家 + 长上下文

三、核心结构

3.1 标准 Decoder-Only Block

TEXT
        ┌────────────────────────────┐
input → │ RMSNorm                    │
        │  → Multi-Head Self-Attn    │
        │  → Residual Add            │
        │  → RMSNorm                 │
        │  → SwiGLU FFN              │
        │  → Residual Add            │
        └────────────────────────────┘
                          ↓
                       output

3.2 GQA(Grouped-Query Attention)

将 KV 头分组共享,显著降低推理显存:

TS
const GROUP_SIZE = numHeads / numKvHeads
// Q: [B, T, H, D]  KV: [B, T, H/GROUP_SIZE, D]

3.3 MoE 路由

TS
function moeTopK(x: Tensor, k = 2): Tensor {
  const scores = gate(x)              // [B, T, E]
  const { values, indices } = topk(scores, k)
  return combineExperts(x, indices, values)
}

四、工程权衡

  • 稠密 vs 稀疏:MoE 训练 FLOPs 略高,但推理激活量更小,适合在线服务。
  • 位置编码:RoPE 已成为事实标准,YaRN、LongRoPE 等扩展使其支持 128K+ 上下文。
  • 长上下文:稀疏注意力(Sliding Window + Global Token)在不显著损失质量的情况下,大幅降低显存。

五、总结

LLM 架构演进的清晰主线是:在固定算力下,让模型"看得更全、记得更久、答得更准"。理解这条主线,比记住某个具体模型的参数量更有价值。

推荐阅读: Attention Is All You NeedScaling Laws for Neural LMsGShard


文章 slug: llm-architecture-evolution 最后更新: 2026-06-16

版权声明 · CC BY-NC-ND 4.0

署名-非商业性使用-禁止演绎 4.0 国际

版权归属

本作品著作权归 窦长友 所有, 首次发布于 ,受相关知识产权法律法规保护。

授权范围
  • 可自由分享 — 在任何媒介以任何形式复制、转载本文
  • 不得用于商业目的 — 未经书面授权禁止商用
  • 禁止演绎修改 — 不得改编、转换或以本文为基础再创作
署名要求

转载或引用时须明确标注作者姓名原文出处及本许可协议链接。 不得以任何方式暗示或声称作者为您的使用背书。

评论

由 GitHub Discussions 驱动