Skip to content

LLM 训练工程师完全指南

从分词表征到后训练对齐,从单卡微调到万卡集群调度,从纯文本理解到多模态统一基座。

系统性拆解大语言模型全栈训练技术体系,贯通底层数学物理机理、核心算法推演、工业级分布式工程与前沿 SOTA 实践。

English Version | 在线阅读yingwang.github.io/llm-tutorial

全景图: 从数据到部署

flowchart LR
    subgraph DATA["<b>① 数据</b>"]
        D1["Web Crawl\nWikipedia\n代码/数学"] --> D2["清洗\n去重\n过滤"]
    end

    subgraph TOK["<b>② Tokenizer</b>"]
        D2 --> T1["BPE / Unigram\n训练词表"]
        T1 --> T2["Token IDs"]
    end

    subgraph PRE["<b>③ 预训练</b>"]
        T2 --> P1["Transformer\nGQA · MoE · MLA\nRoPE · SwiGLU"]
        P1 --> |"Next Token\nPrediction"| P2["Base Model"]
    end

    subgraph POST["<b>④ 后训练</b>"]
        P2 --> S1["SFT\n指令微调"]
        S1 --> S2["RLHF / DPO\n偏好优化"]
        S2 --> S3["Safety\n安全训练"]
    end

    subgraph DEPLOY["<b>⑤ 部署</b>"]
        S3 --> Q1["量化\nINT4/FP8"]
        Q1 --> Q2["推理服务\nvLLM · SGLang"]
    end

    classDef step fill:#ffffff,stroke:#555,color:#222
    class D1,D2,T1,T2,P1,P2,S1,S2,S3,Q1,Q2 step

    style DATA fill:#e3f2fd,stroke:#1565c0,color:#0d47a1
    style TOK fill:#e3f2fd,stroke:#1565c0,color:#0d47a1
    style PRE fill:#e8eaf6,stroke:#283593,color:#1a237e
    style POST fill:#fff3e0,stroke:#e65100,color:#bf360c
    style DEPLOY fill:#e8f5e9,stroke:#2e7d32,color:#1b5e20

知识地图: 章节关系

flowchart TB
    subgraph core["核心训练流程"]
        direction LR
        ch1["<a href='chapters/01-tokenizer.md'>① Tokenizer</a>"]
        ch2["<a href='chapters/02-architecture.md'>② 架构</a>"]
        ch3["<a href='chapters/03-pretraining.md'>③ 预训练</a>"]
        ch4["<a href='chapters/04-post-training.md'>④ 后训练</a>"]
        ch1 --> ch2 --> ch3 --> ch4
    end

    subgraph infra["工程基础设施"]
        direction LR
        ch5["<a href='chapters/05-peft.md'>⑤ PEFT\nLoRA/QLoRA</a>"]
        ch6["<a href='chapters/06-infra.md'>⑥ 分布式训练\nTP/PP/DP</a>"]
        ch7["<a href='chapters/07-inference.md'>⑦ 推理部署\n量化/vLLM</a>"]
    end

    subgraph extend["能力扩展"]
        direction LR
        ch8["<a href='chapters/08-embedding-rag.md'>⑧ Embedding\n& RAG</a>"]
        ch9["<a href='chapters/09-multimodal.md'>⑨ 多模态\nVLM/Video</a>"]
        ch10["<a href='chapters/10-safety-alignment.md'>⑩ 安全\n& 对齐</a>"]
    end

    subgraph ref["参考"]
        direction LR
        ch11["<a href='chapters/11-sota-models.md'>⑪ SOTA\n模型解析</a>"]
        ch12["<a href='chapters/12-distillation-merging.md'>⑫ 蒸馏\n& 合并</a>"]
        ch13["<a href='chapters/13-roadmap.md'>⑬ 路线图\n& 资源</a>"]
    end

    ch4 -.-> ch5
    ch3 -.-> ch6
    ch4 -.-> ch7
    ch7 -.-> ch8
    ch3 -.-> ch9
    ch4 -.-> ch10

    classDef chapter fill:#ffffff,stroke:#555,color:#222
    class ch1,ch2,ch3,ch4,ch5,ch6,ch7,ch8,ch9,ch10,ch11,ch12,ch13 chapter

    style core fill:#e8eaf6,stroke:#3949ab
    style infra fill:#e0f2f1,stroke:#00695c
    style extend fill:#fce4ec,stroke:#c62828
    style ref fill:#f3e5f5,stroke:#6a1b9a

章节目录

# 章节 内容
1 Tokenizer BPE, WordPiece, Unigram, 多语言, 字节级
2 模型架构 Transformer, RoPE, GQA, MoE, MLA, Scaling Laws
3 预训练 数据 pipeline, 训练目标, 优化器, 稳定性, 长上下文
4 后训练 SFT, RLHF, DPO, GRPO, Reasoning Models
5 参数高效微调 PEFT LoRA, QLoRA, Adapters, 实战建议
6 训练基础设施 GPU, TP/PP/DP/EP, 框架, 容错, MFU
7 推理与部署 KV Cache, 量化, vLLM, Speculative Decoding, 成本估算
8 Embedding 与 RAG Embedding 模型, 向量检索, RAG pipeline
9 多模态 VLM, 图像生成, 音频, 视频, Omni Models
10 安全与对齐 评估 Benchmark, Red Teaming, Guardrails, 结构化输出
11 SOTA 模型解析 LLaMA 3, DeepSeek, Claude, Gemini, GPT-4, Qwen
12 知识蒸馏与模型合并 KD, TIES, DARE, mergekit
13 实战路线图 学习路径, 论文清单, 资源, 硬件, 成本

训练成本速查

模型规模 硬件 训练 Token 大约成本 时间
1B 1x A100 80GB 20B ~$500 ~2天
7B 8x A100 80GB 1T ~$50K ~2周
13B 32x A100 80GB 2T ~$200K ~3周
70B 256x H100 2T ~$2M ~1月
405B 16384x H100 15T ~$50M+ ~2月
671B MoE 2048x H800 14.8T ~$5.5M ~2月

注:表中 DeepSeek-V3 凭借细粒度 MoE 稀疏激活与 FP8 混合精度训练,实现了计算效率与显存开销的跨越式压缩。

配套代码

本教程配套的可运行工程代码存放于独立仓库 llm-tutorial-code。仓库按章节模块化组织,从手写 BPE 分词器与基础注意力算子起步,逐层递进至大规模预训练流水线、SFT、DPO 对齐、LoRA 微调及高性能推理部署。

术语表

若在阅读过程中遇到专业缩写或前沿概念,可随时查阅 术语表。该表系统归纳了模型架构、训练机制、参数高效微调、分布式基础设施、推理加速、检索增强生成(RAG)以及多模态等维度的 80 余个核心技术词条。

推荐阅读路径

针对初学者,建议遵循由浅入深、理论与代码共振的研读顺序:

  1. 第一章 Tokenizer:剖析离散符号到连续向量的离散化表征入口
  2. 第二章 架构:洞悉 Transformer 骨干网络、位置编码与前沿注意力演进
  3. 第十三章 路线图:把握大模型工程师的全局技能图谱与软硬件工具链
  4. 动手实践:复现并运行 nanoGPT
  5. 进阶深造:系统研读预训练、后训练、分布式系统与推理优化等核心专题

具备相关背景的研发人员,亦可结合工程实际需求按模块选读。

关键链接

资源 链接
nanoGPT github.com/karpathy/nanoGPT
HuggingFace TRL github.com/huggingface/trl
vLLM github.com/vllm-project/vllm
Megatron-LM github.com/NVIDIA/Megatron-LM
Flash Attention github.com/Dao-AILab/flash-attention
LLM Evaluation github.com/EleutherAI/lm-evaluation-harness
Chatbot Arena 排行榜 huggingface.co/spaces/lmsys/chatbot-arena-leaderboard

作者

Ying Wang

引用

若本教程对你的研究或工程实践有所启发,欢迎援引:

@misc{wang2026llmtutorial,
  author = {Ying Wang},
  title  = {LLM 训练工程师完全指南 / The Complete LLM Training Engineer Guide},
  year   = {2026},
  url    = {https://github.com/yingwang/llm-tutorial}
}

许可证

本仓库采用双重许可

  • 正文与示意图(包括 Mermaid 流程图、解释性文字、章节内容):CC BY-NC-SA 4.0(署名 · 非商业 · 相同方式共享)
  • 代码片段(章节中的 Python/Bash 等示例):MIT(自由使用,含商业用途,仅需保留版权声明)

在学习或工程实践中复用本仓库的代码示例,不受非商业性条款限制。


最后更新: 2026-04-26