LLM Pretraining & Post-Training from Scratch (大语言模型端到端训练全流程)

现代大语言模型(如 GLM-5.3-Flash、Llama 系列)的工程实现分为明确的端到端技术链条:

Source: 2026-08-29-xiaohongshu-xhslink-cn-o-6DBidAEScCy-323306fb01.md(来源未公开)

1. 核心技术阶段

  1. 分词层(Byte-level Tokenization):构建无未知词(Unk-free)的高压缩率 BPE 词表;
  2. 模型架构(Transformer Backbone):RoPE 旋转位置编码、SwiGLU 激活、RMSNorm 与 FlashAttention 显存优化;
  3. 预训练(Pre-training):自回归 Next-Token 预测、学习率余弦衰减与分布式数据并行;
  4. 后训练与对齐(Post-training & Alignment):SFT 指令微调 + RLHF/DPO 偏好对齐(呼应 reinforcement-learning-first-principles)。