LLM Pretraining & Post-Training from Scratch (大语言模型端到端训练全流程)
现代大语言模型(如 GLM-5.3-Flash、Llama 系列)的工程实现分为明确的端到端技术链条:
Source: 2026-08-29-xiaohongshu-xhslink-cn-o-6DBidAEScCy-323306fb01.md(来源未公开)
1. 核心技术阶段
- 分词层(Byte-level Tokenization):构建无未知词(Unk-free)的高压缩率 BPE 词表;
- 模型架构(Transformer Backbone):RoPE 旋转位置编码、SwiGLU 激活、RMSNorm 与 FlashAttention 显存优化;
- 预训练(Pre-training):自回归 Next-Token 预测、学习率余弦衰减与分布式数据并行;
- 后训练与对齐(Post-training & Alignment):SFT 指令微调 + RLHF/DPO 偏好对齐(呼应 reinforcement-learning-first-principles)。