Andrej Karpathy 大模型训练流水线全景拆解
根据 Andrej-Karpathy 的第一性原理与经典架构科普(《State of GPT》与《Deep Dive into LLMs》),现代大语言模型(GPT-4、Claude 3.5、Llama 3)的完整工业化生命周期遵循清晰的三幕剧结构:知识获取(预训练) 行为塑造(SFT) 质量与审美对齐(RLHF)。
阶段零:前置分词处理 (Tokenization)
- 核心本质:Transformer 神经网络原生只接受离散的整数(Integers)序列。分词系统通过 BPE(Byte Pair Encoding,字节对编码) 算法无损地将原始文本映射为词表中的 Token 索引(词表规模通常在 50,000 ~ 100,000 个之间)。
- 局限与心智模型:
- 模型并非逐字阅读字母,而是以 Token 为单位进行原子化理解。导致了“数不清单词内字母(如 strawberry)”以及“特定数字组合被常用意象干扰(如 9.11 > 9.9)”等锯齿状智能(Jagged Intelligence)现象。
第一阶段:预训练 (Pre-training) —— 知识获取与世界模型压缩
耗费整个流水线 99% 的计算算力与时间(数千张 GPU 持续数月,耗资数千万美元)。
- 统一数学目标:自回归“预测下一个 Token”()。
- 有损压缩隐喻 (Lossy Compression):
- 预训练实质上是将互联网约 10TB 的海量无序文本(网页、百科、代码、学术论文、书籍),有损压缩进一个数十 GB 到数百 GB 的权重参数文件中(压缩比约为 100:1)。
- 模型并未死记硬背每个文字,而是提取并沉淀了人类语言与客观物理世界的“底层模式与神髓(Gestalt)”。
- 幻觉的生理学根源:
- 预训练只要求“续写在统计概率上最合理(Plausible)”,而非“说真话(Truthful)”。当模型记忆模糊时,为了维持概率分布顺畅,便会自然生成具有逻辑外壳的虚假信息(幻觉)。
- 产出物:Base Model(基座模型):
- 仅是一个强大的“互联网文档补全器”。若向其提问,它可能顺着上下文生成试卷题库或相关链接,尚未具备对话助理角色意识。
第二阶段:有监督微调 (Supervised Fine-Tuning, SFT) —— 行为塑造与梦境引导
耗费 < 1% 的计算开销(通常仅需单集群 1~2 天完成)。
- 核心机制与 3H 规范:
- 雇佣专业标注团队人工编写数万条(10,000 ~ 50,000 条)高质量对话样本(Prompt & Ideal Response),严格遵循 3H 准则(Helpful 有帮助的、Honest 诚实的、Harmless 无害的)。
- 引导梦境 (Directing the Dreams):
- SFT 未从底层改变大模型是个“概率做梦机器”的本质,而是将其发散的做梦模式约束并引导进“好帮手助手梦境(Helpful Assistant Mode)”。
- 当用户向模型提问时,模型在神经层面实质上是在快速模拟“一位顶级数据标注员耗费数小时推敲出的理想答复”。
- 产出物:SFT / Assistant Model(指令助手模型):
- 能够听懂人类指令,以标准结构分点清晰作答。
第三阶段:基于人类反馈的强化学习 (RLHF) —— 质量优化与审美对齐
突破人工手写示范的质量上限,利用“评价与生成的认知不对称性”进行高维对齐。
- 核心洞察:生成难,判别易 (Compare is Easy, Generate is Hard):
- 让人类标注员独立写出最高水准的诗歌或复杂解答难度极高(生成瓶颈);但让 SFT 模型并行生成 4 个版本,人类一眼就能准确排列出优劣顺序(判别极易)。
- 两步走工程链路:
- 步骤 A:训练奖励模型 (Reward Model, RM):利用人类的大规模成对排序数据(Comparisons, ),训练一个专门打分的评估神经网络,输出标量奖励值(Scalar Reward)。
- 步骤 B:PPO 策略强化 (Proximal Policy Optimization):将 SFT 模型作为 Policy,在冻结的 Reward Model 评价下进行自主生成演进,通过强化高分 Token 序列提升模型整体审美与安全性,并加入 KL 散度约束以防止模型通过作弊套话“钻空子”(Reward Hacking)。
- 副作用与代价:
- 熵的丧失 (Loss of Entropy):模型概率分布高度收敛于中庸稳妥的答案,在开放式发散命名、极端创意等任务上的灵动性有所降低。
核心阶段横向对比全景
| 阶段 | 核心任务 | 数据形态 | 算力成本 | 产出形态与角色 |
|---|---|---|---|---|
| Stage 1: 预训练 (Pre-training) | 学习世界常识,预测下一词 | ~10TB 全网原始语料 | 99%(数月/数千万美元) | Base Model:野生博学的文档续写器 |
| Stage 2: 有监督微调 (SFT) | 行为规范,注入助手角色 | 数万条人工精写问答对 | < 1%(1~2 天) | SFT Model:听懂指令的合格学徒 |
| Stage 3: 强化学习 (RLHF) | 基于人类偏好打分(RM+PPO) | 数十万条多版本排序对 | 中等(数天) | Aligned Model:具备优秀审美品味的成品模型 |
未来演进方向:从人类主观打分走向确定性强化学习 (True RL & System 2)
随着模型向深层推理演进,在数学证明、编程实现等拥有客观校验器(Compiler / TestCase)的领域,行业正从依赖人类主观打分的 RLHF 转向基于规则校验器的真正强化学习(True RL)与测试时推理规模化(Test-Time Scaling),实现类似 AlphaGo 自我博弈式的慢思考认知跃迁(详见 synthesis-ai-era-paradigm-shifts 与 synthesis-reinforcement-learning-in-llm)。