LLM Training Pipeline

所有前沿大模型(GPT、Claude、Gemini)都经历由 Andrej-Karpathy 所概括的相同形状的训练旅程:知识获取(预训练)→ 行为塑造(SFT)→ 质量优化(RL)。这是实现 artificial-general-intelligence 道路上的核心技术演进。公司在规模、数据和工程细节上有差异,但结构是一样的。

Source: 2026-07-07-youtube-youtu-be-7xTGNNLPyMI-si-ZPGPZ7stiJFSTiNJ(来源未公开)

Andrej Karpathy,“Deep Dive into LLMs like ChatGPT”(2025-02-05,3.5小时)


0. 在”训练”之前:Tokenization

Source: 2026-07-09-xiaohongshu-xhslink-com-o-7x90p4girur(来源未公开)

Andrej Karpathy,微软 Build 2023 大会演讲《State of GPT》

文本不是直接输入模型的。 它是通过分词(Tokenization)处理,无损地(lossless)将原始文本 scrape/翻译为一系列整数(Integers)序列,因为这是 Transformer 神经网络原生能够处理的表示形式。

算法与词表限制:Byte Pair Encoding (BPE)

  1. 基础原理:从原始字节出发(256个基础符号),迭代地合并最高频的连续字节对,逐步群组铸造成新的 token 符号。
  2. 词表与上下文限制:
    • 词表大小(Vocabulary Size)通常是几万个 token。例如 GPT-3 采用了 50,257 大小的词表,Llama 系列也是在几万个 token 的级别,GPT-4 则扩展到了约 100,000 个 token。
    • 上下文长度(Context Length)限制了模型单次能处理的最大整数序列长度。在 GPT-3 时代通常是 2,048,而在现代模型中扩展到数万甚至数十万级别。

为什么这个很重要(直接后果):

  1. 模型数字母会出错:问 “strawberry 有几个 R?” —— “strawberry” 被 tokenize 成一到两个 token,模型看到的是不透明的原子整数,而不是单个字符。它必须在内部进行复杂的“解包”才能数出字母,这并不是下一个 token 预测任务的直接训练目标。
  2. 数字比较有陷阱:例如 9.11 > 9.9 比较出错,其神经元激活容易被类似圣经章节(Bible 9:11)的模式干扰,因为在海量预训练网页数据中,“9:11” 通常作为一个整体 token 频频出现在圣经或特定历史事件语境中。这是token-efficiency和“锯齿状智能”(Jagged Intelligence)的根源。

工具:Tiktokenizer — 可视化任意文本的 tokenization 结果


Stage 1:预训练(Pretraining)— 知识获取

Source: 2026-07-09-xiaohongshu-xhslink-com-o-7x90p4girur(来源未公开) · 2026-07-09-youtube-youtu-be-zjkBMFhNj_g-si-HS85kcLlHQ9XCq__(来源未公开)

Andrej Karpathy,微软 Build 2023 《State of GPT》 与 2023 科普视频《Intro to Large Language Models》

目标:预测下一个 token。预训练耗费了整个流水线 99% 的计算时间与 FLOPs(数千张 GPU 运行数月,花费数百万美元)。

  • 有损压缩(Lossy Compression):预训练本质上是对大量互联网文本(~10TB)进行有损压缩的过程(压缩率约为 100x,如 140GB 的权重参数文件)。模型无法完美记住原始文件的每个字符(Lossless),而是记住数据的“神髓/完形 (Gestalt)”。
  • 基础开销(典型数据):以 Llama 2 70B 为例,需要约 6000 张 GPU 运行 12 天,耗资约 200 万美元(2023年数据,当前最前沿模型已增加十倍以上)。
    数据:互联网的大部分网页 + 书籍 + 学术论文 + 代码仓库。

数据混合配比(Data Mixture)
预训练数据集是将不同来源的语料按指定比例混合采样的结果。以 Meta 训练 Llama 模型为例,其混合配比包含:

  • Common Crawl / C4:互联网网页抓取,提供最广泛的基础语言知识(数量庞大但质量参差不齐)。
  • Github:公开代码仓库(有利于模型逻辑与代码能力的发展)。
  • Wikipedia:高质量百科全书。
  • Books / ArXiv:专业书籍和学术论文,提供深度知识。
  • StackExchange:高质量的技术问答社区。

这些数据混合在一起,按照特定的重要性配比进行重新采样,喂给神经网络。

参数量(Parameters)与 Token 量的权衡:GPT-3 vs. Llama
在评估大模型的能力时,不能仅看参数大小,训练所消耗的 Token 数量同样甚至更加关键:

  • GPT-3:拥有 175B (1750亿) 参数,但在仅有 300B (3000亿) tokens 的数据上进行了训练。
  • Llama-65B:参数量仅为 65B (650亿),但在长达 1.4T (1.4万亿) tokens 的数据上进行了训练(训练时间更长、更充分)。
  • 结论:Llama-65B 表现出显著强于 GPT-3 (175B) 的性能。因为在较小参数的模型上用更多的数据进行过度训练(Over-training),不仅能让基座模型学习得更扎实,还能大幅降低推理(Inference)时的计算与部署成本。

Transformer 批处理输入矩阵排列方式 (Data Batch Layout)
在多 GPU 超级计算机并行处理中,输入序列被排列成一个 的二维矩阵:

  • (Batch Size / 批大小):堆叠在矩阵中的独立行数,每行代表一个独立的并行训练样本。
  • (Maximum Context Length / 最大上下文长度):例如 2,048 或 4,096。
  • 文档拼接方式:将海量的长短文档首尾相接拼接并“塞”入行中,每当上一篇文档结束、下一篇文档开始时,使用特殊的结束符 <|endoftext|>(如 50256 等特殊 token ID)进行分隔,让 Transformer 知道新文档的边界。
  • 并行计算与监督:在矩阵的每一个 Cell(单元格)处,Transformer 接收该位置左侧的所有 Yellow tokens(上下文),并行预测下一个 Red token 的概率分布。如果词表大小为 (例如 50,257),输出层就会给出 维的概率分布,与 Ground Truth(右侧的下一个真实 token)计算交叉熵损失并反向传播更新数十亿参数。

结果:Base Model(基座模型)。它是“互联网文档补全器”,不是助手。

  • 你问它一个问题,它可能只是回复你更多的问题,或者顺着你的语气继续补全网页文档(例如输入 写一首关于奶酪的诗,它可能只是输出另一个标题或完成一段食谱介绍)。
  • 它是我们能拿来“Prompt(提示词工程)”或进一步“Fine-tune(微调)”的基座。

为什么模型会幻觉:模型被训练为”续写得最合理”,而不是”说真话”。当真实答案不在它的训练参数记忆中时,它会为了延续概率分布而生成”听起来合理”的编造内容——这就是幻觉。真实性需要靠后续的对齐阶段来修正。

可视化工具:

推理工具(体验 Base Model):

  • Hyperbolic — 可以直接玩 Base Model(未经 SFT),看到”原始的文档补全机器”
  • Llama 3 论文(Meta) — 最详细的公开预训练技术文档

推理(Inference):Stochastic Token Autocomplete

每次生成 = 投偏置硬币。

  1. 输入前缀 → 得到下一个 token 的概率分布
  2. 按概率采样(随机)→ 得到 token
  3. 追加到序列 → 重复

关键约束:每个 token 的生成 = 一次前向传播 = 固定数量的计算。模型无法在单个 token 中”在脑子里”完成复杂推理,就像你无法在一步之内解出一道复杂方程。

这直接导致了”模型需要 Token 来思考”原则(见下文)。


Stage 2:有监督微调(SFT)— 行为塑造

目标:给 Base Model 一份”工作描述”,将其转变为一个能够听懂指令、进行对话的 AI 助手(Assistant Model)。

OpenAI 的 InstructGPT 方法:

Source: 2026-07-09-xiaohongshu-xhslink-com-o-7x90p4girur(来源未公开) · 2026-07-09-youtube-youtu-be-zjkBMFhNj_g-si-HS85kcLlHQ9XCq__(来源未公开)

Andrej Karpathy,微软 Build 2023 《State of GPT》 与 2023 《Intro to Large Language Models》

核心心智模型:

  • 引导梦境 (Directing the Dreams):微调阶段并没有从底层改变大模型本质上是个“做梦机器 (Dreaming Machine)”的底色(微调无法根除幻觉)。它的作用是将这种随意的网页续写梦境,约束和引导进“好帮手的梦境模式(Helpful Assistant Dreams)”。
  • 低运算开销与快速迭代:相较于需要数月、数百万美元的预训练,SFT 微调通常只需 1 天完成,且成本极低。公司通过在部署后收集模型的错误表现(misbehaviors),由标注员写出正确答案重新加入微调集,从而快速、日常化地迭代和优化 Assistant Model。

核心机制与标注规则:

  1. 数据收集(Prompt & Ideal Response):人工数据标注员(Human Contractors)根据用户的 Prompt,手工写出最理想的助手回复。
  2. contractor 标注指南:承包商在撰写回复时,需要遵循长篇且极其详尽的标注指南(Labeling Documentations)。
  3. 3H 限制规范:标注规范的核心准则是要求回复必须是:
    • Helpful (有帮助的):切合用户意图,提供有用、清晰、结构良好的解答。
    • Truthful (真实的):坦诚自知之明,在不知道或数据不确定时如实说明,不编造事实。
    • Harmless (无害的):排除偏见、刻板印象、暴力、违法等任何具有恶意或危险的生成倾向。
  4. 算法基础:算法层面没有改变,依然是进行语言模型微调(Language Modeling on instruction data)。只是把数据源从混乱的“互联网网页文档”换成了“高质量的人工对话”。

数据量级:

  • SFT 阶段是典型的 “低数量、高品质” 训练。
  • 其数据量仅在 数万条级别(Tens of Thousands,如 10,000 ~ 50,000),与预训练的万亿级 tokens 相比,数据量小了几个数量级,但人工筛选和撰写的成本极高。

Karpathy 的心智模型:

当 ChatGPT 回答你时,你得到的是一个”OpenAI 数据标注员花了两小时写出理想回复”的神经网络模拟——只是你不需要等两小时。

参考论文:InstructGPT paper


Stage 3:奖励模型(Reward Modeling)— 模拟人类偏好

Source: 2026-07-09-xiaohongshu-xhslink-com-o-7x90p4girur(来源未公开)

Andrej Karpathy,微软 Build 2023 大会演讲《State of GPT》

SFT 模型虽然已经是合格的对话助手,但通过人工生成的高质量示例是有限的。为了让模型能进一步优化,我们需要利用人类的偏好判断来训练一个“打分模型”——奖励模型(Reward Model, RM)。

核心机制:

  1. 数据收集(成对比较 Comparisons):
    • 针对同一个 Prompt,使用已有的 SFT 模型生成多个不同的 Completion(例如生成 3 到 4 个不同版本的回答)。
    • 让标注员(Contractors)对这些生成结果从优到劣进行排序(如 )。
  2. 排序与成对二分类损失(Binary Classification on Pairs):
    • 将 Prompt 与某一个 Completion 进行行拼接,并在句尾附加一个特殊的 Reward Readout Token(奖励读取 Token)。
    • 在训练奖励网络时,仅在此最后的绿色 Reward Token 位置上进行监督,输出一个实数标量(Scalar Reward Value)代表这个 Completion 的得分。
    • 对标注员排序的结果进行成对拆分(Pairs)。利用成对二分类损失(Binary Classification Loss on all possible pairs),拉大好坏回答之间的分值差距:促使模型在好回答上的 Reward 预测值显著高于差回答。

Stage 4:基于 PPO 的强化学习(RLHF / Alignment)

Source: 2026-07-09-xiaohongshu-xhslink-com-o-7x90p4girur(来源未公开)

Andrej Karpathy,微软 Build 2023 大会演讲《State of GPT》

通过奖励模型,模型有了评价“好坏”的自动化标准。下一步便是利用强化学习来根据这个标准优化模型。

基于固定 Reward Model 对 Policy 强化的机制:

  1. 固定奖励模型:在此阶段,上一步训练好的 Reward Model 被保持冻结(Freeze / Fixed),不再进行梯度更新。
  2. Policy 模型采样生成:准备大量的 Prompts,使用需要优化的 Policy 模型(初始化自 SFT 模型)进行采样,生成回答(Yellow tokens)。
  3. 加权 Language Modeling 损失:
    • 将 Policy 生成的完整序列输入固定的 Reward Model,读出其最终的标量 Reward(例如好回答得分为 ,坏回答为 )。
    • 在优化 Policy 时,其优化的底层仍然是语言建模目标(Language Modeling Objective),但使用了 Reward Model 给出的分数作为权重来加权。
    • 如果某个生成的路径获得了高分,其采样的 token 就会受到正向强化,模型在未来生成类似 token 组合的概率增大;如果得分极低,则负向更新,降低该采样路径的生成概率。
  4. PPO 训练机制(Proximal Policy Optimization):
    • 利用 PPO 算法更新 Policy 模型的参数,使其生成的 Completion 能在冻结的 Reward Model 下拿到最高得分。
    • 为了防止模型在优化过程中偏离太远而产生 Reward Hacking(例如找到奖励模型的漏洞,输出完全无意义但得分极高的垃圾文本),通常会在优化目标中加入与原始 SFT 模型的 KL 散度惩罚(KL Divergence Penalty)。

RLHF 为什么效果更好:Compare vs. Generate 的非对称性

Source: 2026-07-09-xiaohongshu-xhslink-com-o-7x90p4girur(来源未公开)

Andrej Karpathy,微软 Build 2023 大会演讲《State of GPT》

为什么不能仅靠 SFT 达到极致,而必须要引入复杂的 RLHF 阶段?这源于人类判断力与生成力在计算成本上的非对称性(Asymmetry):

  • 生成难(Generate is hard):
    如果要求一个普通的 contractor 标注员去为 Prompt 写一首关于回形针的高水准三行俳句诗 写出一个完美的、艺术度极高的高分回答,这极其考验标注员本身的创作素养。许多标注员自己根本不擅长写诗,因此在 SFT 阶段提供的高质量监督数据是有瓶颈的。
  • 判别易(Compare is easy):
    但如果让已经具备一定基础的 SFT 模型一口气生成 4 首不同的俳句诗,即使标注员自己一首也写不出来,他依然能够很容易地判断并指出“第二首写得最好,第四首最糟糕”。
  • 结论:
    借助这种“评估比生成容易”的认知非对称性,通过大量的“人类成对排序”数据去训练一个高水平的 Reward Model,然后使用强化学习驱动 Policy 逼近该审美评估器。这使得模型能超越单个标注员的输出上限,生成更受人类偏爱、质量更高的回答。

RLHF 的局限性与副作用

Source: 2026-07-09-xiaohongshu-xhslink-com-o-7x90p4girur(来源未公开)

Andrej Karpathy,微软 Build 2023 大会演讲《State of GPT》

尽管 RLHF 在对齐和助手表现上极其优异,但也伴随着不容忽视的局限性:

  1. 熵的丧失与输出收敛(Loss of Entropy & Peak Output):
    • RLHF 的优化过程非常强烈地将概率分布推向能拿到高奖励的分支。这会导致模型的熵(Entropy)显著降低,模型输出分布变窄、变 Peak。
    • 模型会倾向于频繁采用那些最为稳妥、中庸、安全且符合特定模式的回复模板,失去了生成的多样性(Variation)。
  2. 创意与多样性任务退化:
    • 在需要高度多样性、新颖性和创意的任务中,经过 RL 对齐的 Assistant 模型反而不如原始的 Base Model 表现好。
    • 典型示例:取未注册的宝可梦名字(Fictitious Pokemon Names):
      如果我们在 Prompt 中给出 7 个真实的宝可梦名字作为 few-shot,让 Base Model 继续往下补全,由于其保留了极高的熵,Base model 会生成一长串完全虚构的、极富创意的、未注册的新宝可梦名称。而经过了 RLHF 的 Assistant Model 可能会由于概率分布过度收敛,倾向于给出极度套路、重复的甚至是已有的宝可梦名字,缺乏灵动与创意。

RL 训练即”管理团队”:奖励设计的黑客风险类比

一位 AI 新贵公司(对比 Kimi 等)内部人士将大模型的强化学习训练过程类比为管理一个团队,用以说明为何头部 AI 公司更倾向 RL 式训练思路而非纯 SFT(有监督微调)式的手把手教学:

  • SFT ≈ 微观管理,RL ≈ 自上而下授权:SFT 相当于直接告诉团队成员”这件事应该这样这样做”,是一种手把手示范式管理;RL 则更像给团队设定一个自上而下的目标与奖励函数,让其自主探索路径去争取奖励,而不干预具体执行细节。
  • 奖励函数设计需要极深的领域理解:奖励定义得好不好,高度依赖设计者对具体业务/研究细节运作机制的理解深度。定义不当,模型(或团队)就会出现 reward hacking(奖励黑客/reward hack)——表面上所有指标都很好看,实际上完全没有达成设计者真正想要的目标。
  • 过度依赖 KPI 式奖励的最大风险,是”看起来都好”的假象:应对办法是建立更多的观测指标,而不是把管理简化为单一奖励信号;同时应尽量避免用纯 SFT 式的手把手管理,因为这类”手把手”式管理最大的代价是扼杀创造力——团队/模型会习惯照抄既定套路,失去自主探索与创新的能力。
  • 两者需要动态平衡(Balance):目前没有”已经调到完美”的答案,头部从业者也仍在持续摸索 SFT 与 RL、精细控制与自主授权之间的最优配比,这与 llm-training-pipeline 上文所述”RLHF 熵丧失导致创意退化”的副作用是同一现象的两种不同视角——过度收敛(无论来自 SFT 式示范还是奖励函数设计不当)都会牺牲模型/团队的探索空间。

Source: 2026-07-19-xiaohongshu-xhslink-com-o-3Itl0r8NfBV(来源未公开)


关键心智模型

1. 模型需要 Token 来思考

每个 token = 一次前向传播 = 固定计算量。

复杂任务需要分布到多个 token 上完成。实践规则:

  • 让模型展示中间步骤(Chain of Thought),而不是直接给出答案
  • 对于精确计算(数学、数数、逻辑),指示模型”用代码”——代码执行器接管精确计算
  • 如果你让模型在一个 token 里给出答案,你只得到了一次前向传播的计算量

2. 锯齿状智能(Jagged Intelligence)

LLM 的能力不均匀——像”瑞士奶酪”,孔的位置不可预测:

  • 能解奥林匹克数学 → 可能搞错”9.11 > 9.9”
  • 能写复杂代码 → 可能数不清”strawberry”里有几个 R
  • 能进行哲学推理 → 可能在某个看似简单的逻辑题上失败

实践含义:永远不要假设”模型在 X 上很强,所以 Y 也没问题”。对关键任务要测试边界情况。

3. 模型没有持续的自我

每次对话都是全新启动。上下文窗口填满后被删除,没有记忆延续。问模型”你叫什么”——它的回答是统计预测,不是内省。

早期没有明确身份训练的模型(如 Falcon)会声称自己是 GPT-3,因为训练数据里”有用的 AI 助手”模式与 OpenAI 的文本高度相关。

4. 幻觉、工具调用与工作记忆

模型的”工作内存”=上下文窗口。没有外部存储,没有数据库查询能力(除非通过工具)。

工具调用的本质:模型生成特殊 token(如 <search_start>query<search_end>),触发外部工具(搜索引擎、代码执行器、计算器),结果被注入回上下文窗口。这不是模型”知道”答案,而是它在”翻参考书”。


DeepSeek-R1:RL 解锁了什么

SFT 模型 vs. RL/推理模型的本质区别:

  • SFT:模仿专家的解答路径
  • RL:通过试错自己发现解题策略

RL 产生了可见的”思考轨迹”:模型展示推理过程、中途自我检查(“wait, let me verify…”)、探索多种方法、再收敛到答案。

DeepSeek-R1 的重要性:MIT 开源,权重可下载,性能与顶级闭源模型竞争。

GPT-o1/o3 是 OpenAI 同类方法的产品(公开表述中采用相似的 RL 训练技术)。


工具全景:Karpathy 推荐的资源

工具用途链接
Tiktokenizer可视化 tokenizationtiktokenizer.vercel.app
bbycroft LLM VisualizerTransformer 3D 可视化bbycroft.net/llm
FineWeb预训练数据集示例HuggingFace FineWeb
Hyperbolic体验原始 Base Modelapp.hyperbolic.xyz
HuggingFace Playground开放模型实验huggingface.co/spaces/huggingface/inference-playground
TogetherAI Playground开放模型 API 实验api.together.xyz/playground
LM Arena模型排行榜(人类盲测偏好)lmarena.ai
LM Studio本地运行开源模型lmstudio.ai
AI News Newsletter追踪 LLM 最新进展buttondown.com/ainews
ChatGPT最广泛使用的前端chatgpt.com

Karpathy 对 LM Arena 的注意事项(录制时):近期被”刷榜”,他比之前更不信任它。排名仅供参考,不是绝对基准。


一句话总结

当你向 ChatGPT 发送一条消息时:文本 → tokenize → 模型以一次一个 token 的方式续写 → 每个 token 是偏置硬币的一次投掷。你在与一个”OpenAI 数据标注员的神经网络模拟”对话,它有瑞士奶酪式的能力,没有持续的自我,没有真正的记忆,且在缺乏知识时会补全一个”听起来合理”的答案。