后训练范式与推理演进 (Post-Training & Reasoning Paradigm)

Source: 2026-09-21-xiaohongshu-xhslink-cn-o-9ATT3XnQUsf-9879f0b42d(来源未公开)

在大模型演进的第一幕中,行业竞争主要由预训练(Pre-training)与海量人类文本的 Scaling Laws 驱动。随着高质量公开互联网文本的消耗殆尽与模型边际知识密度的递减,大模型技术全面步入第二幕——后训练(Post-training)与推理时扩展(Test-time Compute)主导的全新范式。


1. 范式转移的根本驱动力

  1. 预训练的停滞与后训练的爆发:
    • 预训练赋予模型“通识世界模型(World Model)”与语言表征,但无法解决复杂因果推导、长链逻辑验证与精准工具调用的可靠性瓶颈。
    • 顶级团队将 80% 的算法与数据攻坚重心转移至监督微调(SFT)、强化学习(RL)以及过程奖励模型(PRM)。
  2. 合成数据与自博弈(Self-Play)闭环:
    • 不再依赖昂贵且质量参差的人工标注,转向由高阶模型生成推理链路(Chain-of-Thought)、配合形式化编译器/验证器(Evals)自我纠错并自动筛选高质量合成训练样本。
  3. 测试时扩展(Test-time Scaling)取代单步前向传播:
    • 在复杂决策与数学代码任务中,模型的智能上限不再单纯取决于参数量,而是取决于模型在推理阶段被允许消耗的“思考时间”与探索分支数量(如搜索树与回溯机制)。