Test-Time Scaling (测试时与推理时规模化)

在模型预测(推理/测试)阶段,通过生成和消耗更多的 Token(思考或交互过程)来提升模型端到端解决复杂任务能力的算力规模化范式。

核心内涵

传统的 LLM 对话模式(Chat)是单次输入输出,推理计算量极低。测试时规模化(Test-Time Scaling)允许模型在后台自主生成大量的中间 Token(思考过程或工具交互日志),耗时可以从几秒拉长到几个小时甚至数天,从而能够端到端地解决极其庞大且复杂的任务(如重构整个代码库并跑通所有测试,或攻克高难度开放式数学猜想)。

Source: 2026-06-22-youtube-youtu-be-91fmhAnECVc-si-YJi23juyT-M2MZqu(来源未公开)

两大演进范式

根据与外部环境的交互关系,测试时规模化可分为以下两类主流技术路径:

  1. “缸中之脑”推理范式 (Reasoning / System 2 Thinking):
    • 典型代表:OpenAI o1 / o3。
    • 运作机制:模型与外界没有物理和网络交互,所有的思考都在自身黑盒内部进行。它在做题或回答时,自主提出猜想、隐式进行自我验证(反思)、推翻错误猜想,不断串行迭代,最终输出结果。
  2. “交互式 Agent”强化学习范式 (Agentic Interaction):
    • 典型代表:Kimi K2、Claude Computer Use、OpenAI Operator。
    • 运作机制:模型不局限于内部脑暴,而是与外界数字环境做实时、多轮的交互。例如它会克隆代码库,写几行代码,调用编译器和测试套件,查看报错(状态反馈),调用搜索引擎,修改代码,重新测试,直到成功。

在深水区科学与数学发现中的实证表现

Source: 2026-09-18-bilibili-b23-tv-qS8bNoW-8b50502ccb.md(来源未公开)

  • 解决率与思考算力成正比:OpenAI 理论团队实证,在反驳“单位距离猜想(Unit Distance Conjecture)”等前沿数学难题时,随着注入测试时算力预算(Test-Time Compute Budget)的倍增,模型求解成功率可跃升至约 50%。
  • 良性自举循环:当前代模型借助长测试算力攻克难题并记录高质量验证轨迹,这些轨迹又反哺成为下一代模型的高效训练数据,从而在更短思考周期内达成更高推理泛化。