Richard Sutton (理查德·萨顿)
Richard Sutton(理查德·萨顿)被公认为现代强化学习之父(Father of Reinforcement Learning),阿尔伯塔大学计算科学教授,DeepMind 杰出研究员,著有强化学习圣经《Reinforcement Learning: An Introduction》。
Source: 2026-08-25-xiaohongshu-xhslink-cn-o-4P21nENkCJg-05d1f292df.md(来源未公开)
核心哲学:试错学习高于有监督灌输
- 反思有监督学习局限:Sutton 指出,自然界中没有任何动物是通过“有监督学习(Supervised Learning)”掌握肌肉运动和生存技能的。自然界中没有现成的肌肉收缩标准答案;
- 试错与交互(Trial-and-Error):智能的真正起源在于个体与环境发生互动、接受稀疏反馈并自主优化策略。这也奠定了当前 o1、DeepSeek-R1 等前沿推理模型强化学习突破的理论基石(test-time-scaling)。