强化学习之父Richard Sutton:当前AI圈的做法“奇怪”,学习本应持续发生

2026/08/21 14:30阅读量 3

在红杉资本《Training Data》播客中,强化学习奠基人Richard Sutton批评当前AI主流范式——预训练后冻结模型——违背了学习的本质。他认为真正的智能必须从真实世界经验中持续学习,并反对将合成数据、仿真器视为Scaling的通用解。Sutton正与Khurram Javed通过Oak Lab推动持续深度学习算法。

事件概述

Richard Sutton与Khurram Javed近日在红杉资本《Training Data》播客中,围绕《苦涩的教训》、大语言模型、合成数据、持续学习等话题展开对话。Sutton提出,当前AI行业普遍采用的“预训练—后训练—部署后冻结权重”范式背离了学习的本质;学习应当是持续进行的,而非在训练完成后停止。他同时批评合成数据与仿真器路线,认为它们受限于人类专家认知,无法覆盖真实世界的无限复杂度。

核心观点

  • “持续学习”本就是学习本身:Sutton表示,在AI热潮之前,无需单独强调“持续学习”,因为所有的学习都必然是持续的。业界现在专门造出“持续学习”一词,反而说明思维变得古怪。

  • 合成数据与仿真器存在根本瓶颈:合成数据由人类决定生成内容,依赖人类专家判断哪些数据有效;仿真器也需要人工修补与现实世界的差距。Sutton与Javed认为,智能体应自主构建世界模型并从自身经验中学习,而非依赖人类在闭环中不断修正环境。

  • 大世界假说:真实世界的复杂度在量级上远超任何模型、数据集或仿真器。智能体注定只能获得局部视角,因此必须持续学习以调整局部近似,而不是拟合从未经历过的世界。

  • 持续反向传播:Sutton团队提出的持续反向传播算法为每个参数独立优化步长,并持续注入新神经元,使模型在线学习新知识时不破坏已有知识,缓解灾难性遗忘和可塑性下降。

  • 语言能力只占智能的一小部分:Sutton肯定大语言模型是“惊人的科学突破”,但认为语言仅占智能的20%–25%。真正的智能还需要物理世界交互、自主抽象、持续修正世界模型等能力,当前行业可能陷入局部最优。

对《苦涩的教训》的再解读

Sutton认为,大语言模型既是《苦涩的教训》的正面案例——证明了随算力扩展的通用学习方法能带来能力跃升;也是反面教材——其依赖互联网数据这一固定信息源,最终会被有限的人类知识所束缚。他同时澄清,先验知识与后天学习在原则上没有冲突,真正的智能形态是两者结合,但在科研实践中,偏执于人类先验的做法往往压制了学习。

Oak Lab的探索

Sutton与Javed共同创立Oak Lab,计划从零训练一套新架构,并行学习具体知识与“如何学习”的元能力。长期目标是在5–10年内以20瓦功耗运行万亿参数心智,实现自主抽象与规划推理。他们主张,智能的根本路径是让系统在真实世界经验中持续学习,而不是在训练阶段用有限数据一次性概括世界。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。