
8 月 18 日,红杉资本旗下播客《Training Data》发布了一期围绕 AI 持续学习的对谈,受访者为强化学习奠基人、2024 年图灵奖得主 Rich Sutton。此外,参与访谈的嘉宾还有 Sutton 的前学生、Oak Lab 联合创始人 Khurram Javed,对谈由红杉资本合伙人 Sonya Huang 和 Alfred Lin 主持。
访谈从 Sutton 2019 年发表的《苦涩的教训》谈起,延伸至合成数据、世界模型和持续学习,并讨论智能体如何从真实经验中形成抽象概念。Sutton 认为,部署后便停止改变的模型,还称不上完整的智能系统。大模型虽是重要突破,却主要解决了语言能力,只覆盖智能的一部分。
基于这一判断,Sutton 正将持续学习推进为一条完整的技术路线。就在上个月,他与 Khurram Javed 创立 AI 初创公司 Oak Lab,并提出以经验学习、时间抽象和规划为核心的 OaK 架构,希望智能体能从连续经历中实时学习,不断更新认知并改进决策。
" 止步不前 " 的智能
在今天,大模型看起来无所不知,却有一个容易被忽略的特点:它们的大部分能力都在上线前形成,经过预训练和后训练后,模型参数便基本固定。此后即使每天接触大量用户和新信息,也不会像人一样把这些经历转化为新的长期能力。

Sutton 认为,这种静态范式混淆了知识与学习的边界。尽管模型可以记住一段对话,也可以借助外部知识库回答最新问题,但这些都不等于真正的学习。
这是因为上下文只是暂时改变模型当前能够看到的信息,模型内部的知识结构并未随之更新。另外,当对话结束或窗口被清空后,这些信息也可能随之消失。
这一区别在产品端并不明显。一个 AI 助手可以根据用户反馈修改答案,甚至借助记忆功能表现得越来越了解用户,给人一种 " 它正在学习 " 的感觉。但如果模型权重没有变化,那么它只是利用当前提供的信息完成推理,并没有形成可以长期保留的新认识。
不过,让模型继续更新参数,也没有想象中简单。Khurram Javed 等人在《Nature》发表的研究显示,标准深度学习模型在接连学习新任务时,吸收新知识的能力会逐渐下降。研究人员将这种现象称为 " 可塑性损失 ",也就是模型训练得越久,反而越难学会新的东西。
为解决这一问题,现有训练方式往往会采用大量混合数据。Khurram Javed 解释,现有训练通常借助大批量数据,减弱单个样本对原有能力的冲击。但随着真实经验不断增多,而智能体需要保存并反复训练全部历史数据,计算和存储成本将答复增加。
合成数据因此被不少研究者视为一种解决方案。既然高质量的人类数据有限,就让模型自动生成题目、回答或模拟环境,再用这些内容训练下一代模型。
不过,Sutton 在访谈中将这种路径称为一个 " 巨大的错误 "。在他看来,它扩大了数据规模,却没有改变 AI 依赖外部数据生产者的基本方式。
Sutton 指出,任何模拟环境都只能保留现实的一部分,许多因素很难被完整写入模拟器。合成的世界可以很大,但它仍然由有限规则构成,与现实的复杂程度存在差距。
在访谈中,Sutton 又以自动驾驶为例。企业可以让车辆在模拟环境中行驶数十亿公里,再由工程师根据真实路测调整系统。他认为,更合理的路径应当是让车辆直接从驾驶经验中发现预测偏差、修正环境模型,并将新的认识用于下一次决策。
这也是 Sutton 重提 " 苦涩的教训 " 的原因。他认为,能够利用更多计算资源、从数据中自主发现规律的通用方法,最终将胜过植入大量专家知识的系统。例如,AlphaGo Zero 未使用人类棋谱训练,仅凭自我对弈便击败此前的 AlphaGo。
大语言模型在一定程度上延续了这条路线。尽管它没有依靠专家逐条编写规则,而是从大规模文本和计算中学习语言结构。但 Sutton 认为,互联网文本终究是由人类整理出来的有限知识,如果模型始终依赖更多文本和人工反馈,它的进步仍会受到人类数据供给能力的限制。
不过,Sutton 也明确表示,他并不主张抛弃已有知识。而问题在于,当前模型常常把这些知识固定在部署前的参数中,此后只负责调用,很少用新的经历检验和修正它们。
他预测,当前大模型可能只覆盖了智能的四分之一,剩余部分还包括感知、行动、规划,以及在长期经验中持续改变自身的能力。缺少这些环节,模型即使再博学,也只能停留在上线时的状态。
Oak Lab 要实现持续学习
Sutton 团队认为,实现真正的持续学习,核心在于解决深度学习中的灾难性遗忘问题。朴素的单样本权重更新会快速覆盖原有知识,让模型失去之前积累的能力,这也是过去持续学习难以落地的核心障碍。
为解决这一问题,他们提出两个关键的技术方向:第一个方向是 " 步长优化 ",通过为不同参数设置不同的更新速度,已经承载稳定知识的参数变化较慢,需要学习新内容的部分则可以更快调整。第二个是 " 生成与检验 ",即不断提出新的内部特征或神经单元,再检验它们是否有助于模型学习。
基于上述思路,团队提出 " 持续反向传播 " 算法,相关成果此前已于《Nature》发表。这种算法在标准反向传播的基础上,持续加入少量随机初始化的新单元,再由反向传播检验其价值。Sutton 认为,如果将这一机制与步长优化结合,有望形成新一代持续深度学习算法。
不过,这类算法不能直接套用在已经训练好的静态模型上,而要用它们从头训练新的基础模型。模型在积累知识的同时,也会学习今后应当如何更新自身,从而有望在吸收新知识时减少对原有能力的破坏。
持续深度学习只是第一步,更长远的目标是让模型自主构建抽象与世界模型。Sutton 认为,当前的 AI 系统要么使用人类预设的规则模型,要么只能做低层级的时序预测,目前还无法自主生成高层抽象并基于抽象进行规划推理。
Sutton 团队最大的野心,是构建覆盖从微观细节到宏观决策的全谱系知识系统。真正的心智应该可以持续更新,同时始终保持内在的自洽与连贯,不会因为持续学习陷入混乱。

这也正是 Oak Lab 的核心使命。这家成立于 2026 年 7 月的初创公司,目标是在五到十年内打造出万亿参数规模、运行功耗仅 20 瓦的持续学习心智模型。
20 瓦大致和人类大脑的功耗水平相当,这意味着智能的提升不再单纯依赖算力堆砌,而是通过算法效率的飞跃实现。
针对这一目标,Sutton 按照摩尔定律作出估算:如果计算效率每 18 个月提高一倍,10 年大约可以带来两个数量级的提升。这意味着,假如现在能以约 2,000 瓦实现相应规模,未来将可能将功耗降至 20 瓦。
不过,最终形态不会是一个无所不能的单一心智。由于没有任何单个系统可以学完所有知识,同一种基础架构会衍生出大量不同的实例。按照两人的设想,同一种基础架构会产生多个智能体,它们因所处环境和自身经历不同,形成各自的知识与能力。
谈到公司的未来,Khurram Javed 表示,Oak Lab 初期不会追求快速扩张。新范式需要团队成员对研究方向形成高度共识,因此公司将从小规模团队起步,再逐步扩充至数个核心小组,以保持研究效率和方向一致。
参考资料:
1.https://www.youtube.com/watch?v=xH7U7w9Qzlo
2.https://oaklab.ai/mission
运营 / 排版:何晨龙
注:封面 / 首图由 AI 辅助生成