AI 快讯 编译自 the_decoder #行业分析#强化学习#AI智能体

图灵奖得主Rich Sutton创立Oak Lab,打造自主持续学习的AI智能体

2024年图灵奖得主、强化学习之父Richard Sutton在多伦多创立Oak Lab,批评当前深度学习“弱且低效”,致力于构建能持续从环境中自主学习的AI智能体。本文解读其技术愿景及对中文圈的影响。

编译发布 2026/07/13 原文发布 2026/07/13

一句话看懂

图灵奖得主Rich Sutton创办Oak Lab,目标是让AI智能体像生物一样持续从环境学习,而非依赖海量数据和算力。

详细发生了什么

2024年图灵奖得主、现代强化学习奠基人Richard Sutton(Rich Sutton)在加拿大多伦多成立新公司Oak Lab。Sutton是强化学习领域最具影响力的研究者之一,他与Andrew Barto合著的《Reinforcement Learning: An Introduction》是该领域的经典教材。

Sutton在公开声明中直言不讳地批评当前主流的深度学习方法“weak and inefficient”(弱且低效)。他认为,当前AI系统过度依赖大规模数据集和算力堆叠,缺乏真正的自主性和适应性。Oak Lab的目标是开发一种新型AI智能体,能够像生物体一样,通过与环境的持续交互来学习,而不是在固定数据集上训练后部署。

Sutton强调,这种“持续学习”范式将更接近人类和动物的学习方式,有望在机器人、自动驾驶、游戏AI等需要实时适应新环境的领域取得突破。Oak Lab目前尚未公布具体产品路线图或融资信息,但已吸引多位强化学习领域的研究者加入。

中文圈视角

Sutton的Oak Lab对中文圈AI从业者意味着几个重要信号:

  1. 强化学习路线回归:过去几年,大语言模型(LLM)的爆发让注意力几乎全部集中在transformer和自监督学习上,强化学习在产业界的声量有所下降。Sutton的创业可能重新点燃业界对RL的关注,尤其是“持续学习”这一方向。国内如百度、腾讯、字节跳动等公司都有强化学习团队,但更多聚焦在游戏AI和推荐系统,对“环境交互式学习”的投入相对有限。

  2. 对国产大模型厂商的启示:当前国内大模型竞争集中在参数规模、上下文长度和benchmark分数上,Sutton的批评点出了另一种可能性——也许真正的智能不需要万亿参数,而是需要更好的学习算法。这对DeepSeek、Kimi、智谱等厂商而言,既是挑战也是差异化机会。

  3. 中文社区尚未讨论的盲点:Sutton提到的“持续学习”在中文AI社区讨论较少,多数研究仍停留在离线训练-部署模式。Oak Lab的成立可能推动国内研究者重新审视在线学习、终身学习等经典课题。

  4. 合规与数据隐私:持续学习意味着智能体需要不断与环境交互,这在涉及用户数据或物理世界时可能带来新的合规挑战。国内对数据出境的严格监管,可能影响此类技术在中国的落地路径。

几条值得记住的细节

  • Sutton在2024年获得图灵奖,与Andrew Barto共同因强化学习的贡献获奖。
  • Oak Lab总部设在多伦多,该城市是加拿大AI研究重镇,拥有Vector Institute等机构。
  • Sutton明确批评当前深度学习“弱且低效”,认为其依赖大量数据和算力而非真正的学习能力。
  • Oak Lab目前尚未公开任何产品、融资或合作伙伴信息。
  • 持续学习智能体的典型应用场景包括机器人、自动驾驶、游戏AI和个性化推荐。

一句话总结

Sutton的Oak Lab提醒我们:AI的下一个突破可能不是更大模型,而是更聪明的学习方式。