Token导航 LogoToken导航

强化学习之父Sutton:LLM从根本上无法做出科学发现,原因出在缺失了“这一步”

更新时间 2026-06-02来源 AI寒武纪正文 3459字阅读约 11分钟1 张图片
图片

强化学习之父,图灵奖获得者Richard Sutton老爷子最新观点,

一个可能引发争议的观点:

老爷子2026 年 5 月 12 日 为SAIR 人工智能科学研讨会录制了一个视频解释为什么通过监督学习训练的生成式AI从根本上无法做出真正的发现。

视频自行搜搜

Rich Sutton on "AI creativity & discovery"

以下是详细解释:

AI的创造力与发现

我想从一个老笑话讲起。想必各位都听过:一位研究人员的工作成果在评审时,收到这样的评语——"这项工作既新颖又优秀。可惜的是,好的部分不新颖,新颖的部分不好。"

关于AI,我的第一个观点是:这个评价精准地适用于我们今天所知的AI的大部分。不是全部AI,但大部分是这样。几乎所有的"生成式AI"——包括大语言模型、图像和视频模型,甚至最新的世界模型学习方法——都属于此列。这些AI都通过大量样本来学习,产出一个与样本行为相似的"模型",即像人一样生成文字,像艺术家或大自然一样生成图像,像我们在互联网上看到的那样生成视频。别误会,生成式AI可以非常有用,这一点毋庸置疑。但那个笑话中的评价依然成立:这些系统可以产出新颖的输出,也可以产出优质的输出,但无法同时做到两者。

在很多情况下,这根本不是问题。当我们让AI从互联网上找答案,或者总结一份文档时,我们要的并不是原创性。只要答案的质量、好用的程度,来源于原始素材——来源于写那份文件或网络文章的人——我们就很满意了。如果AI的回答是新颖的,意味着它已超出原始素材的范围,额外添加了某些东西。这就是我们所说的"幻觉"。在大多数情况下,我们不喜欢AI凭空编造、添加新东西。

当然有一个例外:那就是当我们寻找的不是事实或真相,而是虚构和娱乐的时候。我们可能会让AI给孩子编一个睡前故事,或者基于网上已有的图像创作一幅有别于它们的新图片。在这些情况下,我们其实很难判断AI到底发挥了多大的创造力,因为我们并不知道AI创作的故事、诗歌或图片与原始素材有多接近。从实际意义上讲,我们根本不可能知道这一点,因为互联网太大了,AI可能引用的素材来源实在太多了。

当我们要求虚构或创新时,AI之所以能给我们这些东西,是因为它的处理过程部分依赖于随机性。每一步决策都可以有多种走向,每次运行都会走向不同的方向,产生不同的轨迹。这条轨迹可以是随机的——因此是新颖的;也可以是基于训练数据的——因此是"好的",因为训练数据来源于真人或现实,是好的。也就是说,轨迹要么新颖,要么好——要么基于随机性,要么基于数据——但绝不会同时两者兼得。

说实话,我觉得生成式AI的输出无法同时做到新颖和优质,这其实没什么大不了的。对于笑话里的那位研究者而言,这评价是毁灭性的;但对于大多数事情来说不是,对于生成式AI来说也不是。生成式AI的本质就是模仿,这就是监督学习的目的所在。只要能模仿,而且比被模仿的对象更快、更便宜、更小巧、更可定制、更易复制,那么即便生成式AI无法同时做到新颖和优质,也仍然是一种变革性的技术。

但这确实是一个局限。别忘了,我们来这里是让AI服务于科学和数学的,而在这些领域,评审笑话中的那种评价是致命的。这些领域需要真正的创造力和发现。而生成式AI——或者叫"模仿式AI"——永远无法带我们到达那里。 为此,我们需要更多的东西。事实上,在AI的其他分支中,我们确实拥有更多的东西。我们有很多AI系统可以给我们更多:

  • • AlphaGo 及其改变世界的第37手棋
  • • AlphaZero 及其精彩绝伦的原创国际象棋风格
  • • GT-Sophy,它驾驶模拟赛车比任何人类都更出色
  • • AlphaFoldAlphaProof 和 Claude Code,它们在科学、数学和编程领域带来了真正的进步
  • • RL-Lyft,它能优化网约车业务中乘客与车辆的匹配

所有这些系统都找到了既新颖又好的东西。而且坦率地说,一些语言模型也通过增强手段,已经超越了单纯基于监督学习的生成式AI。

这些系统都有一些额外的特性,使它们能够实现真正的创造力和真正的发现。我们有必要认清这个关键因素是什么——以及它在普通的、日常的生成式AI中是不存在的。这个东西无法仅靠监督学习、仅靠在样本中学习而获得。它到底是什么?其实是一个简单的东西、一个常识性的东西。它并不新鲜。我们有很多名字来称呼它,但可惜都不是特别好的名字。我愿称之为 "发现"(Discovery)。大体而言,发现就是这样一个想法:尝试很多事情,看看哪些有效,然后保留效果最好的那些。自然选择的演化就是如此运作的。科学方法就是如此运作的。日常的生活与学习也是如此运作的。我们尝试各种事情,并记住有效的那些。还有什么比这更显而易见的呢?在行为层面,心理学对此有两个称呼——"工具性学习" 和 "操作性条件反射"——而在机器学习中,这就是我们所说的 "强化学习"。我们也可以在规划和组合搜索中看到发现的思想——任何涉及"生成与测试"理念的事情。


发现的本质在于结合三个步骤:

  1. 1. 变异(Variation)
  2. 2. 评估(Evaluation)
  3. 3. 选择性保留(Selective Retention)

当然,我并非第一个提出这一点的人。不是我第一个指出这三个步骤的组合对科学、对自然选择的演化、对动物行为来说至关重要。我尤其想提及 Donald Campbell、Daniel Dennett 和 Gary Cziko 的论文。我发言中的新颖之处在于,将"发现"的概念与现代AI直接关联起来,以帮助我们看清:它并不存在于监督学习或生成式AI之中——具体而言,发现并不存在于反向传播或梯度下降之中。

让我明确说出生成式AI缺失了什么。如前所述,这些系统确实有随机的成分,所以它们确实会生成多样的轨迹和行为。缺失的是"评估"这一步骤。 生成器是通过监督学习预先训练好的,因此在运行时无法对其生成的内容进行评估。当然,没有评估,就不可能有选择性保留,也就不可能有发现。变异可以带来新颖性,但没有评估就没有发现,从某种意义上说,也没有创造力。也就是说,我认为创造力要求对生成的新事物进行评估。没有评估,没有对最优结果的保留,就谈不上任何创造。新颖性在瞬间闪现,但如果其价值不被认可,它就会一闪而逝,就此消失。

在很多情况下,评估是由人来完成的,从而促成发现。比如我们让生成式AI为我们画很多图,然后从中挑出最喜欢的那张。人+AI 这个组合系统完成了发现过程。

在另外许多情况下,评估来源于一个明确的目标:

  • • 某些走法通向将军
  • • 某些步骤通向证明
  • • 某些行为带来高回报
  • • 某些基因型复制更多副本
  • • 某些理论能更好地解释数据

有些人更倾向于将"变异"这一步称为"盲变异"(Blind variation),这里的"盲"指的是它是无导向的,是黑暗中射出的箭。它不必完全无导向——优秀的科学家不会随机抽取理论来检验。但也不能是完全有导向和注定的。必须存在关于答案在哪里的某种不确定性,才能谈得上发现。在实践中,变异部分是受引导的,部分是盲目的,而正是盲目部分对应着真正的发现。

现在,让我们简单回溯到现代深度学习,到反向传播算法。乍看起来,反向传播似乎无法实现发现,因为它是确定性的,因此无法产生变异。但这并不正确。反向传播的权重更新虽然是确定性的,但权重在初始化时被赋予了小的随机值。这种随机初始化往往被低估,但实际上,它是一种必不可少的变异形式;必须正确执行才能获得良好性能。在反向传播中,这种变异只在网络初始化时进行一次,因此其效果是暂时的,之后网络可能逐渐丧失学习能力。这正是深度学习的弱点,而我的团队几年前在《自然》(Nature)杂志上提出的新算法缓解了这个问题。我们的"持续反向传播"(Continual backpropagation)做了一个小小的改变:每隔一段时间,一个较少被使用的神经元会被重新初始化为小的随机权重。这使得变异能够持续,可塑性得以保留。


总结

尽管关于创造力和发现还有更多可讨论的,但核心要点是:它们超越了监督学习,超越了模式识别,超越了预测,超越了世界建模。 那些东西很重要,但单独靠它们无法带我们走向发现。发现需要来自人或明确目标的评估,而只有在后一种情形下,我们才能真正实现完全自主。

这就是我的行动号召。 如果我们想要AI科学家发挥全部威力,就该与它们共享目标,让它们能够创造、评估、发现,以这些方式充分参与到实现目标的进程中来。

让我们大胆一些!让我们完全自动化创造力与发现!

--end--

最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)

文章标签大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多