AI科研的验证困境:为何RLVR可能难以突破大科学发现

本文探讨了强化学习验证(RLVR)在科学发现领域的应用局限。核心论点在于,科学理论的验证周期极长(可达数十年甚至数世纪),且更优理论在初期可能做出更差的预测,这使得为大概念性突破设计RL训练循环异常困难。文章通过哥白尼革命、海王星发现等历史案例,论证了科学进步中判断、启发式及“不合理坚持”的关键作用,并指出AI科学家社会仍需保留具有特异性偏见的个体实例来维持多样化的研究议程。

导语

在编程、数学等具有快速、明确验证闭环的领域,强化学习已展现出强大威力。然而,将同样的方法应用于科学发现,可能面临根本性挑战。科学进步的历史表明,理论验证的周期往往极其漫长,且一个“更好”的理论在提出之初,可能还不如现有理论的预测准确。本文以哥白尼日心说、海王星与祝融星的发现、以及化学元素原子量的争论为例,剖析了科学验证的复杂性,并探讨了这对AI驱动的科学研究意味着什么:大概念性突破难以被即时训练,而科学进步仍需依赖个体研究者带有偏见的长期坚持。

大纲与深读 6 章

展开「深读」看每一段讨论的问题与论据。

01

AI与科学验证循环

  • AI擅长编码、数学等具有紧密验证循环的领域
  • 科学理论验证循环可能长达数十年甚至数世纪
  • 更好的理论在短期内往往做出更差的预测
深读这一段

讨论的问题:AI能否在科学突破领域取得不成比例的成功?

论据 / 案例:哥白尼的圆形轨道模型比托勒密的地心模型预测更不准确

02

科学进步的识别困境

00:30
  • 古代雅典人因恒星视差问题否定阿里斯塔克斯的日心说
  • 首次成功测量恒星视差发生在1838年
  • 哥白尼理论在1543年时并非明显更优
深读这一段

讨论的问题:如何判断一个研究纲领是进步的还是退化的?

论据 / 案例:恒星视差从公元前2世纪到1838年才被观测到

03

理论验证的历史案例

01:00
  • 哥白尼理论预测了金星相位,后被伽利略观测证实
  • 第谷模型同样能解释逆行运动和金星相位
  • 海王星的发现(1846年)验证了牛顿力学的预测
深读这一段

讨论的问题:在朴素证伪主义框架下,科学共同体如何更快取得进展?

论据 / 案例:勒维耶预测未知扰动行星,海王星几乎在预测位置被发现

04

研究纲领的渐进性

01:30
  • 水星近日点进动异常引发寻找祝融星的猜想
  • 爱因斯坦广义相对论在1915年解决了水星轨道问题
  • 牛顿主义者会持续修补理论而非放弃
深读这一段

讨论的问题:如何区分进步性与退化的研究纲领?

论据 / 案例:水星每世纪多进动43角秒,牛顿力学无法解释

05

AI科学的根本挑战

02:00
  • 大型概念突破难以被快速验证
  • 科学进展需要具有特异性偏见和启发式的AI个体
  • 必须同时投资多个研究纲领
深读这一段

讨论的问题:AI如何训练实现科学领域的强化学习循环?

论据 / 案例:重大概念突破需要数十年或数世纪才能被认可

06

科学发现的同步性

02:30
  • 达尔文与华莱士几乎同时提出进化论
  • 莱尔的《地质学原理》为进化论提供了深时概念
  • 平行发现模式挑战了创新可提前发生的直觉
深读这一段

讨论的问题:为什么自然选择理论在19世纪中期才被明确提出?

论据 / 案例:《物种起源》发表于1859年,《原理》发表于1687年

金句

  • "The verification loop for theories can be on the order of decades and centuries, and even then we know today as the better theory can often actually make worse predictions." —— 理论的验证周期可能长达数十年甚至数世纪,而且即便如此,我们如今知道,一个更好的理论在初期常常做出更差的预测。
  • "In some sense, [Copernicus's theory] wasn't [better]! You couldn't have known ex ante that heliocentrism married with Kepler's 3 laws (1619) is a much cleaner and more accurate theory..." —— 在某种意义上,哥白尼的理论在1543年并不算更好!你无法先验地知道日心说与开普勒三大定律结合后是一个更简洁、更精确的理论……
  • "What I'm trying to say is that ex ante, one couldn't have known which research program would be more productive. We need to invest in all of them concurrently." —— 我想说的是,事前无法预知哪个研究方向会更富成效。我们需要同时对它们进行投资。
  • "Big conceptual breakthroughs cannot be easily verified. They are recognized decades or centuries later, when it turns out they were much more productive than the alternatives available." —— 重大的概念性突破无法被轻易验证。它们在数十年甚至数世纪后才被认可,因为事实证明它们比当时的其他替代方案更具生产力。
  • "What this means for AI for science is that 1. You can’t easily train an RL loop for big conceptual breakthroughs." —— 这对AI科学应用意味着:第一,你无法轻易为重大的概念性突破训练一个强化学习循环。

原文链接

查看完整访谈

完整内容见原文:Dwarkesh Podcast · AI科研的验证困境:为何RLVR可能难以突破大科学发现