AI训练依赖海量数据,样本效率远逊人类

本文指出,当前AI模型的性能提升主要依赖海量数据和算力投入,而非样本效率的根本性突破。通过对比人类与AI在数据需求上的巨大差距,文章探讨了这种低效率对AI自动化白领工作和自我研究能力的影响,并质疑当前Scaling Law路径能否弥补这一差距。

导语

在人工智能的炫目能力背后,隐藏着一个关于“样本效率”的深刻问题。尽管AI模型日益强大,但其进步的核心驱动力似乎并非学习效率的提升,而是数据与算力规模的急剧扩张。Dwarkesh Patel在本文中剖析了这一现象:人类仅需少量数据和经验即可掌握复杂技能,而AI则需要吸收相当于人类一生数百万倍的数据量。这种巨大的效率差距意味着什么?它如何影响AI替代白领工作与实现自我进化的前景?文章通过对标人类学习过程与当前Scaling Law的局限,提出了一个冷静的观察视角。

大纲与深读 8 章

展开「深读」看每一段讨论的问题与论据。

01

数据驱动的AI进步

  • AI进步的主要驱动力是增加更多、更好的数据,而非样本效率的显著提升。
  • 强化学习被视为一种合成数据生成方式,通过计算寻找‘正确’数据。
  • 人类专家轨迹数据对于模型学习至关重要,且高度特定于任务。
深读这一段

讨论的问题:AI能力提升的主要方式是什么?

论据 / 案例:RL被视为合成数据生成;专家数据来自Mercor或Surge等平台,涉及Word文档专家、法律专家等特定角色;数据产业年收入达数十亿美元。

02

专家数据的规模与成本

01:00
  • 每项技能都需要数百名人类专家生成示例、评分标准和思维链。
  • 数据行业因生产专家标签和RL环境而获得巨大收入,即将达到百亿美元级。
  • 模型训练的任务量远超人类,例如每个任务需要成百上千次 rollout。
深读这一段

讨论的问题:为什么专家数据如此必要且昂贵?

论据 / 案例:GRPO模型每个任务生成数百到数千次rollout;数据产业收入达数十亿美元,即将达数百亿美元。

03

开源模型快速追赶

02:00
  • 开源模型仅落后前沿闭源模型约4个月。
  • 数据是进步的真正驱动力,且容易从公共API中提取。
  • 超参数和训练技巧等不易提取,若它们驱动进步,追赶会更难。
深读这一段

讨论的问题:为什么开源模型能快速追赶前沿模型?

论据 / 案例:Epoch报告开源模型落后闭源模型仅4个月;数据可从公共API提取,而超参数和架构优化不能。

04

人类与AI的样本效率对比

03:00
  • 人类从出生到成年平均接触约2亿个语言token,而前沿模型训练数据达数十万亿token,相差近百万倍。
  • 人类学习驾驶仅需约20小时练习,而Waymo和Tesla需要多3-4个数量级的数据。
  • 机器人学习效率远低于人类,即使收集了数百万小时演示,仍难以执行复杂任务。
深读这一段

讨论的问题:人类与AI在样本效率上差距有多大?

论据 / 案例:人类一生约2亿token vs. 模型数十万亿token;人类学习驾驶20小时 vs. Waymo/Tesla需多3-4个数量级数据。

05

反驳常见反对意见

04:00
  • 进化作为预训练的观点被质疑,因为人类基因组仅3GB,不足以存储模型参数。
  • 边际能力仍需要大量数据,即使预训练完成后,AI仍需数百位专家学习新技能。
  • 多模态数据被排除在样本效率计算之外,但盲人/聋人案例表明语言数据才是智能关键。
深读这一段

讨论的问题:如何反驳‘人类智能依赖进化预训练’等常见反对意见?

论据 / 案例:人类基因组3GB,仅1-2%编码蛋白质,远小于前沿模型参数;盲人/聋人仅通过少量语言token成为通用智能体。

06

规模化定律的局限性

05:00
  • 规模化定律表明更大模型更高效,但参数和数据项在损失函数中独立添加。
  • 即使参数量无限增加,也只能将所需数据量减少约10倍,无法弥合百万倍差距。
  • 人类样本效率是模型的数千到数百万倍,表明人类处于不同的规模化曲线。
深读这一段

讨论的问题:规模化能否解决样本效率差距?

论据 / 案例:基于Chinchilla规模化定律,参数无限增加仅减少数据需求约10倍;人类样本效率是模型的数千到数百万倍。

07

样本效率的重要性

06:00
  • AI实验室的两大目标:自动化白领工作和自动化AI研究本身。
  • 通过RL和SFT将常见任务纳入分布,即使效率低下,也能创造巨大价值。
  • AI训练虽低效,但可摊销到数十亿会话中,仍具经济效益。
深读这一段

讨论的问题:样本效率对AI发展是否重要?

论据 / 案例:AI实验室收入曲线表明自动化常见任务价值巨大;AI训练可摊销到数十亿会话,即使低效仍盈利。

08

AI研究的自动化前景

07:00
  • 实验室计划先自动化AI研究,再由自动化AI研究员解决样本效率问题。
  • 未来AI可能处理分布外问题,但需先实现研究自动化。
  • 对智能爆炸的思考过于简单,需更细致的推理。
深读这一段

讨论的问题:AI能否在没有人类级样本效率的情况下解决研究问题?

论据 / 案例:实验室计划先自动化AI研究;对智能爆炸的常见思考要么完全否定,要么过度简化。

金句

  • "We see these AIs as a galaxy glittering with capabilities, but at their center, invisible to the naked eye, holding all the constellations together, is an unimaginably massive black hole of data." —— 我们将这些AI视为一个闪烁着能力的星系,但在其核心,肉眼看不见的地方,将所有星座维系在一起的,是一个难以想象的数据黑洞。
  • "Human lifespan does not allow for the quantity and breadth of training these models experience. But AIs can learn these skills by firehosing gigawatts of training at a time." —— 人类的寿命不允许经历这些模型所接受的训练数量和广度。但AI可以一次处理海量数据来学习这些技能。
  • "I think the reason it is relatively easy for open source and previous laggards to catch up to within months of the frontier is that data is the real driver of progress." —— 我认为开源和之前的落后者之所以能相对容易地在几个月内赶上前沿,是因为数据才是进步的真正驱动力。

原文链接

查看完整访谈

完整内容见原文:Dwarkesh Podcast · AI训练依赖海量数据,样本效率远逊人类