德瓦克什·帕特尔
Dwarkesh PatelVS埃里克·张
Eric Jang在 2 个共同议题上并排对照(同一议题标签下两人的真实立场,含年份)
样本效率4 vs 1 条
人类与AI的样本效率差距接近百万倍,AI掌握技能所需的数据和练习量远超人类。
“一个人从出生到成年大约接触2亿个语言令牌(tokens),而前沿模型的训练数据量则高达数十万亿到数百万亿令牌,差距接近百万倍。无论是学开车还是操控机器人,人类所需的数据和练习量远低于AI。”
来源访谈 →现实世界多数领域的数据独特而稀疏、无法构建确定性模拟器,因此样本效率是模型达到精通水平、RLVR实现泛化的根本瓶颈。
“由于现实世界大多数领域的数据具有独特性和稀疏性,模型需要样本效率才能达到精通水平。无法为政坛或商业构建“可种植”的确定性模拟器,RLVR的泛化能力因此存疑。”
来源访谈 →智能的定义是样本效率,即用多少数据就能在特定领域熟练运作;近几年AI的进步主要靠扩大数据分布,而非提升训练样本效率。
“智能的定义是样本效率:即在特定领域用多少数据就能熟练运作。过去几年,AI进步主要靠扩大数据分布,而非提升训练样本效率。”
来源访谈 →他质疑模型能力提升的本质究竟是更复杂的数据输入(如强化学习环境)还是模型样本效率的根本突破,这对判断深度学习在机器人学等需要高样本效率领域的进展速度至关重要。
“模型是否变得更样本高效了……还是我们仅仅改变、扩展或改进了数据输入?(英文原话:Are models even getting more sample efficient... or have we just changed/expanded/improved the data input?)”
来源访谈 →相比大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供逐动作的本地改进信号,因此样本效率极高,这是围棋AI能稳定训练的关键。
“相较于大语言模型按轨迹强化学习的“吸管”式监督,MCTS提供了逐动作的本地改进信号,因此样本效率极高,这也是围棋AI能稳定训练的关键原因。”
来源访谈 →