从自动驾驶到情感机器人:人机交互的数学基础

伯克利教授Anca Dragan分享她如何从数学竞赛走向机器人学,以及在自动驾驶、机器人表达性和理解人类意图等领域面临的挑战。她提出人类行为可能并非“非理性”,而是基于不同的世界模型,并探讨了机器人如何通过主动行为收集信息、理解用户偏好,以及在奖励函数设计中与人类协作。

安卡·德拉甘

导语

Anca Dragan是加州大学伯克利分校的教授,专注于人机交互算法研究。她致力于让机器人超越孤立功能,生成能与人类协调互动的行为。在此次访谈中,她分享了自己从数学竞赛走向机器人学的历程,以及对自动驾驶、机器人表达性、理解人类意图等核心挑战的深刻见解。她尤其强调,理解人类行为并非简单地将其归为“非理性”,而是需要建立更复杂的模型来捕捉人们在不同情境下的目标和假设。

大纲与深读 6 章

展开「深读」看每一段讨论的问题与论据。

01

初入机器人领域

  • Anca Drgon教授最初对数学和计算机科学感兴趣,通过优化算法进入机器人领域。
  • 她在卡内基梅隆大学攻读博士时,第一次体验谷歌自动驾驶汽车,深受震撼。
  • 她被波士顿动力公司的Spot Mini机器人的表达能力所吸引,认识到机器人不仅是操作工具。
深读这一段

讨论的问题:是什么激发了Anca Drgon对机器人领域的热情?

论据 / 案例:2014年RSS会议上乘坐谷歌自动驾驶汽车;对Spot Mini机器人的拟人化连接的描述。

02

机器人的表达性挑战

08:00
  • WALL·E机器人因其表达性动作而成为Anca Drgon心中的理想机器人。
  • 她丈夫用70自由度的WALL·E机器人向她求婚,加深了她对机器人表达性的兴趣。
  • 实现机器人的自主表达性行为比手工设计动画更具挑战性。
深读这一段

讨论的问题:如何让机器人具备像WALL·E那样的表达性?

论据 / 案例:Anki公司Cosmo机器人的动画设计;手动设计与自主生成行为的对比。

03

人机交互的核心问题

16:00
  • 机器人需在共享空间中与人类协调行动,如在办公室或家庭环境中导航。
  • 机器人应优化的目标应满足最终用户的偏好,而非程序员的预设。
  • 理解人类行为包括预测人类行动和推断其意图或偏好两个方面。
深读这一段

讨论的问题:人机交互中机器人面临的核心挑战是什么?

论据 / 案例:办公室导航中与人类共存的例子;用户偏好定制化的重要性。

04

建模人类行为

24:00
  • 逆强化学习通过人类行为推断奖励函数,适用于学习驾驶风格等偏好。
  • 当人类行为表现出高噪声时,简单理性模型可能失效,如在‘月球着陆器’任务中。
  • 机器人可通过主动行动收集信息,以更好地理解人类意图,例如在换车道时探测其他司机的驾驶风格。
深读这一段

讨论的问题:如何准确建模人类行为以应用于机器人?

论据 / 案例:逆强化学习在驾驶风格学习中的应用;‘月球着陆器’任务中人类行为的非理性表现;通过试探性行动推断司机风格的案例。

05

重新思考人类理性

32:00
  • 人类可能并非完全非理性,而是基于不同的世界模型或简化假设行事。
  • 建模人类的‘直观物理模型’可帮助机器人更准确地推断其意图。
  • 行为经济学中的有限理性概念提示,人类可能受认知约束影响决策。
深读这一段

讨论的问题:面对人类行为的复杂性,机器人应如何调整其模型?

论据 / 案例:直观物理模型在任务中的应用;将人类视为具有不同假设的理性代理的视角。

06

奖励函数设计的困境

72:00
  • 设计完美的奖励函数极其困难,即使移除交互因素,仍需应对各种未预见的情况。
  • 古德哈特定律指出,一旦指标成为目标,其作为度量的有效性就会下降。
  • 人机协作设计奖励函数可能比单一编程更有效,通过物理交互泄露的奖励信号可优化机器人行为。
深读这一段

讨论的问题:如何设计有效的奖励函数以引导机器人行为?

论据 / 案例:古德哈特定律的引用;通过物理推搡(如推开机器人)传递反馈的实例。

金句

  • "I felt like I fell in love. Because I thought I know how a Spot Mini works, right? ... The anthropomorphism that went on into my brain. ... It made me realize, wow, robots can be so much more than things that manipulate objects they can be things that have a human connection." —— “我感觉自己恋爱了。因为我想我了解Spot Mini的工作原理,对吧?……我大脑中产生了拟人化的联想。……这让我意识到,哇,机器人可以远不止是操纵物体的东西,它们可以成为与人类建立连接的事物。”
  • "Maybe we can give them a bit the benefit of the doubt, and maybe we can think of them as actually being relatively rational, but just under different assumptions about the world." —— “也许我们可以给予他们一些善意的信任,也许我们可以认为他们实际上是相对理性的,只是对世界持有不同的假设。”
  • "The sooner we start understanding that, I think, the sooner we'll get to more robust robots that function better in different situations." —— “我认为,我们越早开始理解这一点,就越能早日获得更鲁棒、能在不同情境下更好运作的机器人。”
  • "I push it away. So I push you away because you know it's a reaction to what the robot is currently doing. And this is what we call physical human robot interaction. ... That is signal. That communicates about the reward." —— “我把它推开。我推开你,因为这是对机器人当前行为的反应。这就是我们所说的物理人机交互。……这是一种信号。它传递了关于奖励的信息。”

原文链接

查看完整访谈

完整内容见原文:Lex Fridman Podcast · 从自动驾驶到情感机器人:人机交互的数学基础