模拟:新的扩展规律——从虚拟小镇到80亿数字孪生

Simile AI创始人Joon Sung Park在访谈中阐述了其公司从生成式智能体研究走向构建人类行为基础模型的历程。核心论点是:模拟而非预测,是理解与塑造未来的关键。公司通过收集访谈、行为观察和随机对照试验数据,训练出能以85%准确率复现个体行为与态度的数字孪生模型。其长远愿景是构建模拟全部80亿人的社会级模拟器,以应对气候变化、民主稳定性等复杂社会问题。

导语

Simile AI是一家专注于构建人类行为基础模型的公司,其愿景是在做出决策前先“模拟世界”。公司CEO Joon Sung Park是2023年里程碑式论文《生成式智能体》(即“Smallville”研究)的核心作者,该论文首次展示了AI角色能够记忆、规划、社交并产生涌现行为。如今,Simile已从学术研究走向商业化,获得由GreenOaks和Index Ventures领投的20亿美元B轮融资,其数字孪生模型正为包括CVS在内的财富100强客户提供服务,在模拟人类焦点小组方面达到了85%-99%的准确率。本次访谈中,Joon深入探讨了其技术路径、核心理念以及模拟技术改变社会决策的宏大潜力。

大纲与深读 10 章

展开「深读」看每一段讨论的问题与论据。

01

从艺术到AI:个人背景与学术起点

  • 主持人邀请嘉宾Joon Sung Park讲述个人经历,Joon分享了他从韩国移居美国、最初在波士顿接受艺术训练的早年生活。
  • Joon解释了他如何从传统的绘画艺术转向计算机科学,因为他相信最伟大的艺术家会创造自己的媒介,而计算是当今最好的媒介。
  • 他在大学期间深入科技领域,并最终对研究产生兴趣,从而进入了AI领域。
深读这一段

讨论的问题:Joon Sung Park是如何从艺术领域转型到AI领域的?

02

Smallville论文:生成式智能体的诞生

01:46
  • 主持人提到Joon的论文《Generative Agents》(常被称为“Smallville论文”)是2023年最佳论文之一,并讨论了其广泛的阅读量和引用次数。
  • Joon回顾了论文的创作背景:在2020年GPT-3即将可用时,他所在的斯坦福团队(由Percy Liang领导)对基础模型的潜在应用产生了浓厚兴趣。
  • 团队在探索基础模型(训练数据广泛、非特定任务)的杀手级应用时,意识到从网络数据中可以挖掘出极其逼真的人类行为。
深读这一段

讨论的问题:《Generative Agents》论文(Smallville)是如何诞生的,其核心洞察是什么?

论据 / 案例:论文《Generative Agents》有7200次引用(Google Scholar数据)。

03

时间机器游戏:为何选择模拟世界

04:45
  • Joon和他的同事(包括未来的Simile联合创始人)玩了一个“时间机器游戏”:想象十年后回望,什么应用会是最重要的。
  • 他们得出的最雄心勃勃的答案是:“如果我们可以重新创造我们生活的世界呢?就让我们创造一个世界。”
  • 作为次选,他们也曾考虑过个性化的个人代理,但认为模拟(对用户建立深刻理解)是实现更复杂代理的前提。
深读这一段

讨论的问题:为什么团队最终选择了“模拟世界”作为核心方向,而不是其他可能的杀手级应用?

论据 / 案例:Joon举了一个简单的例子来说明对用户深刻理解的重要性:如果个人助手点了你讨厌的夏威夷披萨(有菠萝),它就完全失败了。

04

记忆、提示与“社会物理学”基础模型

05:39
  • Joon讨论了当前个人代理的局限,特别是它们对用户的理解深度不足,并以OpenClaw的Markdown文件作为记忆系统的例子。
  • 他指出,虽然提示工程(prompting)在某些情况下有效,但要让模型学习“社会物理学”(即人类行为的底层规律),需要调整模型参数本身。
  • 现有前沿模型主要基于网络数据训练,这些数据反映的是人们“所说”而非真实“所做”的行为,因此缺乏对人类深层行为的本质理解。
深读这一段

讨论的问题:为什么当前基于提示的个人代理存在根本局限?建立行为基础模型需要什么?

05

数据三要素:访谈、行为与因果关系

07:11
  • Joon阐述了Simile建模人类行为的三类数据:1)深度访谈数据,用于捕捉生活的长尾细节和纹理;2)行为观察数据,如交易或网络数据,提供行为基础统计;3)因果机制数据,这是最重要的。
  • 他强调,人们进行模拟往往不是为了预测未来,而是为了了解如何“塑造”未来,这需要因果数据。
  • 获取因果数据的最佳方式是随机对照试验(RCTs),在控制变量的真实实验环境中观察决策差异。
深读这一段

讨论的问题:为了构建准确的“行为基础模型”,需要哪些类型的数据,为什么?

论据 / 案例:Joon举例说明了RCTs如何揭示因果机制:同一个人在喝咖啡和不喝咖啡的日子里,行为可能不同。

06

预测未来与塑造未来:模拟的独特价值

09:13
  • Joon区分了“预测”和“模拟”:预测告诉你未来会怎样(例如销售下降),而模拟告诉你每一步该怎么做才能达到某个期望的结果。
  • 他引用《基地》系列中的“心理史学”作为类比:第一步行动(如流放科学家)可能非常反直觉,但模拟能揭示通往长期目标的正确路径。
  • 在商业中,模拟可以揭示非直觉的策略,例如营销电动汽车可能意外影响其他车型的销售。
深读这一段

讨论的问题:模拟相对于简单预测的核心价值是什么?

论据 / 案例:Joon引用阿西莫夫《基地》系列中的“心理史学”作为模拟指导决策的类比。

07

建模真实个人与人群:方法、精度与挑战

11:37
  • Simile通过与客户合作,根据目标人群(如特定地区年龄层)招募参与者,收集数据并创建模型,供客户进行概念测试、焦点小组等查询。
  • Joon描述了关键的验证研究:招募1000名美国代表性样本,收集数据建立其数字分身,两周后让本人和分身做相同测试,分身能以85%的准确度复制本人的行为和态度。
  • 他强调,前沿模型(如ChatGPT)追求理性,而Simile的模型旨在复制人类的偏见和错误(“像我一样笨”),这是它们在预测真实行为上存在差距(前沿模型可能低至20-30%)的原因。
深读这一段

讨论的问题:Simile如何验证其数字分身的准确性?为什么前沿模型在模拟人类行为方面表现不佳?

论据 / 案例:Simile的研究显示,其数字分身能以85%的准确度复制真人自身的行为重复度。

08

通过RCTs进行后训练与模型层级

13:57
  • Joon讨论了后一篇论文,该研究使用从“开放科学框架”平台收集的数万个高质量、预注册的随机对照试验(RCTs)数据来后训练模型,显著提升了预测人类行为的能力。
  • 他解释了Simile始终训练两种模型:人口级模型和个体级模型,两者输入相似但侧重不同。
  • 他认为,好的模拟需要复现人类的偏见和错误,而非追求完美效率,例如,一个人选择步行回家不是为了效率,而是为了思考。
深读这一段

讨论的问题:如何通过RCTs数据对模型进行后训练?Simile的模型训练有何特点?

论据 / 案例:Simile使用来自“开放科学框架”的数万个预注册行为研究和随机对照试验数据进行模型后训练。

09

模拟的扩展定律与终极愿景:模拟80亿人

18:02
  • Joon透露,Simile在其后训练的模型中观察到了模拟的“扩展定律”早期迹象:输入更多关于人类的数据和算力,模型性能会可预测地提升。
  • 他描述了终极愿景:创建80亿生活在地球上的人的模拟,这将使我们能够回答关于社会涌现行为的宏大问题。
  • 这些问题包括帮助解决气候变化、理解民主崩溃的信号或追溯货币系统的起源等“棘手问题”。
深读这一段

讨论的问题:模拟技术的扩展定律是怎样的?其终极目标和可能解决的社会问题是什么?

论据 / 案例:Joon提到,Simile观察到了模拟性能随数据和算力增长的“扩展定律”早期迹象。

10

从谢林到社会规模模拟:历史、成本与未来

19:10
  • Joon以诺贝尔奖得主托马斯·谢林的早期智能体建模(如1970年代的隔离模型)为例,说明简单规则如何产生复杂社会现象(如种族隔离),并指出生成式AI为创建高保真度的智能体模型提供了新机会。
  • 他讨论了模拟的经济学:今天为数千至数万人建模已能提供足够洞察,但未来可能需要“整个数据中心”的模拟,其成本可能与训练一个基础模型相当,但解决气候变化等问题的价值将使其物有所值。
  • 访谈还触及了多智能体模拟中智能体间的互动如何增加成本,以及模拟作为艺术创作的类比,并探讨了我们是否可能已生活在一个模拟之中。
深读这一段

讨论的问题:模拟技术的历史渊源是什么?其未来的经济学考量和终极哲学问题有哪些?

论据 / 案例:托马斯·谢林因其早期的智能体建模工作获得了诺贝尔经济学奖。

金句

  • "What if we can just recreate the world that we live in?" ——如果我们能重新创造我们所生活的世界,会怎样?
  • "It’s not about predicting the future; it’s about shaping it." ——关键不是预测未来,而是塑造未来。
  • "The models that we are trying to create are models that are as dumb as I am. So if I make some mistakes, the model has to make the same mistake." ——我们试图创造的模型,是要和我一样‘笨’的。如果我犯了错,模型也必须犯同样的错误。
  • "Can we create a simulation of 8 billion people living on Earth?" ——我们能否创建一个模拟地球上80亿人生活的模拟器?
  • "Simulation is surprisingly similar to painting." ——模拟与绘画出奇地相似。

原文链接

查看完整访谈

完整内容见原文:Latent Space: The AI Engineer Podcast · 模拟:新的扩展规律——从虚拟小镇到80亿数字孪生