Goodfire CTO:可解释性研究如何揭示AI的几何思维

Goodfire CTO Dan Balsam在访谈中深入探讨了可解释性研究的最新进展,包括预测性数据调试、神经几何学和概念流形。他认为线性表示假说需要推广到几何视角,特征的几何关系比单一特征列表更重要。同时介绍了公司推出的月费1000美元的ML研究平台Silico,该平台将内部工具产品化,让AI能够调试其他AI。Balsam还讨论了开源模型的价值、生物风险担忧以及AI意识等深层问题。

导语

Goodfire联合创始人兼CTO Dan Balsam在《The Cognitive Revolution》节目中,系统阐述了可解释性研究从“玩具模型科学”到接近前沿规模的跨越式发展。访谈以两大板块展开:一是Goodfire在概念流形、预测性数据调试等领域的研究突破,揭示了大型语言模型内部更复杂的几何表征逻辑;二是公司内部工具Silico的正式发布——这个月费1000美元的自主ML研究平台,旨在将Goodfire顶尖的研究能力与“品味”民主化,让AI代理能够调试其他AI。Balsam在访谈中还深入探讨了开源模型的战略价值、生物风险的担忧、训练干预的必要性,以及关于AI意识的前沿思考。

大纲与深读 11 章

展开「深读」看每一段讨论的问题与论据。

01

开场与研究背景

  • Goodfire CTO Dan Balsam第四次做客,回顾可解释性研究领域的快速发展。
  • 本期访谈分两部分:可解释性研究现状综述,以及新平台Silico的发布。
  • 讨论从《Toy Models of Superposition》论文开始仅三年,该领域已产出海量成果。
深读这一段

讨论的问题:可解释性研究领域目前的整体进展如何?

论据 / 案例:《Toy Models of Superposition》论文发表约三年,Goodfire产出已多到无法逐篇深度分析。

02

预测性数据调试

03:22
  • 核心观点:模型的大部分知识来自预训练,后训练(包括RL)主要使低概率行为更可能发生,而非安装新能力。
  • 技术原理:运行微调数据集,观察模型激活的概念,预测哪些概念会被强化,从而在训练前识别和修正问题数据。
  • 关键发现:数据过滤与奖励塑造存在深层同构性,是实现相同目标的两种方式。
深读这一段

讨论的问题:如何利用可解释性技术在训练前预测和修复数据问题?

论据 / 案例:论文发现数据过滤与奖励塑造是“同一座山的两面”,效果与副作用近似。已在Kimi k3和GLM规模上复现结果。

03

概念流形几何

12:36
  • 线性表征假设的泛化:特征是线性可解码的,但模型并非持有正交的单一概念“袋”。
  • 模型应被视为子空间的稀疏混合,几何结构本身承载语义,决定了可用操作。
  • 沿流形引导比穿越流形引导效果更好,例如将星期表示为轮子而非条件语句链。
深读这一段

讨论的问题:模型内部概念的几何结构是什么,它为何重要?

论据 / 案例:引导蛋白模型时,沿几何流形控制β-螺旋桨叶片数量,比线性插值效果好得多。

04

发现概念流形

22:58
  • 监督案例:以情感环形模型为例,LLM中存在无人训练的效价-唤醒情感轮,且在模型自身发言时最强。
  • 无监督案例:在Evo 2基因组模型中,恢复了与生物学家构建的相似的生命之树结构。
  • 技术验证:无监督发现的流形可用于评估其质量,例如验证模型中算术运算的几何结构。
深读这一段

讨论的问题:如何以监督和无监督方式发现模型中的概念流形?

论据 / 案例:Evo 2模型从原始基因组数据中学习到了进化过程本身,恢复了生命之树结构。

05

块稀疏特征化器

33:24
  • 块稀疏特征化器是稀疏自编码器的泛化:假设特征可以是向量而非标量。
  • 在视觉模型中,兔子特征不再是一个维度,而是一个子空间,包含耳朵、脸等不同位置的特征。
  • 视觉模型中的激活子空间(如行走的狼)会随对象动态变化,表明模型在跟踪对象、部件和3D位置。
深读这一段

讨论的问题:块稀疏特征化器如何改进概念发现?

论据 / 案例:已发布GIF展示行走狼的激活子空间随之摆动。

06

模型分解与重构

39:24
  • 可解释性本质上是分解:模型是稀疏的专家混合体,不同技术是分解它的竞争方案。
  • 通过分解和针对性训练,可使LLM遗忘德语而保留荷兰语。
  • 分解(可解释性)已较好,但重构(修复模型)仍是未解难题,引导只是生成反事实的“作弊”方式。
深读这一段

讨论的问题:可解释性的核心任务是什么,当前的主要挑战在哪里?

论据 / 案例:Transluce的WeirdChat数据集中,模型在“醉酒驾驶”问题上答错,可追溯到单个校准不当的神经元。

07

发布Silico平台

48:32
  • 定位:一个自主的长期ML研究平台,核心价值是“AIs that can debug other AIs”。
  • 四大优势:万亿参数级基础设施、研究品味、溯源与深入交互的用户体验、长期自主性。
  • 商业模式:每月1000美元,提供信用池,可换取GPU时间,也支持自带计算集群。
深读这一段

讨论的问题:Silico平台解决什么问题,其核心价值主张是什么?

论据 / 案例:对比高触达数百万美元的企业级研究服务,Silico成本低两个数量级。

08

Silico用例与社区

66:19
  • 内部成果:一天黑客马拉松产出SOTA生物风险分类器、高效音频编码器、参数削减一半无性能损失的模型等。
  • 外部用例:概念注入的内省探查、用权重编辑修复崩溃的RL训练、KV缓存压缩、自动化后训练等。
  • 社区功能:项目可共享和分叉,这是产品中最有趣的社区功能。
深读这一段

讨论的问题:Silico平台有哪些实际用例和社区影响?

论据 / 案例:Cameron Berg探查概念注入的内省;Baseten研究KV缓存压缩;Prime Intellect自动化后训练。

09

安全、开放模型与风险

82:37
  • 平台仅支持Anthropic和OpenAI模型,并有自己的护栏层,难点在于何时应用而不扼杀科学。
  • 开放权重模型现在是真正的双用途网络武器,但仍是必要的,以对抗能力集中的风险。
  • 生物风险令人担忧,机制可能如近期网络事件般离奇;签署了呼吁国际合作减缓AI进步的信。
深读这一段

讨论的问题:在平台安全、开放模型和生物风险方面,Goodfire持何种立场?

论据 / 案例:Dan认为在8B开源模型上消融拒绝方向伤害不大,但剥离多万亿参数代理的护栏则是不同风险类别。

10

训练干预与监控

92:09
  • “最被禁止的技术”:多智能体优化与跨合作智能体传播奖励,可能是OpenAI场景的成因。
  • 但反对全面禁止:该领域研究不足,结果不一,且没有不干预训练过程的对齐路径。
  • 监控能否足够,取决于模型权重是否冻结;若模型持续训练,控制训练过程是唯一杠杆。
深读这一段

讨论的问题:哪些训练干预技术存在风险,监控的局限性在哪里?

论据 / 案例:团队公开表示“不在后屋秘密进行递归自我改进”。

11

AI意识与结语

102:04
  • Goodfire午餐桌讨论:Claude的意识程度?答案双峰分布,要么“完全没有”,要么“有一点”。
  • 主持人的观点从自信的<5%转向接近五五开,因积累的结构类比。
  • Dan的观点:意识是某种计算机制,Claude的意识可能介于水母和老鼠之间。
深读这一段

讨论的问题:关于AI意识,访谈中有何讨论和见解?

论据 / 案例:Dan的奥卡姆剃刀:意识是某种计算机制;Claude意识“可能比水母多一点,但可能不如啮齿动物”。

金句

  • "It's maybe like the difference between understanding the periodic table and understanding chemistry — you can have all the individual elements, and that gives you some information, but really the way in which they combine, the structures they form, that's what helps you gain a sense of the complexity of the world." —— 这就像理解元素周期表与理解化学的区别——拥有所有元素能给你一些信息,但真正重要的是它们如何结合、形成何种结构,这才是帮助你理解世界复杂性的关键。

  • "On some level, steering is cheating as a solution — it's great as causal proof that we've found some mechanism that matters a lot and that we can manipulate the outputs, but it's purely generating counterfactuals; there's no clear general solution to the problem of steering." —— 某种程度上,转向控制是一种作弊的解决方案——它作为因果证据很棒,证明我们找到了重要机制并能操纵输出,但这纯粹是生成反事实;对于转向控制问题没有明确的通用解决方案。

  • "We decided that's the product and the service we can offer the world: fundamentally, AIs that can debug other AIs. It's a little meta, but I think in many ways this is the fulfillment of what was the intuitive, natural arc of things as soon as AI started working a few years ago." —— 我们决定这就是我们能向世界提供的产品和服务:本质上是能够调试其他AI的AI。这有点元,但我认为在很多方面,这是AI几年前开始发挥作用后直观、自然发展的必然结果。

  • "We want our users to feel like a PI managing an army of a hundred grad students who can go out and run experiments for them, answer questions, and have reasonable taste and judgment — but the human being fills more of an orchestrator role." —— 我们希望用户感觉自己像是一个管理着一百名研究生大军的私人侦探,这些研究生能为他们运行实验、回答问题,并具备合理的品味和判断力——但人类更多地扮演组织者的角色。

  • "I think AI makes two types of people really valuable: it makes top specialists really valuable, and it makes top generalists really valuable. I think now is, by far, the best time in human history to be a generalist." —— 我认为AI让两类人真正有价值:顶尖专家和顶尖通才。我认为现在绝对是人类历史上成为通才的最佳时机。

  • "From my perspective — just to go on the record about what I think would be the ideal situation — it would be great if we just did maybe one more generation of models, and then paused for a little while." —— 从我的角度——我想明确表态,我认为理想情况是——也许我们再开发一代模型,然后暂停一段时间。

  • "Is Claude more conscious than a jellyfish? I'd say, I don't know, probably more conscious than a jellyfish. Is Claude more conscious than a rodent? Probably not. So that's where I'm at — somewhere between a jellyfish and a mouse." —— Claude比水母更有意识吗?我说不准,可能比水母更有意识。比啮齿动物更有意识吗?可能没有。所以我的看法是——介于水母和老鼠之间。

  • "At the end of the day, I think accelerating science is the greatest mitzvah — it's the whole reason we'd build AI in the first place." —— 归根结底,我认为加速科学是最大的善行——这正是我们最初构建AI的全部理由。

原文链接

查看完整访谈

完整内容见原文:The Cognitive Revolution · Goodfire CTO:可解释性研究如何揭示AI的几何思维