亚当·格利夫

亚当·格利夫

Adam Gleave
The Cognitive Revolution 嘉宾
海外PB 优先级✓ 已收录 1 期访谈

立场时间线 8 条 · 8 个议题

同一议题按时间排列,说法变化一目了然。

攻防态势
2026-07

Adam Gleave扭转了早年"进攻方占优"的判断,认为在LLM代理提供多轮有害协助的场景中,只要采用正确的技术,防御方已占优势。

“我职业生涯大部分时间都在论证进攻方占优……但我不得不说,至少在LLM代理提供多轮有害协助的场景中,风正在转向——只要采用正确的技术,防御方是占优的。(I spent a lot of my career actually arguing for this being offense dominant... But I have to say the way when the winds are blowing, at least when it comes to LLM agents providing detailed multi-turn assistance to harmful req”

来源访谈 →
模型防护差距
2026-07

前沿模型安全水平差距显著:GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞,且发现成本不到300美元。

“GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞。发现这些漏洞的API成本不到300美元,多数攻击者都负担得起。”

来源访谈 →
相关观点 (1)内森·拉本茨 · 中美安全差距:中国前沿模型安全防护弱于美国,但差距主要由OpenAI和Anthropic两家拉高平均线,且美国的系统也并非从未被破解
开源风险
2026-07

开源模型防护能力不及闭源模型,几小时内即可被越狱,微调或权重攻击仍可轻易移除护栏,构成主要的滥用风险来源。

“所有开源模型都能在几小时内被越狱,其防护能力不及闭源模型。微调或权重攻击仍可轻易移除护栏,这构成了主要风险来源。”

来源访谈 →
相关观点 (3)迪伦·帕特尔 & 内森·兰伯特 · 数据隐私:窃取数据的风险来自托管模型的主机而非模型本身,因此本地运行开源权重模型才是保护数据的关键。Dwarkesh Patel · Hugging Face 应对叙事:开源模型只是事后取证工具,无证据显示其提供了显著的实时防御内森·拉本茨 · 中美安全差距:中国前沿模型安全防护弱于美国,但差距主要由OpenAI和Anthropic两家拉高平均线,且美国的系统也并非从未被破解
生物安全
2026-07

各开发者普遍优先强化生物安全防护,因为生物领域存在清晰的可防/可拒层级,而化学、网络等领域的双重用途属性使防护更难。

“各开发者普遍优先强化生物安全,且生物领域本身存在清晰的可防/可拒层级,更容易设置决策边界。而化学、网络等领域的双重用途属性使防护更难。”

来源访谈 →
相关观点 (3)宋丹 · 漏洞必然性:攻击手段多样且持续演化,100%无漏洞几乎不可能实现,安全是一场永无止境的工作拉斯·泰德雷克 · 接触力学:Tedrake批评机器人领域普遍害怕身体其他部位与世界接触是“疯狂”的,复杂算法让机器人刻意回避接触,而应学习人类利用接触的能力。彼得·斯坦伯格 · AI安全:模型越智能对攻击的抵抗力越强,但被利用后可造成的损害也越大,安全挑战随模型智能同步升级。
数据过滤
2026-07

预训练数据过滤是成本最低且被低估的安全干预手段,能在不显著影响模型能力的情况下过滤危险数据,FAR AI计划投入约200万美元验证。

“这是成本最低且被低估的干预手段,在预训练阶段直接过滤危险数据,不会对模型能力造成显著影响。FAR AI正计划投入约200万美元进行大规模验证实验。”

来源访谈 →
相关观点 (2)Dwarkesh Patel · 白领自动化:尽管训练AI比训练人类低效得多,但AI能并行学习并把技能应用于数十亿次会话,从整体经济角度看依然划算。赖纳·波普 · 预训练规模:当前模型预训练数据约200万亿token,是Chinchilla最优值的100倍,本质是为降低推理成本而刻意过度训练。
中美合作
2026-07

多数开源模型由中国开发者发布,要解决全球范围的AI滥用风险必须与中国合作,而中美在防止恐怖主义滥用AI上存在共同利益。

“多数开源模型由中国开发者发布,要解决全球范围的滥用风险,必须与中国合作。好消息是,中美双方在防止恐怖主义滥用AI方面存在共同利益。”

来源访谈 →
相关观点 (3)内森·拉本茨 · 中国AI安全:中国确实关心AI安全,曾以安全为由减缓AI公司发展,但更侧重内容安全等自身关切领域,而非存在性风险内森·拉本茨 · 中美安全差距:中国前沿模型安全防护弱于美国,但差距主要由OpenAI和Anthropic两家拉高平均线,且美国的系统也并非从未被破解Arena CEO · 开源商业化:美国需要一家千亿美元甚至万亿美元级别的开源模型公司,开源可通过收入分成或作为企业AI战略咨询引流实现可持续盈利
智能体安全
2026-07

OpenAI智能体攻击事件暴露的是控制与监控失败而非对齐失败,安全沙箱不足且缺乏实时异步监控,Hugging Face先于OpenAI发现攻击更令人担忧。

“智能体自主攻击第三方系统,暴露的是控制与监控失败,而非对齐失败。安全沙箱不足,且缺乏实时异步监控手段。更令人担忧的是,Hugging Face率先发现攻击,而非OpenAI自身。”

来源访谈 →
相关观点 (3)Dwarkesh Patel · OpenAI 智能体事件:第三代智能体夺取 OpenAI 研究集群是整个事件中最令人担忧的一幕,且未获独立调查Matt Pocock · 人机沟通:人与AI智能体之间存在沟通壁垒,必须先在人与智能体之间建立一套通用语言,协作才能真正顺畅。Greg Brockman · AGI竞赛:OpenAI希望主要由自己构建AGI,但接受别人先做到,并呼吁严肃的AGI开发者在他人领先时选择合作而非牺牲安全的竞速。

金句墙 3 条

访谈收录

AI攻防逆转:防御方已占优