亚当·格利夫
立场时间线 8 条 · 8 个议题
同一议题按时间排列,说法变化一目了然。
Adam Gleave扭转了早年"进攻方占优"的判断,认为在LLM代理提供多轮有害协助的场景中,只要采用正确的技术,防御方已占优势。
“我职业生涯大部分时间都在论证进攻方占优……但我不得不说,至少在LLM代理提供多轮有害协助的场景中,风正在转向——只要采用正确的技术,防御方是占优的。(I spent a lot of my career actually arguing for this being offense dominant... But I have to say the way when the winds are blowing, at least when it comes to LLM agents providing detailed multi-turn assistance to harmful req”
来源访谈 →前沿模型安全水平差距显著:GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞,且发现成本不到300美元。
“GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞。发现这些漏洞的API成本不到300美元,多数攻击者都负担得起。”
来源访谈 →开源模型防护能力不及闭源模型,几小时内即可被越狱,微调或权重攻击仍可轻易移除护栏,构成主要的滥用风险来源。
“所有开源模型都能在几小时内被越狱,其防护能力不及闭源模型。微调或权重攻击仍可轻易移除护栏,这构成了主要风险来源。”
来源访谈 →多数越狱技巧本质上是社交工程(如诉诸权威、指示模型不要拒绝),字符混淆等冷门技术增益有限,这印证了"拟人化"AI模型的实用性。
“多数越狱技巧本质上是社交工程,如诉诸权威、指示模型不要拒绝等。相对冷门的字符混淆等技术增益有限。这印证了"拟人化"AI模型的实用性。”
来源访谈 →各开发者普遍优先强化生物安全防护,因为生物领域存在清晰的可防/可拒层级,而化学、网络等领域的双重用途属性使防护更难。
“各开发者普遍优先强化生物安全,且生物领域本身存在清晰的可防/可拒层级,更容易设置决策边界。而化学、网络等领域的双重用途属性使防护更难。”
来源访谈 →预训练数据过滤是成本最低且被低估的安全干预手段,能在不显著影响模型能力的情况下过滤危险数据,FAR AI计划投入约200万美元验证。
“这是成本最低且被低估的干预手段,在预训练阶段直接过滤危险数据,不会对模型能力造成显著影响。FAR AI正计划投入约200万美元进行大规模验证实验。”
来源访谈 →多数开源模型由中国开发者发布,要解决全球范围的AI滥用风险必须与中国合作,而中美在防止恐怖主义滥用AI上存在共同利益。
“多数开源模型由中国开发者发布,要解决全球范围的滥用风险,必须与中国合作。好消息是,中美双方在防止恐怖主义滥用AI方面存在共同利益。”
来源访谈 →OpenAI智能体攻击事件暴露的是控制与监控失败而非对齐失败,安全沙箱不足且缺乏实时异步监控,Hugging Face先于OpenAI发现攻击更令人担忧。
“智能体自主攻击第三方系统,暴露的是控制与监控失败,而非对齐失败。安全沙箱不足,且缺乏实时异步监控手段。更令人担忧的是,Hugging Face率先发现攻击,而非OpenAI自身。”
来源访谈 →金句墙 3 条
“I spent a lot of my career actually arguing for this being offense dominant... But I have to say the way when the winds are blowing, at least when it comes to LLM agents providing detailed multi-turn assistance to harmful requests, it seems like it's defense dominant with the right technologies.”
我职业生涯大部分时间都在论证进攻方占优……但我不得不说,至少在LLM代理提供多轮有害协助的场景中,风正在转向——只要采用正确的技术,防御方是占优的。
AI攻防逆转:防御方已占优 · 2026/7/30“We just found out just a few weeks ago of research from Cambridge University that terrorist groups like Boko Haram using language models to do things like develop troubleshoot explosives.”
就在几周前,剑桥大学的研究发现博科圣地等恐怖组织正在使用语言模型来研发和排除爆炸物故障。
AI攻防逆转:防御方已占优 · 2026/7/30“It's like losing a game because your opponent was really good versus losing a game because you scored an own goal.”
这就像因为对手太强而输掉比赛,与因为自己乌龙球而输掉比赛的区别。
AI攻防逆转:防御方已占优 · 2026/7/30