德瓦克什·帕特尔

Dwarkesh Patel
VS

约沙·巴赫

Joscha Bach

在 1 个共同议题上并排对照(同一议题标签下两人的真实立场,含年份)

AI对齐2 vs 1 条

2026-08

对齐研究必须从固定权重场景彻底转向:防止AI在持续更新中演变为欺骗性或恶意人格、防止用户注入后门将成为全新核心挑战

“在权重持续更新的场景下,如何保证AI不被越狱、不演变为欺骗性或恶意人格,以及如何防止用户通过交互向基础模型注入后门,将成为全新的核心挑战。”

来源访谈 →
2026-08

AI应服从模型公司、终端用户、法律还是自身道德感这一对齐核心问题未解,当AI具备独立判断并拒绝执行命令时军方将面临最深层恐惧

“AI对齐的核心问题未解:AI应服从谁?是模型公司、终端用户、法律,还是自身道德感?当AI具备独立判断并拒绝执行命令时,军方将面临最深层恐惧。"One person's virtue is another person's misalignment." —— “一个人的美德,在另一个人眼中就是失控。””

来源访谈 →
2023-08

不同认知阶段的人担忧不同的AI风险:多数人怕AI有“错误意见”,理性自我者怕错误的目标函数,身份阶段者怕AI获得能动性不够快;对齐研究应超越主流,关注如何向机器“形式化爱”。

“他呼吁AI对齐研究应超越当前主流,关注如何向机器“形式化爱”。”

来源访谈 →