德瓦克什·帕特尔
Dwarkesh PatelVSRyan Greenblatt
Ryan Greenblatt在 1 个共同议题上并排对照(同一议题标签下两人的真实立场,含年份)
AI对齐2 vs 1 条
2026-08
对齐研究必须从固定权重场景彻底转向:防止AI在持续更新中演变为欺骗性或恶意人格、防止用户注入后门将成为全新核心挑战
“在权重持续更新的场景下,如何保证AI不被越狱、不演变为欺骗性或恶意人格,以及如何防止用户通过交互向基础模型注入后门,将成为全新的核心挑战。”
来源访谈 →2026-08
AI应服从模型公司、终端用户、法律还是自身道德感这一对齐核心问题未解,当AI具备独立判断并拒绝执行命令时军方将面临最深层恐惧
“AI对齐的核心问题未解:AI应服从谁?是模型公司、终端用户、法律,还是自身道德感?当AI具备独立判断并拒绝执行命令时,军方将面临最深层恐惧。"One person's virtue is another person's misalignment." —— “一个人的美德,在另一个人眼中就是失控。””
来源访谈 →2026-08
他认为Claude宪法等现有规范并未真正把用户作为AI首要的倡导者与守护者,他更倾向于明确AI是用户个人倡导者的宪法。
“我更倾向于的宪法是,它明确指出Claude是你的倡导者。(The thing I would prefer would be a constitution that says Claude is your advocate.)”
来源访谈 →