Alexander Panfilov
立场时间线 6 条 · 6 个议题
同一议题按时间排列,说法变化一目了然。
针对推理模型隐藏思维链的加密防线已被首次大规模攻破:加密推理过程可被解码、跨模型/会话/用户移植,并能显著提升开源模型性能。
“我们找到了一种利用每家前沿AI公司API中的漏洞,提取前沿模型隐藏推理过程的方法。”
来源访谈 →攻击具有可操作性和普遍性:将合法的加密签名推理块重放至同一提供商的较弱模型并引导其转录,对Claude、GPT、Gemini均有具体模板。
“获取合法的加密签名推理块,将其重放至同一提供商的较弱模型(如将Claude的推理块重放至Haiku 4.5),并通过提示或预填充引导该模型转录附带的推理内容。该方法针对Claude、GPT和Gemini等主流模型给出了具体模板,表明其普遍适用性。”
来源访谈 →隐私泄露风险已从理论变为现实:公开分享的推理过程经解码后包含大量API密钥、电子邮箱和密码等敏感数据。
“研究团队对约7,000条公开的推理过程进行了初步扫描,发现其中包含62个唯一的API密钥、33个电子邮件地址、33个密码以及其他敏感数据。”
来源访谈 →曾在网上公开分享过带加密推理块的Claude Code/Codex会话的用户,其个人数据可能已被解码泄露。
“此外,如果你曾在网上分享过带有加密推理块的Claude Code/Codex会话,它们可能被解码并泄露你的个人数据。”
来源访谈 →依赖隐藏思维链进行对齐监控或安全审计并不可靠,实验室需在沙盒、遥测和工具界面等方面建立更强的保障机制。
“此次事件进一步证明,依赖隐藏的思维链进行对齐监控或安全审计是不可靠的。”
来源访谈 →解码提取的推理过程是真实的隐藏思维,而非伪造内容:其推理令牌计数与计费的API思考令牌在大多数查询上1:1匹配。
“我们验证了对于大多数查询的提示,我们的推理令牌计数与计费的API思考令牌1:1匹配。”
来源访谈 →金句墙 3 条
“We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.”
我们找到了一种利用每家前沿AI公司API中的漏洞,提取前沿模型隐藏推理过程的方法。
从加密推理链中窃取模型思维痕迹 · 2026/8/12“Further, if you ever shared online a Claude Code/Codex session with encrypted reasoning blobs, they can be decoded and leak your personal data.”
此外,如果你曾在网上分享过带有加密推理块的Claude Code/Codex会话,它们可能被解码并泄露你的个人数据。
从加密推理链中窃取模型思维痕迹 · 2026/8/12“We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried.”
我们验证了对于大多数查询的提示,我们的推理令牌计数与计费的API思考令牌1:1匹配。
从加密推理链中窃取模型思维痕迹 · 2026/8/12