从加密推理链中窃取模型思维痕迹

研究人员发现前沿AI公司API存在漏洞,可解码模型隐藏的推理过程(思维链)。扫描公开追踪发现大量敏感信息泄露,包括API密钥和密码。该技术揭示了当前加密推理链的脆弱性,以及公开分享推理过程的潜在隐私风险。

导语

近期,AI安全研究领域出现一项重大发现:研究人员成功利用前沿AI公司API中的普遍漏洞,解码并提取了模型本应隐藏的推理过程(即“思维链”)。这一突破性发现不仅揭示了当前用于防止模型蒸馏的加密机制存在严重缺陷,更引发了关于AI模型透明度、隐私安全和对齐研究的新讨论。研究团队在对公开分享的推理过程进行扫描后,发现了大量泄露的API密钥、电子邮件地址和密码,凸显了这一技术漏洞的紧迫性和现实危害。

大纲与深读 7 章

展开「深读」看每一段讨论的问题与论据。

01

推理追踪泄露漏洞

00:12
  • 研究团队发现可通过API漏洞提取前沿模型的隐藏推理过程
  • 提取的推理令牌计数与计费的思考令牌计数达到1:1匹配
  • 公开的会话追踪中发现了62个API密钥、33个电子邮件地址和33个密码等敏感数据
深读这一段

讨论的问题:如何从前沿AI模型的加密推理追踪中提取敏感信息?

论据 / 案例:对约7000个公开追踪的扫描发现了62个唯一API密钥、33个电子邮件地址和33个密码。该漏洞影响Claude、GPT和Gemini等模型的API。

02

NVIDIA Nemotron 3.5发布

03:36
  • NVIDIA发布Nemotron 3.5 Lightning,一个30B MoE模型,活跃参数约3B
  • 该模型支持1M上下文窗口,吞吐量最高可达4倍提升
  • 在第三方测试中智能指数得分为24,接近gpt-oss-120b但更小更快
深读这一段

讨论的问题:小型开放代理模型如何通过针对性优化实现高效能?

论据 / 案例:Nemotron 3.5 Lightning在GDPval-AA v2中Elo得分为824,在Terminal-Bench v2.1中得分为24%,均大幅超越Nemotron 3 Nano。

03

本地AI工具发展

04:43
  • Unsloth Desktop发布,支持跨平台运行和训练模型
  • Meta Muse Glimmer 30B模型支持DFlash推测解码,生成速度提升2-4倍
  • OpenAI发布ChatGPT桌面版Linux预览,支持项目同步和导入
深读这一段

讨论的问题:本地AI工具生态系统如何向端到端解决方案演进?

论据 / 案例:Unsloth Desktop声称训练速度快2倍且VRAM减少70%。Muse Glimmer的KV缓存效率约为52 KiB/token。

04

代理产品与基准测试

05:46
  • xAI推出Grok Bot,定位为具有持久工作的AI队友产品
  • LlamaIndex发布ExtractBench,专注于企业文档提取的确定性基准测试
  • Artificial Analysis发布AA-AnalystAgent,评估定量分析任务的可靠性
深读这一段

讨论的问题:AI代理产品评估标准如何从单次能力转向长期工作流可靠性?

论据 / 案例:ExtractBench测试370个文档/4,869页/67种文档类型,发现商业VLM在50页以上文档中召回率低于35%。Claude Opus 5在AA-AnalystAgent中以54%领先。

05

基础设施与验证研究

07:01
  • Attestable获得2000万美元种子轮,专注于AI完整性的零知识证明
  • 完全确定性的整数推理在A100、H100、Apple M5 Max等硬件上实现
  • 代理系统正向编译器和内存规划器等更底层栈迁移
深读这一段

讨论的问题:如何为AI推理提供可验证性和跨硬件可移植性?

论据 / 案例:Attestable声称零知识证明开销已降至接近单倍数(<10倍)水平。确定性整数推理在A100上实现106 tok/s,比fp16基线快3.6倍。

06

Meta Muse Glimmer评测

08:57
  • Muse Glimmer 30B在24GB GPU上运行时表现出色,KV缓存仅需约1.8 GiB
  • 早期测试显示在代理工作流中明显优于Qwen 3.6-27B
  • 量化支持良好,2位量化模型可在14GB内存中执行100多次工具调用
深读这一段

讨论的问题:密集型开源模型如何在本地硬件上实现竞争力性能?

论据 / 案例:Muse Glimmer在单张RTX 3090上实现256K上下文+DFlash,VRAM使用约22-23GB,生成速度64-124 tok/s。

07

新兴模型与架构

10:59
  • Qwen 3.8-27B开放权重本周发布,预计为2.4T参数MoE模型
  • Ling-3.0-tiny发布,8B参数MoE模型仅1.3B活跃参数
  • 小型MoE架构在低内存、移动和边缘推理中表现出优势
深读这一段

讨论的问题:混合专家架构如何推动模型向更高效的小型化方向发展?

论据 / 案例:Ling-3.0-tiny在DGX Spark上FP8吞吐量约100-105 tok/s,IFBench得分63.61,超越LFM2.5-8B-A1B的56.47。

金句

  • "" ——我们找到了一种利用每家前沿AI公司API中的漏洞,提取前沿模型隐藏推理过程的方法。
  • "" ——此外,如果你曾在网上分享过带有加密推理块的Claude Code/Codex会话,它们可能被解码并泄露你的个人数据。
  • "" ——我们验证了对于大多数查询的提示,我们的推理令牌计数与计费的API思考令牌1:1匹配。

原文链接

查看完整访谈

完整内容见原文:Latent.Space · 从加密推理链中窃取模型思维痕迹