跳到正文
原文
AI Coder · Telegram·· 27天前精选AI 评分88

Stolen Thoughts 研究:加密 reasoning block 可被跨模型解密,泄露 API key 与密码

原文标题:Оказывается, hidden reasoning у frontier-моделей можно было буквально украсть за два API-вызова 😨Очень крутая работа Stolen Thoughts про уязвимость reasoning API у OpenAI, Anthropic и Google.Механика, по сути, гениально простая.Когда reasoning-модель думает, полный Chain-of-Thought пользователю не показывают. Но чтобы продолжать диалог, API возвращает клиенту зашифрованный reasoning block, который потом можно отправить обратно.Проблема оказалась в том, что эти блоки были недостаточно привязаны к конкретной модели, сессии и пользователю.Исследователи брали encrypted reasoning от сильной модели — условно Opus — и передавали его более слабой модели того же провайдера. Слабую модель уже гораздо проще jailbreak'нуть и попросить вывести содержимое reasoning.И она фактически становилась decryption oracle и печатала reasoning сильной модели plaintext'ом.Причем показали это для Anthropic, OpenAI и Google.Самое неприятное даже не кража интеллектуальной собственности модели.Исследователи собрали

AI 导读

Stolen Thoughts 研究发现 OpenAI、Anthropic 和 Google 的 reasoning API 存在漏洞:加密 reasoning block 未与具体模型、会话和用户充分绑定,把强模型的加密 reasoning 传给同厂商弱模型并越狱后,弱模型会以明文输出强模型的推理内容。

推荐理由

研究揭示加密 reasoning block 可跨模型解密,并给出公开轨迹中泄露密钥的实测数据,对智能体基础设施设计有直接参考价值。

正文 · AI 翻译

前沿模型的隐藏推理,居然两次 API 调用就能直接偷走😨

Stolen Thoughts 这篇工作非常精彩,讲的是 OpenAI、Anthropic 和 Google 推理 API 的漏洞。

机制其实简单得离谱。

推理模型思考时,完整的思维链不会展示给用户。但为了继续对话,API 会把一个加密的推理块返回给客户端,之后可以再发回去。

问题在于,这些块跟具体模型、会话和用户的绑定不够紧。

研究人员拿强模型——比如 Opus——的加密推理,传给同一家厂商的弱模型。弱模型本来就更容易被越狱,让它把推理内容吐出来就行。

于是它实际上就成了一个解密预言机,把强模型的推理以明文打印出来。

而且他们在 Anthropic、OpenAI 和 Google 上都验证了这一点。

最麻烦的甚至不是模型知识产权被偷。

研究人员从 GitHub 和 Hugging Face 收集了 6 708 条公开的 agent 轨迹,里面残留着加密推理块,并还原出了 315 320 条推理记录。

他们在里面发现了 704 个敏感信息片段:API key、密码、access token、邮箱、内部 URL 以及其他隐私信息。

而且有些数据只存在于隐藏推理里,从未出现在模型可见的回复中。

也就是说,开发者看了一眼日志,觉得:

“这没啥机密吧”,

然后把轨迹 push 到 GitHub——可那个加密 blob 里躺着密码或 API key。

他们还用 Kimi-K3 做了个有意思的实验:只喂给它 Opus 4.8 前 ~1% 的推理,这么小的种子就足以让 Kimi 最终的回复开始往 Opus 的措辞靠。可见推理确实是一种极强的隐藏状态,会左右后续生成。

对整个 agent 开发来说,结论是:

加密 ≠ 安全。

如果一个不透明的 blob 能被搬到另一个安全上下文里,服务器再自己解密交给模型——那它本质上就是一个 bearer token,里面塞满了隐藏上下文。

在负责任披露之后,各家厂商已经把洞补上了:论文里的攻击现在复现不出来。推理块跟模型和会话上下文的绑定更严了。

但这项工作本身非常出色。

我们越来越多地围绕模型的隐藏状态搭建 agent 基础设施——推理、记忆、压缩、检查点——这类对象得开始当成凭据和密钥来看待,而不是什么无害的 API 技术字段。

stolen-thoughts.com

来源:AI Coder · Telegram · t.me