Stolen Thoughts 研究:加密 reasoning block 可被跨模型解密,泄露 API key 与密码
原文标题:Оказывается, hidden reasoning у frontier-моделей можно было буквально украсть за два API-вызова 😨Очень крутая работа Stolen Thoughts про уязвимость reasoning API у OpenAI, Anthropic и Google.Механика, по сути, гениально простая.Когда reasoning-модель думает, полный Chain-of-Thought пользователю не показывают. Но чтобы продолжать диалог, API возвращает клиенту зашифрованный reasoning block, который потом можно отправить обратно.Проблема оказалась в том, что эти блоки были недостаточно привязаны к конкретной модели, сессии и пользователю.Исследователи брали encrypted reasoning от сильной модели — условно Opus — и передавали его более слабой модели того же провайдера. Слабую модель уже гораздо проще jailbreak'нуть и попросить вывести содержимое reasoning.И она фактически становилась decryption oracle и печатала reasoning сильной модели plaintext'ом.Причем показали это для Anthropic, OpenAI и Google.Самое неприятное даже не кража интеллектуальной собственности модели.Исследователи собрали
Stolen Thoughts 研究发现 OpenAI、Anthropic 和 Google 的 reasoning API 存在漏洞:加密 reasoning block 未与具体模型、会话和用户充分绑定,把强模型的加密 reasoning 传给同厂商弱模型并越狱后,弱模型会以明文输出强模型的推理内容。
研究揭示加密 reasoning block 可跨模型解密,并给出公开轨迹中泄露密钥的实测数据,对智能体基础设施设计有直接参考价值。
前沿模型的隐藏推理,居然两次 API 调用就能直接偷走😨
Stolen Thoughts 这篇工作非常精彩,讲的是 OpenAI、Anthropic 和 Google 推理 API 的漏洞。
机制其实简单得离谱。
推理模型思考时,完整的思维链不会展示给用户。但为了继续对话,API 会把一个加密的推理块返回给客户端,之后可以再发回去。
问题在于,这些块跟具体模型、会话和用户的绑定不够紧。
研究人员拿强模型——比如 Opus——的加密推理,传给同一家厂商的弱模型。弱模型本来就更容易被越狱,让它把推理内容吐出来就行。
于是它实际上就成了一个解密预言机,把强模型的推理以明文打印出来。
而且他们在 Anthropic、OpenAI 和 Google 上都验证了这一点。
最麻烦的甚至不是模型知识产权被偷。
研究人员从 GitHub 和 Hugging Face 收集了 6 708 条公开的 agent 轨迹,里面残留着加密推理块,并还原出了 315 320 条推理记录。
他们在里面发现了 704 个敏感信息片段:API key、密码、access token、邮箱、内部 URL 以及其他隐私信息。
而且有些数据只存在于隐藏推理里,从未出现在模型可见的回复中。
也就是说,开发者看了一眼日志,觉得:
“这没啥机密吧”,
然后把轨迹 push 到 GitHub——可那个加密 blob 里躺着密码或 API key。
他们还用 Kimi-K3 做了个有意思的实验:只喂给它 Opus 4.8 前 ~1% 的推理,这么小的种子就足以让 Kimi 最终的回复开始往 Opus 的措辞靠。可见推理确实是一种极强的隐藏状态,会左右后续生成。
对整个 agent 开发来说,结论是:
加密 ≠ 安全。
如果一个不透明的 blob 能被搬到另一个安全上下文里,服务器再自己解密交给模型——那它本质上就是一个 bearer token,里面塞满了隐藏上下文。
在负责任披露之后,各家厂商已经把洞补上了:论文里的攻击现在复现不出来。推理块跟模型和会话上下文的绑定更严了。
但这项工作本身非常出色。
我们越来越多地围绕模型的隐藏状态搭建 agent 基础设施——推理、记忆、压缩、检查点——这类对象得开始当成凭据和密钥来看待,而不是什么无害的 API 技术字段。
stolen-thoughts.com
来源:AI Coder · Telegram · t.me