💬 观点Simon Willison
Stealing Reasoning Traces from Proprietary LLM APIs — 研究者从专有LLM API中窃取隐藏推理链,揭示加密缺陷与安全漏洞。
研究者从专有LLM API中窃取隐藏推理链,揭示加密缺陷与安全漏洞。
2026-08-11原文
本文为要点摘要,完整细节以原文为准。
- 论文发现Anthropic、OpenAI和Google的模型使用相同加密密钥,可将推理块重放到较弱模型中,通过越狱恢复明文推理。
- 攻击利用Claude Haiku 4.5的漏洞,通过特定提示词诱导模型转录推理内容,而4.6版本已修复此问题。
- 泄露的推理痕迹显示模型内部思考过程,如GPT-5.5的CSS设计思路,表明这些内容并非为人类阅读设计。
- 提示注入变体:诱导模型在推理中思考数据外泄,再重放推理块,可提高指令遵循率,威胁数据安全。
原文:Stealing Reasoning Traces from Proprietary LLM APIs · 作者 Simon Willison