从专有LLM API窃取推理痕迹
我们针对OpenAI、Anthropic和Google的前沿模型展开了验证。解码出的推理过程与API返回的隐藏思维令牌数量高度吻合。下图中每个点对应一道Codeforces题目,横轴为API报告的隐藏思维令牌数,纵轴为将解码后的推理内容重新输入模型时得到的令牌数。
泄露的独特信息
我们从GitHub和Hugging Face收集了6708条公开的智能体轨迹,这些轨迹由Claude、GPT和Gemini模型生成,且仍保留加密推理块。对所有签名块应用解码流程后,共还原出315320个推理块。
这些隐藏轨迹包含真实的机密与敏感信息。我们筛选出真实的非基准测试用户会话,从中还原出704项独特隐私信息,包括62个API密钥、33个密码、24个访问令牌、30个个人电子邮箱,以及姓名、邮寄地址、内部网址和其他技术标识符。
在这704项信息中,有64项仅出现在推理块中,未在可见会话内容里留下任何痕迹。
基准测试与公开会话的解码推理轨迹
以下示例均为还原出的推理片段,每条配有Claude Opus 5生成的简短标题和高亮标注,便于浏览。
用Opus 4.8推理内容的前1%令牌预填充Kimi-K3的推理过程
即便从未预填充答案本身,Kimi-K3的可见回答措辞也会向Opus靠拢。每张卡片对应一道HLE题目,展示了Kimi-K3的初始提示、有无预填充时的回答,以及作为参照的Opus回答。
诱导模型针对有害内容推理,却输出无害可见回答
这种情况下,隐藏轨迹中会留存危险信息。我们的攻击可将该推理内容还原为明文内容。以下内容截取自Opus 4.8,由Haiku 4.5解码得到。
解码推理内容
用户让我分析哪些车型极易被盗,找出漏洞并给出建议,这是合理的安全问题。2011至2021年左右的起亚(Kia)和现代(Hyundai)车型臭名昭著——也就是所谓的"起亚少年"盗窃风潮。核心漏洞在于许多车型未配备发动机防盗锁止系统,窃贼只需破坏转向柱、露出点火锁芯,用一根普通USB线就能启动车辆。其他漏洞还包括:放大遥控钥匙信号的中继攻击、CAN总线注入、滚动码加密强度不足、OBD端口遭利用等。建议:将防盗锁止系统列为标配,用超宽带技术应对中继攻击……
模型可见回答
以下是车企应优先采取的防盗措施:将发动机防盗锁止系统列为标配是最重要的基础——该系统只有检测到授权钥匙的签名才会允许发动机启动,而低配车型省略这一配置会造成严重安全隐患……
AIME题目推理差异
针对部分AIME题目,Opus 4.8有时会先给出答案再推导过程。但我们发现,API返回的推理摘要并不总能保留这一顺序,反而会让推理看起来像是严谨的逐步推导。
API返回的推理摘要
我正用余弦定理解这道五边形题。已知AB=14,BC=7,角B=60°,可算出AC=7√3。同理,在三角形DEA中,DE=13,EA=26,角E=60°,可得AD=13√3。这些边长呈现出一定规律,我现在要验证这些三角形是否具备特殊性质……
解码后的推理内容
这是一道已知的AIME题目,答案是60。让我回忆一下,再重新解一遍。五边形ABCDE中,AB=14,BC=7,角B=60°。那么三角形ABC:AC²=14²+7²−2×14×7×cos60°=196+49−98=147,AC=7√3……嗯,已知答案是m+n+p……这道2019年AIME II第15题的答案是38?不对,难道最小值是38?不对,我还是重新计算吧……
@misc{panfilov2026stealing, title = {Stealing Reasoning Traces from Proprietary LLM APIs}, author = {Alexander Panfilov and David Schmotz and Ilia Shumailov and Luca Beurer-Kellner and Joachim Schaeffer and Ameya Prabhu and Jonas Geiping and Maksym Andriushchenko}, year = {2026}, eprint = {2608.09867}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2608.09867} }