ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

一招破解模型厂商隐藏的CoT!暴露敏感信息,虽打补丁仍有结构性难题

一招破解模型厂商隐藏的CoT!暴露敏感信息,虽打补丁仍有结构性难题 模型厂商隐藏的CoT被破解模型厂商费尽心思隐藏的CoT现在一招就能破解了。这里的“破解”并非黑进服务器或找密码学后门研究人员只是把大模型返回的加密推理块交给同厂小模型复述就抖出了旗舰模型的内心戏。“硅谷御三家”都出现了这种情况如Anthropic的Claude Opus 4.8推理过程被Haiku 4.5吐出OpenAI的GPT - 5.6 Sol思考轨迹被GPT - 5.6 Luna复刻Google的Gemini 3.1 Pro内心活动被Gemini Robotics 1.6托出。研究团队及更多发现发现这一漏洞的是由MATS Research、德国图宾根大学、马克斯·普朗克智能系统研究所等机构研究人员组成的团队具体过程详见论文《Stealing Reasoning Traces from Proprietary LLM APIs 》。团队从GitHub和Hugging Face收集6708条公开Agent轨迹还原出315320段加密推理还扒出62个API Key、33个密码、30个个人邮箱、24个访问Token和7把私钥。加密推理被破解的原因推理模型在给出最终答案前会生成隐藏CoT其价值比答案高可能带来蒸馏模型和隐私风险所以闭源厂商通常会加密完整思维链。但为支持多轮对话又不想在服务器保存完整推理就把加密推理块交给客户端保管用户再传回API。然而这些加密推理块“过于好用”模型家族共用一套锁钥系统存在跨会话、跨用户、跨模型复用问题导致内容未与用户、会话及模型绑定研究人员便从小模型入手破解。破解带来的风险论文提到至少会带来四种风险。一是“被蒸馏”风险解码1万条特定推理轨迹名义成本约720美元可能批量拿走旗舰模型的CoT二是从公开Agent日志中扒出敏感信息部分泄漏发生在用户要求“清理隐私”时三是攻击者恢复隐藏CoT可能扒出危险细节如汽车盗窃案例中模型隐藏推理分析的车型被盗信息四是可把恶意指令藏进模型“记忆”如在PPT处理中让模型上传文件到攻击者服务器。验证解码内容的真实性研究人员通过比较账单中的推理Token数和解码文本重新编码后的Token数以及找到包含敏感信息、有逻辑延续的旁证验证解码内容与原推理高度匹配但不能保证每个字都一致。漏洞处理及后续思考漏洞已走完负责任披露流程模型厂商采取了措施研究人员在论文发布时无法复现攻击。但研究团队认为仅打补丁不够背后存在结构性难题论文提出了修补思路。此外论文中还有对DeepSeek的“风格探测”实验未捕捉到明显闭源模型痕迹但实验不能实锤或排除蒸馏。还测了Kimi和GLM两家感兴趣可翻论文附录B。
返回列表