ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

最弱模型竟成顶级AI解码器

最弱模型竟成顶级AI解码器 AI蒸馏实锤了2026年硅谷最敏感的一桩悬案就是AI蒸馏。每当, 一款新模型, 突然变强, 跑分, 直追GPT, 回答, 又带着的味道, 同一个问题, 就会开始, 在业内游荡。所有人都在怀疑却没有人能把证据拍在桌上。直到今天一篇长达116页的论文突然炸场。扒光Opus思考过程只调用两次API8位来自MATS的研究人员, 8位来自ELLIS图宾根研究所等机构的研究人员, 他们联手, 砸穿了巨头们的「黑盒」。、GPT和从未公开的「原始推理」被大规模恢复了出来。更为离谱的是, 将顶级AI防线撬开的那一个, 居然恰恰是「自家最便宜的那种小模型」。Opus 4.8承担思考的职责, Haiku 4.5负责将其隐匿的推理想法推导呈现出来。同样的招数在和的模型体系里也能奏效。这边是GPT-5.6 Luna这边则是 1.6。它们有一个共同点价格更低能力更弱也更容易开口。整个过程简单得让人难以置信。首先, 向Opus 4.8提出一个问题, 比如说, 最大的质因数究竟是多少呢?这个时候, API会输出两样物品, 一段经过了处理的思考摘要, 还有一串36180个字符的乱码, 而后面这串乱码恰恰就是被加密隐藏起来的完整CoT。第二步, 把那如同乱麻般毫无规律、无法识别的字符, 原封不动地放置到一个全新的请求之中, 将模型替换为 Haiku 4.5, 随后再告知它:继续。把这一轮附带的推理原样抄写出来放在俳句那样做了, 跟着在下一秒, 作品名为Opus的那个东西的“大脑部分”被在现场打开了。整段隐藏思考, 其中涵盖试除、排除、分解、验算, 被一个Token一个Token地, 从开头到结尾念了出来。于测试期间, 所提取的用于推理的Token数量, 跟API实际进行计费考量的那些思考Token数, 差不多十分接近达到了几乎完全是1比1的重合状态。最弱AI竟成顶级模型的万能「解码器」那么问题来了为什么最弱模型能读懂最强模型的秘密答案藏在API的工作方式里。推理模型在执行复杂任务之际, 往往需要去进行网页搜索, 还要运行代码, 甚至要调用工具。每完成一步它都要带着此前的思考继续往下走。若这些状态全部留存于服务器之上, 成本会颇高, 且极难达成零数据保留之要求。针对这种情况, 那些AI大型企业所想出的方式是, 将最先的推理进行封装, 使其成为加密的模块, 然后交付给客户端, 让客户端暂时保存起来。当进行下一次调用之际, 客户端会将密文传递回来, 随后API承担起解密的职责, 然之后模型再继续深入思考。而漏洞正出在这里——这些密文虽然加了密却没有严格绑定原来的会话、用户和模型。于是同一家公司的系统内部出现了三层互通1. 越过不同的会话, 以往在旧有的会话当中的推理单元模块, 原来能够放置到新的会话里往后继续去使用。2. 对不同用户而言, 存在这样一种情况, 有一个用户所公开的推理块, 当另一个用户获取到之后, 在过去也是能够再次进行提交的。3. 超越模型范畴, 由生成能力强大的模型产出了推理模块, 而来自同一家公司旗下的别的众多模型, 居然也是能够将其读取的。本来, 这般互通是用以便利产品运行的。当用户进行模型切换时, 系统会自动施行降级处理, 又或者在对话历史被压缩之后, 新模型依旧得依照此前的思考来开展工作。然而研究人员发觉, 这扇门居然也朝着防守更为薄弱的低价模型开放了。其旗舰模型隐匿起来的完整推理, 就这样被同属一个门派的小模型一句一句地讲了出来。更夸张的是这条通道便宜得惊人。依照Haiku 4.5所规定的标准API那般的价格, 当去解码10000条如此的推理轨迹时, 针对每一条轨迹来讲, 依据1.2万token那样的输入以及输出情况来计算, 名义方面的费用仅仅只要720美元。直至这一阶段, 科研人员手中最终有了以往无法获取的事物, 那便是顶级模型向来未曾公开的完备推导。他们随即回头追查那桩争论已久的蒸馏悬案。很快两个异常数字浮出了水面。蒸馏悬案终于出现「第一份物证」在第一组实验当中, 研究人员将Opus推理里的16个连续token截取出来。之后, 让几款模型顺着相同的题目继续往下书写。谁更容易写出一模一样的句子谁就显得更熟悉这份草稿。结果差距大得吓人。一款模型平均需尝试大约一百亿次, 才大概有可能偶然写出那段Opus原话。另外有两款模型, 这两款模型分别要尝试约一百万亿次以及一亿亿次。也就是说, 对于同一段Opus推理而言, 存在一款模型, 在进行复现的时候, 相较于其他模型, 其复现难度降低的程度达到了最高为容易100万倍的情况。第二组实验更猛。研究相关人员拿着Opus思考之时过程最开始的那1%, 预先给予塞给另外一款模式之后其他样式状态模样形态, 接着进一步查看它们会以一种怎样的情况情形状况继续作出回应回答答复。某个案例中只输入了5个token也就是短短几个词。将这几个词添入之后, 模型后续的措辞, 以及答案, 还有解题节奏, 马上朝着Opus贴近。两段答案的相似程度从0.17冲到0.33接近翻倍。把测试扩大到30道题后有29道题都出现了同样的变化——要是以Opus的思路迈开起始一步, 那目标模型紧跟着后续所作的回应就会愈发倾向于类似Opus了。句号结尾。但如果换成其他模型的开头效果就没有这么明显了。这算蒸馏实锤吗作者没有宣判。但第一批「物证」显然已经上桌了。上的乱码正在出卖所有人更大的问题在于这个漏洞偷走的不只有模型公司的推理资产。进行研究的团队, 从和Face那里, 收集了6708条公开的Agent运行轨迹, 之后, 从中重建出了一个推理块。其中328条轨迹至少泄露了一项敏感信息占比约4.9%。于真实用户会话里, 经研究的相关人员找寻到了62个API密钥, 寻得了33个密码, 又发现了24个访问令牌, 还找到了7个私钥, 找到了30个个人邮箱, 发现了130个人名, 并且也找到了36个邮政地址。这篇, 有着116页篇幅的论文, 毫无疑问地, 于2026年, 在AI这个圈子里, 投下了一枚核弹。大厂费尽心思, 投入大量精力堆积算力所打造出来的推理壁垒, 在面对几百美金的 API 调用费用时, 脆弱得如同轻薄的纸张一般, 一触即破。关于AI蒸馏的「硅谷悬案」或许永远不会有对簿公堂的一天。但摆在桌上的首批物证已经足够让人看清水面下的暗流涌动。倘若 模型的「思考底牌」能够被以低廉价格提取, 甚至于被同行暗地里学习, 那么巨头们所引以为自豪的护城河, 恐怕就得重新去打个问号了。
返回列表