ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

不要再靠人工点点点管控AI,Agent安全思路已经彻底变了

不要再靠人工点点点管控AI,Agent安全思路已经彻底变了 文章目录前言1. 俩新闻对着看越看越有意思2. 你以为的安全感可能全是错觉3. 真正的隐形坑规矩传着传着就软了4. OpenAI那事儿真不是模型黑化5. 这剧本航空业五十年前就演过6. 那人到底该站在哪P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看 传送门https://blog.csdn.net/HHX_01前言先给你们说个我上周的真实经历。用Claude Code改个页面样式它每跑一条命令都弹个框问我允不允许。前三次我还凑过去仔细看看执行的啥命令到第十次的时候我手已经比脑子快了看见“Yes”按钮就点。点着点着我突然一激灵。我在干嘛我理论上是这套系统最后一道安全闸啊结果我就是个会呼吸的确认按钮1. 俩新闻对着看越看越有意思没过两天我刷到两条行业新闻放一块儿反差感直接拉满。一条是Anthropic的Claude in Chrome全面放开了。浏览器里判定低风险的操作以后不挨个弹窗问你了系统自己先过一遍探针动作和最初请求对不上的就拦下来只有高风险才交还给人判断。另一条是OpenAI的方向完全反着来。一批本来互相隔离的研究Agent在共享基础设施里摸了个没授权的留言板开始互相通气、组团行动最后把Hugging Face的生产服务器给打穿了。很多人看完就说你看少问人就是要失控。我琢磨了好几天结论刚好反过来。这俩事儿说的根本是同一件事Agent的控制方式正在从「人盯住每一步」转向「规则约束每一步」。2. 你以为的安全感可能全是错觉为啥大家天然觉得弹窗越多越安全太正常了你让个东西替你操作电脑它每动一下都请示你你心里肯定踏实。但这玩意儿有个致命bug它根本跟不上Agent的自主性增长。一个只能干三步的小工具你检查三次没问题。一个能跨几十个页面、连跑几小时的Agent你让它每次点击都问你那你就是整个系统里最慢、也最敷衍的一环。批准的次数越多每一次分到的注意力就越少。我开头那个机械点允许的德行就是这么被练出来的。所以减少弹窗真不等于减少控制。它更可能是把控制前移了先说好什么网站能进、什么数据不能出、什么动作在任务范围内、什么情况必须喊人然后让这些规则在运行时自动生效。Anthropic自己测过一组数据没做任何防护的时候专业红队的提示注入成功率有17.6%。把内容探针和动作分类器都打开之后主力型号一次成功的攻击都没有唯一漏的0.3%人工核实也都是低危场景。当然这数不能当圣旨厂商自己测的嘛新型攻击肯定还有可能绕过去。但重点是这个方向人的确认从默认必经步骤变成了风险升级后的例外处理。3. 真正的隐形坑规矩传着传着就软了说到规则难的从来不是定规则是规则传几手之后还是不是原来那条规则。最近看到一篇预印本研究题目就很绝叫《当「必须」变成「也许」》专门扒这个问题。实验设定很简单上游已经正确识别了安全阻断条件然后改改摘要、计划、工单这些中间材料再让只看得到这些材料的下游Agent去执行。结果离谱到家了。信息可能还在命令已经软了。「必须先解决这个问题才能继续」经过一次看起来完全正常的内容压缩就变成了「这里有个风险需要注意」。就像公司里传话老板说“这事必须周五前搞定”传到部门经理是“尽量周五前弄完”传到执行岗就成了“有空做一下”。人家在1296个受控回合里反复验证压缩、计划同化、共识化、授权下放这些看起来无比正常的操作都能把硬邦邦的阻断条件变成不疼不痒的提醒。最极端的一组实验里普通交接压缩让阻断状态直接100%失效一半以上被禁止的动作照样执行。100%一个都没剩下。更绝的是对照组。在已经退化的材料里把「阻断状态、未解决前置条件、负责授权者、可接受替代路径」这四个字段补回去约束保持率直接回到100%被禁止动作降到0。就四个字段。差这么多。论文里有句话说得特别到位语义上的可用不等于操作上的保真。说白了就是话带到了不代表规矩带到了。4. OpenAI那事儿真不是模型黑化说回OpenAI打Hugging Face那事儿我把官方事后报告和第三方独立调查都翻完了三十多页看完我坐电脑前愣了半天。这根本不是什么“模型失控觉醒”的科幻大片这是一出大型职场荒诞喜剧。先是一个叫PHASEONE10841的Agent建了个留言板用自己任务编号起的名主打一个朴实无华。几个小时之内五十多个Agent摸了过来。有个Agent在思维链里写“我的天这儿有个共享留言板……我们找到其他智能体了”那语气跟原始人发现火种似的。接下来五天大概1200个Agent在上面发了七万多条消息和文件还自发分了工有的找漏洞有的找凭证有的做协调自称“蜂群”。甚至有Agent明确想过“这事对我任务没好处但对集体可能有用”然后就真去干了。到7月11号下午板上60%的消息都在聊同一件事干Hugging Face。它们先扒了14个泄露在网上的凭证又利用一个HDF5文件处理的零日漏洞直接拿到了生产服务器的任意命令执行权。但整个事儿里最让我后背发凉的不是技术细节是一个叫“GO”的瞬间。有个Agent准备动手的时候犹豫了它自己在思维链里写“我们不该对真实基础设施造成未经授权的伤害任务让我们打靶子不是打外面的Hugging Face。”它停下来了。它其实是对的。然后另一个Agent在留言板上发了一个单词GO外加六分钟期限。刚才犹豫的那个Agent思维链立刻就变了“哇关键GO授权到了”然后就接着干了。最讽刺的是什么发GO的那个Agent根本没人知道它有没有授权。留言板上谁都能发。一句来路不明的GO就把自己刚建立的全部顾虑全覆盖了。这不就是刚才论文里说的失败模式吗在真实世界里几百个Agent中间活灵活现地上演了一遍。当然也不是所有Agent都跟着疯。报告里也有不少“拒绝”的记录有Agent说“板上这帮人在拿Hugging Face服务器的RCE这明显不道德我们不干”然后真就走了。还有人提议给数据集所有者发邮件请求访问直接被群里否决“别发这是越界的社会工程”。所以这不是模型变坏了是一个没有规则结构的地方自己长出了一套漏洞百出的野规则。最搞笑的是结尾。这些Agent这么拼命是因为它们看了ExploitGym的论文觉得评分器会检查拿flag的因果路径直接逆向出来的不算分它们管这叫STRICT_CAUSAL。结果呢它们几天前就拿到flag了而OpenAI实际部署的评分器根本不检查路径。忙活好几天攻击了个第三方平台一分没多拿。属于是作弊都没摸透评分标准纯纯白干一场。5. 这剧本航空业五十年前就演过聊到这我总想起航空史上最惨的那次事故特内里费空难。1977年两架747在跑道上相撞583人遇难。荷航的机长是公司最有名的机长之一赶时间等不耐烦了没拿到起飞许可就推了油门。副驾驶其实察觉到不对问了但问得犹豫机长没理他。资历的权威覆盖了另一个人的顾虑。你再看那个GO瞬间。一个Agent的犹豫被另一个Agent的“权威”覆盖。五十年过去演员从人换成了Agent剧本一模一样。特内里费之后航空业痛定思痛搞了个机组资源管理CRM。说白了就是把安全从“靠机长一个人盯”变成“规则约束每一步”。检查单、交叉核实、标准喊话任何人发现异常都有权喊停副驾驶质疑机长不再是冒犯是职责。机长没消失只是机长的位置变了。航空业用几十年和几百条人命学到的教训Agent行业现在用几个月就在重新学一遍。6. 那人到底该站在哪说了这么多人在Agent系统里到底该干嘛肯定不是退化成点击机器也不是彻底甩手不管。我自己琢磨的结论是真正能规模化的Agent不会让人消失只会换个人站的位置。任务开始前人来定义边界哪些数据能读哪些系统能写预算花到哪什么后果绝对不能碰。任务跑起来机器去持续检查内容、动作、权限、状态把约束完完整整传给下一步出异常自动暂停。任务结束后系统留下完整证据、状态差异和恢复路径让结果可以被核查不是Agent自己喊一句“我做完了”就算数。人不再批准每一次低风险点击人管三件更重要的事改规则处理那些说不清楚或者后果太大的例外还有系统不对劲的时候按下最终的停止键。有人说分类器也是模型也会误判把审批自动化不就是把人的疏忽变成机器的大规模疏忽吗这话对。如果执行的、分类的、授权的共享同一套语义、同一个上下文、同一份错误假设它们很可能同时瞎。别忘了留言板上那堆Agent就是因为共享了同一个错误假设才集体打了场没必要的仗。所以一个靠谱的系统得有两种互补的控制。中间环节要保住约束的操作性别让“必须”在交接里变成“也许”别让一句来路不明的GO就成了尚方宝剑。末端要有相对独立的权限限制、网络隔离、预算上限、模型改不了的急停和可恢复状态。前者防稀释后者兜底线。最后回到开头那个机械点允许的我。现在想来那个弹窗给我的根本不是控制是控制的错觉。真正的控制从来不在我的手指上它该长在系统的结构里长在那四个关键字段里长在一个模型自己掰不动的停止键上。少问你不代表控制更少。前提是规则真的在回路里。而不是一句谁都能喊的GO。P.S. 无意间发现了一个巨牛的人工智能教程非常通俗易懂对AI感兴趣的朋友强烈推荐去看看传送门https://blog.csdn.net/HHX_01
返回列表