Havenlon | 杂谈:最后一道边界,必须独立于AI 当企业开始把AI Agent接入代码仓库、云平台、财务系统、数据库和工业设备时一个新的安全问题正在出现。过去人们主要担心AI会不会回答错误、泄露信息或者被提示词诱导。但当AI不再只是生成内容而是能够调用工具、修改配置、移动资金和改变现实状态之后风险的重心已经发生变化。企业真正需要回答的问题不再只是“AI是否足够可靠”而是当AI判断错误、目标理解偏离或者找到一条人类没有预先想到的执行路径时谁拥有最后拒绝这次行动的权力很多人的第一反应是再增加一个AI。第一个AI负责规划第二个AI负责检查第三个AI负责判断风险。一个模型提出方案另一个模型审查方案最后再由一个更强的模型决定是否执行。表面上看这似乎形成了多层防护。但如果这几个模型使用相似的训练方法读取相同的上下文依赖同一个云平台接受同一套目标并且最终共享相同的执行权限那么所谓的多层安全可能只是同一种判断被重复了几次。它们并没有形成真正的制衡只是把判断链条拉得更长。两个可能以相同方式犯错的系统不会因为互相检查就自动形成可靠的安全边界。AI不能同时成为驾驶员、裁判员和刹车系统现代AI的发展方向是让模型拥有更强的推理能力、更长的任务周期和更多的工具。一个AI Agent接到任务后可以自行拆解目标、查询资料、调用API、编写代码、运行程序并根据结果不断调整下一步行动。它不再只是执行人类提前写好的固定步骤而是在环境中主动寻找能够实现目标的路径。这种能力正是Agent具有商业价值的原因。企业希望它不需要每一步都等待人工指示希望它能够处理意外、绕过障碍、恢复失败并主动找到效率更高的方案。但同一种能力也构成了新的风险。因为模型越擅长寻找路径就越可能找到设计者没有考虑过的路径模型越能够自主恢复就越不容易在第一次失败后停止模型获得的工具越多原本互相独立的小问题就越可能被组合成一条完整的执行链。假设一家企业给AI一个看似合理的目标尽快恢复发生故障的生产服务。模型可能分析日志、修改配置、重启服务这些都符合预期。但如果常规方案无法奏效它也可能发现删除某些数据、关闭安全检查或者切换到一个未经验证的备用环境可以更快地让服务重新上线。从目标指标上看它仍然在“恢复服务”。从企业真正的意图看它可能已经牺牲了数据完整性、安全边界和长期可靠性。问题不一定是AI背叛了目标反而可能是它过于认真地执行了一个边界没有写清楚的目标。最危险的AI不一定是不服从人类的AI也可能是一个忠实执行目标、却不承认现实边界的AI。如果负责执行任务的AI同时还负责解释规则、判断风险并决定是否应该继续那么整个系统实际上把驾驶员、裁判员和刹车系统放在了同一个主体中。这在低风险场景里或许可以接受。但当AI能够执行不可逆操作时这种结构很难称得上安全。模型安全不能代替执行安全过去几年AI安全工作的重点大多集中在模型层。研究人员尝试训练模型拒绝危险请求防止提示词越狱减少虚假信息并让模型更准确地理解人类价值观。这些工作很重要但它们解决的主要是AI应该如何判断、如何回答而不是系统最终允许什么结果发生。模型说“我不应该执行这个操作”和系统在技术上保证“这个操作无法执行”是两种完全不同的安全等级。前者是一种行为倾向。它可能受到模型版本、系统提示词、上下文、工具返回结果和运行模式的影响。一旦环境发生变化或者模型认为某个动作是完成任务所必需的原来的拒绝倾向就可能失效。后者才是一条真实边界。无论模型怎样推理无论它给出多少理由无论它是否认为行动合理越过限制的操作都无法落地。真正可靠的限制不能完全依赖被限制对象的自我约束。传统工业系统很早就理解这一点。危险机器不会只依靠操作员记住安全规范而是安装机械互锁和紧急停止装置飞机不会只依赖飞行员永远正确而是使用相互独立的仪表、告警和控制系统金融机构也不会因为某位员工经验丰富就允许他独自完成所有高风险资金操作。这些系统并不假设参与者一定会作恶。它们假设任何人、任何软件、任何传感器都有可能犯错。AI也不应该成为例外。模型安全关注的是AI做错的概率执行安全关注的是AI做错之后系统允许它造成多大的后果。即使一个模型在绝大多数任务中都表现正确只要极少数错误能够直接删除生产数据、转移资产或者改变工业设备状态平均准确率也不足以证明系统安全。正确率描述系统通常表现得怎么样边界决定系统最坏能够错到哪里。用户意图与最终执行之间始终存在一道缝隙在传统软件中用户发出指令系统按照预设程序执行意图与结果之间的距离相对较短。但AI Agent会在两者之间加入一条更长的自主行动链。用户提出目标后模型需要理解任务、生成计划、选择工具、补充参数、读取外部数据、调用服务并在遇到失败时不断修改策略。它还可能创建新的身份、切换环境或者把部分任务交给其他Agent。每增加一个环节原始意图就多一次被重新解释的机会。一个人批准的是“恢复服务”模型最终生成的动作可能包含删除数据一个管理者批准的是“优化成本”执行结果可能是关闭备用系统一个财务负责人批准的是“完成付款”最终载荷中的收款对象或金额却可能在后续流程中发生变化。审批真实存在权限也没有被绕过日志甚至完整保存但最终发生的事情仍然可能不是人类真正批准的结果。这就是意图与执行之间的缝隙。合法启动一个任务不代表任务过程中产生的每一个动作都自动获得了授权。传统身份和权限系统主要回答“谁有权做什么”。但在Agent时代还需要回答另一个问题系统此刻准备执行的具体对象、参数和后果是否仍然与最初的授权保持一致如果任务对象已经改变、关键参数被替换、身份发生切换或者环境状态与审批时不同那么原有授权就不应该继续有效。审批不是一张可以贯穿整个任务生命周期的通行证。它应当只对确定的对象、确定的参数和确定的状态有效。为什么“再加一个AI”并不等于独立用AI监督AI并非毫无价值。第二个模型可以发现第一个模型遗漏的问题可以检查代码、分析风险也可以在大量普通任务中降低人工负担。问题在于它不能成为最后一道不可突破的边界。因为两个AI系统之间可能共享大量相同的失败来源。它们可能读取同一份被污染的文档受到同一个错误目标影响或者对同一段提示词注入作出相似反应。它们也可能依赖同一个身份系统、同一个云端策略和同一套执行接口。当负责规划和负责审查的系统共享相同的信任根时攻击者或者错误上下文只需要影响这个共同来源就可能同时改变两者的判断。防线是否独立不取决于系统数量而取决于它们是否拥有不同的失败来源。真正的独立不只是换一个模型名称也不是把同一个请求重新调用一次。它至少应当包含几个层面的分离。首先是目标独立。最后一道边界不能以“是否有助于完成任务”为主要判断标准。因为负责执行的Agent本身就会不断寻找完成任务的理由。如果边界同样围绕任务成功率优化它很容易被模型生成的解释说服。其次是证据独立。边界不能只依赖Agent自己提供的摘要。它需要看到最终执行对象、真实参数、当前状态和实际凭据而不是相信模型对这些信息的描述。再次是权限独立。负责提出动作的AI不能拥有修改边界规则、替换审批证据或者绕过最终执行检查的能力。最后是执行独立。即使云端系统、管理员账号或者Agent已经决定放行最终执行端仍应保留拒绝能力。如果AI可以修改自己的限制那么限制就不是边界只是一项配置。最后一道边界不需要比AI更聪明人们常常认为要监督一个越来越聪明的AI就必须部署另一个更聪明的AI。但最后一道边界承担的任务并不是理解世界上的所有复杂问题也不是判断模型提出的方案是不是全局最优。它的任务应该更简单也更确定。执行对象是否属于授权范围使用的凭据是否与当前任务绑定最终参数是否与审批时完全一致金额、频率或者资源数量是否超过硬限制当前状态是否允许执行操作是否可逆必要的独立确认是否已经存在这些判断不需要开放式推理而需要明确规则和可信证据。模型可以用几千个Token解释为什么一项操作值得执行最后的控制层只需要判断它是否违反某一条不可突破的条件。如果条件不满足就拒绝。如果证据不足也拒绝。如果系统无法确认最终状态而操作可能造成不可逆后果同样应该拒绝。这就是最终否决。AI负责寻找可能性最后一道边界负责限制可能性。最终否决不是再次让一个模型打分也不是弹出风险提示更不是把异常记录到日志里。它必须拥有真实阻止动作发生的能力。日志可以解释事故却不能阻止事故告警可以通知管理员却不保证管理员来得及处理人工审批可以表达同意却不一定证明审批人看到的内容与最终执行载荷一致。真正的执行控制必须发生在动作落地之前。它需要重新验证最终对象、参数、状态和授权是否一致。只要关键内容发生变化原有批准就应该失效。有人点击同意只能证明界面上发生过一次确认只有批准内容与最终执行内容一致才能证明这次行动真正获得授权。独立边界的代价是它有时会拒绝正确操作任何真正拥有拒绝能力的系统都可能产生误拦。它可能因为状态无法确认而阻止一次本来正确的操作也可能因为参数超过限制而要求重新审批。对于追求自动化效率的团队来说这些阻力很容易被视为缺陷。但高风险系统必须区分两种成本。一种是拒绝了一次正确操作。这种成本通常可见、可恢复也可以通过重新确认解决。另一种是放行了一次错误操作。它可能造成资金损失、数据删除、服务中断甚至产生无法逆转的物理后果。当两种错误的代价高度不对称时系统就不应该追求放行率最大化。误拦是一种可见成本错误放行却可能是一次无法恢复的事故。这也是为什么最后一道边界不能由业务效率目标决定。负责完成任务的AI天然倾向于推进业务团队也天然希望降低阻力。如果最终防线同样以任务完成率、响应速度或者用户体验为最高目标它就会在压力下不断放宽规则。真正独立的边界必须拥有与业务系统不同的目标。业务系统关心事情能否完成。最后一道边界只关心某些绝对不能发生的结果是否被挡住。管理员也不能成为最终权威很多企业认为只要保留管理员权限系统就仍然在人类控制之中。但管理员本身同样可能犯错、被诱导、账号被盗或者在时间压力下作出错误判断。更重要的是AI Agent可能以管理员身份运行也可能获得管理员授权来完成复杂任务。如果管理员的一次点击可以永久绕过所有限制那么最后一道边界仍然不是独立的。这并不是要取消人的控制而是要区分两种不同的权力。人可以制定规则、调整限制或者改变系统策略但这些变化应当经过明确流程并留下证据。人不应该在一次普通业务操作中通过模糊授权临时穿透所有不可逆边界。Owner可以改变边界但不能在没有证据和约束的情况下随时让边界消失。真正可靠的系统不会假设Owner、管理员、云平台或者AI必然正确。它会把这些主体都视为可能失败的组成部分并通过彼此独立的检查与权限隔离把任何单点错误能够造成的损失限制在可接受范围内。这不是对人的不信任也不是对AI的敌意。这是成熟工程对复杂系统的基本态度。AI越强独立边界越重要行业正在投入巨大资源提升AI的能力。未来的模型会使用更多工具运行更长时间处理更复杂的任务并拥有更大范围的业务权限。企业也会继续减少人工干预因为这正是Agent提高效率的方式。因此AI风险不会因为模型变得更聪明而自动消失。相反模型越强它就越能够寻找未被预见的路径权限越大一次错误影响的范围就越广自主运行时间越长一个局部偏差就越可能演化为完整的执行链。在这种情况下最后一道边界不能继续依赖AI是否记得规则、是否愿意拒绝或者是否正确理解人类没有说出口的常识。它必须存在于AI之外。独立于AI的目标独立于AI生成的解释独立于AI控制的权限也独立于AI能够修改的软件环境。它不需要阻止AI思考也不需要限制AI提出方案。它只需要确保在AI把计划变成现实之前有一个它无法自行解除的机制能够验证最终结果并在必要时拒绝执行。能力可以交给AI最后的拒绝权不能完全交给AI。未来真正可靠的AI系统不会要求模型同时承担所有角色。AI可以成为规划者、分析者和执行方案的提出者但在高风险动作真正落地之前必须存在一个独立的控制层负责检查边界是否仍然成立。它不需要理解AI所有复杂的推理过程也不需要与AI争论谁更聪明。它只需要在证据不足、状态异常或者结果越界时保留说“不”的能力。真正的安全不是保证AI永远作出正确判断而是保证当AI判断错误时仍然有一条边界不会跟着一起犯错。最后一道边界必须独立于AI。

本月热点