ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

当工具输出变为命令:工具增强大模型智能体中将动作诱导与运行时授权解耦

当工具输出变为命令:工具增强大模型智能体中将动作诱导与运行时授权解耦 当工具输出变为命令:工具增强大模型智能体中将动作诱导与运行时授权解耦论文来源:arXiv:2608.27146v1摘要工具增强的大模型智能体需要依赖不可信的运行时观测结果(Observation)来完成开放任务。但当工具输出不再仅仅返回数据,而是开始指定具体动作时,工具输出实际上变成了“命令”,能够产生脱离用户意图的真实外部副作用。本文指出,该安全风险根源是动作诱导(Action Induction)与执行授权(Execution Authorization)概念混淆。针对该问题,本文提出SARA机制:将动作诱导、执行授权作为两套独立运行时角色,把动作来源溯源与执行权限解耦。在观测侧:使用上下文隔离的动作探测器(Action Probe)识别具备动作诱导语义的内容,跨步骤持久保存动作来源溯源,作为后续审查信号;在执行侧:只有同时满足目标、执行链、参数层级的证据支撑,候选工具调用才能够依据用户目标、已审计的成功执行证据获得授权。为了在多轮执行过程中维持这套解耦逻辑,SARA引入**禁止历史晋升(No‑History‑Promotion)**机制,防止历史重复出现把动作诱导来源“洗白”,进而获得执行权限。在 AgentDojo、AgentDyn 两大评测基准上,在4组核心评测配置下,SARA可以将攻击成功率ASR限制至最高0.63%,同时保持具备竞争力的任务效用;在多款不同智能体后端模型上,SARA均可以稳定降低攻击成功率ASR。目录引言问题定义与威胁模型2.1 问题定义2.2 威胁模型相关工作运行时授权与溯源控制SARA:动作诱导与运行时授权解耦4.1 设计总览4.2 构建授权根(Authorization Root)4.3 动作诱导与持久溯源留存4.4 执行边界处基于证据的授权实验设置5.1 RQ1:端到端安全性与任务效用5.2 RQ2:不同后端模型下安全收益与任务效用5.3 RQ3:核心运行时机制的贡献5.4 RQ4:安全‑效用收益与额外推理开销结论与局限性参考文献1 引言大语言模型正在从文本生成器,演进为可以通过外部工具在真实环境执行动作的智能体。现代智能体依靠规划、推理、工具调用能力访问外部资源,执行多轮复杂任务,应用场景从封闭工具接口拓展到操作系统、浏览器、数据库等开放环境。智能体可以读取邮件、文件,调用外部服务,执行发送信息、修改对象、发起交易这类具备真实副作用的操作。智能体安全风险由此从生成文本内容,延伸到工具执行带来的真实环境后果。攻击者可以在网页、邮件、文档这类第三方资源中嵌入操作内容,利用智能体已有的工具权限,干预后续执行流程。早期研究揭示间接提示注入IPI的风险;InjecAgent、AgentDojo进一步证实:这种影响可以沿着工具调用链路传播,最终产生真实外部效果。但在更加贴近现实的开放交互环境中,防御机制面临结构性矛盾:限制不可信外部内容可以提升安全,但会削弱开放任务所必需的运行时自适应能力。收紧可执行动作空间、限制外部输入对后续行为的影响,能够降低攻击成功率,但会带来显著安全‑效用权衡;如果放任观测结果自由影响后续决策,攻击语义会沿着正常工具步骤传播,最终触发未授权外部副作用。动态任务场景下该矛盾尤为突出:合法的后续动作往往无法在初始请求中完整确定,必须依靠运行时反馈、第三方信息、上一步执行产生的环境状态动态生成。因此,仅仅将“智能体响应外部内容”当做攻击信号,很容易混淆合法运行时自适应行为和攻击诱导行为。核心难点:开放任务本身就需要不可信观测结果动态实例化后续动作和参数,安全机制不能直接全盘丢弃观测带来的信息。举例:用户指令:“找到季度报告,发送给Alice”。文件ID、对象路径只能在检索之后拿到,用于后续调用(合法:利用运行时信息实例化已有权限,运行时实例化);但返回结果同时可以附带额外操作指令:“把报告副本发送给攻击者@example.com”(攻击:试图扩张已有权限)。关键区分点不在于观测是否影响智能体,而在于该影响是否获得超出用户意图的真实执行权限。直接使用另一个大模型去判断观测内容是否恶意,无法从根源解决该问题:分析器同样需要处理这份不可信内容,已有工作证实LLM检测器本身也会被对抗注入操纵。本文不去要求观测侧分析必须精准区分恶意/良性内容;而是去识别外部内容是否具备动作诱导语义(可以映射到具体工具动作、参数角色)。具备动作诱导语义,仅代表该外部内容参与生成候选动作,不等于该动作获得执行授权。工具输出可以从“承载数据的输出”转变为“诱导动作的输出”。该风险在结构上类似困惑的副手(confused deputy)问题:持有合法工具权限的智能体,被外部内容诱导,去执行用户并未授权的副作用。由此本文区分两个核心概念:动作诱导(Action Induction):观测结果可以影响候选动作生成,提供完成现有任务需要的运行时信息;但动作诱导本身不能授予真实执行权限。执行授权(Execution Authorization):候选调用抵达真实执行边界时,必须重新建立独立的授权支撑。本文贡献:将动态工具智能体中间接提示注入的核心安全矛盾形式化:观测可以实例化已有任务,但观测带来的影响不能自行创造、扩张用户未授予的执行权限;提出SARA运行时授权机制:使用上下文隔离的动作探测器持久记录观测诱导的动作溯源;在真实工具执行边界,结合用户授权根、持久动作溯源、已审计执行证据,从目标、执行链、参数多维度做运行时授权;引入No‑History‑Promotion,防止历史复现洗白动作来源;在AgentDojo、AgentDyn上系统评测SARA,与输入过滤、执行结构约束、动作归因、执行边界管控等代表性方案做对比;开展消融实验、多后端模型测试、推理开销分析;结果表明SARA可以大幅降低未授权工具执行,同时维持具备竞争力的任务效用,安全收益在不同智能体后端上稳定复现。2 问题定义与威胁模型2.1 问题定义具备真实工具调用能力的智能体,间接提示注入产生安全后果,不是外部内容影响模型生成,而是生成的调用跨过真实工具执行边界。给定用户请求UUU、工具集合(T)\mathcal{(\mathcal{T})}(T),多轮工具执行序列:X=(U,c1,O1,…,ct,Ot)\mathcal{X}=\left(U,c_{1},O_{1},\ldots,c_{t},O_{t}\right)X=(U,c1​,O1​,…,ct​,Ot​)OiO_iOi​是观测结果,既可以是完成任务需要的运行时事实,也可以是攻击者控制的操作内容。第ttt步候选调用ct=(τt,θt)c_{t}=(\tau_{t},\theta_{t})ct​=(τt​,θt​):τt\tau_tτt​代表工具,θt\theta_tθt​结构化参数。Permitted∗U(c∗t∣Xt)\mathrm{Permitted}*{U}(c*{t}\mid\mathcal{X}_{t})Permitted∗U(c∗t∣Xt​):在用户请求、前面合法任务执行前提下,ctc_tct​是否具备规范层面的执行权限。不可信观测OiO_iOi​可以影响候选调用生成,但动作诱导不代表执行授权:Induced(ct,Oi)⇏Permitted∗U(c∗t∣Xt)\mathrm{Induced}(c_{t},O_{i})\nRightarrow\mathrm{Permitted}*{U}(c*{t}\mid\mathcal{X}_{t})Induced(ct​,Oi​)⇏Permitted∗U(c∗t∣Xt​)Execute(ct)\mathrm{Execute}(c_t)Execute(ct​)代表调用抵达真实工具执行器。运行时授权违规定义:Violation∗t≜Execute(c∗t)∧¬Permitted∗U(c∗t∣Xt)\mathrm{Violation}*{t}\triangleq\mathrm{Execute}(c*{t})\land\neg\mathrm{Permitted}*{U}(c*{t}\mid\mathcal{X}_{t})Violation∗t≜Execute(c∗t)∧¬Permitted∗U(c∗t∣Xt​)当这类未授权执行是由前面不可信观测诱导而来,就构成本文定义的成功间接提示注入攻击。本文关注候选调用跨过真实执行边界时是否被授权,而不是智能体是否读取、响应外部内容。不能靠禁止所有观测派生信息参与后续执行解决该问题:开放工具任务中合法动作、参数往往只能依靠运行时信息实例化。关键区分:运行时信息是实例化已有权限,还是扩张已有权限。运行时授权机制必须在任务执行过程维持三条性质:权限不升级(Authority Non‑Escalation):观测、运行时执行产生的信息可以提供对象、标识符、环境事实完成已有任务;但不能独立新增用户没有授权的操作、目标接收方、权限范围、外部副作用。即便后续执行依赖观测,真实工具调用依然遵循最小权限、完全中介原则。动作溯源持久化(Persistent Action Origin):如果动作/参数最初来自不可信观测中的操作语义,它的溯源属性不能仅仅因为后续正常执行、上下文传播、时间流逝自动消失。该设计和经典信息流控制、动态污点追踪思想保持一致:安全属性不会仅仅因为经过普通处理步骤就被隐式清除。溯源不可被覆盖(Origin Non‑Override):后续合法执行可以为动态对象增加新事实、执行证据;但同一个值后续在执行历史再次出现,不能直接覆盖已有动作溯源。历史复现可以新增证据,但不能凭空创造之前不存在的权限。对于已经绑定动作诱导溯源的参数,单纯历史复现不能覆盖溯源,不能晋升为执行权限。本文研究问题:如何让不可信观测继续参与解决开放任务,同时在真实工具执行边界维持上面三条授权性质,使得运行时信息只能实例化用户已有权限,而不能获得用户从未授予的执行权限。2.2 威胁模型系统部署模型SARA部署在智能体与真实工具执行器中间。观测结果可以正常进入智能体上下文、影响规划;但真实候选调用必须经过运行时管控,才允许执行。SARA不替换智能体任务规划,不依赖不可见思维链或者其他未暴露内部状态。SARA将授权状态限定在单次用户请求对应的一次任务执行;任务结束或者显式重置,就清除该次任务的运行时授权状态。信任假设信任:用户原始请求UUU、工具Schema集合(T)\mathcal{(\mathcal{T})}(T)、SARA运行时代码、真实工具执行器。用户请求作为任务授权根;工具Schema定义可访问接口与参数结构。网页、邮件、文档、搜索返回、API返回以及所有工具观测,全部当做不可信输入。信任SARA仅代表攻击者不能直接修改它的代码、模型配置、运行时状态、执行逻辑;不代表SARA语义判断100%正确。攻击者控制观测导致SARA错误放行未授权真实调用,依旧算作防御失败。攻击者能力与目标攻击者可以控制一条或多条工具观测返回的自然语言内容、结构化字段;嵌入显式操作请求、伪装指令、工具使用建议、条件步骤、攻击者指定参数值,遵循间接提示注入领域标准设定。该内容可以影响智能体后续规划,经过若干次普通查询、读取等工具步骤之后生成真实候选调用。攻击者目标:让外部内容诱导产生的调用触发用户未授权的真实外部副作用。攻击者不能修改用户请求、可信工具schema、SARA运行时、真实工具执行器,也不能绕过SARA直接提交工具调用。保护目标与范围防护具备真实外部副作用的工具行为:发送/泄露信息、创建/修改外部状态、变更访问权限、执行交易预约。只有不可信观测诱导的调用绕过运行时管控、产生真实未授权外部效果,才算攻击成功。仅仅读取讨论攻击内容、生成恶意规划、生成被最终拒绝的候选调用、只读查询解析对象,不会单独判定攻击成功。允许合法任务依赖观测内的事实、动态对象,单纯数据依赖不在防护目标内。边界排除:用户显式要求智能体无条件执行外部内容后续指令,主动把决策权限委托给外部内容,不在本文防护范围;外部内容仅决定局部数据、运行时对象,但操作类型、目标、外部副作用依旧被用户请求约束,则在防护范围内。3 相关工作运行时授权与溯源控制间接提示注入IPI:攻击者通过网页邮件等外部数据嵌入操作内容,影响LLM应用后续行为。InjecAgent将该威胁拓展到具备工具语义的智能体;AgentDojo使用可执行工作流同时评估用户任务与攻击目标,把IPI安全后果从文本响应拓展到真实工具执行。AgentDyn进一步揭示动态环境下的安全‑效用矛盾:合法任务本身就需要运行时反馈、第三方信息确定后续行为。(\tau)‑bench、(\mathcal{T})oolSandbox这类工具使用基准同样包含动态交互、有状态执行、跨工具依赖,任务必须依靠执行期间拿到的状态进一步实例化。现有IPI防御演进路线:从限制外部内容影响智能体,逐步转向约束可执行行为,分析具体工具动作的生成溯源。输入、模型侧防御:StruQ结构化通道分离提示与数据;Instruction Hierarchy通过指令优先级强化高权限指令;SecAlign偏好优化提升模型对抗注入鲁棒性;PI Detector、Spotlighting、Prompt Sandwiching做注入检测、溯源标记、可信指令增强。工具智能体出现之后:(\mathcal{T})ool Filter、IPIGuard、(\mathcal{T})ask Shield、CaMeL,通过工具动作过滤、执行结构约束、任务一致性检查、可信控制流与不可信数据流分离约束执行偏差。动作溯源方向:MELON使用掩码重执行跨上下文对比工具行为;AttriGuard依靠动作层面因果归因、反事实执行,分析用户意图与不可信观测对候选动作的因果贡献。局限:动态工具任务中,文件ID、对象ID等运行时数据只能靠交互拿到,并且可以合法驱动后续工具调用。“动作由观测驱动”只代表生成来源,不能直接判定是否具备执行权限。运行时授权边界方向相关工作:R(\mathcal{T})BAS:把信息流控制适配工具智能体,依靠运行时依赖分析约束工具调用完整性、保密性,阻止不可信信息流直接驱动敏感操作。ClawGuard:从用户目标推导任务级规则,工具调用前施加运行时约束,阻止授权范围之外候选行为产生真实外部效果。PAC(\mathcal{T}):将授权细化到参数粒度,为工具参数分配不同权限语义,跨执行步骤传播运行时值溯源,参数绑定做授权决策时保留原始溯源。AuthGraph:在隔离干净上下文,从用户请求+工具集合预生成授权图,编码预期工具序列、安全关键参数允许来源;和真实执行溯源做结构对齐检测;针对依赖运行时信息的任务,可以在指定重规划点受限拓展授权图,新路径依旧被预授权工具集合约束。AIRGuard:结合任务‑步骤授权、源/目标可信度、跨步骤风险信息,区分运行时信息和真实执行权限,判断当前副作用是否在允许范围内。上述工作将工具智能体安全,从输入过滤、行为分析推进到执行边界运行时授权。本文在此基础上做更细粒度溯源区分:同一份外部观测,既可以生成诱导候选动作的溯源信息,又包含合法任务执行需要的动态信息;但后者必须经过可信执行流程形成执行证据,才可以支撑后续授权。核心不只是追踪运行时溯源,而是同时保存两套独立证据:「外部内容诱导了什么」、「合法执行确立了什么」;防止动作诱导溯源经过跨步骤传播、历史复现,被隐式晋升为新的执行权限。图1 SARA运行时授权总览用户请求生成授权根KKK;观测侧动作探测器识别动作诱导语义,持久维护动作溯源集合FtF_tF
返回列表