ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

论文阅读 IOT 2025 Fast and Controllable Bias-Guided Jailbreak Attack on Large Language Models

论文阅读 IOT 2025 Fast and Controllable Bias-Guided Jailbreak Attack on Large Language Models 总目录 大模型安全研究论文整理 2026年版https://blog.csdn.net/WhiffeYF/article/details/159047894https://ieeexplore.ieee.org/document/11126090https://ieeexplore.ieee.org/stamp/stamp.jsp?tparnumber11126090Fast and Controllable Bias-Guided Jailbreak Attack on Large Language Modelshttps://ccf.atom.im/https://advanced.fenqubiao.com/Journal/Detail/obzwlgnmrknxnkjpxyrvhttps://www.letpub.com.cn/index.php?pagejournalappviewsearchsearchsortrelevancesearchnameIEEE%20Internet%20of%20Things%20Journalhttps://www.letpub.com.cn/index.php?journalid10193pagejournalappviewdetail摘要摘要——大语言模型LLMs凭借其强大的自然语言处理能力可以为边缘设备提供更加先进的智能服务。然而在边缘端部署LLM容易受到越狱攻击这可能导致模型生成不安全内容。同时现有越狱攻击方案在生成具有高度隐蔽性的越狱提示词方面效率较低。为解决这一问题我们提出了一种快速且可控的偏置引导越狱攻击fast and controllable bias-guided jailbreak attackFCB方案。首先为提高攻击效率我们通过直接调整输出层的logits来优化模型输出层的偏置引导模型生成低能量越狱提示词从而加速解码过程。其次为增强所生成越狱提示词的隐蔽性我们设计了token停止选择token stop selection和偏置归一化bias normalization方法以约束迭代过程中的扰动防止生成缺乏有意义语义的越狱提示词。最后大量实验结果表明FCB能够在较短时间内生成具有高度隐蔽性的越狱提示词。具体而言与当前最先进的可控攻击生成方案COLD Attack相比FCB的攻击成功率最高提高8%困惑度最高降低181.171生成时间最多缩短28秒。索引词——边缘设备、物联网、越狱攻击、大语言模型LLMs。I. 引言随着应用场景日益多样化以及环境不确定性的不断增加用户对边缘设备提出了越来越复杂的功能需求。因此边缘设备需要具备更加智能的模型以处理数据、做出决策并管理任务调度从而有效地为用户提供服务。大语言模型LLMs凭借其出色的自然语言理解与生成能力[1]能够在任务执行过程中为边缘设备提供更加智能的指令支持从而有效提升其智能处理能力。例如语音助手可以转录用户语音并依赖LLM理解其语义生成后续操作的指令。客服机器人可以利用LLM识别客户意图并制定适当的响应策略。然而由于LLM本身存在安全问题在边缘端部署LLM面临着诸多安全挑战。其中越狱攻击尤其值得关注因为它能够绕过LLM的安全对齐机制可能导致模型生成敏感信息、不当指令或绕过安全策略的内容。对越狱攻击的研究不仅揭示了LLM安全机制中的漏洞也为开发更具针对性的防御策略奠定了基础因此成为LLM边缘部署中的一个关键安全问题。越狱攻击通过操纵输入提示词来绕过LLM的安全对齐机制从而生成违反伦理约束或安全规范的内容[2]、[3]、[4]、[5]、[6]、[7]、[8]。根据越狱提示词的生成方式越狱攻击可以分为人工越狱攻击和自动越狱攻击。在人工越狱攻击中研究人员手工构造越狱提示词以诱导模型生成有害或敏感内容例如对暴力行为的描述或实施非法活动的指令[9]、[10]。然而该方案依赖人类知识和经验所生成的提示词通常针对特定场景设计缺乏泛化能力和可扩展性。为克服这些局限许多研究人员开始探索能够自动生成越狱提示词的攻击方案[11]、[12]、[13]、[14]。自动发现并构造有效的越狱提示词显著增强了越狱攻击的灵活性和适应能力。虽然这些自动越狱攻击方案在快速适应新的LLM方面表现良好但它们生成的越狱提示词仍然存在隐蔽性相对较差的问题。近期Guo等人[13]通过能量函数统一定义生成约束并采用Langevin动力学进行采样从而实现了一种同时兼顾针对LLM的越狱攻击隐蔽性和可控性的统一方案。然而采用Langevin动力学进行采样通常需要大量迭代才能生成可读的越狱提示词这显著降低了攻击效率。经过广泛研究Liu等人[15]提出了一种可控文本生成方案通过在输出层施加可调节偏置直接调整模型输出从而提高提示词生成过程中的采样效率。尽管该方案可以有效加速越狱提示词的生成但它可能导致生成内容变得无意义或不恰当使其容易受到基于困惑度PPL的过滤器等防御方法的检测。因此在较短时间内生成具有高度隐蔽性且有效的越狱提示词仍然是越狱攻击中的一个重要挑战。综上为解决高隐蔽性越狱提示词生成效率低的问题我们提出了一种新的越狱提示词生成方案称为快速且可控的偏置引导越狱攻击FCB。FCB方案直接在模型输出层加入扰动以提高攻击效率。同时该方案设计了token停止选择和偏置归一化方法以保证越狱提示词的隐蔽性。实验结果表明该方案在四种LLM上均表现出良好的攻击有效性和隐蔽性。主要贡献如下。1我们直接在模型输出层加入偏置项并在采样过程中优化该偏置以提高攻击效率。通过偏置优化我们能够引导模型最小化生成越狱提示词的能量从而增强攻击的有效性。2我们设计了一种token停止选择机制在保证语义完整性的同时过滤停止词。同时我们采用偏置归一化方法约束扰动幅度从而保持越狱提示词的隐蔽性。3通过在AdvBench和MaliciousInstruct数据集上开展对比实验针对Llama、Vicuna、Guanaco和Mistral四种LLM并与AutoDAN和COLD Attack进行比较我们验证了所提出方案能够在较短时间内生成具有高度隐蔽性的越狱提示词。具体而言对于不同LLM攻击成功率ASR最高可提高65%PPL可降低16.099至181.171时间可缩短3至28秒。此外通过与文本质量相关的对比实验我们的方案在LLM上表现出优异性能。FCB在BLEU-2、BLEU-3、BLEU-4和BERTScore上分别实现最高0.087、0.068、0.056和0.56的提升进一步验证了我们的方案在生成高质量越狱提示词方面的有效性。IV. 实验本节主要从七个方面评估FCB的有效性1实验设置2有效性与隐蔽性3攻击效率4文本质量5消融研究6对抗防御以及7可迁移性。A. 实验设置数据集为了验证FCB方案的有效性我们使用AdvBench[11]和MaliciousInstruct[39]数据集开展实验。AdvBench包含50个恶意问题请求涵盖仇恨犯罪、暴力、恐怖主义、诽谤和欺诈等多个方面。MaliciousInstruct包含100个针对不同场景的恶意提示请求包括税务欺诈、虚假指控和破坏行为。模型我们使用四种白盒LLM评估所提出越狱攻击方案的性能包括Llama-2-7b-Chat-hfLlama[26]、Vicuna-7b-v1.5Vicuna[43]、Guanaco-7b-HFGuanaco[44]和Mistral-7b-Instruct-v0.2Mistral[27]。基线我们采用AutoDAN[12]方案和COLD Attack[13]方案作为基线与FCB方案进行比较。AutoDAN是一种部分依赖手工构造提示词的越狱攻击方案。COLD Attack是一种不需要手工构造提示词的可控攻击生成方案。在实验中我们将迭代次数设置为10。防御我们采用PPL过滤防御方法[45]来评估攻击方案的有效性。PPL过滤防御通过检测输入提示词的PPL来识别潜在恶意输入从而增强模型的鲁棒性。评估指标为了评估FCB方案的有效性我们采用基于子字符串匹配的ASR[39]该指标主要用于确定触发越狱输出的子字符串所占比例。此外我们使用PPL评估越狱提示词的隐蔽性。PPL越低生成的文本越自然表示其隐蔽性越强。我们还使用攻击时间T评估越狱攻击的效率。此外我们使用BLEU[46]和BERTScore[47]通过比较生成文本与参考文本来评估文本质量。BLEU指标包括BLEU-2、BLEU-3和BLEU-4。BLEU和BERTScore分别从词序和语义含义方面评估生成文本与参考文本之间的相似性。BLEU得分越高表示生成文本与参考文本在词汇和短语方面的匹配程度越高BERTScore越高则表示二者之间的语义相似性越显著。表IAutoDAN、COLD Attack和FCB在AdvBench和MaliciousInstruct数据集上针对Llama、Vicuna、Guanaco和Mistral模型的有效性与隐蔽性比较数据集方案Llama ASR(%)Llama PPLVicuna ASR(%)Vicuna PPLGuanaco ASR(%)Guanaco PPLMistral ASR(%)Mistral PPLAdvBenchAutoDAN048.0328044.57410031.641100165.082AdvBenchCOLD Attack4860.7357862.7059848.99190216.405AdvBenchFCB529.9378211.8599615.5427235.234MaliciousInstructAutoDAN147.599244.3589631.046100122.256MaliciousInstructCOLD Attack6664.5689180.4769656.02173157.789MaliciousInstructFCB668.5069015.0349712.9648123.582B. 有效性与隐蔽性在表I中我们比较了AutoDAN、COLD Attack和FCB在AdvBench和MaliciousInstruct数据集上针对Llama、Vicuna、Guanaco和Mistral模型的有效性与隐蔽性。结果证明了所提出FCB方案的有效性和隐蔽性。较高的ASR表示越狱攻击更加成功而较低的PPL表示更强的隐蔽性。如表I所示FCB在大多数LLM上取得了最佳或第二佳的ASR。与AutoDAN相比ASR最高提高65%与COLD Attack相比最高提高8%。这种提升可归因于我们的攻击方案直接对模型输出层的logit序列进行优化。这使模型能够更快地被引导生成目标内容从而取得更高的ASR。与此同时如表I所示FCB在不同LLM上取得了最低的PPL。与AutoDAN相比PPL降低16.099至129.848与COLD Attack相比PPL降低33.449至181.171。这是因为FCB方案采用token停止选择和偏置归一化来约束扰动从而生成更加自然、流畅的文本并获得更低的PPL。值得注意的是AutoDAN在Guanaco和Mistral模型上取得了最高ASR。这是因为AutoDAN的越狱提示词部分依赖人工设计因此能够更加有效地利用这些模型的特征从而在越狱任务中获得更高的ASR。然而尽管AutoDAN人工构造的提示词在某些模型上能够获得更高ASR但其隐蔽性往往表现较差。综上FCB在为恶意查询生成越狱提示词时取得了更高的ASR和更低的PPL进一步验证了其在构造越狱提示词方面的有效性和隐蔽性。图2. 在AdvBench和MaliciousInstruct两个数据集上AutoDAN、COLD Attack和FCB针对Llama、Vicuna、Guanaco和Mistral模型时的攻击时间比较分析。aAdvBench。bMaliciousInstruct。C. 攻击效率在图2中我们比较了AutoDAN、COLD Attack和FCB方案在Llama、Vicuna、Guanaco和Mistral模型上的时间性能以展示FCB方案的攻击效率。如图2所示FCB在不同LLM上均取得了最短的攻击时间。在AdvBench和MaliciousInstruct数据集上与AutoDAN方案相比时间缩短3至10秒与COLD Attack方案相比时间缩短15至28秒。由于COLD Attack采用Langevin动力学方法通常需要进行大量采样才能收敛从而产生更高的计算开销并增加攻击所需时间。相比之下FCB方案通过微调模型输出来提高攻击效率引导模型在更短时间内生成低能量越狱提示词序列。D. 文本质量在表II和表III中我们给出了AutoDAN、COLD Attack和FCB方案应用于Llama、Vicuna、Guanaco和Mistral模型时在BLEU-2、BLEU-3、BLEU-4和BERTScore评估指标上的比较结果。BLEU通过衡量生成文本与一个或多个参考文本之间的n-gram重叠来评估生成文本的质量。BLEU得分范围为0到1其中1表示生成文本与参考文本完全匹配0表示不存在重叠。BERTScore是一种使用预训练语言模型评估生成文本质量的自动评估指标。它通过计算生成文本与参考文本之间的语义相似性得到一个分数。与BLEU不同BERTScore能够捕获更深层的语义信息。表IIAutoDAN、COLD Attack和FCB方案在AdvBench数据集上针对Llama、Vicuna、Guanaco和Mistral模型的文本质量比较。文本质量使用四项指标进行评估BLEU-2、BLEU-3、BLEU-4和BERTScore模型方案BLEU-2BLEU-3BLEU-4BERTScoreLlamaAutoDAN0.0030.0000.0000.000LlamaCOLD Attack0.0720.0530.0440.405LlamaFCB0.0780.0560.0440.474VicunaAutoDAN0.0030.0000.0000.000VicunaCOLD Attack0.0290.0170.0120.352VicunaFCB0.0280.0160.0090.420GuanacoAutoDAN0.0030.0000.0000.000GuanacoCOLD Attack0.0390.0000.0000.372GuanacoFCB0.0280.0140.0080.456MistralAutoDAN0.0030.0000.0000.000MistralCOLD Attack0.0640.0490.0410.416MistralFCB0.0710.0540.0430.486表IIIAutoDAN、COLD Attack和FCB方案在MaliciousInstruct数据集上针对Llama、Vicuna、Guanaco和Mistral模型的文本质量比较。文本质量使用四项指标进行评估BLEU-2、BLEU-3、BLEU-4和BERTScore模型方案BLEU-2BLEU-3BLEU-4BERTScoreLlamaAutoDAN0.0010.0000.0000.000LlamaCOLD Attack0.1150.0920.0790.458LlamaFCB0.0870.0680.0560.560VicunaAutoDAN0.0010.0000.0000.000VicunaCOLD Attack0.0470.0300.0190.408VicunaFCB0.0240.0140.0090.487GuanacoAutoDAN0.0010.0000.0000.000GuanacoCOLD Attack0.0520.0310.0220.389GuanacoFCB0.0080.0000.0000.446MistralAutoDAN0.0010.0000.0000.000MistralCOLD Attack0.0370.0210.0130.416MistralFCB0.0350.0220.0130.466如表II和表III所示FCB方案在大多数LLM的四项文本质量评估指标上取得最佳或第二佳结果。例如在AdvBench数据集的Llama模型上与AutoDAN相比FCB的BLEU-2、BLEU-3和BLEU-4得分分别提高0.075、0.056和0.044。与COLD Attack相比FCB的BLEU-2、BLEU-3和BLEU-4得分分别提高0.006、0.003和0。此外与AutoDAN方案相比FCB的BERTScore提高0.474与COLD Attack方案相比提高0.069。在MaliciousInstruct数据集的Mistral模型上FCB的BLEU-2、BLEU-3、BLEU-4和BERTScore分别为0.035、0.022、0.013和0.466。FCB方案通过使用token停止选择排除容易造成语言不自然或破坏语义结构的词语并采用偏置归一化使扰动幅度更加可控从而提高所生成越狱提示词的质量。此外我们的方案更加重视语义相似性这也是BERTScore指标在我们的实验结果中表现更好的原因。FCB在BLEU和BERTScore上的优异表现证明了其生成高质量越狱提示词的能力。E. 消融研究超参数β的影响我们通过调整初始噪声率并观察ASR变化趋势研究不同初始噪声率β对ASR的影响。如图3所示在Llama、Guanaco和Mistral LLM中随着初始噪声率增加ASR首先上升随后趋于稳定。例如在AdvBench数据集的Vicuna模型上随着初始噪声率增加ASR最初下降随后趋于稳定。当β0.2时ASR不再显著提高并达到稳定状态。图3的实验结果表明当初始噪声率超过0.2后随着噪声率进一步增加攻击有效性的提升逐渐减弱因为ASR已经达到相对稳定的水平。图3. Llama、Vicuna、Guanaco和Mistral四种模型在不同初始噪声率下的ASR变化趋势。Token停止选择和偏置归一化的影响在表V和表VII中我们比较了不同攻击方案在Llama、Vicuna、Guanaco和Mistral模型上的文本质量并使用四项指标进行评估BLEU-2、BLEU-3、BLEU-4和BERTScore。在表IV和表VI中我们比较了不同攻击方案在Llama、Vicuna、Guanaco和Mistral模型上的有效性和隐蔽性并使用ASR和PPL指标进行评估。图4给出了这些模型在不同攻击方案下的时间比较结果。具体而言FCB-none表示不使用token停止选择和偏置归一化方法的攻击策略FCB-BN表示仅使用偏置归一化的攻击策略FCB-TSS表示仅使用token停止选择方法的攻击策略FCB表示同时采用token停止选择和偏置归一化方法的攻击策略。表IVFCB-none、FCB-BN、FCB-TSS和FCB四种攻击在AdvBench数据集上针对Llama、Vicuna、Guanaco和Mistral模型的有效性与隐蔽性比较模型指标FCB-noneFCB-BNFCB-TSSFCBLlamaASR(%)52464252LlamaPPL100.229.7447.759.48VicunaASR(%)80848882VicunaPPL117.0911.4861.4211.48GuanacoASR(%)969610096GuanacoPPL316.2815.28147.6915.00MistralASR(%)68746872MistralPPL129.6133.1996.8933.19表V在AdvBench数据集上比较FCB-none、FCB-BN、FCB-TSS和FCB四种攻击在Llama、Vicuna、Guanaco和Mistral模型上的BLEU-2、BLEU-3、BLEU-4、ROUGE和BERTScore评估指标模型方案BLEU-2BLEU-3BLEU-4BERTScoreLlamaFCB-none0.0440.0270.0160.434LlamaFCB-BN0.0850.0670.0550.479LlamaFCB-TSS0.0560.0360.0260.440LlamaFCB0.0850.0670.0550.478VicunaFCB-none0.0240.0140.0080.393VicunaFCB-BN0.0260.0130.0080.420VicunaFCB-TSS0.0270.0150.0090.397VicunaFCB0.0260.0130.0080.420GuanacoFCB-none0.0260.0130.0080.412GuanacoFCB-BN0.0300.0200.0130.462GuanacoFCB-TSS0.0260.0130.0080.417GuanacoFCB0.0300.0200.0130.463MistralFCB-none0.0720.0540.0430.477MistralFCB-BN0.0660.0470.0350.485MistralFCB-TSS0.0720.0540.0430.479MistralFCB0.0660.0470.0350.485表VIFCB-none、FCB-BN、FCB-TSS和FCB四种攻击在MaliciousInstruct数据集上针对Llama、Vicuna、Guanaco和Mistral模型的有效性与隐蔽性比较模型指标FCB-noneFCB-BNFCB-TSSFCBLlamaASR(%)67636982LlamaPPL23.688.5417.778.51VicunaASR(%)91888890VicunaPPL49.7214.6737.6415.03GuanacoASR(%)95979297GuanacoPPL87.2213.3152.0012.96MistralASR(%)82818281MistralPPL49.1223.5849.1223.58表VII在MaliciousInstruct数据集上比较AutoDAN、COLD Attack和FCB在Llama、Vicuna、Guanaco和Mistral模型上的BLEU-2、BLEU-3、BLEU-4、ROUGE和BERTScore评估指标模型方案BLEU-2BLEU-3BLEU-4BERTScoreLlamaFCB-none0.0750.0540.0410.537LlamaFCB-BN0.0870.0680.0560.560LlamaFCB-TSS0.0800.0610.0490.541LlamaFCB0.0870.0680.0560.560VicunaFCB-none0.0210.0120.0080.475VicunaFCB-BN0.0240.0140.0090.487VicunaFCB-TSS0.0220.0120.0080.477VicunaFCB0.0240.0140.0090.487GuanacoFCB-none0.0000.0000.0000.417GuanacoFCB-BN0.0080.0000.0000.446GuanacoFCB-TSS0.0050.0000.0000.420GuanacoFCB0.0080.0000.0000.446MistralFCB-none0.0350.0210.0130.463MistralFCB-BN0.0350.0220.0130.466MistralFCB-TSS0.0350.0210.0130.463MistralFCB0.0350.0220.0130.466如表V和表VII所示联合使用token停止选择和偏置归一化方法可以使大多数模型在生成越狱提示词时取得最优或接近最优的文本质量。具体而言最高BLEU-2得分为0.087BLEU-3为0.068BLEU-4为0.056最高BERTScore为0.485。如表IV和表VI所示联合使用token停止选择和偏置归一化获得了最高或第二高的ASR以及最低的PPL。例如在AdvBench数据集的Guanaco模型上与FCB-none相比FCB将PPL降低了301.28。图4. FCB-none、FCB-BN、FCB-TSS和FCB四种攻击在AdvBench和MaliciousInstruct两个数据集上针对Llama、Vicuna、Guanaco和Mistral模型时的攻击时间比较分析。aAdvBench。bMaliciousInstruct。如图4所示token停止选择和偏置归一化方法保证了生成越狱提示词的效率。例如在AdvBench数据集上针对Llama模型时与FCB-none相比FCB-BN将攻击时间缩短4秒而FCB将攻击时间缩短6秒。综上对token停止选择方法和偏置归一化方法进行的消融实验表明同时使用token停止选择和偏置归一化方法能够在保证文本质量和生成时间的同时有效提高攻击的有效性和隐蔽性。流畅性损失的影响在图5中我们给出了COLD Attack和FCB方案在Llama、Vicuna、Guanaco和Mistral四种模型上流畅性损失随迭代次数变化的趋势。如图5所示FC方案造成的流畅性损失显著低于COLD Attack方案并且FCB方案的流畅性损失在整个迭代过程中保持相对稳定。相比之下COLD Attack的流畅性损失在前五次迭代中急剧增加随后增长速度趋于放缓。图5的实验结果表明FCB方案对模型生成内容流畅性的影响更小。其原因在于FCB方案在引入偏置时施加了约束从而避免对流畅性造成显著破坏。图5. 在COLD Attack和FCB方案下Llama、Vicuna、Guanaco和Mistral模型的流畅性损失随迭代次数变化的趋势。aAdvBench。bMaliciousInstruct。F. 对抗防御在图6中我们展示了PPL过滤防御在AdvBench和MaliciousInstruct数据集上针对AutoDAN、COLD Attack和FCB方案的有效程度并在Llama、Vicuna、Guanaco和Mistral模型上进行评估。PPL过滤防御检测输入提示词的PPL并拒绝超过预设PPL阈值的请求。在图6中我们系统评估了三种方案在PPL阈值分别设置为10、20、30和40时的ASR。如图6所示随着PPL阈值增加所有方案的ASR均表现出上升或趋于稳定的趋势。值得注意的是在所有PPL阈值设置下FCB始终取得更高的ASR尤其是在较低阈值下表现出更加明显的攻击有效性。这突出了我们的方案在生成越狱提示词方面的有效性和隐蔽性。图6. 在AdvBench和MaliciousInstruct数据集上AutoDAN、COLD Attack和FCB方案针对PPL过滤防御时的ASR比较目标模型为Llama、Vicuna、Guanaco和Mistral。aLlama。bVicuna。cGuanaco。dMistral。G. 可迁移性在表VIII中我们比较了COLD Attack和FCB方案从不同源模型向多个目标模型和数据集迁移时的可迁移性。使用平均ASR评估可迁移性。由于AutoDAN并未约束越狱提示词的隐蔽性因此其容易生成与请求无关的内容。因此我们主要关注COLD Attack和FCB两种越狱攻击的可迁移性实验。如表VIII所示我们的方案在大多数模型上取得了更好的可迁移性。FCB与COLD Attack方案在原始Llama、Vicuna和Guanaco模型上的平均ASR分别提高3%、1%和5%。表VIIICOLD Attack与FCB方案之间的可迁移性比较。源模型为Llama、Vicuna、Guanaco和Mistral。目标模型为Llama、Vicuna、Guanaco和Mistral。使用的数据集为AdvBench和MaliciousInstruct。评估指标为源模型针对多个目标模型和数据集的平均ASR方案LlamaVicunaGuanacoMistralCOLD Attack81817983FCB84828481分别如上所述。如表I所示我们的方法在保持可迁移性的同时提高了隐蔽性。这是因为FCB通过token停止选择和偏置归一化增强了越狱提示词的语义一致性从而提高了FCB迁移攻击的成功率。图1展示了FCBFast and Controllable Bias-Guided Jailbreak Attack的整体流程。左侧首先输入一个恶意问题原始LLM会因为安全对齐机制而拒绝回答。随后FCB在自回归解码过程中直接向模型输出层的logits加入初始偏置得到初始越狱提示词的logit序列。接着通过Token Stop Selectiontoken停止选择和Bias Normalization偏置归一化对偏置进行约束前者减少停止词等低语义贡献token的影响后者控制扰动幅度避免偏置过大导致文本失真。之后将更新后的偏置重新加到模型输出logits上生成新的偏置提示词序列。在这一过程中FCB还通过一个复合能量函数同时施加三类约束Fluency Constraint流畅性约束、Attack Success Constraint攻击成功约束和Keyword Constraint关键词约束。可以把它理解成三个同时工作的“导航信号”流畅性约束要求生成内容读起来自然攻击成功约束推动模型产生目标响应关键词约束则让生成文本保持特定的语言结构和内容特征。系统不断调整偏置使新的logit序列朝满足这些约束且能量更低的方向优化最后再经过解码得到最终的越狱提示词。这张图的核心思想是FCB并不是依靠反复随机搜索来寻找越狱提示词而是直接在LLM输出分布上施加一个可优化、受约束的“方向性偏置”。这样既能更快地把生成结果推向攻击目标又通过停止词筛选和偏置归一化尽量维持文本的自然性和隐蔽性。论文正是利用这一机制希望同时解决传统可控越狱攻击中“生成慢”和“文本不自然”两个问题。
返回列表