ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI-Infra-Guard 越狱评估(Jailbreak Evaluation):一站式 LLM 安全测试实战指南

AI-Infra-Guard 越狱评估(Jailbreak Evaluation):一站式 LLM 安全测试实战指南 AI-Infra-Guard 越狱评估Jailbreak Evaluation一站式 LLM 安全测试实战指南【免费下载链接】AI-Infra-GuardA full-stack AI Red Teaming platform securing AI ecosystems via Agent Scan, Skills Scan, MCP scan, AI Infra scan and LLM jailbreak evaluation.项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Infra-Guard本文为 AI-Infra-Guard 平台中「越狱评估Jailbreak Evaluation」模块的完整技术指南覆盖模型接入、内置/自定义数据集、编码与行为控制两大攻击算子库以及安全报告的解读方法。读完本文你可以独立完成一次 LLM 越狱测试配置 OpenAI 兼容模型、选择攻击方法、执行评估并读懂安全评分报告同时了解该功能在开源仓库中的源码级实现链路。一、什么是越狱评估越狱评估Jailbreak Evaluation面向大语言模型提供简洁、易用、高效、全面的安全风险检测能力用户通过一次配置即可识别模型的安全问题帮助开发者高效发现并修复安全缺陷。其核心设计包括三点精选风险提示词库平台内置由腾讯朱雀实验室Tencent Zhuque Lab通过大规模数据清洗、合成、泛化与语义去重整理得到的典型风险 Prompt覆盖重要安全场景100 攻击方法动态增强内置攻击算子库可对风险 Prompt 进行编码、混淆、上下文操控等动态增强系统性测试模型的安全防护边界而不是只测试原始提示词两种使用方式既可以直接使用内置的「越狱评估」评测模型也可以利用自定义评估集功能结合平台提供的攻击方法对内部风险 Prompt 用例做进一步泛化与增强。在开源仓库中该能力对应 Python 端的 AIG-PromptSecurity 子系统评估引擎与 Go 端的 越狱评估任务执行器Web 平台侧任务调度二者协同完成平台点选 → 命令行执行 → 报告回传的完整闭环。二、快速开始三步完成越狱评估官方文档将操作流程概括为三步选择任务类型在对话框下方点击 Jailbreak Evaluation配置模型、数据集与攻击方法选择/配置打分模型评分用模型见下文模型配置选择/配置被测试模型见下文模型配置选择内置数据集见数据集选择或上传自定义数据集见自定义数据集管理选择攻击方法见攻击方法也可以只用原始 Prompt 直接测试启动任务并查看报告点击执行按钮等待任务完成后查看详细结果报告。2.1 平台侧的任务执行链路源码佐证从源码结构看Web 平台上的每次越狱评估任务最终都被翻译成一条对cli_run.py的异步调用。common/agent/prompt_tasks.go 中的ModelRedteamReport.Execute方法展示了完整的参数组装过程前端提交的任务参数model列表、eval_model、dataset、techniques等经 JSON 解析后逐段追加为 CLI 参数--model、--base_url、--api_key、--max_concurrent若平台已配置默认评分模型环境变量eval_base_url、eval_api_key、eval_model见 getDefaultEvalModel则自动注入--evaluate_model/--eval_base_url/--eval_api_key否则使用任务中显式指定的评分模型数据集参数则组装为--scenarios中的Custom:prompt...单条 Prompt或MultiDataset:dataset_file...,num_prompts...,random_seed...批量数据集并允许通过prompt_column指定提示词列名见 数据集场景组装逻辑。值得注意的执行细节均可在 prompt_tasks.go 中确认随机种子random_seed缺省为42保证抽样可复现num_prompts缺省为 -1表示使用全量任务参数校验明确Prompt 与数据集文件不能同时提供也不能同时为空二者必须且只能取其一任务被拆分为三个子阶段回传给前端Pre-Jailbreak Parameter Parsing初始化越狱环境→Jailbreaking执行模型安全评估→Generating report生成模型安全报告这与文档中启动任务并查看报告的体验一一对应。三、模型配置3.1 支持的模型类型与配置参数越狱评估要求接入OpenAI API 格式兼容的模型需要配置三个核心参数参数说明示例模型名称--model模型标识openai/gpt-4oAPI Base URL--base_url兼容 OpenAI 协议的接口地址https://openrouter.ai/api/v1、https://api.openai.com/v1API Key--api_key接口鉴权密钥你的密钥一次评估通常涉及三个角色的模型这也是该模块区别于普通 Chat 测试的关键。结合 AIG-PromptSecurity/README.md 的 CLI 参数定义完整参数表如下CLI 参数作用--model/--base_url/--api_key被测试模型支持多组重复传入以实现多模型对比--max_concurrent被测试模型并发数--evaluate_model/--eval_base_url/--eval_api_key/--eval_max_concurrent打分评分模型缺省复用主模型--simulator_model/--sim_base_url/--sim_api_key/--sim_max_concurrent攻击生成泛化模型缺省复用主模型在 Go 侧任务执行器中ModelParams结构体prompt_tasks.go以base_url/token/model/limit四个字段承载每组模型limit即并发上限缺省值为 1000--max_concurrent默认评分模型同样以 1000 作为并发上限。平台侧支持在一次任务中传入多个model参数从而对多个模型做横向安全对比这与文档中多模型健康检查能力相对应。3.2 健康检查与报告展示健康检查执行支持单模型或多模型健康检查批量接入多个 OpenAI 兼容端点自动生成详细安全评分与风险报告提供跨模型安全性能对比分析。报告展示可视化呈现检查结果包括成功/失败率、风险分析等模型安全评分等级高 / 中 / 低High / Medium / Low支持全量数据结果导出。四、数据集选择与自定义数据集管理4.1 内置数据集内置精选安全测试数据集由腾讯朱雀实验室经过大规模数据清洗、合成、泛化与语义去重后整理覆盖重要安全场景支持选择内置数据集也支持自定义数据集见下节提供自动任务耗时估算便于测试排期规划。从仓库内容看这批内置评测集以 JSON 形式存放在 data/eval/ 目录下包括JailBench-Tiny.json、advbench.json、JailbreakPrompts-Tiny.json、ChatGPT-Jailbreak-Prompts.json、JADE-db-v3.0.json、cnsafe.json、safebench.json、CBRN-weapon.json、cyberattack.json、privacy-leakage.json等 17 个数据集文件与文档致谢中列出的 JailBench、AdvBench、JailbreakPrompts、ChatGPT-Jailbreak-Prompts、JADE 3.0、CNSafe、SafeBench 等公开数据集来源一一对应。4.2 自定义数据集两种使用方式系统支持两种自定义数据集使用方式临时上传Temporary Upload在评估任务执行时临时上传任务完成后不保存兼容主流格式CSV、JSON、JSONL、Excel、Parquet、TXT自动识别常见提示词列名如prompt、question、query、text、content等。注未来版本将支持用户自定义列名配置。数据集管理Dataset Management通过管理页面永久保存到系统中支持复用与共享要求标准 JSON 格式以保证数据质量与一致性。注未来版本将提供数据集质量评估与用户贡献排行。源码层面的对应关系临时上传的数据集在 Go 侧走下载附件 → 落地到uploads/临时目录含路径穿越防护校验→ 组装MultiDataset:dataset_file...场景参数的流程而通过管理页面永久保存的数据集则通过utils.GetEvaluationsDetail拉取详情后写入临时 JSON 文件再传给引擎见 prompt_tasks.go 数据集处理。这与文档临时上传不保存、管理页面永久保存的两种形态严格对应。CLI 直连场景下自定义数据集同样通过两种场景参数加载详见 AIG-PromptSecurity/README.mdCustom:prompt单条提示词或Custom:prompt_file文件路径适合单条或少量自定义 Prompt文件支持 JSON、JSONL、TXT 等格式MultiDataset:dataset_fileCSV或JSON路径,num_prompts抽样数默认10,prompt_column提示词列名,random_seed随机种子,filter_conditions过滤条件适合大规模结构化数据批量导入例如--scenarios MultiDataset:dataset_file/your_data.csv,num_prompts10,prompt_columnprompt。五、攻击方法编码攻击与行为控制攻击系统内置了丰富的攻击方法库支持对风险 Prompt 做动态增强帮助开发者全面测试模型的安全防护能力。当前版本提供两大类攻击策略共计一百余种具体攻击方法编码攻击Encoding Attacks通过各种编码与混淆手段加密风险 Prompt绕过模型的安全护栏如 Base64、ROT-13、Morse、Nato、Braille、Leetspeak、Zalgo、零宽字符等编码变换行为控制攻击Behavioral Control Attacks通过上下文引导、目标重定向或欺骗等手段控制模型行为绕过安全限制如 Prompt Injection、角色扮演、上下文投毒、目标重定向、预填充操控等。这些攻击方法可以单独使用也可以组合使用为开发者提供全面的模型安全测试能力。平台将持续更新和扩展攻击方法库以应对不断演化的安全威胁。5.1 攻击算子库的源码结构在开源仓库中攻击算子实现位于 AIG-PromptSecurity/deepteam/attacks/ 下分为single_turn单轮攻击与multi_turn多轮攻击两个子目录单轮攻击31 个算子目录encoding编码攻击族、goal_redirection目标重定向、context_poisoning上下文投毒、prompt_injection、roleplay、math_problem、multilingual、gray_box、ica、icrt_jailbreak、jailbroken、overload、past_tense、prefill、stego、stratasword等多轮攻击11 个算子目录linear_jailbreaking线性递进、tree_jailbreaking树搜索、crescendo_jailbreaking渐进式、sequential_break顺序对话、best_of_nBest-of-N、bad_likert_judge恶意评分等。攻击方法的分类映射由 AIG-PromptSecurity/utils/strategy_map.json 统一描述其中Encoding组聚合了 A1Z26、ASCII85、BaseEncoding、CaesarCipher、Leetspeak、Morse、Zalgo 等数十种编码策略BehavioralControl组聚合了 GoalRedirection、ContextPoisoning、CodeAttack、DRAttack 等行为控制策略——这与文档所述编码攻击 行为控制攻击两大类口径完全一致且策略数量超过一百种。5.2 组合策略与算子查询除算子本身外评估引擎还支持多种攻击组合策略见 AIG-PromptSecurity/README.mdrandom随机选择攻击方法默认serial串行嵌套攻击前一种攻击的输出作为后一种攻击的输入parallel并行独立攻击各算子独立作用于原始 Prompt。在 CLI 中可直接查询可用算子与参数# 查看所有可用攻击算子 python cli_run.py --scan-tools techniques # 查看特定攻击算子的参数 python cli_run.py --show-tool-params PromptInjection一个典型的数据集 多种攻击方法组合评估命令示例python cli_run.py \ --model gpt-3.5-turbo \ --base_url https://api.openai.com/v1 \ --api_key your-api-key \ --max_concurrent 10 \ --scenarios MultiDataset:dataset_file/test_data.csv,num_prompts10,prompt_columnprompt \ --techniques Base64 PromptInjection RoleplayWeb 平台侧对应的翻译规则可在 prompt_tasks.go 中确认当用户未选择任何攻击方法时平台默认注入--techniques Raw仅用原始 Prompt 测试并将--choice设为parallel以并行跑多组模型/数据集。六、致谢与开源基础越狱评估模块基于 Confident AI 团队开源的 DeepTeam 项目构建并深度定制为适配 AI-Infra-Guard 生态的业务架构与特定需求团队对其进行了大量修改、扩展与重构实现了开箱即用的无缝集成原始许可请参见 DeepTeam 仓库的LICENSE文件。攻击算子方面模块向以下研究与社区致谢Confident AI Inc.部分单轮/多轮算子、Saiem et al.SequentialBreak、Hughes et al.Best of N、Yang et al.ICRT Jailbreak、Alibaba AAIGStrata-Sword、Adversa AIPROMISQROUTE。数据集方面向以下研究与社区致谢STAIRJailBench、Promptfooredteam-deepseek、Rubén Darío JaramilloChatGPT-Jailbreak-Prompts、Chao et al.JBB-Behaviors、复旦大学 Whitzard AI 团队JADE 3.0、Simon KnutsJailbreakPrompts、Andy ZouAdvBench、Zonghao YingCNSafe、SafeBench。【免费下载链接】AI-Infra-GuardA full-stack AI Red Teaming platform securing AI ecosystems via Agent Scan, Skills Scan, MCP scan, AI Infra scan and LLM jailbreak evaluation.项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Infra-Guard创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表