
一、文章主要内容总结本文聚焦基于图的检索增强生成(GraphRAG)系统的安全漏洞,提出两种知识投毒攻击(Knowledge Poisoning Attacks, KPAs),并验证了其有效性及现有防御机制的缺陷,具体内容如下:GraphRAG背景:GraphRAG通过将原始文本转换为结构化知识图提升大语言模型(LLMs)的准确性和可解释性,但依赖LLMs从文本中提取知识,存在被恶意操纵的风险。攻击方法:针对性知识投毒攻击(TKPA):利用图论分析定位知识图中的脆弱节点,通过LLM重写对应文本,实现对特定问答(QA)结果的精准控制,成功率达93.1%,且修改文本占比低于0.06%,保持流畅自然。通用性知识投毒攻击(UKPA):利用代词、依存关系等语言线索,通过修改全局影响词破坏知识图的结构完整性,仅修改0.05%以下的文本即可使QA准确率从95%降至50%。实验验证:在多个真实数据集(如《小王子》、2007-2008金融危机维基页面等)上的实验表明,两种攻击均能高效生效,且现有主流防御方法(如基于困惑度的过滤器、LLM污染检测器)无法检测,凸显GraphRAG安全防护的空白。二、创新点识别新攻击面:揭示GraphRAG中“仅修改现有文本而非添加新内容”的攻击可能