ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

TIGRAG:Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs——基于令牌共现图的高效检索增强生成

TIGRAG:Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs——基于令牌共现图的高效检索增强生成 一、研究背景与问题研究动机大语言模型LLM存在“幻觉”问题即生成与事实不符的内容。检索增强生成RAG通过引入外部知识库来缓解这一问题但现有方法存在明显不足传统RAG将文档视为孤立单元难以处理需要综合多处分散信息的多跳查询Multi-hop QA。现有GraphRAG虽能利用知识图谱的拓扑结构进行多跳推理但依赖LLM进行实体和关系提取带来两大问题——计算开销巨大图构建耗时、成本高和易出错LLM提取可能产生幻觉、噪声或遗漏导致错误级联传播。核心目标提出一个既高效又准确的图增强RAG框架在不牺牲多跳推理能力的前提下大幅降低计算成本和延迟。二、提出的方法TIGRAGTIGRAGToken-Induced GraphRAG是一个基于令牌共现知识图谱的轻量级图增强RAG框架。其核心创新在于用统计共现替代LLM驱动的图构建。整体架构两阶段离线图构建阶段将文档分割成重叠的句子级文本块滑动窗口策略。对每个块进行令牌化、去停用词、过滤短令牌和标点。构建加权无向图节点为有效令牌边的权重基于令牌在滑动窗口内的共现频率。整个过程无需任何LLM参与完全基于统计。在线推理阶段单跳多跳查询预处理将用户查询令牌化取与图节点重合的令牌作为种子节点。语义扩展PPR在图上运行个性化PageRankPPR从种子节点出发探索拓扑邻域得到扩展令牌集及其归一化分数。候选检索与图加权评分检索包含扩展令牌的文本块用BM25结合PPR分数计算混合相关性得分。动态候选池化用累积分数阈值动态筛选出最相关的块避免固定截断带来的噪声。神经重排序用嵌入模型计算查询与候选块的余弦相似度重新排序得到单跳检索结果。多跳迭代机制核心创新从第一跳检索到的Top块中通过命名实体识别NER提取命名实体。用这些实体扩展原始查询仅保留新实体避免循环。用扩展后的查询重复图检索和重排序过程。最多执行2跳经实验验证最后合并各跳结果取每个块在所有跳中的最大相似度分数作为最终排序依据输出Top-β个块作为上下文送给LLM生成答案。三、实验设置数据集HotpotQA、2WikiMultiHopQA、MuSiQue三个多跳问答基准各取1,000个查询。基线方法NaiveRAG、RAPTOR、GraphRAG、LightRAG、ToG、KGP、HippoRAG2以及NoRAG。评估指标检索Recall2、Recall5生成精确匹配EM、令牌级F1效率离线索引时间、在线端到端推理延迟、提示词元占用上下文长度四、主要实验结果1. 检索性能表2TIGRAG在所有数据集上一致最优在HotpotQA上R2达78.60%比NaiveRAG提升9.70%R5达92.05%提升8.23%。在2WikiMultiHopQA上R2达72.98%R5达87.20%均显著优于所有基线。在最难的MuSiQue上R2达42.57%比HippoRAG2提升19.92%。2. 问答生成性能表3TIGRAG在HotpotQA上EM达60.70%13.67% vs NaiveRAGF1达72.60%11.97%。在2WikiMultiHopQA上EM达50.90%F1达58.60%均为最优。在MuSiQue上F1最高35.80%EM略低于HippoRAG226.20% vs 26.50%但F1更高说明TIGRAG能提供更全面、更可靠的证据。3. 计算效率表4、表5——最大亮点离线索引TIGRAG仅需约200秒而GraphRAG需数十万秒LightRAG需数十万至百万秒。TIGRAG比最快的图基线RAPTOR快约150倍。在线推理TIGRAG每查询仅需3~4秒而NaiveRAG需23~64秒在复杂数据集上TIGRAG更快比RAPTOR快约4倍。提示词元占用TIGRAG上下文约1,300~1,460个令牌与GraphRAG相当远小于LightRAG~4,000和NaiveRAG~3,200~3,800既节省计算又减少LLM分心。4. 消融与敏感性分析表6~10最优块数β5过多引入噪声过少证据不足。最优跳数h2超过3跳无增益。最优候选池阈值thρ0.8保证足够候选多样性。PPR驱动扩展远优于简单度中心性神经重排序和BM25均有显著贡献。五、核心贡献总结维度具体贡献方法创新首次提出完全基于令牌共现统计的图增强RAG无需LLM参与图构建从根本上避免了提取错误和高成本。检索能力通过PPR语义扩展BM25加权动态池化神经重排序在三个多跳基准上取得最优的Recall和生成F1。多跳推理设计迭代式实体驱动查询扩展机制利用NER从已检索块中提取新实体来扩展查询有效捕获分散证据。效率优势离线索引时间比现有GraphRAG方法降低2~3个数量级在线推理延迟比最快图基线快4倍提示占用紧凑减少LLM分心。可扩展性轻量级设计使其适合大规模、实时部署。六、局限性与未来工作局限性依赖NER质量实体提取错误可能导致语义漂移。仅捕获基于共现的邻近关系对隐含语义关联建模不足。仅处理纯文本未涉及多模态。未来方向引入语义边连接词汇不同但语义相似的令牌。引入语义感知节点处理多义词消歧。扩展至多模态图像、视频场景。TIGRAG通过令牌共现图替代昂贵的LLM图构建实现了检索精度优于现有GraphRAG、计算效率接近甚至超过简单密集检索的突破为高效、可扩展的多跳RAG提供了新的范式。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要检索增强生成RAG通过将生成过程锚定在外部知识上缓解了大语言模型LLM的幻觉问题。然而标准的RAG方法在处理多跳推理时面临困难。尽管最近的基于图的RAG方法改进了对相互关联的文本块的检索但它们通常依赖于计算成本高昂且容易出错的、基于LLM的提取流水线。为解决这些问题我们提出了TIGRAGToken-Induced GraphRAG一个基于令牌共现知识图的高效图增强RAG框架。TIGRAG直接使用滑动窗口共现统计来建模令牌之间的拓扑关系从而实现了可扩展的图构建。在推理过程中它结合了基于图的语义扩展和神经重排序以检索用于多跳推理的相互关联的证据。具体而言它引入了一种迭代的、由实体驱动的检索策略该策略使用从先前检索到的上下文中提取的桥接实体来逐步扩展查询。我们在三个广泛采用的多跳问答QA基准上评估了TIGRAG。实验结果表明我们的框架在检索和下游QA任务上均持续优于密集检索和基于图的RAG方法同时大幅减少了索引时间、推理延迟和提示词元占用。关键词检索增强生成知识图谱多跳1. 引言随着大语言模型LLM日益普及研究界对其固有的脆弱性特别是幻觉现象给予了越来越多的关注[30, 47]。检索增强生成RAG已成为一种成熟的方法通过将LLM的输出锚定在外部事实性知识上来缓解幻觉问题[8, 29, 3]。在标准的RAG流水线中用户查询被编码为向量然后用于通过相似性搜索从大型文档语料库中检索相关的文本块[27, 17]。检索到的信息随后用于在生成过程中为LLM提供上下文证据[21, 23, 48]。然而传统的基于向量的RAG系统效率不高因为它们将文档视为大致不连贯的单元这限制了它们跨多条信息进行推理的能力。因此它们经常在处理多跳查询时遇到困难而多跳查询需要综合分布在独立文本块中的分散证据[2, 38, 26, 49]。为了解决这个问题图增强RAGGraphRAG方法依赖于结构化表示通常形式化为知识图谱KG。在知识图谱中节点和边捕获文本元素及其复杂的关系从而提供了一个拓扑空间来映射和导航知识[5, 11]。这些方法的范围从将图派生的知识如三元组或社区摘要直接注入上下文[5]到使用拓扑结构作为路由机制来检索最相关的原始文本块[13]。由于其互联结构GraphRAG方法能够固有地处理多跳问答QA所需的复杂推理路径[33, 19]。然而两个关键挑战阻碍了它们的更广泛采用。首先离线KG构建会带来显著的计算开销和延迟[28, 4]。其次传统的GraphRAG流水线[5, 11]严重依赖基于LLM的实体和关系提取使其容易受到幻觉、噪声或缺失连接的影响。这些图构建错误可能会在检索流水线中传播并最终导致下游推理和生成的级联故障[9]。本文旨在通过提出TIGRAGToken-Induced GraphRAG来解决这些计算开销和基于提取的脆弱性问题TIGRAG是一种高效的图增强RAG。与传统的GraphRAG系统不同TIGRAG通过从语料库中提取令牌并根据滑动窗口内的共现关系将它们链接起来从而统计地构建其拓扑基础。TIGRAG的架构包括四个核心组件i一个离线图提取阶段高效地构建拓扑知识图谱ii一个由个性化PageRankPPR驱动的语义扩展和候选检索模块[14]iii一个用于上下文块评估的动态图加权评分机制以及iv一个最终的神经重排序模块根据与查询的语义对齐来筛选出最优的文本块。2. 相关工作本节阐述与TIGRAG相关的方法。具体而言第2.1小节介绍标准RAG方法。第2.2小节描述结构增强检索方法。最后第2.3小节讨论基于网络的检索和多跳推理范式。2.1. 标准检索增强生成RAG已成为限制LLM幻觉的关键范式。它将LLM的输出锚定在可靠且最新的外部知识源上从而提高了事实准确性和响应质量[6]。在这一既定范式内传统的RAG框架通常使用词汇搜索[32]或语义相似性[20]来检索必要的上下文。这些方法将文本块编码为连续向量并应用相似性度量如余弦相似性来有效检索与输入查询具有语义重叠的文档。然而标准的RAG方法将文档视为孤立的单元。因此它们在处理需要综合来自不同文本信息的复杂多跳查询时存在显著困难。实际上在这种情况下它们受到初始问题与远程支持事实之间词汇和语义差距的限制[2, 38]。此外标准的密集检索方法通常检索过长的上下文导致严重的信息冗余和大量的计算开销。为解决此问题近期研究探索了上下文剪枝技术。例如AttentionRAG [7] 引入了一种注意力引导的压缩机制以减少词元消耗并过滤掉检索段落中的无关信息。虽然上下文压缩提供了部分补救措施但它通常难以在压缩率和信息丢失风险之间取得平衡。因此需要一种更具结构性的解决方案来准确识别相互关联的证据而不仅仅是压缩平面文本。2.2. 结构增强检索方法为克服平面向量空间的局限性近期方法已将结构依赖性整合到RAG流水线中。在此背景下GraphRAG已成为一种有前景的范式它利用基于图的索引和检索来挖掘实体间的关系。这使得能够对复杂知识库进行更精确和具备上下文感知的推理[29]。基于此范式已经提出了几种特定的架构。例如RAPTOR [35] 通过迭代抽象处理将文本知识组织成递归树结构有助于在不同粒度级别进行检索。类似地TreeRAG [39] 通过采用基于树的组块和双向遍历策略来解决长文档中常见的碎片化问题。这种方法在检索过程中严格保留了层次依赖关系。同时基于图的系统因其通过层次化索引和摘要来改进信息聚合的能力而受到广泛关注[34]。GraphRAG [5] 利用知识图谱生成层次化的社区级摘要而LightRAG [11] 将图拓扑与双级向量表示相结合以高效检索实体和关系。诸如 KG2RAG [50] 和 HyperGraphRAG [24] 等方法通过分别使用知识图谱和超图表示来利用结构化的块间关系从而丰富检索到的信息。此外GFMRAG [25] 引入图基础模型以深度结构感知能力直接增强生成过程。ToG [36] 将来自结构化知识图谱和非结构化文本的信息检索无缝集成采用紧密耦合的推理机制来锚定生成过程。KGP [42] 通过构建段落级知识图谱并部署基于LLM的遍历代理明确针对多文档问答MD-QA。这种双重机制在相互关联的文档间调节转换空间同时动态收集相关上下文从而在检索延迟和生成质量之间取得平衡。这些方法中有许多是有效的但它们依赖于计算成本高昂的、由LLM驱动的提取流水线或广泛的结构预训练来构建其底层图[45]。此外近期研究表明像GraphRAG这样的实现在现实世界的大规模部署中遇到了显著的可扩展性问题。在这些场景中图遍历算法的计算复杂性和检索延迟随着知识图谱大小的增加而呈指数级增长[29]。TIGRAG直接从标准化文本令牌及其局部共现关系中构建一个高度可遍历的知识图谱。这种精简的方法绕过了生成式图构建的高昂计算成本确保了高效、低延迟的检索操作同时保留了语料库固有的结构完整性。2.3. 基于网络的检索和多跳推理虽然许多方法侧重于构建知识索引以实现更好的摘要但另一条研究路线强调直接使用图拓扑来检索相互关联的上下文[18, 43]。例如GRAG [16] 结合文本和拓扑信息来精确定位相关的子图而KG-RAG [22] 则采用显式的查询分解和多跳知识图谱检索来实现深度推理。然而基于图的检索方法经常面临粒度权衡问题[44]。事实上细粒度的实体级图可以捕获详细的关系但计算成本高昂且可能丢失上下文信息。相反粗略的文档级图保留了上下文但难以建模复杂的多跳关系。近期方法如QCG-RAG [44]通过构建以查询为中心的图来检索不同粒度级别的相关块来解决此问题。其他方法则依靠图神经网络GNN和查询感知的注意力机制从知识图谱中动态识别和聚合相关信息[1]。除了依赖显式的查询分解或训练计算密集型的GNN架构之外一种并行且高效的策略是利用网络理论算法来有机地导航这些知识结构。像HippoRAG [13] 及其后继者HippoRAG2 [12] 这样的方法已证明了使用个性化PageRank来模拟人类认知索引的有效性。这使得检索信号能够自然地传播到语义节点上。虽然TIGRAG受这些基于网络的原则启发但它引入了一个令牌级别的提取阶段、一个动态候选池化策略以及一个迭代的、由实体驱动的多跳检索过程。特别是它从第一个检索跳中提取命名实体以扩展查询并应用神经重排序步骤。这使得它能够检索传统密集检索或单跳基于图的方法经常忽略的相互关联的证据。3. 提出的方法本节概述TIGRAG的技术特性。具体而言第3.1小节解释了我们框架的基本原理而后续小节则描述了构成其基础方法的各个步骤。3.1. 动机标准的RAG系统通常难以处理多跳推理而基于图的检索方法常常需要承担复杂的、由LLM驱动的图构建成本。为解决这些问题我们提出了TIGRAG一个基于令牌共现图的轻量级图增强检索框架。TIGRAG不依赖由LLM驱动的图构建而是直接从文本共现关系中构建令牌级别的拓扑表示从而实现高效且可扩展的图创建。在检索过程中它结合了基于图的语义扩展和神经重排序以识别用于多跳推理的相互关联的证据。然后一种迭代的、由实体驱动的检索策略使用从先前检索到的上下文中提取的桥接实体来逐步增强查询。TIGRAG通过动态选择紧凑且高度相关的上下文大幅减少了提示大小、推理延迟和总体计算开销其性能优于现有的GraphRAG方法。图1展示了TIGRAG的工作流程。如图所示TIGRAG架构在两个基本阶段运行i离线图构建和ii在线推理。在离线阶段TIGRAG将原始语料库分割成重叠的文本块然后使用令牌共现频率来构建拓扑知识图谱。同时TIGRAG预计算并索引块级别的密集嵌入和令牌到块的来源映射。在推理时它对传入的查询进行令牌化以识别拓扑种子节点。这些种子节点随后驱动语义扩展过程获取初始的候选块池。接下来TIGRAG应用图加权评分机制来动态过滤候选块然后将它们传递给神经重排序器进行精确的语义对齐。最终它将筛选出的最优块注入LLM的提示中以锚定最终生成。然后重复此单跳检索过程以实现多跳推理。图1TIGRAG的工作流程展示了图构建、语义扩展和迭代多跳检索3.2. 预处理和文本分块3.3. 知识图谱构建3.4. 查询预处理和语义扩展3.5. 候选检索和图加权评分3.6. 动态候选池化和重排序尽管图加权评分能有效检索到一组广泛的上下文相关块但严格依赖固定截断值可能会引入噪声。为了动态过滤候选集我们应用了一种累积分数阈值机制。3.7. 多跳推理和实体驱动的查询扩展4. 实验在本节中我们描述为验证TIGRAG而进行的实验。具体而言第4.1小节介绍了实验设置第4.2小节展示了获得的结果。4.1. 实验设置在本节中我们描述测试的实验设置。具体而言我们概述了使用的数据集、考虑的基线方法、模型和提示协议、评估的指标以及最后的超参数配置。我们在一个配备有256个AMD EPYC 7742 CPU、1 TB RAM和两个NVIDIA A100 GPU各40 GB内存的服务器上进行了所有实验。为确保被评估方法之间的公平比较我们在相同的硬件基础设施上执行了所有索引、检索和生成实验。4.1.1. 数据集我们在三个广泛采用的多跳问答数据集上评估了TIGRAG的检索和推理能力HotpotQA [46]、2WikiMultiHopQA [15] 和 MuSiQue [40]。为减轻计算开销同时保持统计显著性我们按照先前研究的标准做法[13, 41, 31]从每个数据集中子采样了1,000个查询。每个数据集都提供了需要回答的问题和一个相关文档语料库。该语料库作为必须从中检索相关上下文的证据池。此外每个查询都配有一个标准答案以便在下游评估阶段进行严格评估。表1提供了从每个数据集生成的图的统计信息的全面概览。表1每个数据集的图统计信息方法HotpotQA2WikiMultiHopQAMuSiQue节点数55,73335,25156,467边数1,315,330658,3261,370,777平均度47.2037.3548.55每个节点的平均文档数8.156.998.18块数11,8517,87013,067密度0.00080.00110.0009连通分量数1114.1.2. 基线方法为严格评估TIGRAG的有效性我们将其与一系列最先进的RAG方法进行了比较涵盖了传统的密集检索技术和更先进的结构感知架构。具体而言我们使用NaiveRAG作为标准密集检索基线并采用RAPTOR [35]、GraphRAG [5]、LightRAG [11]、ToG [36]、KGP [42] 和 HippoRAG2 [12] 作为结合了层次化、基于图或知识引导检索机制的最新方法。我们还考虑了不使用RAG的情况。为确保公平性我们使用了相同的生成提示该提示旨在严格执行基于证据的推理。它如图2所示。4.1.3. 模型和提示协议我们实验中使用的LLM是 gemma3:27b-it-qatsup4/sup。在生成阶段我们通过图2所示的提示模板向它提供用户问题和检索到的上下文。最后为确保公平比较我们通过应用等效的提示策略标准化了所有三个被评估基线的生成阶段。我们使用 Nomic Text 1.5 模型sup5/sup进行密集检索和语义相似度计算。我们使用基于Treebank分词器和Punkt句子分割的NLTK进行令牌化。我们使用spacy NER流水线提取命名实体。图2问答生成阶段使用的提示模板。CONTEXT_STR 代表检索到的上下文而 QUESTION 代表要回答的问题。4.1.4. 评估指标遵循[13]的方法我们从三个维度评估TIGRAG检索效能、下游生成质量和计算效率。我们使用Recall2 (R2) 和 Recall5 (R5) 来量化检索性能它们衡量了在前两个R2或前五个R5候选块中成功检索到标准支持证据的查询比例。对于生成式问答阶段我们使用精确匹配EM和令牌级F1分数进行评估。EM评估严格的字符串等价性而令牌级F1分数则评估LLM输出与标准答案在令牌级别的重叠程度。所有这些指标都在实数范围 [0,1] 内或者如果我们以百分比表示则在 [0,100] 内其值越高性能越好。我们省略了KGP、ToG和RAPTOR的Recallk指标因为它们的结构性检索机制与块级评估不兼容。事实上KGP和ToG检索的是知识图谱实体和关系而RAPTOR检索的是层次化的摘要节点。因此这三个系统无法通过Recall来可靠地评估检索质量。最后我们省略了NoRAG的Recallk因为该系统没有检索机制。除了准确性我们还评估了RAG方法的计算负载。具体而言我们测量了离线图构建所需的时间以评估在大规模语料库上的可扩展性。对于在线阶段我们报告了端到端的推理延迟同时捕获了检索和LLM生成的时间。我们还测量了提示词元占用即检索到的上下文的平均令牌长度。这个计算指标至关重要因为减少上下文占用不仅降低了计算开销和延迟还有助于缓解生成过程中注意力分散的问题。4.1.5. 超参数配置4.2. 结果在本节中我们展示实验活动的结果。具体而言第4.2.1小节比较了TIGRAG与文献中提出的其他相关系统的性能。第4.2.2小节比较了TIGRAG和其他相关方法所需的计算资源。最后第4.2.3小节介绍了TIGRAG的超参数和消融研究。4.2.1. 性能比较表2报告了所比较方法在所选多跳问答基准上的检索性能以 R2 和 R5 表示。对于每一列粗体数字表示最大值下划线数字表示次大值。此表显示TIGRAG在所有评估场景中均持续优于所有基线。在HotpotQA上与NaiveRAG相比它在 R2 上提高了 9.70%在 R5 上提高了 8.23%。这一趋势在2WikiMultiHopQA上继续TIGRAG在 R2 上比NaiveRAG获得了 13.41% 的提升在 R5 上比HippoRAG2获得了 10.76% 的提升。在更具挑战性的MuSiQue基准上该基准需要多步语义推理TIGRAG的提升幅度进一步增加与HippoRAG2相比在 R2 上获得了 19.92% 的提升在 R5R5 上获得了 9.73% 的提升。这些结果证明了令牌级拓扑扩展在增强多跳检索方面的有效性。表2在多跳问答基准上的检索性能R2 和 R5方法HotpotQA2WikiMultiHopQAMuSiQue平均值R2R5R2R5R2R5R2R5HippoRAG257.45%84.05%63.42%78.73%35.50%51.29%52.12%71.36%LightRAG69.05%85.25%59.98%69.58%35.62%49.68%54.88%68.17%NaiveRAG71.65%85.05%64.35%70.40%38.39%51.21%58.13%68.89%TIGRAG78.60%92.05%72.98%87.20%42.57%56.28%64.72%78.51%随后我们将焦点从检索指标转移到下游生成性能。表3显示了所比较方法在多跳基准上的问答性能使用精确匹配EM和令牌级F1F1。表3在多跳问答基准上的问答性能EM 和 F1方法HotpotQA2WikiMultiHopQAMuSiQue平均值EMF1EMF1EMF1EMF1NoRAG28.30%37.93%30.90%35.20%7.40%17.59%22.20%30.24%HippoRAG252.80%64.40%50.20%55.57%26.50%33.89%43.17%51.29%Raptor39.80%55.69%32.40%38.24%14.40%24.21%28.87%39.38%KGP22.50%32.26%11.40%13.08%11.10%18.15%15.00%21.16%ToG20.60%26.63%14.50%17.02%5.80%8.60%13.63%17.42%GraphRAG29.99%39.91%7.60%8.41%0.50%1.67%12.70%16.66%LightRAG52.50%66.91%45.70%51.17%22.20%32.14%40.13%50.07%NaiveRAG53.40%64.84%44.40%14.89%21.00%29.88%39.60%47.74%TIGRAG60.70%72.60%50.90%58.60%26.20%35.80%45.93%55.67%如表3所示TIGRAG在HotpotQA上持续提高了答案质量与NaiveRAG相比在EM上获得了 13.67% 的提升在F1上获得了 11.97% 的提升。在2WikiMultiHopQA上也观察到类似趋势TIGRAG在EM上比HippoRAG2高出 1.39%在F1上高出 5.45%。在MuSiQue基准上HippoRAG2获得了略高的EM值但TIGRAG保持了更高的F1值。由于EM会严重惩罚部分正确但更详细的答案TIGRAG更强的F1结果表明我们的框架为多跳推理提供了更全面且语义上更可靠的证据。4.2.2. 资源比较RAG架构的实际可行性不仅取决于检索准确性还取决于计算效率。在分析了第4.2.1节中的检索性能后我们现在关注离线和在线阶段的资源消耗。为此我们分析了三个关键维度离线图构建时间也称为索引时间、在线端到端推理延迟和提示词元占用通过检索到的上下文的长度以令牌数计来衡量。这些指标评估了TIGRAG的可扩展性和实际可用性。离线索引时间衡量处理大型语料库的成本而端到端推理延迟则捕获整个检索-生成流水线的响应能力。过大的上下文会减慢生成速度并使LLM分心因此减少上下文占用对于提高效率和推理质量都至关重要。表4报告了TIGRAG和相关方法在执行第4.2.1节所述测试时获得的离线索引时间和平均在线推理延迟每个查询。表4索引和检索时间后者包括有效检索时间和LLM响应时间方法HotpotQA2WikiMultiHopQAMuSiQue索引 (秒)检索 (秒)索引 (秒)检索 (秒)索引 (秒)检索 (秒)HippoRAG2308,66475.60121,94579.48318,28281.67Raptor29,45214.8017,00114.5635,85115.46KGP1,89330.571,51425.904,09637.16ToG139,37255.2770,66039.91146,14648.58GraphRAG657,05514.9174,80215.75195,32515.75LightRAG721,83320.31343,81219.96593,94220.46NaiveRAG1023.35663.711144.45TIGRAG1913.221553.262024.14对此表的分析表明NaiveRAG由于采用简单的密集检索架构绕过了图构建因此在离线阶段索引时间最短。尽管TIGRAG比NaiveRAG慢但它仍然比其他基于图的方法快得多同时实现了更强的检索和生成性能见表2。在线推理阶段出现了一个引人注目的趋势。在HotpotQA上TIGRAG比NaiveRAG稍慢。然而在更复杂的数据集如2WikiMultiHopQA和MuSiQue上TIGRAG在端到端速度上超过了NaiveRAG。这种效率提升验证了我们的假设即通过动态提取高度集中且相关的上下文TIGRAG可以大幅减少LLM的提示处理和生成时间。这种减少足以抵消图遍历为PPR所需引入的最小延迟。与最快的基于图的基线RAPTOR相比TIGRAG大约快四倍为图增强RAG系统设定了一个高度可扩展的标准。表5详细列出了每个查询生成的平均上下文词元占用以令牌数计。表5每个查询的平均上下文词元占用方法HotpotQA2WikiMultiHopQAMuSiQueGraphRAG1,438.471,263.101,299.82LightRAG4,185.543,982.534,112.78NaiveRAG3,465.003,197.403,870.60TIGRAG1,463.861,382.071,305.30如表所示严格依赖动态过滤文本块的方法产生的上下文要紧凑得多。相比之下通过注入大量知识图谱三元组或社区摘要来增强提示的框架如GraphRAG和LightRAG则受困于过度膨胀的上下文窗口。TIGRAG通过依赖一个紧凑且高度相关的块池来减小提示大小从而提高了推理速度并限制了注意力分散。4.2.3. 超参数和消融研究首先我们研究检索预算如何影响LLM构建上下文的方式特别关注提供给LLM用于上下文构建的块数 β见第3.7节。通过改变 ββ我们评估了提供足够支持证据与引入语义噪声之间的权衡。因此我们评估了上下文大小最终如何影响EM和F1分数。在表6中我们展示了此项实验的结果。在每一列中我们用粗体显示相应指标获得的最佳值。此表的结果突显出性能在 β 的中间值β5时达到峰值。将上下文窗口增加到超过此阈值会降低EM和F1分数。这种行为突显了LLM在暴露于过长和嘈杂上下文时容易分心。相反将 β 设置得过低会使生成模型缺乏必要的支持证据。因此β5 是最佳配置它在不使推理模型能力过载的情况下最大化信息密度。表6超参数 ββ 的敏感性分析βHotpotQA2WikiMultiHopQAMuSiQueEMF1EMF1EMF1357.40%70.02%45.20%52.41%23.30%32.68%560.70%72.60%50.90%58.60%26.20%35.80%1055.80%69.21%44.90%52.66%22.80%33.09%消融结果突显了所提框架每个组件的重要性。移除BM25仅导致性能轻微下降证实了基于图的扩展机制本身就能捕获高度相关的证据。用度中心性替换PPR会大幅降低所有数据集的性能表明拓扑感知语义传播比简单的节点度数更重要。最后消除神经重排序阶段显著降低了检索有效性表明重排序对于过滤图扩展期间引入的噪声候选是必不可少的。5. 讨论从性能角度来看TIGRAG所基于的拓扑方法增强了检索能力并持续优于基线方法。这种高保真度的检索直接转化为更优的下游问答生成在精确匹配和令牌级F1分数上树立了新的最先进水平。除了严格的准确性之外TIGRAG最重要的意义在于其资源效率。通过仅通过统计共现来构建结构图TIGRAG消除了传统GraphRAG方法所需的计算成本高昂的、由LLM驱动的实体提取流水线。因此它在离线图构建和在线推理期间消耗的时间和词元预算都大大减少为现实世界的部署提供了一个高度可扩展的解决方案。尽管结果令人鼓舞但TIGRAG有一些局限性这些局限性为未来的研究指出了有趣的方向。首先TIGRAG的迭代式、由实体驱动的检索策略严重依赖于命名实体识别NER流水线的质量。由于查询扩展是由从先前检索到的块中提取的实体引导的不准确、模糊或不相关的实体可能会在检索阶段传播导致语义漂移和检索精度降低。因此探索更鲁棒的实体消歧和过滤机制是未来工作的重要方向。其次与其他基于共现的方法一样TIGRAG主要捕获从令牌邻近性中涌现的关系。未来的工作将研究轻量级的语义丰富策略这些策略可以更好地建模隐含连接同时保持TIGRAG的计算效率。6. 结论在这项工作中我们提出了TIGRAG一个由令牌共现知识图谱驱动的有效且高效的RAG框架。与依赖于昂贵的基于LLM的实体和关系提取流水线的传统GraphRAG方法不同TIGRAG直接从令牌共现中构建了一个轻量级的拓扑表示。它还使用基于PPR的语义扩展和动态神经重排序来跨多个跳检索相互关联的证据。通过绕过计算成本高昂的、基于LLM的图构建索引TIGRAG所基于的令牌级方法实现了更快的离线图构建同时保留了多跳推理所需的结构依赖性。在HotpotQA、2WikiMultiHopQA和MuSiQue上的实证评估表明TIGRAG显著提高了检索性能与基线模型相比建立了新的最先进性能。这些发现证明图增强RAG系统可以在不牺牲计算效率的情况下解决复杂的多跳推理任务。我们目前的评估侧重于文本多跳数据集然而这项研究为未来的研究指出了几个有前景的方向。首先我们计划通过引入语义边来扩展图拓扑使其超越统计共现。这种语义平滑将连接词汇不同但语义相似的令牌从而捕获隐含关系。其次我们计划通过引入语义感知节点来解决令牌多义性的固有限制从而处理仅将令牌视为词汇单元的局限。这将使图能够动态消歧含义实现更细粒度和更精确的检索。最后由于现代信息生态系统本质上是异质的未来的一个发展方向是将TIGRAG扩展到多模态设置。这将涉及将图像和视频整合到拓扑空间中以支持更复杂的问答任务。
返回列表