ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering面向长文档多模态问答的任务感知策略控

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering面向长文档多模态问答的任务感知策略控 一、研究问题与动机问题背景长文档多模态问答QA需要从包含文本、表格、图表、页面布局等多种模态的文档中提取证据。现有多模态RAG系统虽然能检索到更丰富的证据文本块、页面图像、图结构等但使用证据的方式往往是“查询无关”的固定流程。核心挑战不同查询需要不同的证据行为——局部事实只需单页聚合问题需跨页遍历表格数值需行列对齐视觉问题需页面图像无依据问题应拒绝回答。固定策略会导致“过度扩展”、“扩展不足”或“盲目信任视觉信息”。论文动机提出一个任务感知、策略可控的RAG框架让系统根据查询动态决定“用什么证据、怎么用、何时放弃”。二、提出的方法TAP-RAGTAP-RAG是一个三层解耦框架模块功能TAPC任务感知策略控制器核心控制层。解析查询预测任务类别7类估计视觉/局部/全局证据需求生成可执行策略含检索范围、扩散强度、视觉触发阈值、融合方式、支持阈值、是否放弃等。TA-QFD任务感知查询引导流扩散策略引导的证据执行器之一。在多模态文档图上按策略扩展文本和结构证据种子数、局部/全局扩散强度、跨文档惩罚等。TAVE任务感知视觉增强策略引导的证据执行器之二。仅在策略允许或文本证据不足时选择性调用VLM检查页面图像且视觉信息不能随意覆盖文本证据。Guarded Synthesis受保护合成融合文本、视觉、结构证据计算支持度得分若无候选答案满足策略设定的支持阈值则放弃回答而非强行生成。✅ 关键设计TAPC“决策” → TA-QFD/TAVE“执行” → 合成“验证并决定是否回答”三者形成可控闭环。三、技术亮点任务策略表TPT预定义7类任务的基础证据行为元数据查找、证据定位、文档聚合、数值提取、视觉推理、布尔验证、通用推理作为稳定默认策略。有效性加权投票TAPC采样多个LLM路由结果通过语义、字段一致性、查询锚定加权投票得到最终任务类别和证据信号。有界查询控制在TPT默认策略基础上根据证据信号和置信度进行受限调整不覆盖硬安全规则。视觉融合的保守策略视觉证据仅当“视觉基础强 文本支持弱 视觉答案明显更优”时才允许修订文本答案否则仅做验证或补充。支持门控放弃最终答案必须满足策略调整后的支持阈值否则返回“Not mentioned”类放弃响应。四、实验设置基准DocBench多领域PDF含不可回答问题、MMLongBench-Doc长文档理解。对比系统GPT-4o-mini、Qwen3-VL-Plus、GraphRAG、LightRAG、MMGraphRAG、RAG-Anything同骨干Qwen3-VL-Plus。评估指标答案准确率%按领域和文档长度分桶对比。五、主要结果基准对比最强基线RAG-AnythingTAP-RAG提升DocBench61.1%70.2%9.1 ppMMLongBench-Doc42.2%46.7%4.5 pp领域优势在政府、法律、新闻、研究、教程、金融等多个领域均取得最佳。长度鲁棒性在最长文档桶200页上提升最显著证明策略控制对长文档有效。消融实验完整系统 TAPCTAVE TAPCTA-QFD 仅TAPC 基线验证了策略控制与双执行器协同的必要性。案例研究表格数值提取TAVE验证行列交叉防止邻近数值干扰。章节聚合TA-QFD在有界范围内比较多节选出最长描述章节。六、贡献总结提出TAP-RAG框架首次将长文档多模态QA建模为“受控证据使用”问题而非单纯的检索扩展。设计TAPC策略控制器实现查询级任务感知、证据需求估计和策略生成。引入TA-QFD和TAVE两个策略引导的执行器分别负责图和视觉证据的受控获取。引入支持门控放弃机制在证据不足时拒绝回答提高可靠性。在两大基准上取得SOTA并通过消融和案例验证了模块交互的有效性。七、局限性与未来方向手动设计策略字段可能无法覆盖所有数据集特异策略未来可学习端到端策略。依赖固定解析器和LLM/VLM后端结果可能随基础模型变化。未提供任务类型级准确率因缺乏可靠标签当前结论需结合消融和案例解读。未来工作策略校准自动化、更精细的视觉区域选择、任务诊断可视化。TAP-RAG的核心思想不是“检索更多”而是“根据查询任务动态决定何时、何处、如何获取和使用证据并在证据不足时安全放弃”。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要长文档多模态问答需要的不仅仅是从大型文档中检索相关片段。不同的查询需要不同的证据行为。现有的多模态RAG系统通过文本片段、页面图像、图链接或异构文档元素来改善证据访问但它们往往采用一种很大程度上与查询无关的证据使用策略。我们提出了TAP-RAG一个面向长文档多模态问答的任务感知策略控制RAG框架。TAP-RAG包含一个主控制器——任务感知策略控制器TAPC以及两个策略引导的证据执行器任务感知查询引导流扩散TA-QFD和任务感知视觉增强TAVE。对于每个查询TAPC预测任务先验估计视觉/局部/全局证据信号并生成可执行的策略。随后TA-QFD在多模态文档图上扩展文本和结构证据而TAVE在需要视觉或布局证据时选择性地检查页面图像。受保护的合成阶段融合文本、视觉和结构证据并在支持不足时放弃回答。在DocBench和MMLongBench-Doc上TAP-RAG在对比系统中取得了最佳的整体准确率相比匹配的多模态RAG基线分别提高了9.1个百分点61.1→70.2和4.5个百分点42.2→46.7。1 引言长文档多模态问答QA需要在段落、表格、图形、标题、页面布局、元数据和文档结构之间进行证据选择。一个查询可能询问页面局部事实、表格单元格、跨页面聚合、图表层级关系、文档标识符或应被拒绝的无依据主张Ma等2024Zou等2025。检索增强生成RAG通过向生成器提供外部证据来改善基础支撑Lewis等2020。最近的基于图和多模态的RAG系统进一步通过实体、文档单元、页面图像、布局区域和结构链接扩展了可检索证据Edge等2024Guo等2025bWan和Yu2025Guo等2025a。然而更好的证据访问并不能自动决定如何针对特定查询使用这些证据。图1策略控制的多模态RAG的激励示例。通用RAG使用固定范围和统一读取可能导致过度扩展、扩展不足或支持薄弱。TAP-RAG则使用任务先验和策略来调整证据使用以支持有依据的回答。图1展示了这一动机。页面局部问题应保持在页面特定证据和布局附近。表格数值问题需要行列对齐而不仅仅是语义相似性。聚合问题需要跨章节或重复文档结构的更广泛遍历。视觉问题可能需要选择性的页面图像检查但视觉证据不应随意覆盖有充分支持的文本答案。验证类和不可回答的问题需要更严格的支持阈值和保守的合成。因此与查询无关的流程可能会过度扩展局部问题、不足地探索全局问题、过度信任视觉猜测或在没有充分支持的情况下作答。我们提出了TAP-RAG一个面向长文档多模态问答的任务感知策略RAG框架。TAP-RAG是整体框架。在TAP-RAG内部任务感知策略控制器TAPC是主控制模块。TAPC不直接回答问题相反它解释查询预测任务先验估计视觉/局部/全局证据需求并将其转换为可执行策略。该策略指定检索局部性、种子预算、图扩散强度、元数据锚定、视觉获取阈值、融合权限、结构算子、支持阈值和放弃行为。TA-QFD和TAVE是TAP-RAG下的两个并行证据执行模块。它们不是独立流程也不是TAPC的子部件。相反两者都执行TAPC生成的策略。任务感知查询引导流扩散TA-QFD在多模态文档图上操作并根据策略的局部性、范围和种子控制来扩展文本和结构候选。任务感知视觉增强TAVE在策略指示视觉依赖或文本证据不足时选择性地检查页面图像。通过这种方式TAPC决定需要什么样的证据行为而TA-QFD和TAVE通过图和视觉通道获取相应的证据。最后TAP-RAG应用受保护的合成来组合这些模块的输出。来自文本、视觉页面和结构算子的证据在策略的融合和支持约束下被融合。如果没有候选答案得到充分支持系统放弃回答而非强行生成答案。这种策略控制、图执行、视觉执行和最终合成之间的分离使TAP-RAG比固定的检索-生成流程更明确且可审计。贡献我们提出了TAP-RAG一个面向长文档多模态问答的任务感知策略控制RAG框架以TAPC作为其核心控制模块将查询级证据需求映射为可执行策略。我们引入了TA-QFD和TAVE作为TAP-RAG中辅助的策略引导模块使得在TAPC控制下实现基于图的证据扩展和选择性视觉检查成为可能。我们在DocBench和MMLongBench-Doc上评估TAP-RAG展示了相比强大多模态RAG基线的一致提升并通过消融实验和案例研究分析了模块交互。2 相关工作长文档和多模态文档问答。最近的基准测试强调跨页面推理、视觉基础、细粒度文档理解以及证据不足的情况Ma等2024Zou等2025。这些基准测试揭示了混合的证据需求有些问题可以从一个局部片段回答而另一些则需要表格结构、图像布局或文档级比较。TAP-RAG针对这种混合场景使用单一的多模态文档表示同时通过显式策略在查询时改变证据行为。多模态表示和文档RAG。RAG将语言模型输出建立在外部证据之上Lewis等2020。GraphRAG使用图社区进行查询聚焦检索Edge等2024LightRAG结合图和向量检索Guo等2025bMMGraphRAG将图检索扩展到多模态文档问答Wan和Yu2025而ColPali、VisRAG、M3DocRAG和RAG-Anything等系统增加了页面图像检索或异构文档元素处理Faysse等2025Yu等2024Cho等2024Guo等2025a。正交的MLLM设计工作通过模态专家适配、动量对比语义增强和关键词显式推理来改善模态协调和图文对齐Zhang等2024a,bJi等2024。TAP-RAG是互补的它聚焦于检索到的证据应如何被扩展、检查、融合或拒绝。路由和放弃。自一致性通过聚合多个样本来改进推理Wang等2023。自适应RAG方法决定是否需要检索或在粗略的检索-生成路径之间路由Asai等2024Yan等2024Jeong等2024。TAP-RAG在TAPC内部使用采样但将路由的任务先验和证据信号映射为对扩散、视觉获取、融合、结构算子、支持检查和放弃的细粒度控制。3 方法图2总结了TAP-RAG。该框架假设一个已解析的多模态文档图并聚焦于查询时控制。TAPC首先解析查询所需的证据行为然后将其转换为可执行策略。该策略控制图扩展、视觉获取、融合权限、结构算子和支持检查。这种设计使模块间的交互变得明确TAPC决定行为TA-QFD和TAVE在该行为下获取证据受保护的合成决定最终答案是否得到充分支持。3.1 文档图与策略3.2 任务感知策略控制器TAPCTAPC是TAP-RAG的控制层。它将查询路由到TPT类别聚合证据需求信号并将结果转换为TA-QFD、TAVE和受保护合成的可执行控制。这实现了任务解释与证据执行的分离模型不仅仅是检索更多上下文而是在检索扩展和视觉检查之前决定需要什么样的证据行为。任务策略表TPT。TPT包含七个类别元数据查找、证据定位、文档聚合、数值提取、视觉推理、布尔验证和通用推理。每个类别定义了一个基础证据使用行为。例如元数据查找强调标题页和页眉锚点数值提取偏向局部表格或数值证据聚合允许更广泛的遍历。模糊查询进一步由证据信号和路由置信度调节而不是仅依赖硬标签。3.3 策略控制的证据获取否则视觉证据验证或补充文本路径而不随意覆盖它。这种受保护的行为对于视觉密集的PDF很重要因为看似合理的视觉解释可能与表格结构或提取的文本相冲突。3.4 受保护的合成对于每个候选aTAP-RAG评分文本支持来自检索到的片段视觉支持来自检查的页面或区域结构支持来自确定性算子如表格单元格或页面验证。如果没有候选满足策略调整后的支持阈值TAP-RAG放弃回答。这最后一步闭环了策略与执行之间的关系检索和视觉检查提出证据但仅当选定策略的支持要求得到满足时才接受答案。4 实验4.1 实验设置基准和指标。我们在DocBench和MMLongBench-Doc上评估。DocBench涵盖学术、金融、政府、法律和新闻PDF包含纯文本、多模态和不可回答问题Zou等2025。MMLongBench-Doc涵盖报告、教程、论文、指南、手册、行政文件和财务报告的长上下文文档理解Ma等2024。我们以百分比报告答案准确率并在各系统间使用相同的基准划分和页面范围桶。对比系统。对比包括GPT-4o-miniOpenAI2024、Qwen3-VL-PlusQwen Team2025、GraphRAGEdge等2024、LightRAGGuo等2025b、MMGraphRAGWan和Yu2025和RAG-AnythingGuo等2025a。GPT-4o-mini和Qwen3-VL-Plus是直接模型基线。GraphRAG使用GPT-4o而LightRAG使用GPT-4o-mini作为生成骨干。MMGraphRAG是RAG-Anything论文中在其GPT-4o-mini设置下的已发表参考结果。RAG-Anything使用Qwen3-VL-Plus作为骨干进行评估TAP-RAG使用相同的Qwen3-VL-Plus骨干进行生成和页面图像视觉调用。诊断视角。领域和长度结果衡量整体鲁棒性。由于TAP-RAG的核心主张是查询级证据控制机制级证据由TAPC/TA-QFD/TAVE消融和案例研究提供。这避免了将领域标签作为任务类型的代理而是评估控制器和执行器是否按预期交互。4.2 领域级准确率表3显示TAP-RAG在两个基准上都取得了最佳整体准确率。与最强的同骨干基线RAG-AnythingQwen3-VL-Plus相比TAP-RAG在DocBench上提高了9.1个百分点在MMLongBench-Doc上提高了4.5个百分点。提升涵盖多个领域尤其是政府、法律、新闻、研究、教程、学术、指南、行政和金融文档。这些结果支持TAP-RAG的动机长文档多模态问答需要受控的证据使用而不仅仅是更多检索。TAPC在证据获取之前选择任务感知策略在答案合成之前调整检索范围、视觉检查、融合和放弃。DocBench的多模态和不可回答列仍然具有挑战性表明在更强的视觉召回和拒绝校准方面仍有改进空间。4.3 按文档长度的性能图3评估了方法在文档变长时是否仍然有效。TAP-RAG在所有页面范围内都具有竞争力并且在最长的MMLongBench-Doc桶中表现最强其中相关证据通常跨越标题、表格、标题和解释性文本。这种模式与TAPC和TA-QFD的设计一致更长的文档需要更广泛但仍然有界的证据遍历而策略防止扩展漂移到不相关的页面。TAVE在长报告包含难以从提取文本中恢复的视觉组织表格或页面级线索时进一步提供帮助。在DocBench上中等长度文档仍然困难因为它们包含足够的干扰项来混淆检索但用于扩散强化的重复结构较少。精确的页面范围值列于附录表9。4.4 消融和执行器耦合表4评估了TAPC和两个策略引导的执行器。目标是测试交互而非纯粹的加性模块堆叠TA-QFD扩展图候选而TAVE视觉验证选定的页面。完整系统在同一策略下使用两者然后应用支持门控合成。这一设置直接测试了当证据扩展、视觉检查和最终接受由一个共享控制器管理时执行器行为是否仍然有益。仅TAPC已经很强表明查询级策略解析是控制的主要来源。它在生成之前调整局部性、视觉触发阈值、融合权限、结构算子和支持要求。然而仅TAPC无法恢复初始候选集中缺失的证据也无法直接检查布局敏感页面。TA-QFD通过图扩散改善候选覆盖有利于文本密集和结构密集的文档。然而当查询高度局部时扩展也可能引入语义相关的干扰项。TAVE通过视觉验证候选页面提供互补行为但它依赖于候选页面的质量。如果检索遗漏了正确页面或包含视觉上看似合理的干扰项仅视觉检查仍可能被误导。完整模型最强因为模块形成了一个受控循环。TAPC选择策略TA-QFD在选定的局部性和范围约束下扩展证据TAVE仅在需要时验证布局或视觉证据受保护的合成防止噪声图或视觉候选主导最终答案。这种交互解释了为什么两个执行器在协调使用时比作为独立附加组件更有效。4.5 案例研究案例研究展示了TAP-RAG如何为不同的证据行为使用统一的策略接口。图4展示了来自case1.pdf的表格单元格提取案例。查询询问诺和诺德2020年的工资和薪金。表格包含养老金成本、社会保障缴款和总员工成本的相邻值因此语义检索可能选择相关但错误的数字。TAP-RAG将查询视为数值提取使用TA-QFD检索以表格为中心的证据并使用TAVE验证行列交叉点。这防止了邻近的数字干扰项仅仅因为与查询语义接近而被接受。最终答案DKK 26,778百万在结构和视觉证据一致后被接受。图5展示了来自case2.pdf的章节级文本聚合案例。查询询问哪个施工步骤具有最长的文本描述答案是第2.3节“进化式问题生成”。挑战在于在有界范围内比较相邻章节。TAP-RAG将查询路由为聚合导向在相关章节范围内扩展并在支持感知比较后选择答案。因此系统不会止于第一个高重叠章节而是根据请求的属性比较候选章节。这些案例共同说明了为什么TAP-RAG将长文档多模态问答视为受控证据使用。第一个案例需要局部结构精度和视觉验证第二个案例需要更广泛但有界的聚合。TAPC通过局部性、视觉获取、融合权限、结构算子和支持阈值的策略字段将两者联系起来使TA-QFD和TAVE作为协调的执行器而非独立的检索附加组件工作。这些示例还暴露了不同的基线失败模式使策略决策和证据路径更易于审计和比较。5 结论我们提出了TAP-RAG一个面向长文档多模态问答的任务感知策略控制框架。TAPC将每个查询映射为可执行策略控制图扩散、视觉获取、融合、结构算子、支持检查和放弃。这使得RAG行为明确且可审计同一文档上的问题可以使用不同的检索范围、检查策略、支持阈值和拒绝规则。在DocBench和MMLongBench-Doc上的实验显示跨领域和页面范围包括长文档设置的提升。与RAG-Anything的同骨干比较表明改进来自查询时证据控制而非更强的生成器。消融实验表明TA-QFD和TAVE在配合TAPC和受保护合成时最有效。这些结果表明应将长文档多模态问答视为受控证据使用而非检索规模扩展。TAP-RAG提供了可解释的策略接口而未来工作可以改进策略校准、视觉区域选择和任务诊断以实现可靠的文档级推理。这些观察强调TAP-RAG通过决定何时、何地以及如何安全地贡献证据来提高可靠性而非通过添加上下文。这一方向支持在文档证据不完整或内部冲突时更强的人工监督尤其是在高风险文档推理场景中。局限性TAP-RAG在DocBench和MMLongBench-Doc上使用固定解析器、评判协议和LLM/VLM后端进行评估因此结果可能因不同的文档解析器、模型或基准分布而有所变化。任务类别集涵盖了常见的长文档多模态问答行为但非常规布局、语言或领域约定可能需要新类别或重新校准。本文报告了领域级、长度级、消融和定性分析。由于核心主张涉及任务特定的证据行为当可靠的任务标签可用时任务类型级准确率将是一个有价值的额外诊断。因此当前结果应与消融实验和案例研究一起解读而非仅从领域表格中得出。最后策略字段是手动设计的而非端到端学习的。这提高了可解释性和可审计性但可能错过学习控制器可能发现的特定数据集策略。伦理考量本研究在基准风格文档上研究文档问答未引入新的人类主体数据。主要的伦理问题是文档分析流程中无依据答案的生成。TAP-RAG包括证据支持验证和放弃机制但这些机制在诸如法律、金融或医疗决策等高危环境中并非保证。实际部署应保护文档隐私、尊重数据使用限制、避免将秘密存储于提交到仓库的环境文件中并要求对关键决策进行适当的人工审查。AI助手的使用。AI助手仅用于语言润色、LaTeX格式化和清单撰写辅助。所有科学内容、实验、结果和最终稿件决定均由作者审阅和批准。
返回列表