
摘要本文解读 Findings of EMNLP 2026 论文《Beyond Chunk-Local Extraction: Cross-Chunk Graph Augmentation for GraphRAG》。该论文提出CrossAug通过融合自监督图破坏、拓扑感知 GNN 缺失度打分与GNN 引导的 LLM 取证补全把“恢复跨块关系”从不可行的全组合穷举改写为可自监督训练的子图缺失度打分问题其特别之处在于结构搜索交给 GNN、昂贵的语义抽取才交给 LLM增强后的图作为静态索引被任意下游检索管线复用。实验表明CrossAug 在 4 个问答基准、3 个 LLM 抽取型 GraphRAG 框架上普遍生效HippoRAG2 在 MuSiQue 拿到 EM 29.30 / F1 41.28、F1 提升 1.33在 LiteraryQA 拿到 18.40 / 33.81、提升 1.0924 项 EM/F1 指标中 21 项上升、1 项持平且索引期只多花 8.2% 的 LLM 调用与 15.3% 的墙钟时间为长文档 GraphRAG 的建图期补全提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景CrossAug 的三模块分工方法细节实验设计与结果结果对比总结CrossAug 的增益与成本关键发现局限性常见问题FAQCrossAug 与 HippoRAG2、LightRAG、GFM-RAG 是什么关系为什么不让 LLM 直接补全所有跨块关系监督信号从哪来需要人工标注吗增强后的三元组可信吗索引成本高吗怎么调代码和数据是否开源参考链接论文基本信息项目内容标题英文Beyond Chunk-Local Extraction: Cross-Chunk Graph Augmentation for GraphRAG标题中文跨块图增强打破 GraphRAG 的块内抽取盲区作者Jiaming Zhang, Yibo Zhao, Jing Yu, Jianxiang Yu, Xiang Li机构华东师范大学数据科学与工程学院School of Data Science and Engineering, East China Normal University· PLANING Lab通讯作者Xiang Lixianglidase.ecnu.edu.cn会议EMNLP 2026 FindingsarXivhttps://arxiv.org/abs/2605.28004项目网站https://github.com/DonFinliani/CrossAug背景与动机长文档问答与多跳问答的瓶颈往往不在“检索器不够强”而在关系结构本身不完整。GraphRAG结构化检索增强生成把语料组织成显式图索引用图遍历、社区摘要支持多跳检索与语料级查询但主流框架都在单个 chunk 内抽取实体与三元组隐含假设“块内三元组拼接即可还原文档级关系结构”。而别名消解、因果链这类关系的证据天然分布在多个块中于是跨块关系在建图期就系统性缺席——库里每条边都对但回答所需的那条关系根本不在索引里。这就是论文命名的“块内抽取盲区”。已有工作为什么没能补上这块把建图路线排开来就清楚了框架建图路线关系证据范围是否处理跨块关系MS-GraphRAG2024直接从原文构建 KG 索引 社区摘要块内不处理HippoRAG / HippoRAG22024–2025逐块抽 (s,p,o) 建无模式 KG Personalized PageRank块内不处理LightRAG2024实体/关系描述 双路检索压低建图成本块内不处理LinearRAG2025不使用关系三元组的轻量层次索引不使用关系三元组不处理LP-RAG把检索改写为归纳式链接预测需 LLM 分块器与合成查询块内不处理GFM-RAG2026训练通用 GNN 当检索器块内不处理CrossAug本文GNN 缺失度打分定位不完整子图 离线 LLM 取证补全跨块多段证据 chunk 引用在建图期补全上表最后一列是分水岭既有工作几乎都在优化“已建好的图怎么用”而本文处理的是“建图阶段本身”——用 GNN 定位结构上不完整的区域做索引期图补全而不是查询时再检索一次。与此同时把“用 LLM 全面恢复跨块关系”直接做掉在工程上也不成立任意实体对 / 块对都可能藏着漏掉的关系组合数随文档长度爆炸上下文与成本双双失控。从更长的时间线看GraphRAG 的演进可概括为四个阶段2024 年 MS-GraphRAG 首次证明图索引在语料级查询上优于扁平向量检索2024–2025 年 HippoRAG / HippoRAG2 用逐块三元组加 Personalized PageRank 做关联式多跳检索2025–2026 年 LightRAG / LinearRAG / LP-RAG / GFM-RAG 转向降建图成本或把 GNN 当检索器到 2026 年的 CrossAug补的才是建图阶段。索引期补全之所以关键有三点构建时漏掉的关系下游算法只能在同一份残缺结构上工作块组合数随文档长度爆炸使穷举补全不可行必须先做结构级筛选补全只付一次成本增强后的图即静态索引无需改动检索端。研究主线从问题到结论CrossAug 的研究链路是一句话可以讲清的因果闭环从块内抽取的结构性盲区出发指出跨块关系在建图期缺席且穷举补全不可行再把 GNN 当作结构向导筛选出“看起来不完整”的局部子图只在这些区域调用 LLM 取证补全最后用四个基准、三个框架的对照实验兑现收益。图 3CrossAug 论文的研究主线与因果链Mermaid 流程图——从块内抽取盲区出发经“跨块关系缺席 → 穷举补全不可行”的动机链落到 GNN 缺失度打分与 LLM 取证补全最终由四基准三框架的对照实验兑现收益。基准/方法设计定位与图接口。CrossAug 是一个离线增强步骤作用于已建好的基图 $\mathcal{G}(\mathcal{V},\mathcal{E})$不改动查询期的检索与生成组件——图只增强一次之后作为静态索引被任意下游复用。它只要求基图提供实体节点、带关系类型的边以及把事实追溯到证据块的出处因此不绑定某个框架的具体 schema可直接插到任何基于 LLM 抽取的 GraphRAG 索引上。任务与数据。论文选用四个问答基准三个多跳加一个长文档叙事MuSiQue 抽 1,000 题组合式多跳跨块证据占比高、2WikiMultiHopQA 抽 1,000 题维基双跳实体消解密集、HotpotQA 抽 1,000 题以及 LiteraryQA 用测试集前 50 本书、共 1,358 题多数书超过骨干模型的上下文窗口。统一评测协议。为避免“检索器差异”污染结论所有框架共用同一套栈骨干 Qwen3-32B32,768 token 上下文嵌入 BGE-M3重排 BAAI-bge-reranker-v2-m3统一 top-$k5$指标为 Exact MatchEM与 F1。基线为 LightRAG、GFM-RAG、HippoRAG2各自对比 base 与 CrossAugLinearRAG 作为非 LLM 抽取的对照、不施加 CrossAug。三模块总览。第一步自监督图破坏从基图自身采样实体中心子图用“掩事实边 / 删实体节点”构造不完整视图把“缺了哪些三元组”这个无标注问题转成缺失度检测任务。第二步拓扑感知 GNN 打分不预测具体缺哪条边只判断局部拓扑看起来是否不完整——这与“该把 LLM 花在哪里”的目标更对齐。第三步GNN 引导的 LLM 补全仅把高分、低重叠的子图连同证据段落与已知三元组交给 LLM校验通过的三元组按原 schema 写回索引。图 1CrossAug 工作流总览——先由 GNN 缺失度打分从基图中挑出结构上不完整的局部子图再由 LLM 在证据段落约束下抽取出有据可依的三元组最后把校验通过的三元组写回图索引整条增强链路在查询前离线完成一次。分类全景CrossAug 的三模块分工把整条流水线拆开看三个模块各自承担一种职责且都可以独立替换或调节图 4CrossAug 三模块分工分类图Mermaid 分类图——模块一用掩事实边与删实体节点制造监督信号模块二用异构消息传递做图级缺失度打分模块三用阈值与 Jaccard 去重筛选、预算约束控本、chunk 引用强制抑制幻觉。方法细节模块一 · 自监督破坏与采样。论文不为每对实体/块建样本而是从符合条件的根实体出发做多次加权随机游走转移权重 $\tilde{w}e\min(w_e,c)\cdot\alpha{\psi(e)}$事实边乘子大于同义边游走只在实体–实体边上进行、不穿块节点最后只保留节点数达标且至少含一条事实边的子图。破坏分两类其一按比例 $\rho_e$ 随机掩掉事实边模拟“认出了实体却漏掉关系”其二按比例 $\rho_v$ 删掉参与事实边的非根实体模拟“连实体一起丢”的更强失败模式。模块二 · 拓扑感知 GNN 打分。节点初始表示 $h_v^{(0)}W_x x_ve_{\phi(v)}$两层按边类型分别做变换后聚合邻域信息实体与块由同一嵌入模型编码故共享投影矩阵 $W_x$。图级表示用顺序无关池化 $g(S)[\mathrm{mean}{v\in S} h_v;\ \mathrm{max}{v\in S} h_v]$经多层分类器给出缺失度分 $m(S)\sigma(a(S))$以 BCE 训练完整视图为 0、破坏视图为 1每个 epoch 重新采样根实体避免过拟合到静态人造样例。监督信号完全来自基图自身零人工标注。模块三 · GNN 引导的 LLM 补全。推理期先按 $m(S)$ 排序只有得分超过阈值 $\theta$ 的子图才具备补全资格再用节点级 Jaccard 相似度 $J(S_i,S_j)\lvert V_i\cap V_j\rvert / \lvert V_i\cup V_j\rvert$ 跳过与已选子图高度重叠的候选。选择持续到 LLM 调用预算 $B$ 用尽为止——把“所有跨块组合的穷举”转成“一组多样且高缺失度子图的定向选择”。每个选中子图的上下文包含根实体、局部实体列表、已抽出的三元组以及从事实边出处取回的多个证据段落。引用强制是最后一道闸门LLM 提出的每个新实体与关系都必须附带支持它的 chunk 标识缺少有效 chunk 引用的关系直接丢弃——这条规则同时强制跨块依据并抑制幻觉式扩图。通过校验的三元组按原抽取器的 schema 插入基图结构上与基图一致可被任何下游检索管线直接消费。图 2CrossAug 用于 GNN 引导 LLM 补全的提示词模板——向 LLM 提供被选中的子图、已知三元组、候选实体与证据块并要求它只返回有证据支持的三元组与实体且必须附上支撑它们的 chunk 标识。超参敏感性附录 F。三个核心超参的扫描显示默认点 $\rho_e0.20$、$\rho_v0.08$、$\theta0.50$ 是一个折中而不是最优点超参数EMF1事实边掩蔽 $\rho_e0.10$17.6032.96$\rho_e0.15$17.6032.99$\rho_e0.20$默认18.4033.81$\rho_e0.25$17.4533.41实体删除 $\rho_v0.06$17.5333.02$\rho_v0.08$默认18.4033.81$\rho_v0.10$17.8933.44$\rho_v0.12$17.6732.93打分阈值 $\theta0.40$18.5834.24$\theta0.45$18.4334.02$\theta0.50$默认18.4033.81$\theta0.55$17.9233.54掩蔽比例过低$\rho_e0.10$产生的破坏信号太弱打分器区分度不足反而要跑 2,313 次调用过高0.25会删掉太多边。打分阈值 $\theta0.40$ 的性能最好但代价是 3,788 次调用、40.42M prompt token默认的 2.5 倍$\theta0.55$ 把调用压到 760 次、prompt 降到 8.57M但 EM/F1 双双低于默认。换言之阈值与预算就是把“质量–成本”曲线显式暴露出来的两个旋钮。实验设计与结果基准规模。四个语料的索引规模如下“新增”是 CrossAug 在基图之上写入的增量统计量LiteraryQAMuSiQue2WikiHotpotQAChunks9,55011,6566,1199,811基图节点68,014104,19054,48784,632基图边225,908331,233169,455262,256基图三元组103,148123,30864,52398,592新增节点3,2032,9941,5691,718新增边27,28420,0939,7819,839新增三元组8,7078,9015,0485,252四个语料的基图规模相差不到 2 倍但新增三元组都落在 5,000–8,900 量级——跨块遗漏不是某个语料的特例语料较短的 2Wiki 与 HotpotQA 绝对增量最小5,048 / 5,252。主结果MuSiQue / 2WikiMultiHopQA方法MuSiQue EMMuSiQue F12Wiki EM2Wiki F1LinearRAG不施加24.1037.2347.9065.16LightRAG base20.5028.0928.4036.93LightRAG CrossAug21.4029.2429.3037.34GFM-RAG base20.3030.6152.9060.43GFM-RAG CrossAug20.4030.9653.2060.44HippoRAG2 base27.9039.9551.2057.53HippoRAG2 CrossAug29.3041.2851.9058.15除首行的对照外每两行是一组 base / CrossAug。MuSiQue 的纪录由 HippoRAG2CrossAug 拿下29.30 / 41.28F1 提升 1.332Wiki 的 F1 纪录仍属于不依赖 LLM 抽取的 LinearRAG 65.16。主结果HotpotQA / LiteraryQA方法HotpotQA EMHotpotQA F1LitQA EMLitQA F1LinearRAG不施加47.0064.5911.5626.57LightRAG base44.9058.6011.2626.24LightRAG CrossAug44.9058.5011.6326.82GFM-RAG base40.5050.4212.5927.49GFM-RAG CrossAug40.3050.8214.5828.83HippoRAG2 base53.8068.0317.5932.72HippoRAG2 CrossAug54.1068.4418.4033.81HotpotQA 与 LiteraryQA 的四项最佳值被 HippoRAG2CrossAug 包揽54.10 / 68.44 / 18.40 / 33.81LiteraryQA F1 提升 1.09。但增益并非无条件LightRAG 在 HotpotQA F1 上回退 0.10GFM-RAG 在 HotpotQA EM 上微降 0.20。F1 增量拆解对应论文图 3框架MuSiQue2WikiHotpotQALiteraryQALightRAG1.150.41−0.100.58GFM-RAG0.350.010.401.34HippoRAG21.330.620.411.09三组柱子里 HippoRAG2 在四个基准上全为正LightRAG 的 HotpotQA 是唯一负值−0.10GFM-RAG 在 2Wiki 上几乎持平0.01。增益明显集中在 MuSiQue 与 LiteraryQA——恰是跨块证据更关键的场景。F2T / T2F 案例分布对应论文图 4 与附录 G。把“基线错、加 CrossAug 对”False-to-TrueF2T与“基线对、加 CrossAug 错”True-to-FalseT2F拆开统计才能判断检索变化是收益还是噪声。各框架的 F2TEM 案例数如下框架MuSiQue2WikiHotpotQALiteraryQAHippoRAG22516619LightRAG17252041GFM-RAG30454754规律是基线越弱、可修复空间越大——GFM-RAG 在四个基准上的 F2T 计数全面高于 HippoRAG2差异最大的 LiteraryQA 为 54 对 19。论文图 4 进一步把每个变体按四个基准画出 F2T 与 T2F 的双向柱四组依次为 HippoRAG2块、LightRAG块、LightRAG事实、GFM-RAG块16 组里有 13 组 F2T 高于对应的 T2F净差最大的是 GFM-RAG 的 LiteraryQA51 对 22反向的三组集中在 LightRAG 变体的 HotpotQA 与 LiteraryQA例如 LightRAG 事实变体在 HotpotQA 上 F2T 12、T2F 16。机制上 F2T 主要来自两种检索效应块顺序变化集合不变但更有用的证据被排到前面与块集合变化新的金标块、或能支撑推理链的桥接块进入 top-$k$。组件消融附录 E。把 GNN 打分器换成同样预算下的随机子图选择就能把“子图选择质量”与“多花钱调 LLM”两个因素分开数据集设置EMF1MuSiQueCrossAug29.3041.28MuSiQuew/o GNN等预算随机子图28.4039.952WikiCrossAug51.9058.152Wikiw/o GNN50.9057.52HotpotQACrossAug54.1068.44HotpotQAw/o GNN53.3067.66LiteraryQACrossAug18.4033.81LiteraryQAw/o GNN18.1933.17四个基准全部退化MuSiQue 最伤F1 −1.33、EM −0.90、2Wiki 次之EM −1.00——拓扑引导的选择本身在起负载作用而不是“多花了 LLM 调用”。索引成本与预算敏感性附录 B。LiteraryQA 上的成本对照设置Prompt×10^6Completion×10^6LLM 调用时间hHippoRAG2 base17.8323.0217,99037.2 CrossAug增量17.662.631,4835.7CrossAug 的调用次数只有基线的 8.2%、墙钟时间的 15.3%但带来了 17.66M 的 prompt token——与基线整个索引的 17.83M 几乎持平因为每次补全的 prompt 都要装进子图、多个跨块证据段落与已知三元组。用预算 $B$ 扫描就能在质量与成本之间选点预算 $B$EMF1Completion×10^6base17.5932.7223.025018.2633.672.5810018.4033.812.6315018.4833.805.3820018.7834.005.99预算从 50 提到 200 时 EM 与 F1 单调上升18.26 → 18.78、33.67 → 34.00补全 token 同比例增长2.58M → 5.99M而 $B50$ 时就已优于 base说明小预算即可拿到可用增益。补全三元组质量附录 D。从四个数据集的 HippoRAG2CrossAug 增强三元组里各随机抽 1,000 条用 DeepSeek-V4-Pro 作自动评委再抽 100 条由三位作者人工标注严格二值、多数投票评委准则DeepSeek 判对率%Human–LLM F1Cohens κ事实正确性84.350.9400.765chunk 引用正确性81.540.8990.781人机一致性落在 substantial agreement 区间$\kappa$ 0.765 / 0.781支持把自动评委当作可扩展的代理但判对率本身只有 81–84%残余错误会被写进索引。跨块失败案例附录 A。四个定性案例覆盖了从“多跳长文档”到“叙事长文”的不同语料语料问题基线答案CrossAug 答案补出的关键跨块事实Voodoo Planet冲突发生在哪里on a camping groundin a deadly swampkhatkan swamp 作为战斗地点的定位关系ImmenseeErich 送了什么The gilded birdcageA canary(Eric, is, friend of Elisabeth)MuSiQue / The OfficePam 的婚礼日期未提及October 8, 2009(niagara the office, features, pam beesly and jim halpert s marriage)Youth同意拖带的蒸汽船名Judea被拖的受损船The Sommerville明确描述拖带事件的跨块三元组Voodoo Planet 是最教科书的一例基图里的三元组都块内正确——(Tau, approached, Lumbrilo)、(Tau, defeated, Lumbrilo)、(Voodoo Planet, features, showdown between Lumbrilo and Asaki)——但它们只能串出“Tau 与 Lumbrilo 有冲突”的事件链说不出冲突发生在哪里。CrossAug 补出两条定位事实沼泽是战斗与最终对决的地点检索随即命中沼泽与营地段落Immensee 的问题被从“容器”纠正到“礼物”检索从块 0027 换到块 0014那里写着 “In the cage was a canary … Your friend Eric sent it this noon … as a present for Elisabeth.”MuSiQue 的案例用隐藏事实把婚礼事件桥接到 Niagara 剧集页该页含 “Original air date October 8, 2009”Youth 则纠正了实体角色混淆把答案从被拖的受损船 Judea 改成拖带方 The Sommerville。三个案例分别对应错误对象、缺失链接、排序不足但机制一致CrossAug 改的是图检索的起点与邻域而不只是往库里多塞三元组。结果对比总结CrossAug 的增益与成本把主结果、消融与成本三件事放在一起看CrossAug 的收益形态就非常清楚图 5CrossAug 结果对比总结Mermaid 流程图——三个基框架接入后普遍提升MuSiQue F1 39.95 → 41.28、LiteraryQA 32.72 → 33.8124 项指标 21 升 1 持平代价是多花 8.2% 的 LLM 调用与 15.3% 的墙钟时间。关键发现GraphRAG 的瓶颈在建图期不在检索算法块内抽取让跨块关系别名消解、因果链在建图时就永久缺席下游再聪明的图算法也只能在残缺结构上工作——补全必须发生在检索之前。四个语料各新增 5,048–8,901 条跨块三元组规模相差不到 2 倍的基图都出现了同量级的遗漏。把“哪里的图不完整”变成可自监督学习的问题用掩边与删点两类破坏从基图自身造出监督信号零人工标注GNN 只需判断子图是否不完整等预算换成随机选子图后四个基准全部下降——MuSiQue F1 41.28 → 39.95−1.33、2Wiki EM −1.00说明增益来自“结构向导”本身。框架无关且增益集中在跨块证据更关键的场景同一套 GNN 打分 LLM 取证补全接到 LightRAG、GFM-RAG、HippoRAG2 上都生效24 项 EM/F1 指标中 21 项上升、1 项持平提升最大的是 MuSiQueHippoRAG2 F1 1.33与 LiteraryQA1.09而 HotpotQA 上出现了 −0.10 与 −0.20 的轻微回退。成本被 GNN 压得很小但单次 prompt 很贵LiteraryQA 上 CrossAug 只增加 1,483 次 LLM 调用与 5.7 小时基线的 8.2% / 15.3%却带来 17.66M prompt token预算 $B$ 从 50 提到 200 时 EM 18.26 → 18.78、F1 33.67 → 34.00 单调上升补全 token 从 2.58M 增到 5.99M——质量与成本同步增长运行点可显式挑选。增强三元组基本可信但有残余错误随机抽 1,000 条用 DeepSeek-V4-Pro 评判事实正确率 84.35%、chunk 引用正确率 81.54%100 条人工复核下 Human–LLM F1 为 0.940 / 0.899、Cohens κ 0.765 / 0.781属 substantial agreement。Oral 级创新信号可以逐条对上证据附录 C论文命中三种模式——P1 审计并扭转负载假设n181$\Delta_{\text{OH}}$ 为 13.1 个百分点实现在四个基准各补 5,048–8,901 条跨块三元组、所有框架 F2T 计数显著高于对应 T2FP7 制造监督信号n66用基图自身造不完整正例与完整负例免去人工标注等预算随机对照把增益归因到选择质量P2 替换算子或表示n109把“用 LLM 逐块抽关系”替换为带拓扑归纳偏置的 GNN 缺失度打分器跨框架一致提升且消融隔离出该算子的独立贡献。非 LLM 路线仍是竞争者LinearRAG 在 2WikiMultiHopQA 上以 65.16 F1 压过全部 LLM 抽取型框架且完全不使用 LLM 抽取——跨块图补全不是长文档推理的唯一路径。局限性单次 prompt 很贵每次补全调用都要喂入局部子图、多个跨块证据段落与已知三元组单次 prompt 远长于基图管线LiteraryQA 上增量 prompt 达 17.66M token与基线整个索引的 17.83M 几乎持平作者明确指出这是设计上的代价需要靠上下文压缩或选择性证据检索来缓解。绝对开销不可忽视LiteraryQA 上 CrossAug 额外增加 1,483 次 LLM 调用、17.66M prompt token 与 5.7 小时索引时间约为基线调用与墙钟的 8.2% 与 15.3%——对一次性离线索引可接受对需要频繁重建的语料则不便宜。残余误差会传播引用强制与校验并不能消除全部错误——事实正确率 84.35%、chunk 引用正确率 81.54%写回的错误三元组会进入下游检索与问答高风险场景需要人工复核。依赖基图质量增强以已有基图为起点采样、破坏与打分都建立在基图的实体与边之上若基图本身抽取质量很差可发现的跨块关系也随之受限。增益并非无条件24 项指标里有 2 项为负LightRAG/HotpotQA F1 −0.10、GFM-RAG/HotpotQA EM −0.20而摘要原文 “consistently improves performance” 并未提示这一点。论文自身的表述瑕疵正文 “benchmarks---MusiQue” 与其余处的 “MuSiQue” 拼写不一致Related Work 中定位本文整段与 LP-RAG 对比段在源文件里被注释掉读者无法从成稿中看到完整定位论证结论处仍残留弱 hedge“future work could explore …”。作者展望用更高效的上下文压缩或选择性证据检索降低单次补全的 prompt 开销在不牺牲补全质量的前提下继续压成本整体开销已可由 GNN 阈值 $\theta$ 与预算 $B$ 调节。常见问题FAQCrossAug 与 HippoRAG2、LightRAG、GFM-RAG 是什么关系不是替代关系而是可插拔的离线增强层。三个框架各自按块内抽取建图CrossAug 在查询前对已建好的图做一次跨块关系补全之后图作为静态索引被原框架的检索与生成组件继续使用——实验里三种框架在四个基准上的 24 项 EM/F1 指标有 21 项上升、1 项持平正是这种框架无关性的证据。为什么不让 LLM 直接补全所有跨块关系因为组合爆炸。任意实体对 / 块对都可能藏着漏掉的关系穷举的规模随文档长度增长上下文与成本都不成立。CrossAug 把问题反过来解先用便宜的 GNN 拓扑打分判断“哪个局部子图看起来不完整”再用节点级 Jaccard 相似度去掉高度重叠的候选只在预算 $B$ 内调用 LLM——LiteraryQA 上只多花 1,483 次调用。这也解释了打分器为什么只判断“子图是否不完整”、而不直接预测缺哪条边跨块的别名与因果事实需要的是区域级关系上下文而不是一对孤立实体而“该把 LLM 花在哪里”这个目标也只要求定位区域。消融证明这个选择有效——把 GNN 打分换成等预算的随机子图后四个基准全部退化MuSiQue F1 41.28 → 39.95。监督信号从哪来需要人工标注吗不需要零人工标注。监督完全来自基图自身从基图采样实体中心子图按比例 $\rho_e$ 掩事实边、按比例 $\rho_v$ 删非根实体构造“不完整”正例更充分采样的完整视图作负例。每个 epoch 重新采样根实体避免过拟合到静态人造样例。增强后的三元组可信吗大体可信但有余量。四个数据集各随机抽 1,000 条DeepSeek-V4-Pro 判定事实正确率 84.35%、chunk 引用正确率 81.54%100 条人工标注下 Human–LLM F1 为 0.940 与 0.899、Cohens κ 为 0.765 与 0.781达成 substantial agreement。残余错误会写进索引并传播到下游高风险场景仍需人工复核。索引成本高吗怎么调调用次数很少但单次 prompt 很贵。LiteraryQA 上增量是 1,483 次调用、17.66M prompt token、5.7 小时约为基线调用与墙钟的 8.2% 与 15.3%。两个旋钮可调阈值 $\theta0.40$ 性能最好但调用升到 3,788 次、prompt 升到 40.42M$\theta0.55$ 把调用压到 760 次、prompt 降到 8.57M代价是 EM/F1 低于默认预算 $B50$ 就已优于 base$B200$ 时 EM 18.78 / F1 34.00 为最优。代码和数据是否开源论文给出项目地址 https://github.com/DonFinliani/CrossAug 通讯作者为华东师范大学 Xiang Lixianglidase.ecnu.edu.cn。实验统一使用 Qwen3-32B 骨干、BGE-M3 嵌入与 BAAI-bge-reranker-v2-m3 重排四个基准的题量与图索引规模在正文表格中给出。参考链接本文 arXiv 摘要页https://arxiv.org/abs/2605.28004官方代码作者开源https://github.com/DonFinliani/CrossAugHippoRAG2From RAG to MemoryICML 2025https://arxiv.org/abs/2502.14802LightRAGarXiv 2410.05779https://arxiv.org/abs/2410.05779GFM-RAGGraph Foundation Model for Retrieval Augmented GenerationNeurIPS 2026MS-GraphRAGFrom Local to GlobalarXiv 2404.16130https://arxiv.org/abs/2404.16130LinearRAGarXiv 2510.10114https://arxiv.org/abs/2510.10114给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件