ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GraphRAG 快速上手指南:从原始文本到可查询知识图谱

GraphRAG 快速上手指南:从原始文本到可查询知识图谱 GraphRAG 快速上手指南从原始文本到可查询知识图谱【免费下载链接】graphragA modular graph-based Retrieval-Augmented Generation (RAG) system项目地址: https://gitcode.com/GitHub_Trending/gr/graphrag用传统 RAG 问这批文档的主要主题是什么这类全局性问题往往只能得到一堆检索片段的拼凑。GraphRAG 是一个模块化的基于图的检索增强生成框架它用大模型从非结构化文本中抽取实体与关系构建知识图谱并生成层级社区摘要让问答能覆盖整个语料库而不只是个别片段。 30 秒看懂 GraphRAG输入什么、输出什么一句话概括它吃进你的原始文本用 LLM 提取实体和关系、聚类成社区并写出摘要最后产出一套可查询的知识图谱索引。与传统 RAG 的差异看这张表对比项传统 RAGGraphRAG检索单元文本片段 向量相似度实体、关系、社区摘要局部问题某个人、某事件够用够用全局问题语料整体主题、跨文档共性片段难凑出全貌靠社区级摘要回答知识形态片段库层级知识图谱 社区报告 第一次构建从克隆仓库到跑通第一条索引建议用 Python 3.11 环境。四步跑通克隆仓库后面的 Web 面板也要用它git clone https://gitcode.com/GitHub_Trending/gr/graphrag安装 CLI 并初始化工作区pip install graphrag graphrag initinit会生成settings.yaml、.env、prompts/目录和一个空的input/目录把GRAPHRAG_API_KEY填进.env即可。往input/里丢一个样例文档比如仓库自带的docs/data/operation_dulce/Operation Dulce v2 1 1.md。执行索引graphrag index运行后终端里会看到各步骤依次推进的进度输出看到步骤逐条跑完、目录里多出output/文件夹就构建成功了。提醒一句索引会对每段文本发起大量 LLM 调用官方文档明确建议先用小数据跑通流程再上量。️ 读懂构建产物数据流经过哪三站构建完成后打开output/目录你会发现数据流过了三站每站对应几张 parquet 表实体与关系图谱entities.parquet和relationships.parquet是核心站点抽出的每个实体、实体间每条关系都存在这里是整张知识图谱的地基。层级社区communities.parquet把实体按 Leiden 算法聚成不同粒度的社区父子层级分明。社区摘要与可查询索引community_reports.parquet由 LLM 为每个社区写好摘要配合文本单元和嵌入表成为全局检索的原料。想逐字段对照每张表的含义可以查 输出表说明。 打开统一搜索面板让图谱变得可玩仓库内置了一个对比多种搜索模式的 Web 面板必须在克隆下来的仓库里运行cd unified-search-app uv sync uv run poe start浏览器打开http://localhost:8501拿两个问题感受差别面板左侧可勾选要对比的模式全局检索如What are the top themes in this story?以社区摘要为上下文回答有整体结构。局部检索如Who is Scrooge and what are his main relationships?以实体关系图谱和相关片段为上下文具体细节更准。体感规律问全局用 global问个体用 local。️ 从能用到好用四个最值得调的开关settings.yaml的extract_graph段控制实体类型与抽取规则类型分得越细图谱越清晰但抽取成本也越高。settings.yaml的cluster_graph段控制社区划分粒度直接决定社区摘要的层级和全局检索回答的角度。prompts/目录由graphrag init生成可直接改提示词模板贴合你的领域拿不准怎么改可以先跑graphrag prompt-tune自动生成一版再微调。graphrag update命令增量更新只处理新增数据不用全量重建索引大语料下省下的费用很可观。各配置项的完整字段见 配置文档。️ 排错速查三个高频问题问题原因解法构建慢、token 费贵每个文本单元都要调 LLM开销随数据量线性涨先用小数据验证流程在settings.yaml的models段换成更快更便宜的模型支持哪些模型默认对接 OpenAI / Azure OpenAIsettings.yaml里可分别指定 chat 与 embedding 模型更多接入方式以官方文档为准该选它还是传统 RAG两者面向不同的问题类型问局部事实传统 RAG 够用问跨文档的全局主题GraphRAG 明显更好数据量小可先从传统 RAG 起步跑通这一圈之后建议顺着 docs/ 把查询方式和数据流完整读一遍遇到问题可以直接在项目里提 issue。下一步不妨接入你自己的文档问出第一个全局问题——那才是这套框架最好玩的时刻。【免费下载链接】graphragA modular graph-based Retrieval-Augmented Generation (RAG) system项目地址: https://gitcode.com/GitHub_Trending/gr/graphrag创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表