ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

5 步用 MCP 把 PageIndex 接入 Claude 与 Cursor,直接提问完成长文档分析

5 步用 MCP 把 PageIndex 接入 Claude 与 Cursor,直接提问完成长文档分析 5 步用 MCP 把 PageIndex 接入 Claude 与 Cursor直接提问完成长文档分析【免费下载链接】PageIndex PageIndex: Document Index for Vectorless, Reasoning-based RAG项目地址: https://gitcode.com/GitHub_Trending/pa/PageIndex200 页的 PDF 没法在 AI 对话框里直接提问。PageIndex 是一个无向量、基于推理的长文档分析框架通过 MCP 集成可以直接接入 Claude 桌面版与 Cursor 等客户端用大白话向文档提问。 工作原理先翻目录再读原文PageIndex 不切块、不走向量库它先给 PDF 生成一份目录再让模型沿着目录找到页码、最后读原文。树状索引就像书的目录AI 按目录查内容而不是逐字搜索。具体分两步第一步扫描 PDF生成树状索引每个节点是文档的自然章节带章节标题、页码范围和简短摘要第二步在提问时模型沿树从上到下推理、逐步缩小范围定位到相关节点后再取页内容。这和向量检索相似但不相关的毛病不同每次检索都带明确的章节与页码引用答案从哪来可以核对。官方 Mafin 2.5 金融文档系统基于这套方法在 FinanceBench 基准上取得 98.7% 准确率来源项目官方基准数据。⚙️ 3 步装好并配好密钥环境要求 Python 3.8无需额外安装向量数据库三步完成克隆仓库并进入目录安装依赖在项目根目录创建.env文件填入 LLM 的 API key走 LiteLLM可换成其他模型厂商git clone https://gitcode.com/GitHub_Trending/pa/PageIndex cd PageIndex pip3 install --upgrade -r requirements.txtOPENAI_API_KEYyour_API_key_here密钥配好后可以先对任意一份 PDF 跑一次建索引打开生成的结构文件看看目录长什么样。入口脚本是 run_pageindex.py模型与节点参数都在 pageindex/config.yaml 里改的时候留意这两处即可。 接入 AI 客户端Claude 与 CursorPageIndex 的 MCP 服务地址是 api.pageindex.ai/mcp仓库里 pageindex/mcp_bridge.py 实现了完整的客户端协议你只需要在客户端配置里加一条服务器记录。在 Claude 桌面版中添加 MCP 服务器这是最标准的 Claude MCP server 配置路径全程在客户端图形界面内完成打开 Claude 桌面版进入设置找到 MCP Servers / Developer 部分添加新的 MCP 服务器选择远程HTTP类型粘贴下面的配置片段key 换成你自己的保存后等待状态变绿工具列表里应出现 browse_documents、get_document_structure、get_page_content 等只读工具配置片段并入客户端的 mcpServers 配置pageindex: { url: https://api.pageindex.ai/mcp?toolsread, headers: { Authorization: Bearer your_API_key } }注意地址末尾的?toolsread是只读模式模型只能查询和阅读、不能删除文档第一次接入建议用这个。在 Cursor IDE 中启用文档分析Cursor 文档分析的配置与上面完全相同打开 Cursor 设置中的 MCP 入口选择添加新的 MCP 服务器粘贴同一段 JSON 配置填入 key验证在对话框输入列出我能查看的文档能返回文档列表就说明接好了 完整走一遍上传、提问、核对接好之后一个完整闭环分三步全程可核对。上传文档把一份 PDF 上传到 PageIndex 文档库本地也可以用 run_pageindex.py 建索引。文档会先进入树状索引构建可用 get_document 查看处理状态。直接提问问这份年报里的主要风险有哪些。模型会先调 get_document_structure 取目录缩小到风险相关章节再调 get_page_content 按页码读原文最后组织答案。核对答案回答会附带章节名和页码翻回 PDF 对应页面比对检索是否准确一目了然。这个查目录 → 读原文 → 引页码的闭环正是 MCP 长文档分析体验的核心。❓ 常见避坑安装命令跑完报 ModuleNotFoundError 怎么办多半是 Python 版本问题。项目要求 3.8先用 python3 --version 确认系统里装了多个 Python 时注意用与解释器匹配的 pip3 重装依赖。配置文件到底在哪个位置一共三处分工不同模型名与节点参数在 pageindex/config.yamlAPI key 在项目根目录的 .envMCP 连接地址与鉴权头在 AI 客户端的配置里别混着改。MCP 服务器显示连接失败或 401、403几乎都是鉴权问题。检查 Authorization 是否为Bearer加空格再加 keykey 是否过期以及网络能否访问 api.pageindex.ai公司网络要留意代理设置。上传长文档后很久没响应正常吗正常索引构建耗时与页数成正比。先看状态pending、processing、completed或用 wait_for_completion 参数最多等 3 分钟长时间停留在 processing 时换一份更小的文档重新验证流程。PDF 抽不出文字扫描件怎么办自托管走的是标准 PDF 解析纯图片的 PDF 会提示页面空白。这种情况改用带 OCR 的云端服务或先把 PDF 转成可检索文本的版本。️ 进阶调优先动这两个参数默认值对多数文档够用超长文档主要调下面两个。max_page_num_each_node每节点最大页数默认 10文档很长时可提到 15~20树节点更少、检索更快代价是章节粒度略粗max_token_num_each_node每节点最大 token 数默认 20000单节内容太长导致节点被截断时调大保证章节完整toc_check_page_num扫描目录的页数默认 20目录位置靠后时调大避免树建在错误的标题上构建速度也值得关注。项目内置的 PageIndex Flash 用启发式方法做结构提取树结构本身几秒就能生成加上摘要与优化1000 页的文档大约 3~4 分钟 去哪学更多cookbook/pageIndex_chat_quickstart.ipynb聊天流程快速上手跟着跑一遍就有手感examples/tutorials/doc-search/文档搜索教程覆盖描述、元数据等检索策略examples/tutorials/tree-search/树搜索教程讲清模型如何在树上导航examples/agentic_vectorless_rag_demo.py自托管的 agentic 无向量 RAG 完整示例把 PageIndex 通过 MCP 接入 Claude 与 Cursor 之后长文档从逐字翻变成按目录翻每个答案都能带页码去核对。挑一份你一直想问的文档把上传、提问、核对这个闭环跑一遍上手也就这几步的事。【免费下载链接】PageIndex PageIndex: Document Index for Vectorless, Reasoning-based RAG项目地址: https://gitcode.com/GitHub_Trending/pa/PageIndex创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表