ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

MinerU PDF 解析插件上手笔记

MinerU PDF 解析插件上手笔记 MinerU PDF 解析插件上手笔记【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU手上有一份两百页的学术论文 PDF要转成结构干净的 Markdown 喂给下游 LLM还要保留公式和表格——这是 MinerU 典型的使用场景。它通过可插拔的后端模块pipeline / vlm-engine / hybrid-engine把 PDF 解析、Markdown 转换这件事拆成了不同算力档位你可以按机器配置只装需要的部分。下面按实际使用顺序从安装到调优走一遍。最小可用路径# 安装核心模块pipeline 解析、VLM 依赖、Gradio WebUI uv pip install mineru[core] # 对仓库自带的示例 PDF 执行解析结果写入 ./output mineru -p demo/pdfs/demo1.pdf -o ./output跑完后终端会打印进度条产物落在./output/pdf名/auto/目录下.md文件、images/图片目录、content_list.json内容列表结构说明见文档reference/output_files.md。图中展示 MinerU 从 PDF 输入到 Markdown 输出的整体解析流程。按使用深度选安装档位基础转换只装 core适用场景有 CPU 或单张 GPU日常文档转换。# core vlm pipeline gradio 三组依赖的合集 uv pip install mineru[core]默认后端是hybrid-engine只想用传统小模型版面检测 OCR 表格识别走 CPU 路线加-b pipeline即可。这一档能覆盖大部分 PDF 转换需求公式和表格解析默认开启。需要 GPU 加速装 vllm 后端适用场景Linux 机器上有一张 8GB 以上显存的 NVIDIA 卡Turing 架构及以后如 3060、4090。# all core vllm仅 Linux s3 等附加依赖 uv pip install mineru[all] # 启动 OpenAI 兼容的 VLM 推理服务 mineru-openai-server --port 30000关键环境变量MINERU_VIRTUAL_VRAM_SIZE限制推理虚拟显存GB默认自动检测显存紧张时手动调低可防 OOMMINERU_INTRA_OP_NUM_THREADSonnx 模型单算子线程数默认-1自动原理一句话把 VLM 的 KV 缓存管理交给 vllm 引擎同规格显存下推理吞吐明显高于 transformers 原生路径适合批量任务。只要客户端、不跑推理适用场景本地机器显存不足或干脆没有 GPU另有一台远端 GPU 机器跑推理服务。# 基础包不装 torch 等重型依赖体积最小 uv pip install mineru # 连接远端 OpenAI 兼容推理服务纯客户端模式 mineru -p input.pdf -o ./output -b vlm-http-client -u http://server-ip:30000vlm-http-client不在本地跑任何模型hybrid-http-client则要求本地装mineru[pipeline]小模型版面、OCR、表格在本地处理VLM 部分发给远端。后者按本地显存配MINERU_HYBRID_BATCH_RATIO6GB 以下显存设84GB 设42GB 设1用来压 batch 占用的显存。配置与调优常用环境变量如下优先级高于配置文件和命令行参数变量名作用推荐值 / 示例MINERU_MODEL_SOURCE模型下载源modelscope国内网络MINERU_FORMULA_ENABLE公式解析开关默认true纯文字文档可设falseMINERU_TABLE_ENABLE表格解析开关默认trueMINERU_VIRTUAL_VRAM_SIZE推理虚拟显存上限GB按实际显存留 1~2GB 余量MINERU_HYBRID_BATCH_RATIOhybrid 客户端小模型 batch 倍率按显存档位取1/2/4/8完整的参数清单包括 API 服务的并发、超时、任务保留时长等见文档usage/cli_tools.md的环境变量说明一节此处不展开。组合逻辑很简单MODEL_SOURCE解决模型从哪来公式/表格开关解决解析哪些元素显存类变量解决推理跑得动。踩坑记录vllm 装不上多为 torch 与 CUDA 驱动版本不匹配。先nvidia-smi确认驱动对应的 CUDA 版本再按官方 Docker 部署文档quick_start/docker_deployment.md选预构建镜像比本地装省心。中文 PDF 输出乱码pipeline后端加-l ch指定语言OCR 准确率会明显改善或改用hybrid-engine后端绕过传统 OCR。显存 OOM降低MINERU_VIRTUAL_VRAM_SIZE客户端侧同时把MINERU_HYBRID_BATCH_RATIO调到显存对应档位。模型下载超时默认源是 HuggingFace国内网络设export MINERU_MODEL_SOURCEmodelscope后重跑即可。写在最后这篇笔记覆盖了 MinerU 从core基础安装、GPU 加速到纯客户端的三种部署形态以及常用环境变量的调法和四个高频故障的处理方法。进阶方向是自定义解析模块开发和mineru.json配置文件的写法之后会单独展开。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表