
三个脚本把 PDF 转成干净的 MarkdownDolphin 文档解析实践【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin拿到一份 60 页的 PDF想要里面可编辑的 Markdown表格、公式、代码全靠手工重排几乎不可能。Dolphin 是一个开源文档图像解析模型ACL 2025两阶段完成页面布局、阅读顺序与元素识别直接输出结构化 Markdown。本文覆盖安装、最短跑通路径与参数调整看完你能在自己机器上完成第一次 PDF 转 Markdown。Dolphin 是什么不是什么一句话定义Dolphin 是字节跳动开源的通用文档图像解析模型当前版本 Dolphin-v2 为 3B 参数在 OmniDocBench 上的综合得分 89.78比初版 74.67 有明显提升。它的工作方式是先分析后解析第一阶段判断文档类型数字原生 vs 拍照件并预测布局与阅读顺序第二阶段对文本、表格、公式、代码分元素并行解析拍照件则走整页整体解析。它适合有 GPU 的开发者、需要批量把论文/报告转成 Markdown 的团队。要提前说清楚的两件事它没有图形界面纯命令行运行3B 模型在 CPU 上推理很慢只当玩具跑不建议。另外拍照件依赖整页解析图像质量差低分辨率、严重倾斜时效果会打折这不是参数能救的。安装与首次跑通 环境要求 Python PyTorch依赖见 requirements.txt其中 torch 2.6.0、transformers 4.51.0。git clone https://gitcode.com/GitHub_Trending/dolphin33/Dolphin cd Dolphin pip install -r requirements.txt然后下载 Dolphin-v2 预训练权重到本地./hf_modelpip install huggingface_hub huggingface-cli download ByteDance/Dolphin-v2 --local-dir ./hf_model首次运行建议用仓库自带的示例页单张图片或单页 PDF 都可以也支持整个目录批量处理python demo_page.py --model_path ./hf_model --save_dir ./results \ --input_path ./demo/page_imgs/page_1.png结果写在--save_dir指定的目录包含结构化 JSON 与 Markdown 两种格式多图会按figures/子目录落盘。常用参数对照表仓库提供三个入口脚本分工不同demo_page.py 做整页解析支持 PDF 逐页转图后处理demo_element.py 做单元素解析demo_layout.py 只做布局与阅读顺序检测。参数 / 脚本作用什么时候需要它--input_path单个文件、PDF 或整个目录批量转换时直接指向目录无需写循环--save_dir结果输出目录不想让结果文件混进原文件目录时--max_batch_size默认 4同类型元素的并行解码批大小显存富余调大可提速显存吃紧就调小--post_process对输出结果做后处理Markdown 需要进一步规整排版时--element_typetext/table/formula/codedemo_element.py 的元素类型只对某一类元素如表格单独重解析时--print_results控制台直接打印识别结果快速验证模型输出不关心落盘文件时demo_layout.py仅输出布局框与阅读顺序排查阅读顺序错乱问题先定位再调参输出长什么样两张元素级解析示例表格被还原为 Markdown 表格结构代码块保持原始缩进与语法客观说干净排版的数字原生 PDF 转换质量高阅读顺序基本正确但复杂跨页表格、低分辨率扫描件仍会有单元格错位这是所有同类解析模型共有的短板验收时建议抽查而不是全信。使用前后自查这份清单报 Unsupported file type→ demo_element.py 只收图片PDF 要走 demo_page.py → 换成页面解析脚本或把 PDF 导出为图片再试。跑一页要等很久→ 无 CUDA 时模型以 float 精度落 CPU → 换 GPU 环境短期可先用--input_path指向单页冒烟测试。表格内容缺失或串行→ 表格是独立裁剪后解析的元素与正文重叠度高时会受影响 → 提高原图分辨率或用--element_type table单独核对。双栏论文阅读顺序错乱→ 第一阶段布局框重叠严重时会自动回退为整页解析 → 先用 demo_layout.py 看布局输出确认是布局问题还是元素解析问题。找不到模型文件→ 权重未下载到默认路径 → 确认./hf_model存在或显式传--model_path。适合三类场景学术论文批量归档成 Markdown、扫描报告电子化、含大量代码的技术文档结构化提取。手边有一批待转的 PDF直接从上面的 clone 那一步开始即可。【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考