ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何把杂乱文档变成 AI 能读的格式:docling 文档预处理全流程指南

如何把杂乱文档变成 AI 能读的格式:docling 文档预处理全流程指南 如何把杂乱文档变成 AI 能读的格式docling 文档预处理全流程指南【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling你大概率遇到过这个情况一份 PDF、一个 Word、几张扫描件、一堆 CSV要一起喂给 RAG检索增强生成流程结果全卡在数据进不去。docling 就是为这一步做的文档解析工具包把三十多种格式的文档统一转成 Markdown、JSON 这类大模型能直接读的结构化结果且全程本地运行数据不出机器。能力全景30 多种输入格式汇入一棵文档树先说它能吃什么基本覆盖你日常碰得到的东西办公类PDF、DOCX/DOC、XLSX、PPTX、ODT、EPUB、Apple Pages文本与标记Markdown、AsciiDoc、LaTeX、HTML、CSV图像PNG、JPEG、TIFF、WEBP多媒体音频WAV/MP3需 asr 扩展、视频MP4/AVI需 ffmpeg垂直 XMLUSPTO 专利、JATS 期刊文章、XBRL 财务报告、邮件 EML/MSG这些格式解析后都变成同一个东西——DoclingDocument一棵带位置、阅读顺序、表格和图层的文档树。页面上每个区块是标题、正文、表格还是图片由版面模型layout model判定扫描件走 OCR把图片里的字识别成文本表格交给表格结构模型重建行列。输出侧也有 7 种以上Markdown、HTML、无损 JSON、纯 Text、Doctags保留布局信息的紧凑标签格式、WebVTT、以及可直接进 RAG 的 ChunksJSONL 分块输出。pip install docling 三步跑通最小转换示例 ⚡安装就一行命令要求 Python 3.10 以上Linux、macOS、Windows 的 x86 和 arm64 都能跑pip install doclingPython API 四行搞定第一次转换from docling.document_converter import DocumentConverter source ./example.pdf # 也支持直接传 URL converter DocumentConverter() result converter.convert(source) print(result.document.export_to_markdown()) # 直接得到 Markdown命令行同样能干活docling example.pdf --to markdown效果一样docling --help里有全部选项。注意第一次运行会自动从 Hugging Face 下载模型权重慢是正常的。扫描版 PDF 是怎么被处理的5 步流水线一份没有文本层的扫描件走 docling 的标准流水线时依次经历解析读取页面、渲染成图先尝试抽取已有文本层版面检测layout 模型框出每个区块的类型和位置OCR没有文本的区块送进 OCR 引擎识别表格结构表格区域做单元格级解析重建行列关系组装按阅读顺序拼出 DoclingDocument带上标题层级OCR 和表格结构默认都是开着的装完就能跑。代码块和公式识别默认关闭——这两步比较慢需要时再显式打开。输出不只是 Markdown哪些格式能直接进 RAGMarkdown 最常用但无损 JSON 和 Chunks 往往更关键JSON无损序列化版面、来源、置信度全保留还能反序列化回来二次加工Markdown / HTML / Text直接喂给大模型读ChunksJSONL分块一步到位--chunks-max-tokens控制块大小RAG 管道直接消费Doctags紧凑标签适合把布局结构传给 VLM视觉语言模型docling 的结果也能直接接 LlamaIndex、LangChain、CrewAI、Haystack这些框架都有现成的集成适配器不用自己写胶水代码。进阶换语言、开公式、离线部署怎么写默认跑通之后定制靠传选项。PDF 流水线的控制台是 PdfPipelineOptionsfrom docling.datamodel.base_models import InputFormat from docling.datamodel.pipeline_options import PdfPipelineOptions, OcrAutoOptions from docling.document_converter import DocumentConverter, PdfFormatOption opts PdfPipelineOptions( do_formula_enrichmentTrue, # 开启公式识别 ocr_optionsOcrAutoOptions(lang[eng, chi_sim]), # 中英双语 OCR ) converter DocumentConverter(format_options{ InputFormat.PDF: PdfFormatOption(pipeline_optionsopts) })还有两个高频场景离线/内网环境先把模型权重下载到本地缓存然后给artifacts_path指过去运行期就不碰网络了复杂版式论文可以切到 VLM 流水线--pipeline vlm --vlm-model granite_doclingGraniteDocling 是文档专用视觉模型复杂排版下往往比传统流水线更准批量转换就是循环调converter.convert记得判断result.status失败的记录文件名别让一个坏文件把整批中断。翻车与自救这 4 个问题基本人人踩 ️中文 OCR 出乱码Tesseract 需要系统层面装对应语言包如 chi_sim而且lang里的值必须和你选的 OCR 引擎的语言码体系对得上两套别混用。Intel 的 Mac 装不上新版 PyTorch 已经不再提供 Intel Mac 的 wheel要么锁 torch 2.2.2 再装要么直接用官方给的docling[mac_intel]扩展安装。纯 CPU 服务器装 PyTorch 的 CPU 版本不然白下几百 MB 的 GPU 依赖文档里 installation 有对应参数。处理慢到怀疑人生OCR、表格、公式几个开关是叠加计时的官方建议大批量场景给document_timeout设 90~120 秒的保护只开你真正需要的步骤。从安装、跑通流水线到定制和离线部署docling 的常用路径基本就是这几步。下一步建议直接翻官方使用文档里 GPU 和高级选项的部分或者挑一个最接近你业务的 docs/examples/ 示例跑一遍踩到 bug 就去项目仓库提 issue维护者响应挺快。参考资源官方文档docs/usage/示例代码docs/examples/常见问题docs/faq/index.md【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表