ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

markitdown:把 PDF、Word、PPT 批量转成 Markdown,3 行代码接入你的大模型流程

markitdown:把 PDF、Word、PPT 批量转成 Markdown,3 行代码接入你的大模型流程 markitdown把 PDF、Word、PPT 批量转成 Markdown3 行代码接入你的大模型流程【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdownmarkitdown 是微软开源的 Python 文档转换工具能把 PDF、Office 文档、图片、音频等格式统一转成 Markdown保留标题、列表和表格结构。它输出的文本对大模型很友好适合要做 RAG 知识库或文本分析的你。3 步跑通markitdown 安装步骤 环境要求一句话Python 3.10 及以上建议放在虚拟环境里避免依赖冲突。pip install markitdown[all]然后几行代码就能拿到转换结果from markitdown import MarkItDown md MarkItDown() result md.convert(test.pdf) print(result.text_content)不想写 Python 也行装完就有命令行入口markitdown document.pdf -o output.md支持范围与核心特性一览类别支持内容说明Office 文档DOCX / PPTX / XLSX / XLS每种格式有独立的可选依赖组按需安装文档PDF / EPUBPDF 可提取文本、标题和表格网页与文本HTML / CSV / JSON / XML / RSS纯文本类格式直接转换图片JPG / PNG 等读取 EXIF 元数据可接 LLM 生成文字描述音频WAV / MP3元数据 语音转写需安装转录依赖其他ZIP / Outlook .msg / YouTube 链接ZIP 会遍历内部文件逐个转换除内置转换器外它还有一套插件机制第三方可以注册自己的格式转换器用--use-plugins参数即可启用。功能深潜挑 3 个最常用的讲清楚图片转 Markdown让 LLM 替你看图说话解决什么问题PPT 和文档里常嵌图片传统转换工具只会丢一个占位符或文件名图片信息就丢了。怎么配置初始化时传入任意 OpenAI 兼容的客户端和模型名from markitdown import MarkItDown from openai import OpenAI md MarkItDown( llm_clientOpenAI(api_keyyour-key), llm_modelgpt-4o ) result md.convert(diagram.jpg)得到什么Markdown 里对应位置会写上一段模型生成的图片描述比如形状、颜色、文字内容下游大模型读这段文字就能知道图里有什么。下图就是项目测试目录里专门用来验证这个能力的样例图PDF 转 Markdown论文和报告直接变结构化文本解决什么问题PDF 是企业里最常见的黑盒格式手工复制会丢掉表格和标题层级。怎么配置只需装pip install markitdown[pdf]然后走命令行或convert()即可没有额外参数。得到什么章节标题变成#级标题表格变成 Markdown 表格语法列表保持列表。对 LLM 来说这比一整块无结构的纯文本好解析得多。测试目录里就放着一份论文首页的扫描件可以看到转换后标题、作者、摘要层级都保留了下来扫描件识别markitdown-ocr 插件纯扫描的 PDF 没有文字层上面的 PDF 转换器拿不到内容。项目单独提供了一个 markitdown-ocr 插件它给 PDF、DOCX、PPTX、XLSX 转换器加上 OCR 能力复用同一套llm_client参数不引入额外的机器学习库。配套的测试样例在 ocr_test_data 目录都是带图片的扫描类文档方便你验证效果。一个真实场景把散落的会议材料喂给知识库小团队里做知识库的人经常遇到这种情况一个季度的材料散在共享盘里会议纪要是一堆 DOCX数据报表是 XLSX产品截图是 JPG手动整理要一整天。实际操作是这样的先把文件集中到一个目录然后一条命令批量转换find . -name *.docx -o -name *.xlsx -o -name *.jpg | \ xargs -I {} markitdown {} -o md/{}.md得到的 Markdown 文件里纪要保留了小标题和列表Excel 报表变成了表格语法。接着把它们切块、向量化丢进向量库同事用自然语言提问时大模型回答里能直接引用原文的表格内容。这个同事把两百多份文件从要整理一周压缩到了一个下午全程没有手工复制过一段文字。避坑与实用建议按需装依赖只转 PDF 和 Word 就装markitdown[pdf,docx][all]会把音频、Azure SDK 全拉进来体积大不少。Python 版本低于 3.10 装不上报的错往往不直观先查版本再排依赖问题。扫描件是高频坑默认 PDF 转换器读的是文字层纯扫描 PDF 会转出空白需要加 markitdown-ocr 插件并配置视觉模型。音频转写较慢wav/mp3 依赖[audio-transcription]和系统语音引擎首次运行别以为卡死了。安全边界工具以当前进程的权限读写文件处理来路不明的文件时建议用convert_stream()/convert_local()这类窄接口并校验输入README 的安全章节有详细说明。大文件控制内存用流式接口convert_stream()逐个处理比一次性读入更稳。写在最后源码和完整用法都在 主包 README 里格式清单和安全注意事项以它为准。想自己加一个格式的转换器照着 插件示例 抄一份就行扫描件多的话直接上 OCR 插件。测试目录 test_files 里各种格式的样例文件拿来试手最合适。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表