
3 步把破损扫描件还原成可编辑文本Zerox OCR 古籍与旧档数字化指南【免费下载链接】zeroxOCR Document Extraction using vision models项目地址: https://gitcode.com/GitHub_Trending/ze/zerox一张褪色的 1965 年驾照、一张泛黄的发票、几页字迹模糊的扫描文档如何把它们上面的文字变成可编辑、可检索的 MarkdownZerox OCR 就是干这件事的把文档逐页转成图像交给视觉大模型读字最后输出结构化 Markdown让破损文档修复与古籍数字化比人工录入轻松得多。下文按一张破损扫描 → 一份可恢复文本的主线展开跟着处理流程走上手机器器的教程会自然嵌在流程里。第一步如何把破损扫描件变成图像OCR 图像增强预处理OCR 的原料终究是图像。图本身糊、方向歪、边上有黑边再强的模型也白搭。所以 Zerox 在识别之前会先做一轮图像到图像的清理分辨率控制PDF 渲染时指定 DPI默认 300字迹褪色的页面不会因为渲染参数吃亏方向校正Node 版correctOrientation内部调 Tesseract 的方向检测模式先判断每页哪边朝上再送去识别。Tesseract 调度工具采用 worker 池策略起步小规模、页数多了自动扩容边缘裁切Node 版trimEdges把与四边背景色接近的像素裁掉让模型视野里只剩有效内容。这就是 Zerox 的图像增强部分。它不是某套专有滤镜而是围绕 OCR 流水线的一组针对性预处理但效果很直接模型收到的是一张更清晰、摆正、无干扰的页面。第二步多模型协同识别褪色字迹如何被读出来并交叉验证预处理好的页面图并行送往选定的视觉模型。SDK 同时支持 OpenAI、Azure OpenAI、AWS Bedrock、Google Gemini 和 Vertex AIPython 版通过 模型适配层基于 LiteLLM 把这些厂商统一成一个入口切换模型只改model参数即可。关键设计是并发 上下文。默认按页并发批处理concurrency控制同时跑多少页默认 10由 页面处理工具用信号量限流。如果文档里表格跨页、或希望排版前后一致可以打开maintain_format系统会把上一页的 Markdown 连同当前页图像一起喂给模型——相当于先读上一页再读这一页。速度降为串行但格式连续性明显提升适合表格密集的旧档。上下文校正的另一半是提示词工程。Python SDK 的custom_system_prompt允许你写自己的识别规则而默认规则集见 shared/systemPrompt.txt已经约定了不少细节水印包进watermark、页码包进page_number、图表优先转成表格、勾选框用 ☐/☑。这套机制让模型在输出文字时就按规则自我校验而不是事后靠别的工具去纠错。第三步输出识别结果为 Markdown3 行代码完成数字化模型返回的文本会先经正则清洗剥掉多余的代码块包裹和解释性文字文本清洗逻辑再按页序拼接成完整文档写入output_dir下与源文件同名的.md文件Node 版同样可用outputDir参数落盘。最终产物长这样表格变成标准 Markdown 表格语法代码块保留围栏格式连Table 26.2这类图注都有对应行。换成中文票据也一样表格字段、印章区的文字都能被逐项读出整个过程代码量很小。Python 版先装包系统需先装 poppler 提供 PDF 渲染支持再调用核心异步 APIpip install py-zeroximport asyncio, os from pyzerox import zerox os.environ[OPENAI_API_KEY] your-key result asyncio.run(zerox( file_pathshared/inputs/0028.pdf, modelgpt-4o-mini, output_dir./output, select_pagesNone, # 也可传页码列表只处理部分页 maintain_formatFalse, # 表格跨页多时建议开启 )) print(result)破损文档修复能到什么程度效果边界与适用场景说句实话Zerox 的修复是把现存信息读全而不是把已经消失的字补回来。它能扛住的褪色、泛黄、带污渍但字迹仍可辨的扫描件比如开篇那张 1965 年的驾照表格、印章、图文混排等复杂版式——视觉模型本来就比纯文本 OCR 更擅长这种页面批量数字化select_pages支持大文件只处理指定页concurrency调节吞吐Node 版还有maxRetries等容错参数。它不擅长的残损到只剩半个字的页面——没有任何算法能凭空想象缺失内容篆书、隶书等手写古文体——当前视觉模型的主战场是印刷体现代文本这类文献建议把它输出当草稿再配合专业工具校对。另外Node 版还提供按 JSON Schema 抽取结构化字段extractOnlyschema和逐页抽取extractPerPage可以和批处理任务组合做先数字化归档、再抽取业务字段的流程。总结三类人适合现在动手手里有一批纸质档案、票据、证照扫描件想快速变成可检索文本 → 直接可用装完包几行代码起步在搭文档 → AI 摄入管线 → 官方定位就是 OCR for AI ingestion它的 Markdown 输出恰好就是下游要的格式团队在 Node 生态 → 用npm install zerox装 Node 版参数集更全方向校正、边缘裁切、重试次数等。项目采用 MIT 开源协议Python 核心流程只有一个清晰的小文件想深入改行为、看整条流水线怎么串起来直接读源码即可。【免费下载链接】zeroxOCR Document Extraction using vision models项目地址: https://gitcode.com/GitHub_Trending/ze/zerox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考