ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

pdf2zh(PDFMathTranslate):一键翻译整篇论文,公式与版式全保住

pdf2zh(PDFMathTranslate):一键翻译整篇论文,公式与版式全保住 pdf2zhPDFMathTranslate一键翻译整篇论文公式与版式全保住【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslatePDFMathTranslate命令名pdf2zh是一款面向科研论文的开源 PDF 翻译工具它读取带文本层的 PDF把文字部分换成中文公式、图表和版面位置原样保留同时输出纯中文与中英对照两份文件。该项目的论文已被 EMNLP 2025 System Demonstrations 接收PyPI 包pdf2zh的累计下载量超过 22.2 万。下面从安装讲起再给你按场景调参数的方法。它翻得了哪些 PDF翻不了哪些一句话链路输入带文本层的 PDF → 版面模型逐块识别正文、公式、图与图注 → 文字部分送翻译服务 → 译文写回原位。这就是保留版式翻译的完整过程。适合公式密集的论文公式翻译后仍是公式需要中英对照逐句精读文献的人想一次处理整个文件夹 PDF 的批量场景不适合纯扫描版、图片型 PDF没有文本层只挑几段文字来翻译最小粒度是按页下图是项目的 Star 增长曲线可以直观看到它被多少团队用过。装好并跑出第一份中文稿环境要求 Python 3.11 或 3.12先装pip install pdf2zh✅ 装完得到命令行入口pdf2zh。把待翻 PDF 放到当前目录执行pdf2zh paper.pdf✅ 当前目录会生成paper-mono.pdf纯中文与paper-dual.pdf中英对照默认走 Google 服务免 API key。其他安装路径一句话带过uv用户可换成uv tool install --python 3.12 pdf2zhWindows 用户可从发布页下载pdf2zh-version-win64.zip解压后直接运行pdf2zh.exe不想装 Python 的用文末的 Docker 方式即可。按目标调参数从试读到批量论文不止一份时命令后加--dir /path/to/papers/就整目录批跑-t 3开三个翻译线程-o指定输出目录。指定语言方向与试读页码不是英译中或想先在前几页验证质量pdf2zh paper.pdf -li en -lo zh pdf2zh paper.pdf -p 1-5-li/-lo指定源语言和目标语言-p接页码范围翻译带内置缓存试读跑过的部分全量跑时不会重复请求。换用 DeepL、OpenAI 或本地 Ollama默认 Google 不合意时用-s切换服务pdf2zh paper.pdf -s deepl pdf2zh paper.pdf -s ollama只有google和bing免 key其余要先配好 API key 等环境变量各服务的变量清单见 docs/ADVANCED.md 的对照表ollama接本地模型翻译环节不依赖外网。有固定术语比如希望 neutrino 一律译作中微子时用--prompt传入提示词文件。打开网页界面不想敲命令时pdf2zh -i浏览器没自动打开就访问http://localhost:7860/在页面上选文件、选服务、选翻译页数细节见 docs/README_GUI.md。给团队部署一个 Docker 实例要部署到服务器、多人共用docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zh跑完在浏览器打开http://localhost:7860/就是同一套界面机器上不用准备 Python 环境。译文对比公式和图都在原位官方文档用一篇含公式与网络图的双栏学术论文做演示样本左图是英文原文右图是翻译结果正文变成中文公式和网络图留在原处。可以自己核实的事实论文被 EMNLP 2025 System Demonstrations 接收摘要中写明 PyPI 累计下载量超过 22.2 万。版面解析在pdf2zh/pdfinterp.py翻译调度在pdf2zh/translator.py代码量不大可以顺着读。实验性的 v2.0 翻译内核用--mode precise开启相关代码在pdf2zh/kernel/目录下。会真正卡住你的坑⚠️扫描版不能直接翻。工具解析的是文本层图片型 PDF 要么装实验 OCR 模式pip install pdf2zh[ocr]要么先转成文本版。首跑要下载版面模型。模型名wybxc/DocLayout-YOLO-DocStructBench-onnx下载超时先设置HF_ENDPOINThttps://hf-mirror.comWindows 用setPowerShell 用$env:更多网络问题见 docs/PROXY_CONFIGURATION.md。多数服务要先配 key。仅 Google默认与 Bing 开箱即用变量名以 docs/ADVANCED.md 对照表为准。改参数后译文不变。翻译默认走缓存切换服务或改提示词后旧译文不会自动失效加--ignore-cache强制重翻输出文件有字体兼容问题就加--skip-subset-fonts。接下来做什么读论文的人今天执行pip install pdf2zh再用pdf2zh paper.pdf一条命令拿到dual对照文件。部署到团队的人用docker pull byaidu/pdf2zh起一个共用实例所有人从浏览器进。想读源码的人从pdf2zh/pdfinterp.py的版面解析到翻译回写这条链路读起。它只做了一件事输出里的公式还是公式图还是图被翻译的只有文字。文献整理里最费时间的排版后处理交给它了。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表