ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

一条命令翻译 PDF 论文:PDFMathTranslate 从安装到出稿的 4 步实践

一条命令翻译 PDF 论文:PDFMathTranslate 从安装到出稿的 4 步实践 一条命令翻译 PDF 论文PDFMathTranslate 从安装到出稿的 4 步实践【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslatePDFMathTranslate 是一款保留排版格式的开源 PDF 文档翻译工具EMNLP 2025它先识别页面布局再把文本送去翻译公式、图表和目录都留在原位最终产出单语译文与双语对照两个 PDF 文件。 适用场景PDFMathTranslate 适合哪些翻译需求浏览器网页翻译对付网页文章够用但遇到学术论文就力不从心公式被拆散、图表错位对照原文引用时几乎没法用。PDFMathTranslate 针对的就是这类译文必须和原文同版式的场景它依靠布局检测模型wybxc/DocLayout-YOLO-DocStructBench-onnx区分文字、公式与图区只把正文段落交给翻译服务版式信息不动。适合它的人群大致有三类需要精读外文论文、逐页核对推导过程的科研人员要基于原文页码引用公式和图表的写作者以及手上攒了一批 PDF、想批量产中译本的读者。它默认把英文翻译成中文也能指定日、韩等其他目标语言。 快速上手3 条命令完成安装与首次翻译环境要求Python 3.11 至 3.12。安装前确认python --version落在该区间即可。第 1 步安装pip install pdf2zh执行完成后pdf2zh命令会注册进你的 PATH终端输入pdf2zh --version可看到当前版本号。第 2 步运行第一条翻译命令pdf2zh document.pdf首次运行会先下载布局检测模型随后逐页显示解析与翻译进度。默认服务为 Google源语言 en、目标语言 zh默认 4 线程并发翻译。第 3 步验证产出ls当前目录下会多出两个文件document-mono.pdf纯译文和document-dual.pdf双语对照原文在上、译文在下。打开任一文件确认公式仍在原位置即算跑通。不想装 Python 的话也可以用 Docker 起一个 Web 版docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zh容器在后台启动后浏览器访问http://localhost:7860即可拖入 PDF 翻译。 核心工作流翻译一篇论文并核对公式下面以一篇英文论文paper.pdf为例走一遍完整流程。1. 发起翻译pdf2zh paper.pdf执行后终端先加载 ONNX 布局模型再按页输出解析、翻译进度条页面多的文档可加-t 8提高并发。2. 检查双语版排版open paper-dual.pdf打开后每一页是原文页 译文页的结构文字块位置与原文对齐LaTeX 公式保持矢量形态没有被转成图片。3. 抽查公式密集页翻到推导最多的章节确认行间公式和上下标没有被翻译服务改写——这正是布局检测环节的工作。4. 二次运行验证缓存pdf2zh paper.pdf已翻译文本命中缓存不会重复调用 API第二次运行明显更快。想强制重翻时加--ignore-cache。原文与译文效果可对比这两张截图⚙️ 常用参数表语言、服务、页面与批量高频参数整理如下完整清单见 docs/ADVANCED.md参数作用示例-p只翻译指定页码pdf2zh paper.pdf -p 1-3,5-li/-lo源语言 / 目标语言pdf2zh paper.pdf -li en -lo ja-s选择翻译服务可用服务:模型指定模型pdf2zh paper.pdf -s openai:gpt-4o-mini-t翻译线程数默认 4pdf2zh paper.pdf -t 8-o指定输出目录pdf2zh paper.pdf -o out--dir递归批量翻译目录下 PDFpdf2zh --dir ./papers/-i启动 Web GUIpdf2zh -i--config使用 JSON 配置文件pdf2zh paper.pdf --config cfg.json几个值得留意的点内置服务有 Google、Bing、DeepL、OpenAI、Ollama 等二十余种用本地 Ollama 时默认模型为 gemma2各服务所需环境变量见 docs/ADVANCED.md 的服务表输入也接受 .doc/.docx会先自动转成 PDF--config不传路径时默认读写~/.config/PDFMathTranslate/config.json。️ 实用技巧与避坑模型下载卡住布局模型从 Hugging Face 拉取网络不佳时先设置set HF_ENDPOINThttps://hf-mirror.comPowerShell 用$env:HF_ENDPOINT https://hf-mirror.com再运行。Windows 打不开 exe从发布页拿到的 Windows 包若双击无反应先安装微软的 vc_redist.x64.exe 运行库。Docker Hub 拉不动改用容器镜像ghcr.io/byaidu/pdfmathtranslate运行命令不变。输出字体异常或文件偏大默认会做字体子集化来压缩体积遇到兼容问题加--skip-subset-fonts关闭。想试 v2 内核--mode precise走实验性的隔离环境翻译内核fast 为默认的 v1需要额外准备 pdf2zh_next 子模块见 docs/ADVANCED.md。PDFMathTranslate 把翻译一篇论文压缩成一条命令、两份产出版式由它负责。若想继续研究布局解析与翻译流水线可以克隆仓库阅读源码git clone https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate。对想理解 AI 工具如何处理 PDF 的人来说它是一份可以直接跑的参考实现。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表