ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

PDF 翻译保姆级教程:pdf2zh 把英文论文翻成中文版,公式图表双语对照一步到位

PDF 翻译保姆级教程:pdf2zh 把英文论文翻成中文版,公式图表双语对照一步到位 PDF 翻译保姆级教程pdf2zh 把英文论文翻成中文版公式图表双语对照一步到位【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslatepdf2zh 是被 EMNLP 2025 收录的开源 PDF 翻译工具一条命令就能把英文论文翻成中文版公式、图表、目录原位保留还多产出一份中英双语对照版PyPI 下载量已超 22 万次。先认版面再翻文字它和普通翻译软件差在哪普通 PDF 翻译是把整页文字抠出来翻一遍再贴回去公式很容易被拆成乱码。pdf2zh 换了个顺序先用 ONNX 版面模型wybxc/DocLayout-YOLO-DocStructBench-onnx判断页面上每块是什么——正文、公式、图、图注只有需要翻译的文字才发给翻译服务公式、图、目录、注释全锁在原位最后把译文写回原坐标产出一份纯中文版再加一份中英逐句对照版。所以它特别适合三件事读公式密集的英文论文、做中英对照的讲义或文献综述、一次翻完一整夹 PDF。核心逻辑放在 pdf2zh/ 包里版面解析在pdfinterp.py翻译调度在translator.py篇幅不长。两步装好翻出第一份双语对照 PDF要 Python 3.11 或 3.12。两条路任选一条装pip install pdf2zh # 习惯 uv 的话也可以 uv tool install --python 3.12 pdf2zh再对当前目录里的 PDF 执行pdf2zh paper.pdf跑完当前目录会多出两个文件paper-mono.pdf纯中文版paper-dual.pdf中英双语对照版默认走 Google 翻译不需要任何 API key。Windows 上不想装 Python可以直接下发布页的pdf2zh-version-win64.zip解压后跑pdf2zh.exe若打不开装上微软运行库vc_redist.x64.exe再试。按任务改参数从试读几页到批量整夹常用参数就这几个-li/-lo指定源语言和目标语言-p只翻部分页-s换服务-t控制线程数-o指定输出目录。只翻前几页先试读文档长、想先看效果用-p传页码范围区间和单页可以混写pdf2zh paper.pdf -p 1-3,5切换 DeepL、OpenAI 或本地 Ollama 服务用-s切服务。Google 和 Bing 免 key其余要先配环境变量pdf2zh paper.pdf -s deepl pdf2zh paper.pdf -s openai pdf2zh paper.pdf -s ollama每个服务要设哪些变量docs/ADVANCED.md 里有一张完整对照表比如 DeepL 是DEEPL_AUTH_KEYOpenAI 是OPENAI_API_KEY。也能在命令里直接带模型-s openai:gpt-4o-mini。给固定术语写一份自定义提示词想让 mutant 一律译成突变体用--prompt传一个提示词文件模板支持${lang_in}、${lang_out}、${text}三个变量pdf2zh paper.pdf --prompt prompt.txt整文件夹批量翻译怎么做--dir传一个目录配-t线程数和-o输出目录就能整夹处理pdf2zh --dir /path/to/papers/ -o output/ -t 3不开命令行GUI 和 Docker 部署pdf2zh -i浏览器没自动弹出就访问http://localhost:7860/拖进 PDF、选服务、选页数再下载译文。细节见 docs/README_GUI.md。要部署到服务器或团队共用用 Docker 就不用管 Python 环境docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zh对照官方演示核对这几处可查证的细节项目用一篇 2006 年的 Nature 论文双栏、多公式、带网络图做过演示。下面两张截图来自官方文档翻译前是英文原文翻译后正文变成中文公式、节点网络图、图注都留在原位。几个能自己核实的点论文被 EMNLP 2025 System Demonstrations 收录摘要写明 PyPI 累计下载已超过 22 万次版面识别、翻译回写链路在 pdf2zh/ 里顺着pdfinterp.py到translator.py读就能看明白Python API 目前弃用、计划在 2.0 重新提供需要程序化调用的先看 docs/APIS.md。翻车预警这四种情况怎么自救⚠️ 扫描版、图片型 PDF 不行。它解析的是文本层得先 OCR 成可复制文本的 PDF 再翻译。首次运行要下载版面模型下载慢或超时就先设镜像再跑Windowsset HF_ENDPOINThttps://hf-mirror.comPowerShell$env:HF_ENDPOINThttps://hf-mirror.com。更多网络问题看 docs/PROXY_CONFIGURATION.md。免 key 的只有 Google 和 Bing。换别的服务前先把 docs/ADVANCED.md 对照表里对应的变量设好。改完参数译文没变多半是缓存。换服务或改提示词后想强制重翻加--ignore-cache输出文件字体兼容性有问题就加--skip-subset-fonts跳过字体子集化。按你的身份选一条下一步在读论文今天先pip install pdf2zh翻出第一份dual对照文件维护团队工具部署一个 Docker 实例让所有人从浏览器进想搞清楚原理从 pdf2zh/ 源码读起版面识别到翻译回写的链路比想象中直白。它做的事很具体把公式当公式、把图当图只让文字部分变得能读。做文献整理最费时的后处理就是这一步。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表