
BabelDOC 教程一条命令把英文 PDF 译成中文版式与公式都保留【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC周五下午四点你收到一批英文技术资料要求下班前整理成中文讲义。把整份 PDF 丢进网页翻译工具公式和表格的排版立刻散架。BabelDOC 是一个免费开源的 PDF 翻译命令行工具它按段落解析原文交给大模型翻译后再重新排版回 PDF最终输出一份原版式不变、带中英双语对照的文档。项目速览定位、许可与关键依赖项目说明一句话定位PDF 翻译引擎解析原版式逐段翻译重新排版输出新 PDF核心能力公式与表格原位保留、双语对照输出、CLI 与 Python 接口语言支持英语→中文为主支持 100 余种目标语言最适合谁需要本地批量处理论文、技术手册等 PDF 的人许可协议AGPL-3.0运行环境Python 3.10–3.13关键依赖PyMuPDF、onnxruntime版面检测、openai翻译接口翻译引擎任意 OpenAI 兼容大模型含 Ollama 等本地模型完整能力清单见 README各阶段的实现原理见 实现细节文档。首次运行从安装到第一份双语 PDF准备一个 Python 3.10 及以上的环境然后安装并验证pip install BabelDOC babeldoc --help第一条命令装完会输出Successfully installed BabelDOC之类的成功信息第二条命令你会看到版本号 0.6.2 和按翻译 / PDF 处理 / 翻译服务分组的全部参数说明说明环境就绪。接着跑第一条正式翻译命令把一份英文 PDF 译成中文babeldoc --openai \ --openai-model gpt-4o-mini --openai-api-key 你的密钥 \ --files example.pdf执行过程中你会看到带步骤名称的进度条解析、翻译、排版结束后当前目录多出两个文件example.zh.pdf是纯中文版本example.zh.dual.pdf是原文与译文左右并排的双语对照版。首次运行会自动下载版面检测模型和字体耗时稍长属正常现象。功能深挖对照输出、页码范围、术语表与扫描件双语对照与阅读版式对谁有用需要边读原文边核对译文的人尤其是学术场景。怎么用默认同时产出纯中文版和并排对照版只想要其中一份时用--no-dual或--no-mono关闭另一种。在手机上阅读可以把--use-alternating-pages-dual打开对照版会改成一页原文、一页译文交替排列比左右分栏更易读。页码范围与长文档切分对谁有用论文动辄上百页只想先翻几章或一次性全翻怕失败重来。怎么用--pages 1,2,1-,-3,3-5支持任意页码组合只翻译指定页输出中其余页保持原文--max-pages-per-part 30让工具每 30 页切一段翻译结束后自动合并回完整 PDF。术语表控制对谁有用团队有固定译名如产品名、缩略语不想让大模型自由发挥。怎么用准备一个含source,target,tgt_lng三列的 CSV用--glossary-files 路径.csv传入仓库里有 示例文件 demo_glossary.csv 可参考格式。另外工具默认会自动从文档中提取高频术语辅助翻译--no-auto-extract-glossary可关闭该步骤。扫描件处理对谁有用手头是扫描出来的 PDF背景里残留原图文字。怎么用加--ocr-workaround译文下方会垫白色色块遮住原文、全部文字强制纯黑输出前提是白底黑字。已知文档确定不是扫描件时可加--skip-scanned-detection跳过检测直接提速。完整工作流翻译一篇论文的指定章节以把 80 页英文论文的正文部分1–20 页翻成中文并固定术语为例完整链路如下。输入paper.pdf、一个大模型 API 密钥、可选的术语表。babeldoc --openai --openai-model gpt-4o-mini --openai-api-key 你的密钥 \ --pages 1-20 \ --glossary-files docs/example/demo_glossary.csv \ --files paper.pdf -o output/处理工具按固定管线执行——解析 PDF 并构建中间表示检测版面区域区分标题、正文、公式和表格处理样式与公式占位保证公式不参与翻译再调大模型逐段翻译结果有缓存重复段落不再计费最后重新排版并映射字体写回 PDF。输出output/paper.zh.pdf纯中文与output/paper.zh.dual.pdf左右对照仅第 1–20 页被翻译其余页保持原文。预期结果正文中的行内公式、表格和图片位置与原文档一致对照版左栏为英文原文、右栏为中文译文术语表里的词全部按你指定的译名出现。常见坑与解法现象输出的 PDF 在某些阅读器里打不开。原因部分阅读器不支持产物中的富文本结构。解决改用--enhance-compatibility它等效于跳过清理、译文页前置并禁用富文本翻译。现象扫描版翻译后出现文字重叠、背景发花。原因原文是图片未被选中的原字留在译文背后。解决加--ocr-workaround用白色色块盖住原文限白底黑字文档。现象处理百页以上文档时内存溢出或中途崩溃。原因整份文档一次性进入处理。解决用--max-pages-per-part 30分段翻译完成后自动合并。现象同一专有名词前后译法不一致。原因大模型按上下文即兴翻译。解决把该词写进 CSV 并用--glossary-files传入命中的术语表会被附进提示词强制遵守。进阶调优TOML 配置与离线资产TOML 配置文件参数多的项目建议把常用参数写进 TOML 文件用--config 配置.toml一次性加载示例模板见 README 的 Configuration File 一节。团队里多人翻译同类文档时配置即规范。命令行参数的完整定义在 babeldoc/main.py。离线资产包在无外网的机器上部署时先在一台联网机器执行babeldoc --generate-offline-assets ./assets生成包含全部模型与字体的 zip 包再用babeldoc --restore-offline-assets ./assets在目标机器恢复包内文件以 SHA3-256 校验完整性保证两台机器翻译行为一致。babeldoc --generate-offline-assets ./assets babeldoc --restore-offline-assets ./assetsBabelDOC 把保版式、护公式的重活收在管线内部你只需提供 PDF 和一个大模型密钥。下一步建议挑一篇公式密集的英文论文只翻前 10 页跑一次双语对照核对图表与公式位置确认效果后再投入整篇。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考