
把英文论文变成中英对照 PDFBabelDOC 免费快速上手指南【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOCBabelDOC 是一个开源的 PDF 翻译工具输入一份英文 PDF它会重排一次版输出原文和译文并列的中英对照双语 PDF公式和原始排版尽量保留。如果你的工作流里经常要批量读论文读完这篇能从零装好并跑通你的第一份对照文档。问题为什么一翻译排版就崩导师丢来一份 40 页的英文论文两周后交综述这是最常见的翻车现场。网页翻译插件逐段翻公式和上下标碎掉一大片。整页截图走 OCR双栏论文的阅读顺序经常读反参考文献被糊成一坨。先转 Word 再翻译版面直接崩掉图表位置全飘。根因是 PDF 本身是印出来的格式逐字改文字必然破坏版面。BabelDOC 的管线一句话讲完先把 PDF 解析成段落、公式、表格的中间表示让大模型只翻译纯文本部分公式符号原样保留最后按原文字体和字号重排成对照页面。快速上手一条命令安装五分钟出首份对照用 uv 管理 Python 3.12 环境这条命令装完后你会多出一个全局的babeldoc命令可以先跑babeldoc --help确认参数列表uv tool install --python 3.12 BabelDOC准备一个 OpenAI 兼容的 API key官方接口、DeepSeek、Ollama 本地模型都行跑下面这条最短命令文件路径建议写绝对路径首次运行会自动下载字体和版面分析模型断网机器可提前用--warmup拉取babeldoc --openai --openai-model gpt-4o-mini \ --openai-base-url https://api.openai.com/v1 \ --openai-api-key 你的key \ --files /path/to/paper.pdf跑完后在当前目录或--output指定的目录会拿到两份文件双语 PDF原页与译页左右并排这就是你要的中英对照版本单语 PDF纯译文适合只读译文不想分屏的场景。译文版默认带水印不需要的话加--watermark-output-mode no_watermark。参数速查日常要记住的 8 个参数完整列表跑babeldoc --help查官方注明 CLI 主要用于调试下表是高频的那几个参数作用何时用--pages 1,3,5-8只翻译指定页先试读前几页控制费用--files a.pdf --files b.pdf可重复传参批量处理多个 PDF一次翻多篇论文--lang-in/--lang-out源/目标语言默认 en → zh英文→中文以外的语言对--no-dual/--no-mono只输出两类文档中的一类只要译文省一半生成时间--max-pages-per-part长文档按页拆分分批翻译再自动合并几百页的文档防中途挂掉--glossary-files terms.csv术语表CSV 三列 source、target、tgt_lng专有名词译法要统一--qps限制每秒请求数默认 4API 额度紧时调低--output输出目录默认当前目录想集中存放结果 最容易被低估的是术语表文本里命中术语时对应词条会被强制塞进给模型的提示词专名译法一下就稳定了示例文件在 docs/example/demo_glossary.csv。排错5 个常见故障怎么修译文盖在扫描底图上文字互相叠字。原因扫描件检测有漏检译文直接叠在原扫描文字上。解法加--ocr-workaround它会在译文下垫白色底块并强制文字为黑色仅适合白底黑字的扫描文档。输出 PDF 在某些阅读器打不开或偏色。原因部分阅读器对输出格式兼容性差。解法加--enhance-compatibility等价于--skip-clean --dual-translate-first --disable-rich-text-translate的组合注意代价是--skip-clean会让文件体积变大。长文档中途失败担心重跑再烧一遍 API。原因翻译默认带缓存已翻完的段落重跑时直接读缓存。解法原命令重跑即可别顺手带--ignore-cache那是强制重翻用的。想用 Ollama 这类本地模型但没有 API key。原因工具只要求接口 OpenAI 兼容对 key 本身无要求。解法--openai-base-url指向本地服务地址key 填任意值即可例如--openai-api-key a。作者区和参考文献被并成一段。原因官方 Known Issues 里承认的问题——这两区解析有错翻译后会合并成一段同类未支持项还有横线和首字下沉。解法没有参数能修带可复现的 PDF 去报 issue或先容忍这个瑕疵。适合谁 / 往哪走它的主场是英文→中文论文精读、批量文献处理、要存档或打印的 PDF 中英对照场景。⚠️ 官方明确其他语言对尚未充分测试重要文档先用--pages抽几页验证再全量跑。需要 Web 界面或更多翻译服务传统引擎如 Bing/Google 未做优化只支持 OpenAI 兼容的 LLM可以看社区的自部署项目 PDFMathTranslate-next。想深挖时分阶段的实现说明在 docs/ImplementationDetails/解析、找段落、样式与公式、排版各有专篇解析加排版的管线源码在 babeldoc/format/pdf/document_il/支持的语言清单见 docs/supported_languages.md。实验室没有外网的话先在有网机器上用--generate-offline-assets打一份离线资产包再分发目标机器用--restore-offline-assets恢复。一句话收尾成本是一条安装命令加一个 API key跑一次 gpt-4o-mini 的 token 费用拿到的是一份可以存档、打印的中英对照 PDF。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考