
RetainPDF 用户实战教程从上传扫描版 PDF 到下载译文保留排版翻译全流程详解【免费下载链接】retain-pdf在保留版面、公式与结构的前提下进行 PDF 翻译适用于科研与技术文档项目地址: https://gitcode.com/gh_mirrors/re/retain-pdfRetainPDF 是一款免费的开源扫描版 PDF 保留排版翻译工具专为科研论文、技术手册、扫描图书等图片型 PDF 设计它能在翻译的同时完整保留原版面、行内公式、表格与多栏结构。本教程面向新手带你走完最实用的一条主线上传扫描版 PDF → 选择翻译设置 → 跟踪进度 → 在线对照阅读 → 下载译文 PDF全程只需 5 个步骤。一、为什么扫描版 PDF 最难翻译常见的机翻工具直接对文本框逐句翻译遇到扫描件就会翻车扫描件没有文字层必须先 OCR 识别论文里的行内公式、上下标、多栏排版逐框翻译会把语义切断译文字变长后版面直接溢出、错位。RetainPDF 的做法是先恢复完整语义单元再翻译再用自研排版引擎重排上图展示了 SCI 论文、公式密集的扫描文档和图书教材的原文—译文对照效果。二、安装 RetainPDF两种方式 5 分钟上手方式 1桌面客户端最简单推荐从 Releases 下载对应系统的安装包Windows 为Setup.exemacOS 为.dmgLinux 为.deb。安装后打开即可使用。macOS 若提示应用已损坏把应用拖入/Applications后在终端执行sudo xattr -r -d com.apple.quarantine /Applications/RetainPDF.app方式 2Docker 自部署适合团队共享git clone https://gitcode.com/gh_mirrors/re/retain-pdf.git cd retain-pdf/ops/deployment/docker/delivery docker compose up -d启动后浏览器访问http://127.0.0.1:40001即可。完整配置说明见 ops/deployment/docker/delivery/README.md。三、第 1 步上传扫描版 PDF打开客户端后点击上传选择你的 PDF。上传成功后系统会自动识别页数你可以在图书馆页面看到这本书的封面、页数与翻译状态如果你习惯用脚本或 API对应接口是POST /api/v1/uploads返回upload_id、page_count等字段详见 docs/api/01-任务/01-创建任务.md。四、第 2 步选择 OCR 与翻译设置新手用默认值即可创建翻译任务时有三组设置新手只需关注前两组设置项说明新手建议OCR 引擎识别扫描件文字支持paddle、mineru等 provider选paddle填入自己的 token翻译模型OpenAI 兼容的大模型接口模型名、base URL、密钥选一个效果好的模型翻译并发 workers同时翻译的批次数越大越快保持默认术语表固定专业词译法、保留不翻译的词有专业名词时强烈建议配置渲染参数字体、字号倍率、行距倍率等全部默认两个对新手最有价值的开关mode: sci科研翻译模式针对论文语境优化适合学术文档术语表Glossary支持三种策略——preserve强制保留原文不翻译如 Hartree-Fock、canonical强制固定译法如 密度泛函理论、preferred软性偏好。CSV 即可导入接口见 docs/core/api/index.md 的术语表章节。完整字段说明翻译参数 · 渲染参数五、第 3 步跟踪四个阶段的翻译进度一个完整任务会依次经过OCR → 规范化Normalize→ 翻译 → 渲染四个阶段。界面上可以实时看到阶段名与页数进度如翻译 37/142 页每个阶段都有独立的进度条。几个实用提示大部头几百页翻译耗时几小时是正常的界面会持续汇报页数进度若某阶段失败系统会给出失败诊断失败阶段、原因、是否可重试、能否从断点恢复恢复后只重跑失败的阶段已完成的 OCR 结果会直接复用不重复排队。事件字段与阶段语义详见 docs/api/02-进度事件/01-事件总览.md断点恢复与阶段重试的接口契约见 backend/api/docs/api-spec/jobs.md。六、第 4 步在线对照阅读译文翻译完成后无需先下载就能直接阅读。原 PDF 与译文 PDF同页并排展示方便逐段核对公式、图表和版面位置另外还提供Markdown 阅读模式PDF 与 Markdown 同屏公式和图片全部保留适合快速通读长文档。七、第 5 步下载译文产物任务详情里可以下载多种产物按需选择/pdf翻译后的 PDF最终译文/pdf/side-by-side原文与译文左右对照合成的 PDF适合打印核对/markdown译文 Markdown 文本?rawtrue得到原始文件/download包含全部产物的 ZIP 打包下载。大文件加载走的是支持 Range 的按需加载几千页的 PDF 也能秒开预览。接口清单见 docs/api/07-产物下载/01-下载总览.md。八、进阶三招让翻译更符合你的需求阶段重跑对译文不满意时可从翻译或渲染任意阶段重试前面的产物自动复用不必从头再来retry-stage/resume接口。AI 文档问答直接围绕当前文档提问回答附带页码和原文引用确认无误后可切换到 PDF Agent 做受限的 PDF 修改。AI 运行时配置模型、密钥等通过凭据库统一管理接口只返回引用不返回明文详见 backend/README.md。九、新手常见问题FAQQ翻译一个 100 页的扫描论文要多久A取决于 OCR 和模型速度通常几十分钟到数小时。进度界面按页汇报可随时取消。Q翻译中途失败了怎么办A查看失败诊断点击从断点恢复即可只重跑失败阶段OCR 结果不会重算。Q我的文件和译文存在哪里A全部在后端数据目录uploads / jobs / downloads删除一本书会连同任务产物一起清理源文件默认保留。Q本地开发如何启动A仓库根目录执行python3 ops/development/dev_stack.py --runtime python完整说明见 docs/core/api/local-dev.md。十、总结RetainPDF 把扫描版 PDF 翻译这件麻烦事拆成了清晰的五步上传 → 设置 → 跟踪进度 → 对照阅读 → 下载译文。保留版面、保留公式、术语可控、断点可恢复是目前开源项目里对扫描件最友好的选择。 本文涉及的核心文档创建任务接口docs/api/01-任务/01-创建任务.md翻译参数详解docs/api/04-翻译/01-翻译参数.md渲染参数详解docs/api/05-渲染/01-渲染参数.md进度事件总览docs/api/02-进度事件/01-事件总览.md产物下载总览docs/api/07-产物下载/01-下载总览.md【免费下载链接】retain-pdf在保留版面、公式与结构的前提下进行 PDF 翻译适用于科研与技术文档项目地址: https://gitcode.com/gh_mirrors/re/retain-pdf创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考