ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Abogen有声书生成完全指南:5分钟把EPUB、PDF和纯文本变成带同步字幕的有声书

Abogen有声书生成完全指南:5分钟把EPUB、PDF和纯文本变成带同步字幕的有声书 Abogen有声书生成完全指南5分钟把EPUB、PDF和纯文本变成带同步字幕的有声书【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogenAbogen是一款开源有声书生成工具它基于Kokoro-82M文字转语音模型把EPUB、PDF、纯文本变成带同步字幕的音频。支持8种语言、语速0.1x~2.0x提供桌面与Web两种界面。本文手把手带你完成安装、单本转换与批量转换。能力速览一张表看懂Abogen能做什么项目说明输入格式EPUB、PDF、TXT、MD、SRT、ASS、VTT另有内置文本编辑器输出音频WAV、FLAC、MP3、OPUS压缩比最佳、M4B带章节信息字幕输出SRT、ASS宽/窄/居中可切句子级、词级、行级支持语言美音/英音英语、西班牙语、法语、印地语、意大利语、日语、葡萄牙语、中文语速0.1x ~ 2.0x语音编码首字母是语言a美音b英音…次字母 m/f 表示性别如 af 为美音女声跑起来Abogen安装与三种启动方式所有平台先装一个依赖 espeak-ngWindows 从 espeak-ng 官方 Release 下载安装 .msimacOS 执行brew install espeak-ngUbuntu/Debian 执行sudo apt install espeak-ng。Abogen Windows一键安装步骤git clone https://gitcode.com/GitHub_Trending/ab/abogen cd abogen双击WINDOWS_INSTALL.bat按提示选择版本推荐 1Stable PyPI。脚本会自带 Python 并装齐依赖含 CUDA不需要单独装 Python。Abogen Linux和macOS安装git clone https://gitcode.com/GitHub_Trending/ab/abogen cd abogen python -m venv venv source venv/bin/activate pip install abogen需要 Python 3.10~3.12。也可以直接用仓库推荐的 uv 方式uv tool install --python 3.12 abogen。桌面、Web、Docker三种启动方式桌面应用PyQtabogenWeb 界面Flaskabogen-web然后打开 http://localhost:8808拖入文档即可。Web 端多出新功能Supertonic TTS、LLM 文本标准化、Audiobookshelf 推送Docker 常驻docker build -t abogen . mkdir -p ~/abogen-data/uploads ~/abogen-data/outputs docker run --rm \ -p 8808:8808 \ -v ~/abogen-data:/data \ --name abogen \ abogen容器里上传文件存到/data/uploads生成结果落在/data/outputs。 场景一给单本电子书生成带同步字幕的有声书目标一本 EPUB 进去音频加字幕出来。运行abogen把 EPUB/PDF/TXT 拖进输入框或用内置编辑器直接粘贴文字选语音按语言首字母 性别选编码点播放按钮可先试听设语速0.1x~2.0x与字幕模式Sentence句子级最常用1/2/3 words 词级仅英文可用选输出格式与保存位置与源文件同目录、桌面或自定义文件夹点 Start电子书可勾选章节单独保存或生成合并版PDF 还能按章节 页码选取范围桌面应用从选文件到出音频的完整流程 场景二Abogen批量转换一次处理整个书架目标多本书排队转换不用每本重复配置。打开 Queue Manager队列管理器.txt、.srt、.ass、.vtt直接用 Add files 按钮或拖入队列PDF、EPUB、Markdown 则先在主窗口输入框选好点 Add to Queue每个文件会记住入队时的配置鼠标悬停可查看勾选 Override item settings with current selection可强制所有项统一使用当前设置确认后 Abogen 按顺序自动处理并保存输出队列管理器批量添加并管理转换任务️ 场景三用语音混合器混出专属讲述声音目标把多个语音模型按权重叠出一种自己的声音。在主界面打开 Voice Mixer语音混合器左侧 Profiles 选一个基础配置或点 New profile 新建右上角选语言如 American English拖动每个语音的权重滑块界面会实时显示百分比例如 af_nicole 39.2%、af_heart 39.2%点 Preview 试听混音效果满意后 OK 保存为 profile以后在语音下拉框直接选用也可导入/导出分享给别人语音混合器按权重叠加多个语音模型️ 场景四在服务器上常驻运行浏览器随时取书目标服务常驻后台上传即转完成即下载。服务器上运行abogen-web或按跑起来一节用 Docker 启动打开 http://localhost:8808局域网内用服务器 IP 访问在 Dashboard 拖拽上传文档选语音、语言、语速、字幕样式、输出格式点 Create job任务立即进队列后台 worker 按序执行进度与日志在浏览器里实时刷新完成后下载音频/字幕文件任何任务可随时取消或删除关键配置Web 端独有的 Supertonic TTS、LLM 标准化在设置页配置做完的书可在 Settings → Integrations → Audiobookshelf 填 Base URL、Library ID、文件夹和 API token 后直接推送到 Audiobookshelf 书库。Web 界面仪表盘任务总数、转换进度与日志实时更新进阶调优按需使用GPU加速勾选 Use GPU Acceleration (if available)。NVIDIA 显卡在 Windows/Linux 都可用AMD 显卡需 Linux ROCm若提示 CUDA GPU is not available. Using CPU说明已回退到 CPU速度会变慢章节标记处理 EPUB/PDF/Markdown 时会自动写入CHAPTER_MARKER:章节标题到缓存文本里纯文本可手动加效果是把文本拆成独立音频、出错时只重跑指定章节输出格式取舍OPUS 压缩比最好M4B 带章节元数据适合有声书播放器WAV 音质最高缓存已转换文本会缓存重复处理更快菜单里 Clear cache files 清空缓存Pre-download models and voices for offline use 可预下载模型实现完全离线时间戳文本含HH:MM:SS格式时间戳的文本会被自动识别用于精确控制每段话的播出时间点踩坑速查安装报 No matching distribution found → 需要 Python 3.10~3.12推荐用 uv 安装。Windows 提示 CUDA GPU is not available. Using CPU → PyTorch 未能使用 GPU 而回退 CPUAMD 显卡需改用 LinuxROCm。Linux 提示 abogen-cli 不在 PATH 中 → 把~/.local/bin加入 PATH。日语语音不出声 → 日语需要额外安装misaki[ja]依赖。图形界面起不来看不到原因 → 命令行运行abogen-cli查看详细报错再按报错信息排查。资源指引源码、文档与测试全部源码在 abogen/其中 abogen/webui/ 是 Web 界面、abogen/plugins/ 是 Kokoro 与 Supertonic 语音引擎插件详细文档见 docs/安装排错与测试方法见 docs/getting-started.md 与 docs/testing.md测试用例在 tests/改代码前可先跑一遍确认没破坏行为挑一本你最想听的书现在就把你的第一本有声书生成出来。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表