ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OpenVoice 即时语音克隆:一段参考音频,换一条能说话的声线

OpenVoice 即时语音克隆:一段参考音频,换一条能说话的声线 OpenVoice 即时语音克隆一段参考音频换一条能说话的声线【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice 是 MIT 与 MyShell 联合开发的开源即时语音克隆模型。给几秒参考音频就能用这个声音朗读任意文本原生支持中、英、日、韩等 6 种语言。适合需要快速搭建语音助手、有声内容等功能的开发者和创作者。你可能为什么需要它你有一段角色的录音现在想用它朗读两万字的剧本。传统 TTS 的音色是固定的配不上这个人请人重新录制周期按周算商业克隆服务又贵还未必允许放进自己的产品。OpenVoice 的即时语音克隆定位很明确几秒音频完成音色克隆代码开源MIT 许可证商用免费。最快体验路径不装环境也能跑门槛最低的方式是用 MyShell 平台上的官方部署服务提供英语、中文、日语等多种语言的语音克隆入口在平台上创建一个 Bot上传参考音频就能出效果适合先听再决定要不要本地部署。想本地运行命令很少。准备好 Python 3.9 环境后克隆仓库并安装conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .关键一步是下载模型权重V1 解压到checkpoints目录V2 解压到checkpoints_v2目录各版本的下载地址见 docs/USAGE.md。之后运行python -m openvoice_app --share本地会打开一个 Gradio 页面上传参考音频、输入文字几秒钟后就能听到结果。它是怎么工作的音色和台词分离可以这样理解音色好比声纹内容好比念出来的台词。OpenVoice 只负责从参考音频里提取音色至于念什么词、用什么情绪和口音念由底层的 TTS 基础模型决定。两者解耦带来一个直接好处随时可以换声纹而不改变说话方式也可以换基础模型来调整情感表达。跨语言克隆同理参考音频可以是任意语言V2 版本原生支持英语、西班牙语、法语、中文、日语、韩语。让效果更好4 个实用调节点参考音频的干净程度比长度更关键。单声、无底噪的录音最好背景噪音和长时间静音会直接体现在生成结果里。别指望它克隆情绪。OpenVoice 只克隆音色想要输出更情绪化或带特定口音更换基础 TTS 模型即可框架支持替换。跨语言用法看仓库里的 notebook 示例。demo_part1 讲风格控制demo_part2 讲跨语言demo_part3 讲 V2 的用法照着改参数就行。换参考音频前先清缓存。OpenVoice 会缓存参考音频的中间结果同名文件直接复用换料不换缓存会拿到旧结果。避坑常见问题遇到生成语音音质差通常是参考音频有噪音、太短、混有多人说话或长静音导致换一段更干净的录音重跑即可。遇到音色对了但情感和口音不对这不是 bugOpenVoice 只克隆音色情感和口音由基础模型决定想调整就更换基础模型。遇到输出和上次不一样但参考音频没变通常是旧的processed缓存文件夹没删删除后重新运行即可。遇到首次运行长时间卡住通常是 Silero 人声检测模型需要联网下载且源不可达手动下载模型包放入 torch 缓存目录具体路径见 docs/QA.md。接下来可以做什么接入 API 的话openvoice/api.py 已封装好完整推理链在业务服务里直接调用即可。做二次开发读一遍 demo_part1 到 demo_part3 三个 notebook 和 核心模块目录能覆盖风格控制与跨语言两条主线。查安装与版本细节从 docs/USAGE.md 入手。OpenVoice 是给声音做免费、合法克隆时的开源选项一段参考音频换一条能多语言朗读的声线。完整用法与权重下载见 docs/USAGE.md。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表