ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OpenVoice:几秒参考音频完成语音克隆,MIT 协议免费商用

OpenVoice:几秒参考音频完成语音克隆,MIT 协议免费商用 OpenVoice几秒参考音频完成语音克隆MIT 协议免费商用【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice想让 AI 用你自己的声音念一段新文字传统做法是准备几小时录音再训练模型。OpenVoice 把语音克隆压缩到几秒钟上传一段参考音频它提取音色再用任意文本合成你的声音。V2 版本原生支持中、英、日、韩、法、西 6 种语言MIT 协议可自由商用。先看效果音色能克隆到什么程度官方演示里同一段文本可以分别用不同参考人的音色朗读沙哑、清亮、低沉这些音色差异都能区分开。三个能力值得注意音色克隆只换音色内容不变参考音频说中文生成端也能输出英语、日语风格可控口音、情感、节奏、停顿、语调由底层 TTS 模型控制合成时可调整零样本跨语言参考端和生成端的语言都不需要在训练集里出现过不写代码也能体验官方平台已部署 9 种语言的即时克隆服务英式/美式/印度/澳洲英语、西班牙语、法语、中文、日语、韩语创建 Bot 后上传参考语音即可克隆。上手最短路径在线体验与本地部署在线平台 Widget Center 里有 TTS 分类选一个基础语音模型再用语音克隆功能上传参考音频几秒出结果。适合只想听听效果的人。本地适合要集成进自己项目、或需要离线部署的开发者Linux Python 3.9conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .之后按版本解压 checkpoint 到checkpointsV1或checkpoints_v2V2还需额外安装 MeloTTS 与 unidic 日语词库具体命令见 docs/USAGE.md。仓库自带三个 Notebook 演示demo_part1.ipynb风格控制demo_part2.ipynb跨语言克隆demo_part3.ipynbV2 多语言想直接开网页交互跑一条命令起本地 Gradio 界面python -m openvoice_app --share能力边界克隆的是音色不是口音docs/QA.md 说得很直白OpenVoice 只克隆参考说话人的音色tone color口音和情感不归它管——这两样来自底层 TTS 模型想要不同口音得换对应的 base speaker。其他语言也能支持前提是你有该语言的基础 TTS 模型音色转换部分团队已训好所以跨语言语音克隆里参考端和生成端的语言可以完全不同官方定位是技术而非产品大部分声音效果不错但别期待每个 case 都完美稳定性需要自己工程化生成音频默认带隐形水印wavmark用于标识 AI 生成内容技术一瞥两个模型如何协作整条流水线是基础 TTS 音色转换器的组合文本 风格参数口音、情感、语调先进Base speaker TTS生成带目标风格的语音Tone color extractor从参考音频里提取音色特征中间 IPA 对齐模块把音色从语音特征里剥离、保留其他风格再把参考音色贴回得到你的声音 受控风格的最终音频音色提取的核心在 openvoice/se_extractor.py对外 API 入口在 openvoice/api.py——BaseSpeakerTTS负责合成ToneColorConverter负责extract_se提音色和convert换音色两步。实战建议参考音频避坑清单docs/QA.md 里列的坏音质排查项其实就是参考音频的准入标准干净、无背景噪声单人说话别混进第二个人时长别太短也别有大段空白换了参考音频文件名后记得清掉processed缓存目录否则会读到旧特征另外两个环境坑本地默认走cuda:0纯 CPU 机器要改 devicese_extractor.py首次运行会下载 Silero VAD 模型网络受限的机器需手动下载解压到 torch hub 缓存目录。文档入口问题排查与扩展安装与分版本使用docs/USAGE.md常见问题音质、语言、安装报错docs/QA.md三个演示 Notebook 与 V2 多语言用法demo_part1.ipynb / demo_part2.ipynb / demo_part3.ipynb【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表