ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

MOSS-TTS 浏览器演示开箱即用:5 个 Gradio 应用一键体验语音克隆

MOSS-TTS 浏览器演示开箱即用:5 个 Gradio 应用一键体验语音克隆 MOSS-TTS 浏览器演示开箱即用5 个 Gradio 应用一键体验语音克隆【免费下载链接】MOSS-TTSMOSS‑TTS Family is an open‑source speech and sound generation model family from MOSI.AI and the OpenMOSS team. It is designed for high‑fidelity, high‑expressiveness, and complex real‑world scenarios, covering stable long‑form speech, multi‑speaker dialogue, voice/character design, environmental sound effects, and real‑time streaming TTS.项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTSMOSS-TTS 是 MOSI.AI 与 OpenMOSS 团队开源的语音与声音生成模型家族支持高保真长文本语音合成、零样本语音克隆、多说话人对话和实时流式输出。本教程带你用 5 个 Gradio 浏览器应用一键体验语音克隆、音色设计、多角色对话和音效生成——无需写一行前端代码。准备工作3 步搭建语音克隆演示环境演示基于 Python 3.12 Transformers 5.0.0推荐用 Conda 隔离环境避免依赖冲突。# 1. 克隆仓库 git clone https://gitcode.com/GitHub_Trending/mo/MOSS-TTS cd MOSS-TTS # 2. 创建环境并安装依赖 conda create -n moss-tts python3.12 -y conda activate moss-tts pip install --extra-index-url https://download.pytorch.org/whl/cu128 -e .[torch-runtime] # 3. 安装 FFmpeg音频读写依赖 sudo apt-get install -y ffmpeg # Debian/UbuntumacOS 用 brew install ffmpeg 首次启动应用时会自动从模型仓库下载权重如OpenMOSS-Team/MOSS-TTS-v1.5请耐心等待。GPU 显存建议 8GB 起步无 GPU 时可安装 FlashAttention 2 或改用 llama.cpp 后端降低显存占用详见 README.md。整个家族共用同一个「音频底座」MOSS-Audio-Tokenizer将 24kHz 音频压缩成 12.5Hz 的离散 token是语音克隆高保真的关键5 个 Gradio 应用一键启动清单所有演示脚本都放在 clis/ 目录下各自独立运行、端口互不相同可同时启动多个应用启动命令默认端口核心玩法️ MOSS-TTS 语音克隆python clis/moss_tts_app.py7860零样本克隆、31 种语言、时长控制 MOSS-TTS-Local v1.5python clis/moss_tts_local_v1.5_app.py786148kHz 立体声、浏览器实时流式播放✨ MOSS-VoiceGeneratorpython clis/moss_voice_generator_app.py7862用文字描述设计全新音色️ MOSS-TTSD 多说话人对话python clis/moss_ttsd_app.py7863最多 5 位说话人超长对话️ MOSS-SoundEffect 音效python clis/moss_sound_effect_app.py7861文本生成 30 秒环境音效⚠️ 小提醒Local v1.5 与 SoundEffect 默认都用 7861 端口同时运行时可用--port参数错开。应用 1MOSS-TTS 语音克隆——一段参考音频变声克隆这是旗舰演示对应 clis/moss_tts_app.py默认加载 8B 的 MOSS-TTS-v1.5。打开浏览器后你只需要做三件事选择参考音频上传任意一段人声或从内置示例中挑选参考音频见 assets/audio/输入目标文本支持纯文本、拼音nin2 hao3、IPA 音标混写挑选模式并生成界面提供三种模式——Clone标准零样本语音克隆参考音频有多长都行v1.5 对「长参考 短文本」的克隆更稳定Continuation把参考音频当开头续写音色自然延续Continuation Clone两者结合先续写再克隆。亮点功能31 种语言标签合成非中英语言时选中对应语言如 French能显著提升发音准确度⏱️时长控制滑块指定生成的 token 数粗略控制音频长短适合做配音卡点⏸️显式停顿文本里直接写[pause 3.2s]即可插入指定秒数的停顿示例文本一键填充内置中英文样例来自 assets/text/moss_tts_example_texts.jsonl点击即可试用。应用 2MOSS-TTS-Local v1.5——48kHz 立体声 浏览器流式试听clis/moss_tts_local_v1.5_app.py 是与众不同的一位它不是「生成完再播放」而是边合成边在浏览器里出声的实时 Web Audio 应用体验接近语音对话。基于 MOSS-Audio-Tokenizer-v2原生48kHz 双声道输出空间感更自然同样支持 Clone / Continuation / Continuation Clone 三种语音克隆模式支持语言标签、流式解码模型权重从本地目录加载--model-dir可指定适合反复调试音色。应用 3MOSS-VoiceGenerator——不传音频用文字「设计」音色clis/moss_voice_generator_app.py 演示了「免参考音频」的音色设计在指令栏输入类似低沉磁性、略带沙哑的男中音这样的自然语言描述模型直接生成对应的声音风格再配合文本合成台词。内置的中英文示例assets/text/moss_voice_generator_example_texts.jsonl覆盖了播客、旁白、角色等多种场景。主观评测中它在整体偏好、指令遵循、自然度三个维度上均领先同类音色设计模型应用 4MOSS-TTSD 多说话人对话——一键生成多人对谈clis/moss_ttsd_app.py 专为播客、访谈、剧本配音而生最多5 位说话人每人上传各自的参考音频 一句话 prompt 来「定调」对话文本用[S1]、[S2]标记角色切换界面预置了一段英文商务对话示例打开就能听超长对话表现稳定说话人归属准确率高主观评测胜过多款闭源对话模型应用 5MOSS-SoundEffect——一句话生成 30 秒环境音效clis/moss_sound_effect_app.py 基于 DiT Flow Matching 架构见 moss_soundeffect_v2/输入文字描述即可生成 48kHz 音效最长 30 秒步进数、CFG 强度、随机种子都暴露在界面上方便微调。试试这些 prompt暴雨打在铁皮屋顶上远处偶尔雷声滚动深夜便利店自动门开合饮料机低鸣清晨森林鸟鸣与溪流交错常见问题速查问题解决方案启动卡在下载权重首次运行需下载模型可先用huggingface-cli预下载到本地再用--model_path指定本地路径显存不足8GB安装 FlashAttention 2或转向 moss_tts_delay/llama_cpp/ 的 torch-free 后端克隆音色不稳定v1.5 已显著降低克隆方差参考音频尽量选 5~30 秒清晰人声端口被占用所有应用都支持--host/--port参数自定义小结一套 clis/ 脚本覆盖语音克隆、音色设计、多角色对话、流式试听、音效生成五大场景全部浏览器即用新手建议从 clis/moss_tts_app.py 的 Clone 模式入手体验「上传参考音频 → 输入文本 → 得到克隆语音」的最短路径深入调参请看各模型卡docs/moss_tts_model_card.md、docs/moss_ttsd_model_card.md、docs/moss_voice_generator_model_card.md、docs/moss_sound_effect_model_card.md想训练专属音色三种架构的微调教程分别在 moss_tts_delay/finetuning/、moss_tts_local/finetuning/ 和 moss_tts_realtime/finetuning/。【免费下载链接】MOSS-TTSMOSS‑TTS Family is an open‑source speech and sound generation model family from MOSI.AI and the OpenMOSS team. It is designed for high‑fidelity, high‑expressiveness, and complex real‑world scenarios, covering stable long‑form speech, multi‑speaker dialogue, voice/character design, environmental sound effects, and real‑time streaming TTS.项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表