ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Voicebox上手指南:本地声音克隆与语音生成,从几秒音频到能用的声音

Voicebox上手指南:本地声音克隆与语音生成,从几秒音频到能用的声音 Voicebox上手指南本地声音克隆与语音生成从几秒音频到能用的声音【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voiceboxVoicebox 是一个开源的本地 AI 声音克隆工作室几秒人声就能克隆出一个可用音色配合 7 个 TTS 引擎在本地生成 23 种语言的语音。做旁白、播客、听写、给 Agent 接语音的开发者都适用模型和数据全程不出你的电脑。为什么值得试试全本地运行模型、声音样本、录音都存在你自己机器上隐私问题从根上不存在输入输出两头都管一边是 TTS 生成和声音克隆一边是全局听写加 Whisper 本地转写声音 I/O 的完整闭环在一个应用里7 个 TTS 引擎随便切Qwen3-TTS、Chatterbox Multilingual、LuxTTS、HumeAI TADA 等按场景换引擎低配机器用 LuxTTS 约 1GB 显存就能跑API-first 设计REST API 加内置 MCP 服务器克隆出来的声音可以直接给你的智能体当嘴巴三分钟跑起来桌面端提供 macOSDMG和 WindowsMSI安装包Linux 用 Docker 三条命令即可git clone https://gitcode.com/GitHub_Trending/voicebox1/voicebox cd voicebox docker compose up系统加速方式macOSMLX / MetalWindows / LinuxNVIDIA CUDA、AMD ROCm、Intel Arc无独显纯 CPU 也能跑LuxTTS 约 1GB 显存档启动后照着 快速开始文档 建第一个声音档案Voices 标签页里新建档案上传或录制 10~30 秒清晰人声保存就能开始生成。按场景对号入座配音总缺个自己的声音几秒音频克隆一个 ️核心能力就是零样本声音克隆一段参考音频之后任意文本都能用它朗读。Voices 标签页点New Voice填名称和语言再上传、录制或捕获一段 10~30 秒的参考音频存成声音档案不想克隆有 50 个预设声音Kokoro、Qwen CustomVoice 提供直接选用生成时按内容切引擎综合质量选 Qwen3-TTS 1.7B23 种语言覆盖选 Chatterbox Multilingual长文本选 HumeAI TADA引擎、档案、文本每次生成都可换同一档案能反复复用整本书想变有声书5 万字符直接丢进去 长文本不是问题单次输入上限 50,000 字符整章小说、整篇稿子直接粘贴。文本自动按句子边界切分每段独立生成后交叉淡化拼接长文无感分段逻辑认识缩写和中日韩标点不会在奇怪的位置断句生成走异步队列提交后还能继续编辑下一条互不阻塞History 里每次生成都保留原始版本换种子重录多条 Take、加星标收藏都行短视频角色太机械情绪标签加音效救场机械念稿感靠两层表演解决都在生成端就能出效果。Chatterbox Turbo 支持副语言标签[laugh][chuckle][gasp][sigh][groan][clear throat]文本框里敲/直接调出标签插入器注意标签只对 Chatterbox Turbo 生效其他引擎会把标签当文字念出来8 种后期音效基于 Spotify 的 pedalboard 库移调最高 12 个半音、混响、延迟、合唱、压缩、增益、高/低通滤波生成后实时预览内置 Robotic、Radio、Echo Chamber、Deep Voice 四个预设还能自建并设为某个声音档案的默认做多人播客和有声剧用多轨时间线编排 Stories 编辑器是个类似 DAW 的多轨时间线专门给对话、播客、叙事类内容用。每个角色/讲者一条轨道拖拽编排自动播放头整体预览时间线上直接裁剪、拆分音频片段每段剪辑可锁定对应的生成版本重生成不会打乱整片适用多主持播客、有声书旁白加角色音、游戏对话、广播剧细节见 Stories Editor 文档每天要写大量文字全局听写解放双手Voicebox 把输入半边也补上了按住组合键说话、松手停止Whisper 本地转写后自动粘进当前聚焦的文本框macOS 下剪贴板原样保存恢复。组合键可在设置里自定义支持 push-to-talk 和 toggle 两种模式本地 LLM 可自动清理口头语每次听写自动存入 Captures原始音频和文字稿成对保存可重转写、编辑还能一键升级为声音样本流程细节见 听写文档进阶给 Agent 和你的应用接上嘴巴 Voicebox 后端本身就是一个服务默认端口 17493REST 和 MCP 两套入口都开箱即用。curl -X POST http://127.0.0.1:17493/speak \ -H X-Voicebox-Client-Id: my-script \ -d {text: 部署完成。, profile: Morgan}MCP 侧一条命令接入 Claude Code四个工具voicebox.speak、voicebox.transcribe、voicebox.list_captures、voicebox.list_profiles随即可用claude mcp add voicebox --transport http \ --url http://127.0.0.1:17493/mcp \ --header X-Voicebox-Client-Id: claude-code在 Settings → MCP 里给不同 Agent 绑定不同音色听到声音就知道谁在说话朗读时屏幕会浮现提示气泡全程可见。工具实现见 mcp_server 源码路由在 speak.py。先跑通哪一个你的情况建议先跑通原因短视频 / 公众号创作者克隆一个自己的声音生成一条旁白零样本克隆加情绪标签最快出人味儿成片播客 / 有声书作者丢一章 5 万字符内的稿子进生成框自动分段加多轨时间线从稿件到成片一条龙开发者REST 的/speak或 MCP 接入你的 Agent一条命令跑通声音 I/O 直接进自己的应用模型、声音数据、录音始终只留在你的机器上——把声音 I/O 的完整闭环交给本地硬件就是 Voicebox 的全部意义。【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voicebox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表