ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何快速部署Orpheus-FastAPI:从环境准备到生成第一条语音的完整新手教程

如何快速部署Orpheus-FastAPI:从环境准备到生成第一条语音的完整新手教程 如何快速部署Orpheus-FastAPI从环境准备到生成第一条语音的完整新手教程【免费下载链接】Orpheus-FastAPIHigh-performance Text-to-Speech server with OpenAI-compatible API, 8 voices, emotion tags, and modern web UI. Optimized for RTX GPUs.项目地址: https://gitcode.com/gh_mirrors/or/Orpheus-FastAPIOrpheus-FastAPI 是一个高性能的Text-to-SpeechTTS语音合成服务器提供 OpenAI 兼容 API、24 种多语言声音、情感标签和现代化的 Web 界面并且针对 RTX 系列显卡做了深度优化。本文将带你完成 Orpheus-FastAPI 的完整部署从环境准备、Docker 一键启动到在网页界面上生成你的第一条语音全程跟着做即可。Orpheus-FastAPI 能做什么先花 30 秒认识一下这个项目 OpenAI API 兼容可以直接替换 OpenAI 的/v1/audio/speech接口已有 TTS 集成如 OpenWebUI几乎零成本迁移24 种声音、8 种语言覆盖英语、法语、德语、韩语、印地语、中文、西班牙语、意大利语情感标签在文本中插入laugh、sigh等标签语音就会带笑声、叹息等自然情绪不限音频长度自动按句分批生成并用 50ms 交叉淡化拼接长篇文本也能一次合成智能硬件适配自动检测 GPU/CPU 并切换高性能模式无需手动调参Web 界面预览输入文本、选择语言与声音点击按钮即可得到带波形可视化的音频支持播放和下载。 语音引擎的核心实现位于 tts_engine/inference.pytoken 生成与 API 通信和 tts_engine/speechpipe.pySNAC 音频转换管线FastAPI 服务入口是 app.py。环境准备部署前的检查清单开始部署前确认你的机器满足以下条件 ✅项目要求说明Python3.8 – 3.11⚠️3.12 不受支持因pkgutil.ImpImporter被移除显卡NVIDIA推荐 RTX 系列或 AMD ROCm无显卡时可用纯 CPU 模式Docker仅需 Docker Compose走 Docker 路线时其他依赖全部自动处理CUDA≥ 12.4Docker GPU 场景需安装 NVIDIA Container Toolkit两条部署路线任选其一Docker Compose推荐新手一条命令拉起 Orpheus-FastAPI llama.cpp 推理服务器 模型自动下载省心原生本地安装适合已有 LM Studio / GPUStack / llama.cpp 推理服务的用户最快部署方法Docker Compose 一键启动项目内置了三份 Compose 配置按硬件对号入座硬件配置文件NVIDIA CUDA 显卡docker-compose-gpu.ymlAMD ROCm 显卡docker-compose-gpu-rocm.yml纯 CPU 机器docker-compose-cpu.yaml第 1 步克隆代码并创建配置文件git clone https://gitcode.com/gh_mirrors/or/Orpheus-FastAPI cd Orpheus-FastAPI cp .env.example .env # Windows CMD 用copy .env.example .env配置文件 ​.env.example 中默认使用高质量模型Orpheus-3b-FT-Q8_0.gguf。想换量化模型Q2_K 最快、Q4_K_M 均衡或语种专用模型如法语、中文只需修改其中的ORPHEUS_MODEL_NAME。第 2 步启动服务# NVIDIA GPU 用户 docker compose -f docker-compose-gpu.yml up # AMD ROCm 用户 docker compose -f docker-compose-gpu-rocm.yml up # 纯 CPU 用户 docker compose -f docker-compose-cpu.yaml up系统会自动从 Hugging Face 下载模型文件稍等片刻即可。Compose 文件会同时编排三个服务orpheus-fastapiWeb 服务、llama-cpp-server模型推理、model-init自动下载模型。原生本地安装手动部署 Orpheus TTS 服务如果你已经自己跑好了 Orpheus 模型的推理服务按下面 5 步安装 Web 服务部分即可# 1. 克隆并进入项目 git clone https://gitcode.com/gh_mirrors/or/Orpheus-FastAPI cd Orpheus-FastAPI # 2. 创建 Python 虚拟环境3.8 - 3.11 python -m venv venv source venv/bin/activate # Windows: venv\Scripts\activate # 3. 安装带 CUDA 支持的 PyTorch pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124 # 4. 安装其余依赖详见 requirements.txt pip3 install -r requirements.txt # 5. 创建输出目录 mkdir -p outputs staticAMD 用户把 PyTorch 换成 ROCm 版本安装即可参见 requirements.txt 中的注释说明。启动服务并验证部署是否成功进入项目目录运行python app.py # 或指定地址端口 uvicorn app:app --host 0.0.0.0 --port 5005 --reload启动成功时终端会显示 GPU 检测信息和三个关键地址接下来打开浏览器验证 Web 界面http://localhost:5005/API 文档http://localhost:5005/docs看到如下 OpenAPI 文档页面说明 Orpheus TTS 服务器已部署成功如何生成第一条语音方式一Web UI最简单打开http://localhost:5005/在 Text to speak 输入框填写要合成的文本在 Language 中选择语言默认 English点选一个声音卡片例如Tara女声、清晰自然、Leo男声、低沉有权威感、Dan男声、友好随意点击Generate Speech稍等片刻即可在 Generated Audio 区域看到波形点击 Play 试听或 Download 保存方式二API 调用OpenAI 兼容curl http://localhost:5005/v1/audio/speech \ -H Content-Type: application/json \ -d { model: orpheus, input: Hello world! This is a test of the Orpheus TTS system., voice: tara, response_format: wav, speed: 1.0 } \ --output speech.wav主要参数input必填文本、voice默认 tara、response_format目前仅 wav、speed0.5–1.5。项目还保留了一个更简化的/speak接口可供调用。加个情感标签试试在文本里插入laugh、sigh、chuckle、yawn等标签例如Well, thats interesting I hadnt thought of that before.Web UI 配置指南不改文件也能调参数界面下方的Advanced options可以配置模型、语速和全部服务器参数修改后保存即写入.env一键重启服务器即可生效常用配置项也可在 .env.example 中预置ORPHEUS_API_URL你的 LLM 推理服务地址务必改成实际地址ORPHEUS_MAX_TOKENS最大生成 token 数默认 8192要合成超长文本可提到 32768并把ORPHEUS_API_TIMEOUT调大到 1800ORPHEUS_TEMPERATURE/ORPHEUS_TOP_P生成风格参数默认 0.6 / 0.9ORPHEUS_PORT/ORPHEUS_HOSTWeb 服务端口与地址默认 5005⚠️ 重复惩罚Repetition penalty被固定在 1.1这是模型保证输出质量的唯一取值不可修改。常见问题速查 ️问题解决方法使用 Python 3.12 启动报错换用 3.8–3.11 重建虚拟环境Docker GPU 模式报设备错误确认 CUDA ≥ 12.4 且已安装 NVIDIA Container Toolkit界面提示连不上推理服务检查.env中ORPHEUS_API_URL是否指向正在运行的推理服务器生成的语音不连贯属正常现象——Orpheus 模型本为短文本设计长文本分批拼接可能有轻微断层想用其他推理服务器支持 LM Studio、GPUStack、llama.cpp server 等任意 OpenAI 兼容服务改ORPHEUS_API_URL即可使用 llama.cpp 时记得带上--ctx-size、--n-predict与ORPHEUS_MAX_TOKENS一致和--rope-scaling linear参数才能获得最佳效果。总结恭喜你已经完成了 Orpheus-FastAPI 语音合成服务器的完整部署 回顾一下关键路径准备确认 Python 版本与显卡驱动部署新手推荐docker compose -f docker-compose-gpu.yml up一键启动验证浏览器访问http://localhost:5005/与/docs生成语音Web UI 点选声音或调用 OpenAI 兼容的/v1/audio/speech接口调优通过 Web UI 配置面板修改模型、语速与服务器参数接下来可以试试不同语言的声音卡或在文本中玩一玩情感标签感受这条高性能 TTS 服务器的全部魅力。【免费下载链接】Orpheus-FastAPIHigh-performance Text-to-Speech server with OpenAI-compatible API, 8 voices, emotion tags, and modern web UI. Optimized for RTX GPUs.项目地址: https://gitcode.com/gh_mirrors/or/Orpheus-FastAPI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表