
Pocket TTS serve命令深度教程1条命令搭建本地TTS服务器Web界面【免费下载链接】pocket-ttsA TTS that fits in your CPU (and pocket)项目地址: https://gitcode.com/GitHub_Trending/po/pocket-ttsPocket TTS serve 命令让你用 1 条命令在本地 CPU 上搭建 TTS 文本转语音服务器自带 Web 界面和 HTTP API模型常驻内存、首块音频约 200ms还支持语音克隆和多语言。本教程带你从零启动 Pocket TTS 本地 TTS 服务器并玩转它的网页界面与接口。为什么选择 Pocket TTS serve 而不是 generatePocket TTS 是一款专为 CPU 设计的轻量级语音合成模型约 1 亿参数、仅占 2 个 CPU 核心、速度约为实时速度的 6 倍。它提供两种使用方式对比项generate命令serve命令使用场景一次性生成单个音频反复试听、Web 调用、程序集成模型加载每次启动都重新加载启动一次模型常驻内存响应速度较慢含启动开销快首块音频约 200ms 开始流式输出交互方式命令行参数浏览器 Web 界面 HTTP API官方建议想快速尝试多种音色和文本时优先使用serve命令省去每次冷启动的等待。3分钟快速搭建本地TTS服务器前置要求Python 3.10–3.14PyTorch 2.5无需 GPU 版本推荐用 uv 管理环境一键启动命令无需安装直接用uvx运行依赖会在隔离环境中自动下载uvx pocket-tts serve或者先手动安装再运行pip install pocket-tts pocket-tts serve⚠️Linux 用户注意PyPI 默认会拉取几 GB 的 CUDA 版 PyTorch可改用 CPU 版索引安装更轻量pip install pocket-tts --extra-index-url https://download.pytorch.org/whl/cpu启动后访问http://localhost:8000即可看到 Web 界面。serve命令参数完全详解serve命令的完整参数定义在 pocket_tts/main.py 中官方参数文档见 docs/CLI Commands/serve.md。参数默认值作用--hostlocalhost绑定地址局域网访问可设为0.0.0.0--port8000绑定端口--languageenglish选择语言模型french_24l、german_24l、portuguese_24l、italian_24l、spanish_24l等--config无自定义 YAML 配置路径本地路径 / https URL / hf:// 路径与--language互斥--quantizeFalse开启 int8 量化降低内存占用、提升速度音质损失极小--reloadFalse开发模式代码改动自动重载常用启动示例# 自定义端口 pocket-tts serve --host localhost --port 8080 # 使用法语大模型24层质量更高但更慢 pocket-tts serve --language french_24l # int8量化内存更小、速度更快 pocket-tts serve --quantize # 加载自定义模型配置 pocket-tts serve --config pocket_tts/config/english_2026-04.yaml--language与--config不能同时使用。english与english_2026-04是同一个模型带24l后缀的是未蒸馏的大模型效果更佳但速度稍慢。Web界面使用指南服务器启动后打开http://localhost:8000即可使用内置 Web 界面页面源码位于 pocket_tts/static/index.html。界面上有 3 个核心输入区文本输入框填入要朗读的文字支持任意长度文本模型可处理无限长输入音色 URL可选填预置音色名称如alba、jane、eve或音色音频地址留空则使用当前语言的默认音色上传音色文件上传本地 WAV/MP3/FLAC 音频做语音克隆优先级高于音色 URL点击Generate按钮后音频以流式方式逐步产出并可直接播放。由于模型常驻内存连续试听不同音色几乎零等待非常适合调参实验。调用 /tts HTTP API除了网页Pocket TTS serve 还暴露了一个简洁的 HTTP 接口方便程序集成。核心端点GET /Web 界面GET /health健康检查返回{status: healthy}POST /tts文本转语音返回流式 WAV 音频用curl生成一段语音只需curl -X POST http://localhost:8000/tts \ -F text你好世界。Pocket TTS 让我在本地CPU上轻松生成语音。 \ -o speech.wav接口支持三种指定音色的方式二选一即可见 pocket_tts/main.py 中text_to_speech函数实现字段说明不传音色使用服务器启动时的默认音色voice_url预置音色名或 http/https/hf:// 音频地址voice_wav直接上传音频文件做即时语音克隆响应采用分块流式传输Transfer-Encoding: chunked第一块音频约 200ms 即可到达下游程序可实现边接收边播放。幕后原理为什么这么快Pocket TTS 的模型架构如下由 Flow 语言模型 Mimi 神经声码器组成整条流水线都在 CPU 上高效运行serve命令的关键设计实现在 pocket_tts/main.py启动时调用TTSModel.load_model()一次性加载模型并选定默认音色音色状态通过缓存复用切换音色不重复计算音频在独立线程中流式生成通过队列推送给 HTTP 响应不阻塞服务常见问题排查Q启动时下载依赖特别慢或体积大Linux 上默认会装 CUDA 版 PyTorch约 3GB加上--extra-index-url https://download.pytorch.org/whl/cpu只装 CPU 版约 200MB。Q局域网设备访问不了把--host改为0.0.0.0启动再用机器的局域网 IP 访问对应端口即可。Q内存不够用加--quantize启用 int8 量化可显著降低内存占用且音质影响极小。Q端口被占用换端口启动pocket-tts serve --port 8080。延伸阅读serve 命令官方文档docs/CLI Commands/serve.mdgenerate 命令文档docs/CLI Commands/generate.mdexport-voice 命令文档docs/CLI Commands/export_voice.mdPython API 参考docs/API Reference/python-api.md量化说明docs/quantization.md示例笔记本docs/pocket-tts-example.ipynb内置多语言模型配置目录pocket_tts/config/Web 界面源码pocket_tts/static/index.html一条uvx pocket-tts serve命令你就拥有了一个私有、离线、低延迟的本地 TTS 服务器试试在浏览器里给它换一种音色吧️【免费下载链接】pocket-ttsA TTS that fits in your CPU (and pocket)项目地址: https://gitcode.com/GitHub_Trending/po/pocket-tts创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考