ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Duix-Avatar 本地部署指南:一段 10 秒视频,从 0 到产出口播成片

Duix-Avatar 本地部署指南:一段 10 秒视频,从 0 到产出口播成片 Duix-Avatar 本地部署指南一段 10 秒视频从 0 到产出口播成片【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar如果你需要制作会说话的 AI 数字人视频但素材属于敏感数据、不能上传云端Duix-Avatar 这个开源项目值得试试。它是一套完全在本地完成克隆与 AI 视频合成全流程的数字人工具包提交一段 10 秒左右的视频就能克隆出你的形象和声音之后输入文案或上传音频即可自动生成口型匹配的口播视频。下面覆盖硬件预检、部署步骤、首次体验以及大概率会踩到的三个高频坑。 项目速写它能做什么Duix-Avatar 由 Electron 桌面客户端 Docker 服务端组成服务端起来后客户端自动连接。核心能力一句话一条10 秒视频克隆提交一段带人声的视频形象和声音同时克隆不需要额外训练文字或音频双驱动直接输文案由系统合成语音也可以传录音直接驱动口型全离线镜像下载完成后不再需要联网视频、声音、文本都不离开本机8 种语言中、英、日、韩、法、德、阿拉伯、西班牙语开放 APIDocker 启动后在本地暴露端口可接入自有产品不必走客户端界面。授权方面支持全球免费商用但用户量超过 10 万或年营收达 1000 万美元以上的企业需要签署商业许可协议全文见仓库根目录的 LICENSE 文件。✅ 上手前检查硬件够不够项目的所有算力都跑在你自己的 NVIDIA 显卡上。拉取 70GB 镜像之前先对照这张表项目要求说明系统Windows 10 19042.1526 / Ubuntu 22.04Windows 依赖 WSL2 后端显卡NVIDIA 卡 已装好驱动全部推理在 GPU 上运行这是硬性条件内存32GB 及以上TTS/ASR 服务要加载大模型磁盘WindowsC 盘 100GB / D 盘 30GBC 盘存 Docker 镜像D 盘存数字人与作品数据不达标会怎样没有 N 卡或驱动没装好三个容器直接起不来内存只有 16GBASR 服务大概率启动失败C 盘空闲不足 100GB镜像下载会把盘撑满。 从零部署一条 Docker 命令拉起服务服务端是三个容器fun-asr语音识别端口 10095、fish-speech语音合成端口 18180、duix.avatar视频合成端口 8383。三份 compose 配置都放在 deploy/ 目录按系统选一份即可。Windowsgit clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d三个细节没装过 WSL/Docker 的先执行wsl --install再装 Docker Desktop首次启动按提示接受协议首次拉取约 70GB 流量连好 WiFi 耐心等Docker 里看到三个容器全部绿色 Running服务端就绪只打算做视频合成音频已有用 lite 版只起一个容器docker-compose -f docker-compose-lite.yml up -dRTX 50 系列显卡则用docker-compose-5090.yml。C 盘空间不够时可以在 Docker 设置里把磁盘镜像位置迁移到空闲更足的盘Ubuntu 22.04sudo apt install docker.io docker-compose nvidia-container-toolkit sudo nvidia-ctk runtime configure --runtimedocker sudo systemctl restart docker docker-compose -f docker-compose-linux.yml up -d执行nvidia-smi能显示显卡信息才算驱动就绪。客户端下载官方 AppImage 双击运行即可root 用户桌面需加--no-sandbox参数。️ 首次体验主界面四个区域界面不复杂四个区域各管一件事Create VideoAI 视频生成器选中一个数字人写文案或传音频出成片Create Avatar上传 10 秒说话视频克隆数字人视频里必须有人声——这段声音会被拿去克隆音色My Works / My Avatars已生成的视频和已克隆的模型都在这里支持多模型管理、按名称搜索、随时删除设置右上角齿轮查看用户协议、打开客户端日志、中英文切换。克隆完成一个模型后回到 Create Video 选中新模型就能立刻生成第一条视频整个闭环几分钟内可以走完。 原理浅讲三个容器各干什么只当用户的话这部分可以跳过想改代码、排问题值得花两分钟看懂分工感知fun-asr 干的是 ASRspeech recognition把语音转成文字。它把视频里的声音转写成文本供语音合成服务做参考合成fish-speech 干的是 TTStext-to-speech把文字读成声音。它用克隆到的音色把你要的文案合成一段新的语音输出duix.avatar 负责最后的视频合成。它拿着音频和模型的底视频逐帧驱动口型产出成片。客户端是个本地 Electron 程序源码在 src/main/只做界面、任务排队和音频前后处理ffmpeg 完成。所以数据不出本机不是口号而是架构决定的所有链路都发生在本地容器与本地客户端之间没有任何环节需要上云。 进阶直接调视频合成 API不走客户端的话所有端点都在http://127.0.0.1最核心的是视频合成提交POST http://127.0.0.1:8383/easy/submit 参数{ audio_url: 音频路径, video_url: 模型视频路径, code: 唯一任务号 }提交后用GET http://127.0.0.1:8383/easy/query?code任务号轮询进度直到完成。语音预处理、TTS 合成在 18180 端口各有一个接口参数含义看 README 的 API 一节即可客户端源码里也有现成的调用代码可以抄。️ 踩坑速查三个高频问题提问或发帖前先自查一条三个服务是否都处于 Running。以下三个坑按现象 → 排查 → 解决给。拉镜像报 request canceled现象docker-compose up -d后三个服务都报registry-1.docker.io连接超时排查不是项目 bug是网络问题Docker Hub 官方源不稳定解决在 Docker Engine 的registry-mirrors里加国内镜像源Apply restart 后重拉。克隆形象报 file not exists现象容器日志抛出code -1, file not exists异常排查看日志里两处标记确认音频是否写入了挂载目录、ASR 服务是否已就绪解决ASR 服务启动慢服务端刚拉完等几分钟再做克隆内存 16GB 的机器可能直接起不来。卡住了怎么取日志客户端设置 → 打开日志到AppData\Roaming对应目录下找main.log服务端Docker 里逐个容器打开 Logs 页签复制报错堆栈再去找答案。性能参考硬件建议8GB 显存可以跑社区已验证显存紧张时建议 lite 版合成任务别并行堆12GB 显存4070 级别完整三服务部署正常使用RTX 50 系列5090用 docker-compose-5090.yml 变体 落地场景内容换得勤、形象固定不变教育把课件文案变成口播视频教师形象克隆一次后续课程更新只改文案不用反复拍摄电商同一款商品介绍批量产出多版本配合 8 语言 TTS海外站的本地化内容可以直接做企业培训SOP 和入职培训需要标准讲解人数字人替代真人出镜免去档期协调和个体差异。这三类内容的共同点是形象固定、文案常换——恰好是这套工具效率最高的形态。 遇到问题去哪找答案Duix-Avatar 的价值在于把过去依赖商业 SaaS 的数字人工作流压缩成你自己机器上就能跑的一套服务源码完全开放想改哪块都可以动手。遇到问题先看仓库的 Issues 和 doc/常见问题.md项目有专门的技术交流群部署细节直接问人往往更快。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表