
Duix.Avatar 开源AI数字人本地部署一次跑通【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar在本地克隆你的形象和声音输入一段文案或音频就能产出口型对得上的口播视频——这就是 Duix.Avatar 做的事。它是一个支持本地部署和 API 调用的开源 AI 数字人工具包全程离线运行视频素材不用上传到任何云端。一句话说清它帮你解决什么不花钱买服务同类数字人产品多为 SaaS 订阅或按条计费它开源且支持全球免费商用用户量超 10 万或年营收超 1000 万美元的企业需签商业协议。数据不出门从声音克隆到视频合成全部在本地完成适合播敏感内容、不想素材外流的团队。上手门槛集中在硬件软件步骤只有装 Docker 和两条命令真正的门槛是那张 N 卡。跑起来之前你需要什么项目最低配置推荐配置操作系统Windows 10 19042.1526或 Ubuntu 22.04 Desktop同左NVIDIA 显卡必须无 N 卡无法启动RTX 4070内存32GB 及以上必要32GB 及以上CPU建议第 13 代 i5-13400F 级别同左磁盘C 盘空闲 100GDocker 镜像D 盘空闲 30G数据Ubuntu 需空闲 100G预留更多网络流量拉取镜像约消耗 70G连 WiFi⚠️ 最常见的两个坑显卡驱动没装好三个服务一个都起不来C 盘空间不足记得在 Docker 设置里把镜像位置挪到别的盘。从零到跑通四个环节走一遍备好 Docker 底座Windows 上先确认 WSL 是否装过没有就执行wsl --install再用wsl --update更新。然后安装 Docker Desktop for Windows首次启动接受协议、跳过登录即可。C 盘不足 100G 时打开 Docker Desktop 的 Settings → Resources → Advanced用 Browse 把 Disk image location 指到空闲空间更大的分区。Ubuntu 用户则用docker --version检查没装就sudo apt install docker.io和docker-compose再装 NVIDIA 显卡驱动和 NVIDIA Container Toolkit用nvidia-smi能看到显卡信息即驱动正常。完成后你会看到 Docker 图标在托盘区正常呼吸WSL 里引擎处于 running 状态。让镜像自己到位不用手动逐个docker pull直接执行启动命令时 Docker 会自动拉取三个镜像guiji2025/fun-asr语音识别、guiji2025/fish-speech-ziming语音合成、guiji2025/duix.avatar视频合成。内存和显存紧张如 16G 内存、8G 显存的机器可以只跑视频合成这一个服务的 lite 版本后文会给出对应命令。启动三个服务clone 仓库后进入deploy目录执行cd deploy docker-compose up -d只要视频合成的 lite 版docker-compose -f docker-compose-lite.yml up -dUbuntu 用docker-compose -f docker-compose-linux.yml up -d50 系列显卡用docker-compose -f docker-compose-5090.yml up -d然后就是等待。下载加启动大约半小时网速决定一切。验证是否真的跑通了打开 Docker Desktop 的 Containers 列表确认三个服务lite 版只有一个Duix.Avatar-gen-video都是 Running 状态duix-avatar-asrASR 语音识别端口 10095duix-avatar-tts语音合成端口 18180duix-avatar-gen-video视频生成端口 8383服务端就绪后下载官方构建的客户端安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 直接运行.AppImageroot 用户需加--no-sandbox参数。打开客户端能看到首页说明链路通了。核心玩法演示场景一克隆你的数字人你想做什么用自己的形象做一个能说话的数字分身。怎么做在客户端点 Create Avatar上传一段 10 秒左右、人在说话的视频。后端会自动把视频拆成静音视频和音频音频送到 fish-speech 服务做声音训练同时调用 ASR 把音频转成文字作为参考文本。注意视频必须带人声静默视频会直接报错。得到什么一个数字人模型。它同时记住了你的脸和你的声音存在 My Avatars 列表里之后生成视频时可以反复调用。场景二一句话生成口播视频你想做什么给文案让它替你念出来。怎么做首页点 Create Video选一个已建好的数字人输入文案或上传音频。文字会先经 TTS 合成为语音再和视频流一起做口型同步上传音频则跳过合成直接驱动口型。得到什么一条嘴型对得上、声音是你声音的口播视频落在 My Works 列表里可直接下载。场景三调 API 二次开发客户端本质是在调三个本地接口你也可以自己调。完整请求示例见仓库src/main/service/下的model.js、voice.js、video.js。模特训练拆视频 声音克隆音频需预先放在D:\duix_avatar_data\voice\dataPOST http://127.0.0.1:18180/v1/preprocess_and_tran {format: .wav, reference_audio: xxxxxx/xxxxx.wav, lang: zh}音频合成与视频合成的关键参数如下其余固定传参如format、topP等以src/main/service/voice.js和video.js源码为准接口作用关键参数http://127.0.0.1:18180/v1/invoke文本合成语音speaker自定 UUID、text文案、reference_audio和reference_text取训练接口返回值http://127.0.0.1:8383/easy/submit音视频合成audio_url、video_url、code任务唯一 keyhttp://127.0.0.1:8383/easy/query?code任务key查合成进度code上一步的code踩坑与排障问执行docker-compose up -d报Client.Timeout exceeded镜像拉不下来ADocker Hub 官方源连不稳。在 Docker 设置里配置国内镜像源Ubuntu 写进/etc/docker/daemon.json然后重跑启动命令。问新增模特时报错说素材不合格A上传的视频必须有人声且是人在说话。程序要用这段声音做声音克隆静默或纯 BGM 视频会失败。问定制模特报Connection refused日志指向 funasrAASR 服务启动比别的服务慢服务端刚起来就操作会失败等几分钟再试。另外 16G 内存可能根本带不动全部服务建议用 lite 版。问三个服务起不来或反复重启A先确认机器有 NVIDIA 显卡且驱动装对本项目全部算力在本地没有 N 卡一切免谈。其次确认客户端和服务端都是最新版本社区更新频繁你的问题可能已在新版修复。适合谁不适合谁适合你不适合你有一台带 N 卡的闲置电脑想免费做数字人内容没有 NVIDIA 显卡或显存/内存明显不够素材敏感要求全程离线不上传不想折腾 Docker 和 WSL内容创作者、小团队想批量产口播视频追求商业级高清口型效果官方 API 服务效果更精细开发者想基于三个本地接口做二次开发只需偶尔用一次租云 GPU 更划算现在就可以动手一台 N 卡机器、半小时下载时间就能跑通从克隆形象到产出第一条口播视频的全流程。建议先按 lite 版本试水跑通后再上全套三个服务。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考