ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Duix.Avatar:10秒视频克隆AI数字人

Duix.Avatar:10秒视频克隆AI数字人 Duix.Avatar10秒视频克隆AI数字人【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar做口播视频要么自己出镜要么购买商业数字人服务。Duix.Avatar这款开源克隆工具AI 数字人工具包把整套流程搬到你自己的电脑上一段 10 秒的视频就能克隆外貌与声音输入文案直接产出成品口播视频全部计算在本地完成不依赖外网。 它是谁免费的数字人离线生成工具Duix.Avatar 由 Duix.com 团队维护并开源客户端当前版本为 1.0.6以仓库package.json为准授权条款见仓库内LICENSE文件全球免费商用用户量超 10 万或年营收超 1000 万美元的企业需另行签署商业许可协议。项目分两部分Docker 服务端承载三个 AI 服务Electron 桌面客户端负责上传、编辑和预览支持 Windows 10 与 Ubuntu 22.04。客户端只做操作入口算力全部消耗在你自己的 GPU 上视频素材不出本机。 部署前环境自检GPU与磁盘空间要求既然算力全部在本地没有 NVIDIA 显卡意味着三个服务根本起不来。对照下表先核对硬件项目要求操作系统Windows 1019042.1526 或更高或 Ubuntu 22.04显卡NVIDIA 显卡并装好驱动RTX 30/40 系通用配置50 系用专属配置内存32G 及以上磁盘WindowsC 盘 100G 以上存镜像D 盘 30G 以上存数据磁盘Ubuntu100G 以上空闲空间在终端执行nvidia-smi能看到显卡型号、驱动版本和显存信息即代表驱动正常命令报command not found就先装驱动再谈部署。注意内存必须 32G 起步16G 内存时语音识别服务无法启动。Windows 上如果 C 盘空间不足可以在 Docker Desktop 的 Resources 设置里把 Disk image location 改到空间更大的磁盘再点 Apply and restart 生效。 Duix.Avatar 本地部署步骤从装 Docker 到服务端跑通自检通过后这一节完成全部部署预计耗时 40 分钟左右。1. 安装 Docker目的三个 AI 服务都以镜像形式运行Docker 是底座。操作Windows 用户在 PowerShell 输入wsl --list --verbose查看 WSL 状态未安装先执行wsl --install再执行wsl --update更新然后从 Docker 官网安装 Docker DesktopUbuntu 用户先执行docker --version检查没装则依次执行sudo apt update、sudo apt install docker.io、sudo apt install docker-compose。验证Docker Desktop 左下角显示 Engine running 即安装成功Ubuntu 上docker --version能输出版本号即可。2. 克隆仓库拿到服务端配置目的服务端配置全部放在仓库的deploy目录客户端安装包则需要从仓库 Releases 下载。操作执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar进入deploy目录。验证能看到docker-compose.yml即成功。50 系显卡改用docker-compose-5090.yml显存紧张可试 lite 版它只启动视频合成一个服务。3. 拉镜像并启动服务端目的启动语音识别ASR端口 10095、语音合成TTS端口 18180、视频合成端口 8383三个容器。操作在deploy目录执行docker-compose up -dUbuntu 执行docker-compose -f docker-compose-linux.yml up -d。验证首次下载约 70G 流量、耗时约 30 分钟建议连 WiFi。完成后 Docker 里出现 3 个 Running 状态的容器即成功。服务刚启动时请等几分钟再克隆形象语音识别服务加载模型需要时间。4. 安装客户端并克隆第一个数字人目的客户端是调用三个服务的全部操作入口。操作从仓库 Releases 下载对应系统安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 直接运行 AppImageroot 用户需加--no-sandbox参数启动。验证启动后进入上文的主界面。点击 Create Avatar上传一段 10-20 秒的视频这段视频必须包含真人说话的声音音频就是声音克隆的素材无声视频会直接报错。几分钟后 My Avatars 里出现头像卡片即克隆成功选中它输入文案或上传音频点击生成等待几分钟后成品出现在 My Works可直接导出。⚙️ 数字人视频生成原理文案到口播视频的数据流第一条视频跑通之后看看后台到底发生了什么。跟着一段文字输入走一遍语音阶段客户端把文案和该数字人的参考音频提交到本地 18180 端口语音合成服务按克隆出的音色生成一段新的 WAV如果你直接上传了音频这一步自动跳过。画面阶段音频文件和数字人的静音视频一起提交到 8383 端口的合成接口face2face 引擎根据音频节奏逐帧驱动口型。收尾阶段客户端每 2 秒轮询一次进度合成完成后成品视频写入本地 My Works 列表时长与文件路径记入本地 SQLite 数据库。在此之前还有一次训练上传数字人视频时客户端先用 ffmpeg 转成 H.264、分离出音频再发到 18180 端口的preprocess_and_tran接口做识别返回的参考音频与参考文本就是保存在这个数字人名下的声音指纹。整条链路都走 127.0.0.1素材全程不出你的电脑。 数字人进阶玩法API 调用与批量生成把本地 API 接到你自己的程序场景想把数字人能力嵌进自建网站或工作流而不依赖桌面客户端。怎么做Docker 启动后本地暴露http://127.0.0.1:18180训练与语音合成和http://127.0.0.1:8383/easy视频合成、进度查询几组接口直接发 HTTP 请求即可参数结构可参考 src/main/service/ 下的 model、voice、video 三个源文件。产出你自己的程序通过几行请求就能完成克隆训练到口播视频生成的完整链路。排队批量生成口播视频场景一次要产出多条不同文案的视频。怎么做在客户端连续提交多个任务未完成的任务按顺序进入 waiting 队列列表会显示每个任务排第几系统每完成一个自动拉起下一个。产出不需要盯守界面一次排入十几个任务也能连续产出。切换界面与文案语言场景团队成员习惯英文界面或要生成非中文的口播内容。怎么做点客户端右上角 Setting 菜单里的 Language switch界面提供中、英两种语言文案本身支持中、英、日、韩、法、德、阿拉伯语、西班牙语共 8 种。产出无需重启任何服务切换后立即生效。️ 数字人部署排错高频问题速查部署途中最容易卡住的环节集中在拉镜像和建模特两步以下四个问题在社区出现频率最高。现象执行docker-compose up -d报错Get https://registry-1.docker.io/v2/... Client.Timeout exceeded。原因Docker Hub 官方源连接不稳定。解法在 Docker Desktop 的 Docker Engine 设置里加入registry-mirrors国内镜像源列表下图所示配置方式应用并重启引擎后重新拉取。现象新增模特时直接报错任务失败。原因上传的视频没有声音或者画面里没有人说话程序需要这段音频做声音克隆。解法重录一段 10-20 秒、正脸清晰、持续说话的视频再上传。现象定制模特日志出现Connection refused。原因语音识别服务启动后加载模型要几分钟过早提交请求会被拒绝16G 内存的机器则可能根本加载不动该服务。解法等三个服务全部 Running 并静置几分钟再操作内存不足 32G 先升级硬件。现象三个容器反复重启或起不来。原因本项目所有算力都在本地 GPU 上缺 NVIDIA 显卡或缺驱动时无条件启动失败。解法用nvidia-smi复核驱动需要看报错细节时点客户端右上角 Setting 菜单选 Open Log 拿客户端日志服务端日志则直接在 Docker 容器页复制配合日志对照定位。下一步文档、源码与求助通道到这里你已经拥有一套跑在自己机器上的数字人流水线一段 10 秒视频、约 40 分钟部署、零授权费用后续生成不受次数限制。常用入口doc/常见问题.md自查步骤与报错处理清单deploy/Windows、Ubuntu、5090、lite 四套服务端配置src/main/service/客户端模型、语音、视频三个服务的源码也是 API 参数的权威参照想跟进新功能和社区计划去仓库的 roadmap 与 Discussions 查看。下次再遇到卡住的情况先按 doc/常见问题.md 里的自查步骤过一遍仍无法解决时把复现步骤和报错日志贴到仓库 Issues社区每天都在处理问题单。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表