ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

HeyGem.ai本地部署快速上手:4个任务把文字和语音变成数字人视频

HeyGem.ai本地部署快速上手:4个任务把文字和语音变成数字人视频 HeyGem.ai本地部署快速上手4个任务把文字和语音变成数字人视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarHeyGem.ai 是一款可本地部署的 AI 数字人视频平台部署完成后它能把你的文本和语音全离线地变成一段会说话的数字人视频。下面用 4 个任务带你走完自检、起服务、造数字人、出视频。部署前三查先把这三样东西核对好 动手之前先花 2 分钟核对硬件、网络、环境三件事。任何一项不达标后面命令跑得再快也会卡住。检查项要求怎么查显卡英伟达 N 卡 已装驱动30/40/50 系列终端跑nvidia-smi能看到显卡信息才算过。本项目全部算力在本地 GPU没卡、没驱动服务根本起不来内存32G 及以上推荐系统设置里看。16G 可能带不动 ASR 服务磁盘WindowsC 盘 100G放镜像、D 盘 30G放数据Linux空闲 100G磁盘管理或df -h网络稳定首次拉镜像约 70G 流量建议有线或稳定 WiFi耐心等约半小时系统Windows 10 19042 / Ubuntu 22.04Windows 需 WSL Docker Desktopwsl --list检查运行时Node.js 18仅客户端需要node -v两个补充点权限Linux 下用管理员终端带sudo执行命令即可Windows 装好 Docker Desktop 后正常操作就行无需额外提权。驱动先于一切nvidia-smi都跑不起来的话先去装显卡驱动这一步不跳过。最短路径启动本地服务几条命令跑通全部整个系统分两部分AI 服务Docker 三个容器 客户端Electron 桌面端。1. 拿到代码git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai2. 拉起 AI 服务cd deploy docker-compose up -d就这一条。它会拉取语音识别ASR、语音合成TTS、视频生成三个镜像首次约 70G 流量等半小时左右。两种特殊情况才需要换文件# 50系显卡如 RTX 5090 docker-compose -f docker-compose-5090.yml up -d # LinuxUbuntu 22.04 docker-compose -f docker-compose-linux.yml up -d3. 启动客户端npm install npm run dev✅ 怎么算跑通了Docker 里duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务全部Running客户端窗口弹出并看到首页。首页就两个入口左边Create Video用来生成视频右边Create Avatar用来造数字人。接下来两个任务都用它们。从零造一个数字人一条 10 秒视频就够很多人以为要准备一堆照片、再单独录音。实际上一条 10 秒左右的视频就够了形象和声音都从它里来。准备素材人物正面、在说话的 10 秒左右视频。 ⚠️ 视频必须有声音且说话的就是画面里的人——形象克隆取视频声音克隆取音频静音视频会直接失败。在客户端首页点快速定制 / Create Avatar。上传视频等克隆完成。My Avatars / 我的数字模特列表里会出现这个数字人供下一步直接调用。需要多个角色就重复同样操作每个数字人都拥有独立的形象和声音。把文字和声音变成一段视频两种输入方式有了数字人就可以出片了。输入方式只有两种按需选纯文本直接填文案。TTS 服务用刚克隆的声音把它念出来数字人跟着对口型。音频文件上传现成语音数字人跟着你的音频说话节奏和情绪都保留原样。操作很简单首页点Create Video / 短视频制作选中你要用的数字人二选一填入文本或上传音频确认生成成片落在My Works / 我的作品点开即可预览、导出。脚本支持中、英、日、韩、法、德、阿拉伯、西八种语言跨语种口播也能做。生成环节由视频合成服务完成口型对齐全程本地素材不经过外网。让它跑得更稳GPU 与资源分配跑通之后盯住三件事就能长期稳定运行。CUDA 加速把算力全交给显卡compose 文件里三个服务都带runtime: nvidia这就是 CUDA 加速开关Linux 用户还要装 NVIDIA Container Toolkit否则 Docker 用不了 GPU50 系显卡5090 已验证用前面的docker-compose-5090.yml对应更新版本的 torch视频生成服务里的PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:512是抑制显存碎片用的别删。内存32G 是安全线内存低于 16G 时ASR 服务可能起不来或反复重启视频生成服务已预置shm_size: 8g共享内存不要调小。存储数据和镜像分开放数据目录Windows 是d:/duix_avatar_datavoice 与 face2face 两个子目录Linux 是~/duix_avatar_data数字人和成片都存在这里留 30G 以上Docker 镜像默认吃系统盘C 盘不足 100G 时去 Docker Desktop → Settings → Resources → Advanced把 Disk image location 挪到别的盘。避坑速查高频报错对照表报错 / 现象可能原因排查动作docker-compose up -d报request canceled/context canceledDocker Hub 官方源连接不稳在 Docker Engine 配置registry-mirrors国内镜像源后重新拉取服务起不来 / 反复 Restarting没有英伟达显卡或没装驱动nvidia-smi检查不显示就先装显卡驱动新增模特上传视频失败视频没声音或不是人在说话重传一段 10 秒左右的人声视频定制模特报Connection refusedASR 服务启动慢或内存不足服务起来后等几分钟再操作确认内存 32G 以上镜像拉取中断 / 磁盘写满磁盘空间不足、网络不稳镜像目录换盘、配镜像源后重拉第一类问题的设置位置如下图把国内镜像源写进registry-mirrors点 Apply restart还不明就里时先抓两组日志客户端日志客户端右上角菜单选打开日志 / Open Log文件是main.logWindows 下位于%APPDATA%\heygem.ai\logs\。服务端日志Docker 里点开对应服务的 Logs 页用复制按钮把报错段落带出来。完整问题清单可以看仓库里的常见问题想深入原理直接读 src/main/service/ 下的model.js、video.js、voice.js分别是模特训练、视频合成、语音合成的调用源码。跑通之后自检、起服务、造数字人、出视频——四个任务走完你的第一条数字人视频已经在我的作品里躺着了。想再往深走一步的话服务端本地暴露了 18180、10095、8383 三个 API 端口把这几个接口串起来就能把数字人视频生成接进你自己的系统或站点。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表