ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

HeyGem.ai 教程:10秒视频克隆你的AI数字人,完全离线本地部署(完整部署指南)

HeyGem.ai 教程:10秒视频克隆你的AI数字人,完全离线本地部署(完整部署指南) HeyGem.ai 教程10秒视频克隆你的AI数字人完全离线本地部署完整部署指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarHeyGem.ai 数字人是一款完全开源、可离线运行的数字人工具拍一段约10秒的你讲话的视频它就能克隆你的外貌和声音做成一个数字人之后输入文案或上传音频即可在本地生成口型匹配的口播视频全程不联网。本文带你从硬件确认到出片不需要技术背景。你的电脑够格吗一张表确认硬件门槛动手前先对照这张表自查系统操作系统CPU内存显卡磁盘空间WindowsWindows 1019042.1526 或更高第13代酷睿 i5-13400F 或更高32GB 及以上NVIDIA RTX 4070 或更高C 盘 100GB 以上、D 盘 30GB 以上UbuntuUbuntu 22.04 Desktop同上同上同上同上真正的硬门槛只有两个32GB 内存和装好驱动的 NVIDIA 显卡。所有算力都在本地跑缺了这两样服务根本起不来。⚡ 30分钟搭好本地数字人工作室第一步准备 Docker 与 WSLDocker 的作用是在你的机器上把多个服务装进标准容器里一键跑起来不用操心环境冲突WSL 是 Windows 自带的 Linux 子系统是 Docker 运行的底座。先在终端执行这条命令更新子系统wsl --update然后安装 Docker for Windows首次启动时接受协议即可登录可以跳过。第二步拉取镜像并一键启动三个服务服务端由三个镜像组成ASR语音识别把语音转成文字、TTS语音合成把文字读成语音以及视频生成服务。先把三个镜像拉下来docker pull guiji2025/fun-asr docker pull guiji2025/fish-speech-ziming docker pull guiji2025/duix.avatar镜像就位后进入 deploy 目录启动cd deploy docker-compose up -d首次运行会自动下载依赖耐心等待约 30 分钟。三个容器全部变成 Running 状态服务端就算就绪了。第三步安装客户端下载官方构建的安装包双击Duix.Avatar-x.x.x-setup.exe完成安装Ubuntu 用户直接双击Duix.Avatar-x.x.x.AppImage运行。打开客户端能看到Create Video和Create Avatar两个入口说明环境全部打通。从10秒视频到你的第一个数字人数字人克隆四步走① 素材准备拍一段你自己讲话的视频10 秒左右就够。程序会把它拆成静音视频和音频其中音频要放到约定目录D:\duix_avatar_data\voice\data可在 docker-compose 中修改。② 训练数字人在客户端点Create Avatar选中你的视频。程序用你的外貌和声音特征训练模型结果就是My Avatars里出现一个长着你脸、能发出你声音的数字人。③ 合成语音输入口播文案客户端调用 TTS 服务把文字转成音频音色就是你视频里克隆下来的那个声音听起来像你自己说的。④ 生成口型视频客户端把音频和数字人模型配对逐帧驱动口型生成完成后一条完整的本地口播视频就会出现在My Works作品列表里。想接API记住这3个端点Docker 启动后会在本机开放端口通过http://127.0.0.1就能调用方便你二次开发功能端点地址用途说明模特训练http://127.0.0.1:18180/v1/preprocess_and_train传入音频返回后续合成要用的参考参数音频合成http://127.0.0.1:18180/v1/invoke把文本合成为克隆音色的语音视频合成http://127.0.0.1:8383/easy/submit音频加数字人生成口型视频进度可查/easy/query调用参数和完整流程都写在客户端源码 model.js、voice.js、video.js 里对着这三个文件就能照搬。高频翻车现场5个坑与快速解法三个服务没进入 Running→ 原因通常是 NVIDIA 驱动没装或装错其次是内存不足起不来 → 解法先验证显卡驱动再确认内存达到 32GB。docker-compose up -d连接超时→ 原因是 Docker Hub 官方源连接不稳定 → 解法开启全局代理或在 Docker 里配置国内镜像源。新增模特时报错→ 原因是素材视频没有声音、或画面里没有人讲话声音克隆无从下手 → 解法重拍一段口齿清晰的讲话视频。定制模特报 Connection refused→ 原因是 ASR 服务启动慢16G 小内存甚至可能直接启动不了 → 解法服务端启动后等几分钟再操作克隆。客户端与服务端版本不一致→ 原因是社区更新频繁你停在旧版 → 解法服务端到 deploy 目录重新执行docker-compose up -d客户端升级到最新版旧问题多半已在新版修复。更多报错日志的查看位置见仓库内的常见问题。HeyGem.ai 其实适合这些人选它理由有二成本比传统 3D 数字人制作降低 99% 以上且全流程离线、数据不出本机没有隐私泄露风险。在线教育老师做课程视频、自媒体创作者做口播内容、企业宣传做介绍短片、想拥有个人数字形象的人都能从一段 10 秒视频起步。这段 10 秒视频是你唯一的投入回报是一个 7×24 在本地为你工作的数字人。现在装好 Docker按上面三步走今天就能看到第一条口播视频。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表