ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

15分钟跑通SadTalker:音频驱动面部动画从环境搭建到出片

15分钟跑通SadTalker:音频驱动面部动画从环境搭建到出片 15分钟跑通SadTalker音频驱动面部动画从环境搭建到出片【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一款音频驱动面部动画工具输入一张静态人像加一段语音就能生成嘴型、表情都与音频对齐的说话视频。这篇安装教程带你走环境、模型、出片三步。先看效果一张照片加一段音频能变成什么最终产物是 mp4人物对着镜头说话口型、眨眼和头部微动都跟着语音走全身照输入也不会崩坏。下面这段动图就是一次完整运行的输出。图注SadTalker 音频驱动面部动画的出片效果嘴型随语音逐帧变化原理拆开并不玄先从照片里恢复出三维人脸参数再把音频转成头部和口型的运动系数最后逐帧渲染合成视频。仓库自带的演示素材都在 examples/ 目录音频和照片可以直接拿来试。硬件底线你的配置够不够维度最低更从容显卡6GB 显存RTX 2060 一档8GB 以上RTX 3060 起内存8GB16GB 以上磁盘留 10GB留 20GB没有独显也能跑脚本检测不到 CUDA 会自动切到 CPU十几秒音频大概要等几分钟适合先验证流程、后面再考虑提速。环境一次搭好conda、PyTorch 与依赖先建隔离环境克隆仓库后用 conda 拉一个 Python 3.8 的独立环境把依赖隔离开冲突会少很多git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker再装依赖PyTorch 按机器的 CUDA 版本去官网挑对应命令纯 CPU 机器装 CPU 版ffmpeg 交给 conda 最省事最后补齐项目依赖pip install torch torchvision torchaudio conda install -y ffmpeg pip install -r requirements.txtmacOS 上装完还要补装 dlib仓库 docs 目录的 install.md 里写了分平台的额外事项。模型自动下载与第一次推理一条命令拉全模型bash scripts/download_models.sh它会自动创建 checkpoints 目录把 256 和 512 两档的 safetensors 主权重、两个 mapping 网络的 pth 文件以及 GFPGAN 人脸增强权重全部取回本地下载用的是断点续传写法重跑不会重复拉已存在的文件。GPU 与 CPU 各一套参数第一次先按 256 分辨率把全链路跑通python inference.py --source_image examples/source_image/full_body_1.png \ --driven_audio examples/driven_audio/bus_chinese.wav --size 256图注上面命令默认的全身输入图面部区域清晰是全身照能跑好的前提完成后视频按时间戳落在 results 目录。显卡有富余把--size提到 512、--batch_size提到 4画面更细CPU 机器在命令里加--cpu并把--batch_size压到 1。除了真实照片风格化插画也可以直接当输入图注风格化插画同样能驱动出自然的说话动画出片不顺时先查这三处显存吃紧先把--batch_size降到 1、--size降到 256还报 OOM就设置PYTORCH_CUDA_ALLOC_CONF环境变量让显存分配更紧凑。依赖版本打架别在原环境里打补丁删掉 conda 环境从头重建一次最干净。加载权重报错多半是某个模型文件没拉全重跑一遍下载脚本即可它会跳过已存在的文件。最后给挑输入素材定个标正脸、清晰、光线足音频用 WAV 最稳。图注正脸清晰的这类人像是音频驱动面部动画最省心的输入到这里环境、模型、命令都齐了换一张自己的照片和一段自己的音频跑一条属于自己的出片命令就好。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表