ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SadTalker 安装与配置:5 步跑通音频驱动面部动画生成

SadTalker 安装与配置:5 步跑通音频驱动面部动画生成 SadTalker 安装与配置5 步跑通音频驱动面部动画生成【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个 CVPR 2023 的音频驱动面部动画系统输入一张人像照片加一段音频输出说话人视频。本文给出 SadTalker 安装的一条完整落地路径按硬件选路、一条命令式流程搭好环境、模型下载与校验、首次推理命令外加一张按报错关键词组织的问题速查表。全部命令基于仓库真实脚本可直接复制。一、选路你的硬件走哪条路这一节帮你判断走 GPU 还是 CPU。做完你能明确自己的部署路线。对比项GPU 路线CPU 路线硬件要求NVIDIA GPU建议 4GB 显存起步任意 x86/ARM CPU依赖CUDA 11.3 版 PyTorchPyTorch CPU 版内存16GB 内存建议 32GB 内存10 秒音频量级耗时10–30 秒3–8 分钟结论有 4GB 以上显存的 NVIDIA 显卡就直接走 GPU没有显卡的机器走 CPU 兜底结果一致只是慢一个量级。设备是自动检测的inference.py 发现 CUDA 可用就分配给 GPU加--cpu参数才强制走 CPU。选好路线下一步把环境搭起来。二、一条命令式流程搭好 SadTalker 运行环境这一节按顺序执行 5 个步骤。做完你的 conda 环境能直接加载全部依赖torch.cuda.is_available()返回True。克隆仓库并创建 conda 环境git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker按 CUDA 分支装 PyTorchCUDA 11.3 或 CPU 二选一# CUDA 11.3 pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 # CPU 兜底 pip install torch1.12.1cpu torchvision0.13.1cpu torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cpupython -c import torch; print(torch.__version__, torch.cuda.is_available())安装 FFmpegconda install ffmpegffmpeg -version安装依赖清单见 requirements.txtpip install -r requirements.txt跑 Gradio 网页演示需要额外装 Coqui TTSpip install TTS。环境自检python -c import numpy, librosa, face_alignment; print(OK)环境就绪后还差预训练模型这一环。三、模型文件下载清单与校验这一节把模型下到正确位置。做完你的项目目录下会出现checkpoints/和gfpgan/weights/两个目录且每个文件的大小符合预期。文件位置大小用途SadTalker_V0.0.2_256.safetensorscheckpoints/约 1.2GB256 分辨率面部渲染主模型SadTalker_V0.0.2_512.safetensorscheckpoints/约 1.2GB512 分辨率面部渲染主模型mapping_00229-model.pth.tarcheckpoints/约 200MBcrop 模式 MappingNetmapping_00109-model.pth.tarcheckpoints/约 200MBfull 模式 MappingNetalignment_WFLW_4HG.pthgfpgan/weights/数十 MBfacexlib 面部对齐detection_Resnet50_Final.pthgfpgan/weights/数十 MBfacexlib 人脸检测GFPGANv1.4.pthgfpgan/weights/约 300MBGFPGAN 人脸增强parsing_parsenet.pthgfpgan/weights/数十 MB面部解析两种下载方式。方式一Linux/macOS 直接运行仓库自带的下载脚本自动建目录并拉取全部文件bash scripts/download_models.sh方式二手动下载。在 Releases 页面下载核心模型放入checkpoints/另下载 GFPGAN 离线补丁包解压后覆盖到项目根目录的gfpgan/。注意两个 mapping 文件要下全src/utils/init_path.py 按--preprocess是否为 full 模式二选一加载。下载后校验完整性du -h checkpoints/*.safetensors checkpoints/*.pth.tar du -h gfpgan/weights/*.pthsafetensors 文件应在 1.2GB 量级两个 pth.tar 在 200MB 量级。明显偏小说明下载不完整用wget -nc断点续传补齐。模型就位下面跑第一次推理。四、跑通 SadTalker 第一次推理这一节用最少参数生成第一条视频。做完results/下会出现一个时间戳目录里面是一条带口型动画的 mp4。最小参数集python inference.py --driven_audio examples/driven_audio/bus_chinese.wav \ --source_image examples/source_image/art_0.png \ --enhancer gfpgan仓库自带示例音频和示例人像可直接使用。两个关键参数。--size选 256 还是 512 分辨率主模型init_path 会自动加载对应的SadTalker_V0.0.2_512.safetensors或 256 版本默认 256512 质量更好显存需求更高。--enhancer gfpgan用 GFPGAN 修复人脸细节不需要增强就去掉。输入是全身照时加--still --preprocess full保持原始头部姿态并贴回全身画面只生成人脸特写就用默认 crop 模式。更多组合见 docs/best_practice.md。ls results/视频已生成剩下就是性能预期和报错自查。五、性能表现与报错关键词速查这一节给耗时预期和按报错关键词组织的问题表。对照速查表90% 的安装问题能直接定位。硬件10 秒音频量级耗时GPU10–30 秒CPU3–8 分钟报错关键词原因解法CUDA out of memory显存不足降--batch_size、--size 256或设PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128ffmpeg is not recognizedFFmpeg 未装或不在 PATHconda install ffmpeg后ffmpeg -version验证unexpected EOF, The file might be corrupted模型下载不完整按清单表校验大小重新下载No such file or directory模型目录结构不对对照第三节目录结构检查 checkpoints/ 与 gfpgan/weights/No module named ai/Illegal Hardware多为 Mac M1 上 dlib 不兼容单独重装pip install dlibInvalid data found when processing input音频格式不对输入只支持 wav 或 mp3更完整的案例见 docs/FAQ.md。环境、模型、推理三步落地后SadTalker 的安装配置就算完成。 再遇到问题回这张速查表按关键词查即可。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表