
如何 4 步装好 SadTalker一份新手可用的完整配置指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是 CVPR 2023 的音频驱动说话头视频工具给它一张人像和一段语音它能输出口型、表情与声音对齐的说话视频。这篇带你走完 SadTalker 安装全流程——环境、依赖、模型文件、验证命令均可直接复制文末附硬件参数对照和 SadTalker 常见报错速查。 核对动手前的硬件与系统清单项目最低推荐操作系统Windows 10 / Ubuntu 18.04 / macOS 10.15Ubuntu 20.04Python3.8必须3.8.10CUDA10.211.3GPU 显存4GB8GB内存8GB16GB空闲磁盘10GB20GB两点提醒Python 锁定 3.8更高版本容易和旧依赖起冲突没有 GPU 的机器也能跑运行时加--cpu即可只是生成会从 GPU 上的几十秒拉长到几分钟。下文命令按 GPU CUDA 11.3 路线给出。 搭建环境、安装依赖与下载模型文件1. 建一个隔离的 Python 3.8 环境git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker拉取代码仓库并进入项目目录后续所有命令都在这个目录里执行。conda create -n sadtalker python3.8 conda activate sadtalker新建名为 sadtalker 的独立 conda 环境并激活避免和你系统里已有的包互相打架。2. 装好 PyTorch 与 FFmpegpip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113安装与 CUDA 11.3 配套的 PyTorch实际跑模型的深度学习框架。纯 CPU 机器换成 cpu 版本pip install torch1.12.1cpu torchvision0.13.1cpu torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cpuconda install ffmpegFFmpeg 是负责视频帧处理的底层工具缺了它无法合成视频Windows 用户需手动安装并确认ffmpeg -version能出结果。pip install -r requirements.txt按 requirements.txt 一次装齐全部 Python 依赖其中关键的几个numpy 1.23.4 / scipy 1.10.1 负责数值计算face_alignment 1.3.5 做面部关键点检测librosa 0.9.2 解析音频basicsr 1.4.2 与 facexlib 0.3.0 处理面部超分gradio 提供本地网页界面safetensors 是更安全的模型存储格式。可选组件pip install TTSgradio 网页版的文本转语音要用到不用网页界面可跳过。macOS 用户尤其 M1/M2建议单独pip install dlib装面部检测组件避免架构报错。Windows 与 macOS 的更多细节见 docs/install.md。3. 下载并摆好全部模型文件bash scripts/download_models.sh这个脚本会自动建目录并下载全部模型已存在的文件直接跳过。完成后项目里应有这些文件checkpoints/SadTalker_V0.0.2_256.safetensors— 256 分辨率面部渲染主包约 1.2GBSadTalker_V0.0.2_512.safetensors— 512 分辨率渲染包细节更好约 1.2GBmapping_00109-model.pth.tar— MappingNet全身full模式需要约 200MBmapping_00229-model.pth.tar— MappingNet裁剪crop头部模式用约 200MBgfpgan/weights/alignment_WFLW_4HG.pth— 人脸对齐模型detection_Resnet50_Final.pth— 人脸检测模型GFPGANv1.4.pth— 人脸修复增强模型parsing_parsenet.pth— 人脸解析模型文件不用手工改名挪位置src/utils/init_path.py 会自动选模型——checkpoints 下只要存在 .safetensors 就走新版并按--size加载 256 或 512 的包preprocess 含 full 时用 mapping_00109否则用 mapping_00229。若你刻意使用旧版 pth 模型如 wav2lip.pth、auido2exp_00300-model.pth、epoch_20.pth运行时加--old_version。4. 验证环境并跑通第一条视频python -c import torch; print(torch.__version__, torch.cuda.is_available())打印 PyTorch 版本与 CUDA 是否可用第二个值显示 True 说明 GPU 路线就绪。ffmpeg -version ls checkpoints gfpgan/weights前一条确认 FFmpeg 在 PATH 里后一条核对模型文件是否齐全缺了就回到第 3 步。然后用仓库自带素材做一次完整生成python inference.py --driven_audio examples/driven_audio/bus_chinese.wav \ --source_image examples/source_image/full_body_1.png用示例语音驱动示例人像走一遍裁剪、音频转系数、渲染全流程成品视频保存在 results/ 目录下文件名是时间戳。上图就是命令里用的那张默认输入图。习惯网页操作的话Linux/macOS 执行bash webui.sh即可启动 gradio 网页界面Windows 双击webui.bat。️ 调整参数GPU 与 CPU 两套配置inference.py 会自动检测设备torch.cuda.is_available()为真且没加--cpu时走 cuda否则走 cpu。常用参数对照GPU 路线CUDA 11.3、8GB 显存python inference.py --driven_audio audio.wav --source_image img.png \ --size 512 --batch_size 4 --enhancer gfpgan--size 512启用 512 模型提升画质默认是 256--batch_size 4多帧并行渲染更吃显存--enhancer gfpgan追加一次人脸修复。显存峰值约 3–6GB。CPU 路线python inference.py --driven_audio audio.wav --source_image img.png \ --cpu --size 256 --batch_size 1强制 CPU 跑保持 256 与单帧批处理不挂 enhancer用速度换内存。 排查常见报错现象、原因与解法ffmpeg is not recognized as an internal or external command原因FFmpeg 没装或不在 PATH。解法Linux 执行conda install ffmpegmacOS 执行brew install ffmpegWindows 安装后把 bin 目录加入 PATH再用ffmpeg -version复验。FileNotFoundError: [Errno 2] No such file or directory: checkpoints\BFM_Fitting\similarity_Lm3D_all.mat原因模型文件缺失或放错目录。解法重跑bash scripts/download_models.sh再对照第 3 步清单逐项核对目录结构。RuntimeError: unexpected EOF, expected 237192 more bytes. The file might be corrupted.或ModuleNotFoundError: No module named ai原因文件下载不完整或损坏后者一般对应 epoch_20.pth 被截断。解法用wget -c 链接断点续传同一文件或整包重下 gfpgan 文件夹下载后核对文件大小。RuntimeError: CUDA out of memory原因显存不够512 分辨率加大 batch 时更容易触发。解法--batch_size降到 1、--size降到 256并在运行前限制显存分配export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128 # Linux/macOS set PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128 # WindowsIllegal Hardware ErrorMac M1/M2 多见 原因dlib 与 Apple Silicon 架构不匹配。解法确认 Python 是 arm64 版本后执行pip install dlib重装。Error while decoding stream #0:0: Invalid data found when processing input ... Header missing原因音频格式不支持SadTalker 只收 wav 和 mp3。解法先转换例如ffmpeg -i input.aac -ar 16000 -ac 1 output.wav再把 wav 喂给 inference.py。环境与模型都就位后换一张自己的人像和一段语音就能让 SadTalker 持续产出新的说话视频。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考