ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SadTalker 四步跑通:从环境配置到第一次生成说话人脸视频的完整实操

SadTalker 四步跑通:从环境配置到第一次生成说话人脸视频的完整实操 SadTalker 四步跑通从环境配置到第一次生成说话人脸视频的完整实操【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个发表于 CVPR 2023 的说话人脸视频生成工具给它一张人像图片和一段音频就能生成口型、表情与头部姿态同步说话的动画视频。本文面向会基本命令行操作、但没有接触过该项目的读者带你完成环境配置、下载预训练模型并在本机生成第一段视频随后讲解结果确认方法与常用参数调整。安装前检查开始之前请逐项核对以下条件系统Linux、macOS 或 WindowsWindows 需先安装 Python 3.8 与 gitPython建议使用 conda 创建 3.8 虚拟环境避免依赖冲突PyTorch官方推荐 1.12.1cu113版本无独立显卡的机器可以加--cpu参数在 CPU 上运行速度较慢ffmpeg必须安装用于音频解码与视频编码磁盘为预训练模型文件与生成结果预留足够空间快速上手四步生成第一段视频第一步克隆仓库并创建虚拟环境拉取代码并建立隔离的 Python 3.8 环境。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker第二步安装依赖安装 PyTorch、ffmpeg 以及项目依赖清单。若上面安装的 PyTorch 版本与你的显卡驱动不匹配按 README 安装章节给出的版本命令重装。pip install torch torchvision torchaudio conda install ffmpeg pip install -r requirements.txt第三步下载预训练模型执行官方下载脚本一次性获取人脸渲染、音频到表情/姿态、人脸增强等模型分别存放在checkpoints/与gfpgan/目录。bash scripts/download_models.shWindows 上可改为手动下载按 README「Download Models」一节列出的清单把文件放到相同目录结构。第四步首次运行使用仓库自带的音频与人像完成第一次生成。默认是crop模式只动画人脸裁剪区域输出保存在results/下。python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/full_body_1.png \ --result_dir results整个过程依次完成音频特征提取、3D 运动系数生成、逐帧人脸渲染合成三个阶段全程离线。确认生成结果查看终端输出成功时最后一行打印The generated video is named:并给出完整视频路径。打开results/目录下带时间戳子目录的 mp4 文件播放确认人像口型与音频内容同步。注意不追加--verbose参数时中间文件会在生成结束后自动清理目录中只保留最终视频。常用参数与进阶场景以下三个参数来自 docs/best_practice.md覆盖了多数使用场景。全身图片动画--preprocess full让动画作用于整张图片配合--still保持原始头部姿态适合全身人像素材。python inference.py --driven_audio examples/driven_audio/chinese_poem1.wav \ --source_image examples/source_image/full_body_2.png \ --preprocess full --still --result_dir results_full人脸增强--enhancer gfpgan在生成后执行人脸修复可提升面部细节质量。python inference.py --driven_audio examples/driven_audio/imagine.wav \ --source_image examples/source_image/art_2.png \ --enhancer gfpgan --result_dir results_enhanced调整表情幅度--expression_scale是表情强度倍数取值大于 1 时动画幅度更明显。python inference.py --driven_audio examples/driven_audio/bus_chinese.wav \ --source_image examples/source_image/art_3.png \ --expression_scale 1.5 --result_dir results_expressiveSadTalker 常见报错与处理报错现象原因解决命令ffmpeg is not recognizedffmpeg 未安装或未加入 PATHconda install ffmpegmacOS 可改用brew install ffmpegCUDA out of memory显存不足运行前执行export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用set代替exportFileNotFoundError: ... checkpoints/BFM_Fitting/similarity_Lm3D_all.mat模型文件缺失或目录位置不对重新执行bash scripts/download_models.sh并检查checkpoints/目录结构音频解码错误如mp3float ... Header missing音频格式不受支持项目只接受wav与mp3先用 ffmpeg 转成wavRuntimeError: unexpected EOF ... file might be corrupted模型文件下载损坏删除损坏文件后重新执行bash scripts/download_models.sh后续探索更完整的参数说明参考视频--ref_pose、--ref_eyeblink自由视角--input_yaw等见 docs/best_practice.md更多问题可查 docs/FAQ.mdexamples/ 目录提供了更多驱动音频与人像素材可替换为自己的素材继续尝试。如果偏好图形界面先执行pip install TTS再运行python app_sadtalker.py即可启动本地 gradio 演示。建议先跑通参考视频模式观察姿态控制对成片自然度的影响。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表