
SadTalker 说话视频生成从环境搭建到出片的完整流程【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker手头有一张正脸照片和一段录音想让照片里的人开口说这段话SadTalker 就是干这件事的开源工具读入音频和一张静态肖像图逐帧合成带口型、表情和头部动作的说话视频。整个流程可以完全离线跑在本机输入只有两个文件。 项目背景与核心能力SadTalker 出自西安交通大学与腾讯 AI Lab 等团队论文入选 CVPR 2023开源协议为 Apache 2.0已迭代多个版本512×512 高清面部模型也已可用。它的几个核心能力输入一张照片加一段音频直接产出说话视频内置 Gradio 界面浏览器里上传文件即可生成支持 512×512 面部分辨率可挂 gfpgan 增强细节提供 crop、resize、full 三种预处理模式和全身图像模式 环境要求与首次启动环境要求Python 3.8、PyTorch、FFmpeg。按下面四步走克隆仓库git clone https://gitcode.com/GitHub_Trending/sa/SadTalker。Linux/Mac 终端执行bash webui.shWindows 双击webui.bat脚本会自动装依赖并启动 WebUI。运行bash scripts/download_models.sh一次性拉齐全部模型权重。打开浏览器访问本地 WebUI上传图片和音频点生成。如果更习惯命令行用下面这条命令生成第一个视频python inference.py --driven_audio 音频.wav --source_image 照片.png --enhancer gfpgan结果保存在results/目录下带时间戳的文件夹里。 按场景选择预处理模式单张正脸肖像直接用默认参数。--preprocess默认值crop会自动抠出面部区域只动画这张脸再贴回原图是稳定性最高的模式。全身或半身照--preprocess full配合--still使用。full 模式把抠出的面部动画贴回整张图加--still后头部沿用原图姿态、几乎不晃动人物看起来像站定在说一段话适合展示完整人物。证件照风格图片选--preprocess resize整图缩放到固定分辨率后生成完整说话视频画面构图和输入一致。官方文档提醒全身照不适合这个模式效果会明显变差。面部动作不够自然用参考视频功能。--ref_eyeblink传入一段真人视频系统会借用其中的眨眼和眉毛动作--ref_pose则借用头部姿态让生成结果比纯音频驱动更像真人。参考视频比音频短时会自动循环使用。 首次生成的关键参数参数推荐值作用说明--preprocess默认crop全身照用full决定处理整图还是只动面部--still全身场景加正脸可不加固定头部姿态动作更收敛--expression_scale1.0 最稳1.2~2.0 增强表情和动作的强度系数--enhancergfpgan面部修复增强低清图建议开启--ref_eyeblink任意含清晰人脸的视频路径借参考视频的眨眼和眉毛动作参数细节可对照 docs/best_practice.md 逐项查证。 报错排查思路命令行提示 ffmpeg 无法识别→ 环境里没有 FFmpeg 或不在 PATH → 用 conda、brew 安装Windows 则安装后把 ffmpeg 加入系统 PATH。加载模型时报 unexpected EOF→ 权重文件不完整或被截断 → 重新执行模型下载脚本确认每个文件都完整落地。CUDA 显存不足→ 音频较长或分辨率较高 → 启动前设置环境变量PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128再运行限制显存分块大小。更多情况见 docs/FAQ.md覆盖 Mac M1 重装 dlib、音频格式只支持 wav/mp3 等细节。SadTalker 把照片 音频 说话视频做成了可本地离线复现的流程参考视频和全身模式进一步拉近距离观感。想继续往下挖建议从 best practice 文档里的参数表开始逐个场景试一遍。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考