ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SadTalker快速上手:一张照片加一段录音,生成会说话的开口数字人视频

SadTalker快速上手:一张照片加一段录音,生成会说话的开口数字人视频 SadTalker快速上手一张照片加一段录音生成会说话的开口数字人视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker是基于CVPR 2023论文开源的说话人脸动画项目。输入一张肖像图片和一段音频本地离线生成25fps的数字人说话视频人物会眨眼、动头、口型对齐。完整流程只有三步克隆仓库、下载模型、跑一条推理命令。下面按任务顺序给出命令、参数取值和预期效果。让一张肖像图开口说话3步跑通第一步准备环境。需要Python 3.8以及系统里装好ffmpeg用于视频拼接git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker pip install -r requirements.txt有N卡的话装PyTorch CUDA版没有GPU也能跑命令末尾加--cpu只是更慢。第二步下载模型文件共数GB放进checkpoints/和gfpgan/weights/bash scripts/download_models.sh第三步用仓库自带的示例图片和音频跑一次推理python inference.py --source_image examples/source_image/art_0.png \ --driven_audio examples/driven_audio/chinese_news.wav结果保存在results/下目录名是生成时间戳视频名形如2024_xx_xx_xx.xx.xx.mp4。默认--preprocess crop模式会围绕人脸自动裁剪生成说话头像视频表情和头部动作都由音频驱动。下面4个参数对效果影响最大参数作用默认值何时调整--preprocess图片预处理crop人脸特写 / resize缩放 / full全身crop全身图用full证件照类用resize--still锁定原始头部姿态去掉头部晃动关full模式搭配保持画面稳定--expression_scale表情幅度放大倍数1.0太僵硬调1.2~1.5太夸张调0.5~0.8--size人脸渲染分辨率256要更清晰用512速度变慢让全身照说话保留服装和背景源图是全身或半身照时crop模式会丢掉身体。改用full模式系统自动裁出人脸生成口型动画后再贴回原图服装、背景、构图都保持原样python inference.py --source_image examples/source_image/full_body_1.png \ --driven_audio examples/driven_audio/chinese_poem1.wav \ --preprocess full --still --enhancer gfpgan full模式建议始终搭配--still。不加的话头会随音频晃动全身构图下显得不自然加上后人物位置不动只有面部配合音频开合。预期效果面部贴回区域加上gfpgan人脸增强后更清晰远处看几乎看不出拼接痕迹。用参考视频补上自然的眨眼和头部动作默认由模型自己合成头部运动和眨眼长视频里容易显得呆。可以借一段参考视频--ref_eyeblink借它的眨眼节奏--ref_pose借它的头部动作两个参数指向同一个视频即可python inference.py --source_image examples/source_image/art_2.png \ --driven_audio examples/driven_audio/imagine.wav \ --ref_eyeblink examples/ref_video/WDA_KatieHill_000.mp4 \ --ref_pose examples/ref_video/WDA_KatieHill_000.mp4examples/ref_video/里自带两段真人参考视频可以直接拿来试。参考视频比音频短时会循环使用。让脸更清晰分辨率和两级增强默认人脸渲染分辨率是256可以两级增强--enhancer用人脸修复网络处理脸部区域--background_enhancer realesrgan对整段视频做超分。两个增强库需要单独安装pip install gfpgan realesrgan python inference.py --source_image examples/source_image/art_16.png \ --driven_audio examples/driven_audio/deyu.wav \ --size 512 --enhancer RestoreFormer --background_enhancer realesrgan--size 512会加载512分辨率的人脸模型显存和时间都会上升。显存低于8GB的机器建议保持256只开enhancer。不敲命令的跑法本地WebUI不想记命令行参数可以一键启动Gradio网页界面bash webui.sh # macOS/LinuxWindows双击 webui.bat脚本会自动建虚拟环境、装依赖然后打开浏览器访问http://localhost:7860上传图片、音频参数在页面上勾选。也可以直接python app_sadtalker.py启动页面里想用文字转语音先pip install TTS。附录环境要求、报错速查与项目内资源环境要求Python 3.8ffmpeg在PATH中PyTorch推荐GPU版纯CPU可加--cpu模型文件约2GB由scripts/download_models.sh自动下载音频输入仅支持wav / mp3真人肖像图效果最好二次元画风暂不支持报错速查提示ffmpeg不是内部或外部命令→ 没装或不在PATH →conda install ffmpeg或brew install ffmpegWindows装好后加入PATHModuleNotFoundError: No module named ai→epoch_20.pth下载不完整 → 重跑下载脚本并核对文件大小Mac M1/M2报Illegal Hardware Error→ dlib未适配Apple芯片 → 单独pip install dlib重装CUDA out of memory→ 显存不足 → 运行前设置export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128或降低--size、--batch_size读音频时报decoding stream错误→ 音频格式不支持 → 先转成wav或mp3项目内资源docs/best_practice.mdinference.py全部进阶参数详解含自由视角--input_yaw等docs/FAQ.md官方常见问题src/facerender/人脸动画渲染引擎生成器、稠密运动网络src/audio2exp_models/音频到表情系数的模型examples/driven_audio/14段示例音频开箱即可测试【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表