ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SadTalker 语音驱动人脸动画:一条命令跑通,8 个高频报错一次搞定

SadTalker 语音驱动人脸动画:一条命令跑通,8 个高频报错一次搞定 SadTalker 语音驱动人脸动画一条命令跑通8 个高频报错一次搞定【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker刚拉下 SadTalker 仓库跑python inference.py就炸模型文件缺失报FileNotFoundError推理到一半又抛CUDA out of memory别慌这两个坑都是环境没配齐。按下面步骤走你能独立跑通 SadTalker 首次推理输出口型对嘴的视频拿到 8 条高频报错的速查方案再用 2 条进阶命令按自己需求调整表情和画面范围。能独立跑通 SadTalker 首次推理在results/目录得到第一个口播视频能解释checkpoints/与gfpgan/weights/里每个模型的用途判断下载是否完整能写出带--still、--expression_scale等参数的进阶命令环境自检动手前 60 秒确认一张表过完依赖缺哪补哪。依赖版本要求一句话用途缺失时的快速补救Conda任意较新版本建隔离虚拟环境官网装 Anaconda / MinicondaPython3.8推荐项目指定解释器conda create -n sadtalker python3.8PyTorch1.12.1 cu113推理核心需与显卡 CUDA 版本匹配pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113FFmpeg任意新版视频编码输出必装Linuxconda install ffmpegmacOSbrew install ffmpegWindows 用 scoop 或手动加 PATHGit任意新版克隆仓库scoop install gitWindows平台差异只有两处Windows 记得确认ffmpeg在%PATH%里macOS含 M1装完依赖后还要单独执行pip install dlib否则人脸关键点检测直接挂。没有 GPU 也能跑加--cpu参数即可只是速度会明显慢。核心操作三步跑通 SadTalker 安装从克隆到出片只需三个动作拉代码、装依赖、下模型、推一遍。一键拉代码仓库自带全部示例素材省得自己找图找音频。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker装依赖配环境依赖版本在 requirements.txt 里锁死了照单安装最稳。conda create -n sadtalker python3.8 conda activate sadtalker # CUDA 11.3 显卡用官方指定版本CPU 环境直接 pip install torch torchvision torchaudio pip install torch1.12.1cu113 torchvision0.13.1cu113 torchaudio0.12.1 --extra-index-url https://download.pytorch.org/whl/cu113 conda install ffmpeg pip install -r requirements.txt # 仅 macOSM1需要单独装原版 dlib pip install dlib模型自动下载不装模型一切白搭。脚本会自动创建checkpoints/和gfpgan/weights/两个目录并逐个拉取权重总大小约 2GB请留够磁盘和耐心。文件名大小用途mapping_00109-model.pth.tar约 50MB音频到表情系数网络mapping_00229-model.pth.tar约 50MB音频到姿态系数网络SadTalker_V0.0.2_256.safetensors约 400MB256 分辨率完整模型包内置 BFM_Fitting 人脸重建库SadTalker_V0.0.2_512.safetensors约 800MB512 分辨率完整模型包gfpgan/weights/4 个权重约 600MB人脸检测与 GFPGAN 修复供--enhancer gfpgan使用bash scripts/download_models.sh⚠️ 脚本用了wget -nc中断后重跑会断点续传不用删掉重下。首次推理出视频素材现成examples/下 15 条驱动音频、20 张源图、2 条参考视频。先用默认参数推一条最短路径确认链路通了再谈调参。# 首次推理256 分辨率、默认 crop 预处理 python inference.py \ --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/full_body_1.png \ --result_dir results跑完后终端会打印The generated video is named: results/时间戳.mp4视频就在该时间戳目录下打开看口型。踩坑速查高频报错对照表报错别急着重装环境先对号入座。报错关键词根因修复命令/操作No module named aiepoch_20.pth缺失或损坏重跑bash scripts/download_models.shCUDA out of memory显存碎片化分配失败export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用setFileNotFoundError ... similarity_Lm3D_all.mat512 模型包没下全BFM 库缺失确认checkpoints/下两个.safetensors完整unexpected EOF ... file might be corrupted权重下到一半中断重跑下载脚本wget -nc可续传ffmpeg is not recognized系统 PATH 缺 ffmpegconda install ffmpeg或 Windows 加 PATHIllegal InstructionMac M1dlib 架构不兼容pip install dlib单独重装Invalid data found when processing input输入音频不是 wav/mp3先把音频转成 wav 再喂给--driven_audio终端打印Cant get the coeffs of the input图中人脸检测失败换正脸清晰图或改用--preprocess crop以上没覆盖到的先翻官方 FAQ 再到项目 issue 区搜九成问题都有前人踩过了。跑通之后进阶与延伸会跑之后把参数变成你的。换素材调参数效果立竿见影两个参数最值得玩--expression_scale控制表情幅度默认 1.0--still让头部保持源图姿态、少晃动适合全身图。# 全身图动画full 预处理 still 保持原姿态 GFPGAN 人脸修复 python inference.py \ --driven_audio examples/driven_audio/chinese_poem1.wav \ --source_image examples/source_image/full_body_1.png \ --preprocess full --still --enhancer gfpgan \ --expression_scale 1.2 --size 512 \ --result_dir results_full预期效果脸部贴回原图全身画面头部基本不转表情比默认更生动512 分辨率加 gfpgan 修复后人脸清晰度明显提升。完整参数含义见最佳实践文档。接下来可以探索什么examples/ref_video/用--ref_pose、--ref_eyeblink借参考视频的姿态和眨眼--input_yaw / --input_pitch / --input_roll从单图生成自由视角说话头docs/face3d.md加--face3dvis输出 3D 渲染脸docs/webui_extension.md 与app_sadtalker.pyGradio 网页端或 SD WebUI 插件接入环境跑顺之后把--size从 256 换到 512 对比一次清晰度差异再挑一张自己满意的输出截图贴在 issue 或讨论区能帮到下一个卡住的人。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表