ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SadTalker说话头完整部署指南:新手10分钟上手

SadTalker说话头完整部署指南:新手10分钟上手 SadTalker说话头完整部署指南新手10分钟上手【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是 CVPR 2023 的开源项目输入一张人像图和一段音频就能生成口型与表情自然的说话头视频。本文按环境自检、依赖安装、模型资产下载、首次运行验证的顺序带你走通全流程跟着自检 → 三步安装 → 首跑的路线大约 10 分钟就能拿到一个可播放的视频。环境就绪自检开跑前五分钟动手前按表格核对一下机器配置。任何一项不达标都能事后补救但中途排查会麻烦得多项目必需推荐操作系统Linux / macOS / Windows 10Ubuntu 20.04 及以上运行时版本Python 3.83.8 Anaconda或 MinicondaGPU 与 CUDANVIDIA GPU、CUDA 11.x也可纯 CPU 运行RTX 3060 及以上8 GB 显存内存8 GB16 GB磁盘10 GB 可用空间20 GB预训练资产较大⚠️ 最容易踩的两个坑Python 版本不是 3.8项目部分依赖锁定了旧版本用新版容易装不上以及 FFmpeg 没装或没进 PATH。三步完成部署隔离环境、依赖、资产一次到位第一步创建隔离环境项目的依赖版本锁定较多装进系统公共环境极易和其他项目冲突所以先克隆仓库并建一个独立的 conda 环境git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker激活后校验一下版本确认隔离环境生效python --version✅ 输出以 Python 3.8 开头即通过。第二步安装核心依赖先装 PyTorch 框架因为依赖清单里的其他包都建立在它之上。GPU 机器执行pip install torch1.12.1 torchvision0.13.1 torchaudio0.12.1✅ 命令走完打印安装成功即可如果你是纯 CPU 机器改成安装 cpu 后缀的 CPU 版本推理脚本运行时会自行检测设备。再装 FFmpeg它是音视频编解码的必选项conda install ffmpeg # Linuxconda 环境内 brew install ffmpeg # macOS⚠️ Windows 请安装 FFmpeg 官方二进制包并把 bin 目录加入 PATH装完统一用ffmpeg -version能打印版本信息来确认。然后一键装完全部 Python 依赖numpy、librosa、face_alignment、gfpgan 等都在清单里pip install -r requirements.txt✅ 最后用一条导入命令验证不报错并打印出版本号就说明依赖齐了python -c import torch, librosa, face_alignment, gfpgan; print(torch.__version__) 如果打算用 Gradio 网页里的文本转语音功能需要额外执行pip install TTS。第三步获取预训练资产代码和依赖就绪后还差最后一块预训练模型。需要的资产一览文件大小用途checkpoints/SadTalker_V0.0.2_256.safetensors约 1 GB256 分辨率面部渲染模型checkpoints/SadTalker_V0.0.2_512.safetensors约 1 GB512 分辨率面部渲染模型checkpoints/mapping_00109-model.pth.tar数百 MB映射网络全身图模式使用checkpoints/mapping_00229-model.pth.tar数百 MB映射网络标准模式使用gfpgan/weights/4 个 .pth 文件合计数 GB人脸检测、对齐、解析与 GFPGAN 面部增强项目自带一键下载脚本Linux/macOS 推荐bash scripts/download_models.sh✅ 脚本会自动创建 checkpoints/ 与 gfpgan/weights/ 目录并逐个下载已存在的文件会被跳过可安全重复执行中途断网直接重跑即可续传。Windows 用户或脚本失败时手动把上表文件放到对应目录即可可在项目发布页找到下载源如果只打算用 256 模型512 那个文件可以跳过。验证首次运行三条命令确认就绪依次执行下面三条命令确认环境真正可用python -c import torch; print(torch.__version__, torch.cuda.is_available()) ffmpeg -version python -c import librosa, face_alignment, gfpgan, safetensors; print(deps ok)预期输出第一条打印框架版本与 True有 GPU或 False无 GPU第二条打印 FFmpeg 版本信息第三条打印 deps ok。全绿之后跑最短示例。inference.py 内置了默认的示例图像与音频直接运行即可python inference.py运行结束后会生成一个说话头视频保存在 results/时间戳.mp4。换成自己的素材时python inference.py --driven_audio ./examples/driven_audio/deyu.wav \ --source_image ./examples/source_image/full_body_1.png按硬件选方案GPU与CPU怎么选GPU 方案CPU 方案硬件门槛NVIDIA GPU4 GB 显存起步任意 x86 CPU预期速度一条视频数十秒级数分钟到数十分钟推荐参数--size 512 --batch_size 2可开 --enhancer gfpgan--cpu --size 256 --batch_size 1不开增强GPU 示例追求质量python inference.py --driven_audio ./examples/driven_audio/deyu.wav \ --source_image ./examples/source_image/full_body_1.png \ --size 512 --enhancer gfpganCPU 示例保证能跑python inference.py --cpu --driven_audio ./examples/driven_audio/deyu.wav \ --source_image ./examples/source_image/full_body_1.png \ --size 256 --batch_size 1 脚本会自动检测 CUDA--cpu 只在你想强制用 CPU 时才需要加。错误速查与排查症状→原因→解决先查表绝大多数问题落在这七类里症状可能原因解决办法ModuleNotFoundError、依赖冲突包缺失或版本不符激活隔离环境重跑 pip install -r requirements.txtffmpeg is not recognized未安装或不在 PATH按平台安装后用 ffmpeg -version 验证FileNotFoundError: ... checkpoints/...资产未下载或位置不对重跑 bash scripts/download_models.sh核对目录结构RuntimeError: unexpected EOF ... corrupted下载中断、文件不完整重新下载对应资产并核对文件大小CUDA out of memory显存不足设置 PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128调小 --batch_size 或改用 --size 256Illegal HardwaremacOS M1dlib 构建问题单独执行 pip install dlib 重装Error while decoding stream音频报错音频格式不支持项目只接受 wav/mp3先用 ffmpeg 转换格式几个高频问题问全身图能不能直接做动画 答可以加--still --preprocess full动起来的脸部会自动贴回原图得到全身视频。问想用网页界面而不是命令行 答python app_sadtalker.py启动 Gradio 页面或用一键脚本 webui.shLinux/macOS与 webui.batWindows。问256 和 512 两个模型都要留吗 答不用代码按 --size 自动选模型留你打算用的那个分辨率即可。问产物在哪能看到中间结果吗 答默认输出到 results/时间戳.mp4加 --verbose 会保留全部中间产物。收尾部署路线回顾核硬件、建独立 3.8 环境、装依赖、拉资产三步走完后用首次运行验证收尾。跑通之后建议试试--still全身模式、--enhancer gfpgan面部增强以及用参考视频借用眨眼和姿态这几个进阶玩法。更多参数组合见 docs/best_practice.md遇到新报错可以翻 docs/FAQ.md。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表