ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SadTalker 完整指南:一张照片 + 一段音频,快速生成会说话的视频

SadTalker 完整指南:一张照片 + 一段音频,快速生成会说话的视频 SadTalker 完整指南一张照片 一段音频快速生成会说话的视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker把一张人物照片丢给它再配上一段录音几十秒后你会拿到一个会眨眼、会张嘴、而且嘴型和声音对得上的视频。这套东西叫 SadTalker是一个 CVPR 2023 的开源项目主打音频驱动的单图说话人脸动画——输入是静态图输出是动态的说话视频。下面不讲原理推导直接带你从零跑通再把每个旋钮讲清楚。先说清楚它到底解决什么问题很多人手里有一张角色立绘、一个头像或者一段想配上去的旁白但想让脸动起来以前要么逐帧手动画口型要么找真人重拍。SadTalker 把这两步压成一个图负责长什么样音频负责说什么、什么节奏模型负责让嘴、眼、头跟着声音自然地走。它的价值就一句话用最低成本让一张不会动的图开口说话并且口型大体对得上。不管是做虚拟形象、视频配音还是短视频素材这个能力都是刚需。一句话看懂核心原理声音怎么变成脸的动作别被3DMM吓到你可以先把它理解成把一张脸拆成一组可控的数字。整个流水线其实就三步对应仓库里三个位置对齐裁剪先找到脸的位置把脸裁出来并对齐人脸裁剪与对齐。音频转系数把声音波形喂进去算出每一帧脸该怎么摆、嘴怎么张音频到系数。这一步是整个项目最核心的环节。系数转画面拿着一帧帧的脸该怎么摆重新画出对应的画面最后拼成视频人脸渲染。所以它不是把嘴部区域单独抠出来贴上去而是让整张脸的姿态和表情一起跟着音频走这也是为什么它比单纯对口型看起来更自然。从零搭建安装与模型下载环境这块跟官方安装文档保持一致用 conda 建一个干净的 Python 3.8 环境最省心。下面这段命令直接照抄即可一共 7 行git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python3.8 conda activate sadtalker pip install torch torchvision torchaudio pip install -r requirements.txt bash scripts/download_models.sh几点提醒能帮你少走弯路依赖看 依赖清单里面锁了 numpy、librosa、facexlib、gfpgan 等具体版本不要自己乱升降。模型靠脚本拉模型下载脚本 会把推理需要的权重下到checkpoints/还会把 GFPGAN 超分权重下到gfpgan/weights/。网络不稳就多跑几遍脚本用了断点续传不会重复下。系统层面最好先装好ffmpegLinux 用包管理器装Windows 加进 PATH后面读写音频和视频都依赖它。有显卡就直接跑没有显卡它会自动落到 CPU只是慢一些。两种调用方式网页和命令行网页方式适合边点边看改参数直观。入口就是根目录的app_sadtalker.py在 SadTalker 目录下执行python app_sadtalker.py即可浏览器打开对应地址后左边传图和音频右边调参数点生成。它还能在线把文字转成语音再驱动适合懒得自己找音频的人。命令行方式适合批量、进流水线入口是 命令行入口。想跑全身、又要画面稳用下面这条就够python inference.py --driven_audio examples/driven_audio/deyu.wav \ --source_image examples/source_image/full_body_1.png \ --preprocess full \ --still --enhancer gfpgan跑完后结果视频会落在results/下按时间戳命名的目录里。--preprocess full是让全身入镜--still让头的动作收着点更自然--enhancer gfpgan是对脸做超分补细节。参数对照表口型自然度的几个关键旋钮不用记全部参数先把下面这几个玩明白效果就能拉开差距参数管什么怎么选--preprocess怎么处理原图crop只取脸 /full取全身想要全身出镜就full只要脸就crop--still让头的晃动更少、更稳全身图建议加半身图看口味--pose_style头部姿态的幅度档位0 到 45越大头动得越夸张默认 0--expression_scale表情强度表情发木就调到 1.2 左右太浮夸就调小--size渲染分辨率256 或 512先 256 快速看效果定稿再上 512--enhancer脸部超分可选gfpgan脸糊就开能明显提清晰度一个小技巧先用 256 分辨率把preprocess和still试到位确认构图和动作都满意再切到 512 出正式片。这样调试成本低很多。怎么确认它跑对了验证与避坑判断成功与否不用猜直接看三样东西看产出去results/里按最新时间戳找到那个.mp4正常能播时长和你给的音频一致。对口型把视频音画一起看嘴的张合是否大致跟着说话走。个别字不准很常见整体对得上就算正常。看脸是否被找到如果提示No face is detected多半是图里人脸太小或角度太偏换一张脸占比更大、正脸一点的图再试。几个高频坑提前排掉音频格式优先用 WAV给 MP3 也行程序会自动转成 16kHz 的 WAV 再处理。脸糊、想更清晰加--enhancer gfpgan前提是gfpgan/weights/里的权重已经下全。显卡显存吃紧把--size降到 256、--batch_size调小或者干脆不加超分先跑通。下一步建议先拿仓库自带的examples/里的图和音频把上面那条命令行命令原样跑一遍确认results/里能出片跑通后再把你自己的图和音频换进去调--preprocess和--expression_scale很快就能找到适合自己素材的甜点位。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表