ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SadTalker数字人视频生成完整指南:一张照片开口说话

SadTalker数字人视频生成完整指南:一张照片开口说话 SadTalker数字人视频生成完整指南一张照片开口说话【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker你有没有过这样的时刻手里有一张很喜欢的照片却不知道怎么让它动起来尤其是当你想做一条给亲友的祝福视频、一段自己讲的科普内容或者一个能说会道的虚拟形象最头痛的就是——需要真人出镜、录口型、剪视频一套流程下来半天就没了。SadTalker能帮你把这件麻烦事压缩成一条命令。这是腾讯AI Lab参与、发表在CVPR 2023上的开源项目输入一张肖像图加一段音频几分钟后你就能拿到一段口型对得上、表情自然的数字人视频。本文从零开始带你亲手跑通第一个作品再逐步调出更专业的观感。先弄懂它做的事一句话就够了SadTalker的核心逻辑可以写成一个公式一张人像图片 一段语音音频 一段会说话的数字人视频它先用3D运动系数学习技术从你的静态图片里重建出人脸的立体结构和动作参数再让这些参数跟着音频的节奏动起来——嘴型对台词、表情随语气起伏最后渲染成视频。更难得的是整个过程会尽量保留原图本身的风格油画、动漫、写实照片都能处理而不是把你的人脸抹平成一张标准脸。 你不需要懂任何深度学习知识下面的步骤照着敲就行。动手前准备三样东西十分钟搞定目标很明确让 SadTalker 在你的电脑上跑起来。你需要一个装有 Python 3.8 以上版本的终端环境8GB以上内存有NVIDIA显卡更好没有也能用CPU只是慢一些。先拉取项目并安装依赖git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker pip install -r requirements.txt接下来下载模型文件这是让项目有脑子的关键一步文件较大请耐心等它跑完bash scripts/download_models.sh如果中途报ffmpeg找不到用conda install ffmpeg装一下即可。Windows用户可以直接双击运行webui.batLinux和macOS则执行bash webui.sh脚本会自动帮你装好依赖——这是最省心的备选路径。第一个作品一条命令让照片开口说话现在进入最有成就感的环节。准备一张正面清晰的人像照项目自带示例在examples/source_image/里再准备一段wav格式音频示例在examples/driven_audio/也支持mp3。在项目目录下执行python inference.py --source_image examples/source_image/art_0.png --driven_audio examples/driven_audio/chinese_news.wav --enhancer gfpgan生成过程会依次输出3DMM提取音频转系数渲染等日志完成后视频会自动保存到results/目录下文件名带时间戳。这就是生成的效果人物开口说话、表情自然服饰细节和光影都被完整保留。第一次看到静态照片里的人物开口的那一刻基本就是你被这个项目圈粉的时刻。别急着走下面的参数才是让它更像真人的关键。一张图适合什么玩法三种预处理模式怎么选不同照片要用不同的处理方式选错了效果会大打折扣。SadTalker通过--preprocess参数提供了三种模式模式适合的图效果crop全身或半身人像自动裁出面部区域做动画表情和头部动作最自然resize证件照类特写整图缩放适合头部占比较大的图full全身照、艺术创作保留整张原图只让面部区域动起来python inference.py --source_image examples/source_image/full_body_1.png --driven_audio examples/driven_audio/bus_chinese.wav --preprocess full --still --enhancer gfpgan上面这条命令用full模式处理写实全身照再加--still保持原图头部姿态避免画面晃得太野。油画质感的肖像也完全可以用艺术风格会在动画中被保留下来。让画面更专业四组参数照抄就行跑通之后你可能发现表情不够丰富、或者头部动作太夸张。这些问题都有对应的参数可调--expression_scale 1.2表情强度。默认1.0调大到1.2-1.5能让表情更生动数字人视频里的情绪表达会更明显。--still静止模式。想让头部保持原图角度、少些摆动加上它。--enhancer gfpgan画面增强。用面部修复网络提升清晰度观感提升非常直观。--ref_eyeblink 参考视频.mp4和--ref_pose 参考视频.mp4借参考视频的眨眼和头部动作让数字人更有人味。项目examples/ref_video/里有现成素材。组合示例python inference.py --source_image examples/source_image/art_0.png --driven_audio examples/driven_audio/chinese_news.wav --expression_scale 1.2 --still --enhancer gfpgan --ref_eyeblink examples/ref_video/WDA_AlexandriaOcasioCortez_000.mp4✅ 建议先从默认参数出片看哪里不满意再单独调一项每次只改一个变量你很快就能摸清每项参数的作用。不想碰命令行网页界面了解一下如果你更习惯图形界面SadTalker内置了Gradio网页版。启动后浏览器会自动打开本地地址默认7860端口在界面上传图片、上传或录音音频、勾选参数点一下Generate就能看结果python app_sadtalker.py界面里也集成了文本转语音功能输入一段文字可以直接生成驱动音频等于从文字到数字人视频一步到位做多语言教学素材时特别省事。常踩的三个坑提前帮你避开报错找不到checkpoints相关文件多半是模型没下载全重新完整执行一遍bash scripts/download_models.sh确认checkpoints/和gfpgan/目录都出现再生成。提示CUDA out of memory显存不够。执行--batch_size 1降低渲染批大小或者改用--cpu参数。视频口型对不上优先检查音频清晰度和采样率16kHz的wav表现最稳也可以把--expression_scale往低调一档试试。更多参数细节和最佳实践可以翻看项目文档 docs/best_practice.md想确认自己是不是某类图片导致的效果问题先查 docs/FAQ.md。想研究技术原理的模型源码都在src/audio2exp_models/、src/facerender/和src/face3d/这几个目录里按模块看即可。好了现在轮到你动手了。挑一张喜欢的照片录一段三十秒的话把命令敲下去——几分钟后你就能亲眼看到照片里的那个人开口和你说话。从第一个粗糙的作品开始逐步调出自然的效果这个过程本身就是做数字人视频最好玩的部分。关键参数记不住也没关系先跑通再优化。把本文收藏起来下次想做数字人视频时照着一步步来就行。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表