ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

LIA 5分钟快速上手教程:一条命令生成首个 AI 动画视频,附预训练权重下载与 Python 环境避坑指南

LIA 5分钟快速上手教程:一条命令生成首个 AI 动画视频,附预训练权重下载与 Python 环境避坑指南 LIA 5分钟快速上手教程一条命令生成首个 AI 动画视频附预训练权重下载与 Python 环境避坑指南【免费下载链接】LIA[ICLR 22, TPAMI 24] LIA: Latent Image Animator项目地址: https://gitcode.com/gh_mirrors/li/LIALIALatent Image Animator是一个开源 AI 图像动画工具也是 ICLR 2022 / TPAMI 2024 论文的官方 PyTorch 实现一张静态图片加一段驱动视频一条命令即可生成首个 AI 动画视频。本教程带你 5 分钟跑通完整流程并附上预训练权重下载说明与 Python 环境避坑指南。30 秒了解 LIA让静态照片动起来的原理LIA 的核心思想非常简洁用一个自监督自编码器把源图片和驱动视频都编码到同一个潜空间latent space然后通过潜空间中向量的线性位移直接把运动搬到静态图上。与依赖姿态、关键点等结构提取的传统 talking head 方案不同LIA 不需要额外结构模块流程更精简在源图与驱动视频外观差异较大时也更稳健。项目内置 3 组预训练模型覆盖 3 类典型场景模型适用场景内置示例数据vox名人真实人脸VoxCelebdata/vox/taichi3D 动画角色Taichidata/taichi/ted演讲类长说话视频TED Talksdata/ted/环境准备Python 与 PyTorch 版本避坑清单 LIA 对版本比较敏感先对照下面这张清单检查环境能避开 80% 的安装坑Python官方要求 3.7推理服务配置 cog.yaml 使用 3.83.8/3.9 均可PyTorch1.5且必须与 torchvision 版本配套必须带 CUDA 的 GPU 版其他依赖av、tqdm、moviepy、tensorboard、lpipspip install torch torchvision av tqdm moviepy tensorboard lpips⚠️ 三个高频坑torch 与 torchvision 不配套例如 torch 1.10.1 要配 torchvision 0.11.2官方服务即此组合CUDA 11.0版本错配会出现算子缺失报错视频读取失败torchvision.io.read_video依赖底层解码器确保装好了av包且视频格式为 mp4/mov 等常见格式没有 NVIDIA GPU推理代码直接调用.cuda()纯 CPU 环境无法运行建议准备显存 6GB 的显卡预训练权重下载3 个模型放对位置 LIA 提供 3 个预训练权重文件vox.pt、taichi.pt、ted.pt从项目官方渠道下载后统一放入仓库根目录下的checkpoints/文件夹该目录已留有put checkpoints here占位文件可直接替换checkpoints/ ├── vox.pt ├── taichi.pt └── ted.pt提示3 个模型按需下载即可。用哪个场景的模型--model参数就填哪个名字。5 分钟生成第一个 AI 动画视频 ⚡第一步获取代码仓库git clone https://gitcode.com/gh_mirrors/li/LIA cd LIA第二步用内置示例数据运行这一条命令run_demo.py是演示主入口python run_demo.py --model vox --source_path ./data/vox/macron.png --driving_path ./data/vox/driving1.mp4看到进度条跑完后打开res/vox/目录就能找到成品视频macron_driving1.mp4命名规则源图名_驱动视频名帧率与原视频保持一致。其余两个场景同样各一条命令python run_demo.py --model taichi --source_path ./data/taichi/subject1.png --driving_path ./data/taichi/driving1.mp4 python run_demo.py --model ted --source_path ./data/ted/subject1.png --driving_path ./data/ted/driving1.mp4换成自己的图片和视频把自己的素材换成下方尖括号中的路径即可python run_demo.py --model 数据集 --source_path 你的图片 --driving_path 你的视频数据集三选一vox/taichi/ted务必与素材风格匹配真人头像选vox或ted3D 动画角色选taichi源图会被自动缩放为 256×256建议尽量提供正面、清晰的人脸/角色图想部署成 Web 推理服务可查看 predict.py 中的服务化推理入口进阶玩法线性操控与效果评测线性操控对单张图片在潜空间中做线性位移自动生成各种动作变体结果默认保存在./res_manipulationpython linear_manipulation.py --model 数据集 --img_path 图片路径 --save_folder 输出路径效果评测批量生成重建视频并计算 LPIPS 指标见evaluation.pypython evaluation.py --dataset 数据集 --save_path 输出路径模型本体由networks/目录下的编码器encoder.py、合成网络styledecoder.py与整体生成器generator.py组成想阅读 LIA 潜空间导航源码可从这里入手。常见问题排查 ❓报错 / 现象原因与解决办法FileNotFoundError: checkpoints/xxx.pt权重未下载或没放进checkpoints/目录读取视频时报错未安装av包或视频格式不被支持换成 mp4 试试Torch not compiled with CUDA装成了 CPU 版 PyTorch重新安装 CUDA 版本生成的视频偏模糊输出分辨率固定 256×256属正常现象动作与源图对不上模型与素材风格不匹配换对应场景的模型写在最后 ✅至此你已经跑通 LIA 完整链路装环境 → 放权重 → 一条命令出视频。LIA 证明了在潜空间中线性导航就能高质量地驱动静态图像对新手而言它也是理解图像动画化、talking head 方向一个很好的起点。快去换一张自己的照片生成第一个属于你的人物动画吧【免费下载链接】LIA[ICLR 22, TPAMI 24] LIA: Latent Image Animator项目地址: https://gitcode.com/gh_mirrors/li/LIA创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表