ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【arXiv 2025】Wan-Animate 论文解读:统一角色动画与替换的框架|从AI视频生成技术视角

【arXiv 2025】Wan-Animate 论文解读:统一角色动画与替换的框架|从AI视频生成技术视角 摘要本文解读 arXiv 2025 论文《Wan-Animate: Unified Character Animation and Replacement with Holistic Replication》。该论文提出Wan-Animate一个统一角色动画与角色替换的框架通过融合统一输入范式、表情与身体解耦控制与Relighting LoRA 环境重光照实现表情、动作与环境的整体复刻。其特别之处在于保留 Wan-I2V 原始输入结构单模型同时支持双模式、长视频与任意分辨率。实验表明全身动画组 SSIM 0.813、肖像组 FVD 94.65 均列第一20 人用户研究击败 Runway Act-two 与 DreamActor-M1 等闭源 SOTA为数字人 AIGC 领域提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机为什么角色动画需要统一框架研究主线从问题到结论基准/方法设计一套输入范式两种生成模式分类全景角色动画方法的技术路线方法细节身体与表情解耦LoRA 适配环境实验设计与结果两组量化第一用户研究击败闭源结果对比总结关键发现局限性常见问题FAQWan-Animate 和 Animate Anyone 是什么关系动画模式和替换模式有什么区别为什么用隐式人脸特征而不是 landmark 关键点Relighting LoRA 具体做什么模型能生成多长的视频代码和权重开源吗参考链接论文基本信息项目内容标题英文Wan-Animate: Unified Character Animation and Replacement with Holistic Replication标题中文Wan-Animate角色动画与替换的统一框架作者HumanAIGC Team26 位作者字母序机构HumanAIGC Team, Tongyi Lab, Alibaba Group会议arXiv 2025arXivhttps://arxiv.org/abs/2509.14055项目网站https://humanaigc.github.io/wan-animate/背景与动机为什么角色动画需要统一框架角色图像动画是影视制作、广告与数字人领域的核心生产力扩散模型的进步让这项技术从实验室走向创作一线但现有方案各有明显短板UNet 路线的质量瓶颈Champ、MimicMotion、StableAnimator、UniAnimate 基于 Stable Diffusion 或 SVD 骨架缺少时序先验生成质量明显落后于 SOTADiT 路线的功能残缺Realisdance、UniAnimate-DiT 只做动作控制缺乏表情整体复刻角色替换任务开源空白VACE 虽可近似实现但身份一致性差、参数依赖强人脸动画信号粒度不足landmark 稠密信号提取丢失细节跨身份时精度要求极高。从历史视角看2024 年 Animate AnyoneCVPR 2024用 UNet ReferenceNet 确立了角色动画一致性范式2025 年 Wan-Animate 迁移到 Wan 2.1 DiT 视频基础模型统一动画与替换2025–2026 年 Wan2.2-Animate 与 Wan-Animate-2 进一步走向生产级部署与实时流式。Wan-Animate 正站在视频基础模型 可控后训练的转折点上把实验室技术推向产业应用。研究主线从问题到结论图 11Wan-Animate 研究主线流程图Mermaid基准/方法设计一套输入范式两种生成模式核心设计一句话修改输入范式把参考图、时间引导与环境条件拼装成一套符号表示动画与替换两种模式共享同一模型、同一套参数。参考公式化角色图经 Wan-VAE 编码为参考潜变量沿时间维与条件潜变量拼接掩码置 1作为外观注入主通道时间公式化从前段尾部随机选取 1–5 帧作时间引导整帧掩码置 1并以一定概率参与训练防过拟合环境公式化动画模式目标帧置零替换模式对 SAM2 分割出的环境区域掩码置 1、主体区域掩码置 0。这种设计与 Wan-I2V 原生输入结构完全兼容分布偏移最小post-training 快速见效。图 1Wan-Animate 双模式总览Animation 与 Replacement分类全景角色动画方法的技术路线图 12角色动画方法分类全景Mermaid方法细节身体与表情解耦LoRA 适配环境身体控制Body AdapterVitPose 提取骨架 → Wan-VAE 压缩 → patchify 后直接加到噪声潜变量上实现空间对齐参考潜变量不注入姿态在时序上区分参考与目标。表情控制Face Adapter人脸图 $512\times512$ 压缩为 1D 潜变量配合缩放、颜色抖动、噪声增强与线性运动分解实现身份/表情解耦1D 因果卷积做时间下采样对齐序列长度每 5 层注入 Face Blocks40 层 DiT 共 8 层在对应时间片内做交叉注意力。图 2Wan-Animate 系统框图图 6表情注入机制隐式人脸特征时序对齐注入Relighting LoRA仅替换模式作用于 DiT 的自注意力与交叉注意力层用 IC-Light 把角色合成到随机背景构造光照差异样本训练让模型学会根据新环境调整角色光照与色调。图 7IC-Light 数据增强训练五阶段身体控制 → 表情控制肖像数据为主头/眼/嘴区域更高损失权重部分参数用 LIA 预训练权重初始化→ 联合控制 → 双模式训练 → Relighting LoRA。并行策略上DiT 与 T5 使用 FSDP 全分片数据并行 上下文并行RingAttention Ulysses人脸特征提取在 Ulysses 组内并行。推理设计姿态重定向按肢体长度比例缩放骨架、按取景平移对齐必要时先用图像编辑模型把角色转为 T-pose 再计算缩放因子长视频每段 78 帧迭代生成后续段拼接上一段尾帧 1–5 帧作时间引导CFG 默认关闭需要精细表情控制时可对表情条件开启分辨率按 token 数自适应以 $1280\times720$ 为基准。实验设计与结果两组量化第一用户研究击败闭源评测协议自重建任务——取视频首帧作参考图用后续帧动作信号驱动模型重建整段视频指标为 SSIM、LPIPS、FVD另设 20 人用户研究与闭源 SOTARunway Act-two、DreamActor-M1做 cross-ID 匿名偏好对比。数据大规模人类中心视频数据集说话、表情、身体动作全覆盖单角色一致性过滤 DOVER/Unimatch/美学评分质量过滤SAM2 提取角色掩码QwenVL2.5-72B 生成文本描述。任务方法SSIM↑LPIPS↓FVD↓全身动画UniAnimate0.7870.271155.03全身动画StableAnimator0.7940.265147.92全身动画Wan-Animate0.8130.227118.65肖像表情X-Portrait20.8250.21298.03肖像表情SkyReel-A10.8210.231101.45肖像表情Wan-Animate0.8340.20594.65图 3动画模式定性对比图 4用户研究结果图 5替换模式定性对比消融一Face Adapter 训练方案——基线所有控制模块从零联合训练表情驱动不准确、难以收敛渐进式训练先身体后表情配合肖像数据快速收敛。这证明先对齐身体动作、再学习表情是整体收敛的关键。图 8Face Adapter 训练消融消融二Relighting LoRA——无 LoRA 时角色光照色调与参考图强一致但融入新环境显得突兀有 LoRA 时融合自然和谐且感知身份保持不变。图 9Relighting LoRA 消融应用案例表演复刻还原经典表演、跨风格迁移真人到卡通角色、复杂动作舞蹈等特技、动态运镜广告制作、角色替换影视名场面重演。图 10多种应用场景定性结果结果对比总结图 13结果对比总结Mermaid关键发现量化全面第一全身动画组 SSIM 0.813、FVD 118.65肖像组 SSIM 0.834、FVD 94.65两组 10 个基线方法全部被超越用户研究胜出20 人匿名偏好对比中击败闭源 SOTARunway Act-two、DreamActor-M1从质量、身份一致性、动作准确度、表情准确度四维综合考量控制开销低40 层 DiT 仅注入 8 层表情模块每 5 层 1 层表情驱动效率高长视频能力78 帧/段迭代生成1–5 帧时间引导支持任意分辨率、任意时长双模式统一单模型共享参数仅输入拼装不同五阶段渐进训练稳定收敛消融证明端到端联合训练不收敛全量开源模型权重 完整管线开源直接抬升开源角色动画基线。局限性身形差异受限替换模式不建议使用姿态重定向源角色与目标角色体型差异大时会产生变形文本控制弱动作是主导控制信号文字仅辅助默认使用固定 prompt精细表情需手动配置CFG 默认关闭需要更精细表情复刻时须手动开启骨架信号瓶颈2D 骨架存在空间歧义与关键点缺失问题重定向依赖 T-pose 编辑辅助流程复杂度较高。常见问题FAQWan-Animate 和 Animate Anyone 是什么关系同属阿里巴巴 HumanAIGC 团队的一脉工作Animate AnyoneCVPR 2024用 UNet ReferenceNet 确立角色动画范式Wan-Animate 在此基础上迁移到 Wan 2.1 DiT 视频基础模型并统一了动画与替换两个任务。动画模式和替换模式有什么区别动画模式保留源图像的背景只用参考视频的动作和表情驱动角色替换模式把角色融入参考视频替换原角色并复刻场景光照色调。两者共用同一模型仅输入拼装方式不同。为什么用隐式人脸特征而不是 landmark 关键点稠密 landmark 提取会丢失细节跨身份时精度要求极高隐式特征直接编码原始人脸图配合空间压缩与数据增强实现身份/表情解耦表情表达更细腻。Relighting LoRA 具体做什么替换模式下让角色的光照色调适配新环境用 IC-Light 把角色合成到随机背景构造光照差异样本训练 LoRA 学习光照调整只作用于注意力层保持身份的同时消除贴图感。模型能生成多长的视频采用迭代生成每段 78 帧后续段用上一段尾帧 1–5 帧作时间引导可无限拼接分辨率按 token 数自适应支持任意长宽比。代码和权重开源吗论文承诺全量开源模型权重与完整管线项目主页为 https://humanaigc.github.io/wan-animate/后续演进为 Wan2.2-Animate-14B 生产级模型。参考链接arXiv 论文https://arxiv.org/abs/2509.14055项目主页https://humanaigc.github.io/wan-animate/Animate AnyoneCVPR 2024https://arxiv.org/abs/2311.17117Wan 2.1 视频基础模型https://arxiv.org/abs/2503.20314Wan2.2 官方仓库https://github.com/Wan-Video/Wan2.2给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表