ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

5GB 显存也能跑:ComfyUI-WanVideoWrapper 用 WanVideo 做 AI 视频生成的完整上手指南

5GB 显存也能跑:ComfyUI-WanVideoWrapper 用 WanVideo 做 AI 视频生成的完整上手指南 5GB 显存也能跑ComfyUI-WanVideoWrapper 用 WanVideo 做 AI 视频生成的完整上手指南【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapperComfyUI-WanVideoWrapper 是一个 ComfyUI 视频插件把阿里 WanVideo 系列模型1.3B / 5B / 14B接入 ComfyUI 节点系统让你用拖拽节点的方式完成文生视频、图生视频和音频驱动视频生成。它适合已经装了 ComfyUI、想跑 AI 视频生成但没有大显存的用户——作者实测 1.3B 模型配合上下文窗口在 5GB 以内显存生成 1025 帧视频RTX 5090 上耗时约 10 分钟。下面按先跑起来 → 常用玩法 → 背后原理的顺序讲你不需要任何模型背景知识。先把环境装好生成第一条视频硬件与软件要求项目要求GPUNVIDIA 显卡8GB 显存起步1.3B 模型14B 模型建议 16GB系统Windows / Linux 均可需已能正常启动 ComfyUIPython 依赖自动处理只需执行一次安装命令最小安装三步第 1 步把插件仓库放进 ComfyUI 的 custom_nodes 目录cd ComfyUI/custom_nodes git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper第 2 步安装 Python 依赖。源码安装 ComfyUI 直接跑pip install -r ComfyUI-WanVideoWrapper/requirements.txtWindows 便携版ComfyUI_windows_portable则在根目录执行python_embeded\python.exe -m pip install -r ComfyUI\custom_nodes\ComfyUI-WanVideoWrapper\requirements.txt第 3 步重启 ComfyUI搜索 WanVideo 能看到一堆WanVideo*开头的节点就说明装好了。模型文件放哪里去 HuggingFace 的 Kijai/WanVideo_comfy 模型库下载作者个人推荐其 fp8_scaled 量化版按类型分目录放置模型放置目录说明umt5-xxl 文本编码器ComfyUI/models/text_encoders负责读你的提示词主模型TransformerComfyUI/models/diffusion_models1.3B 约 2.6GB14B fp8 约 14GBVAEComfyUI/models/vaeWan2_1_VAE_bf16 或 Wan2_2_VAECLIP VisionComfyUI/models/clip_vision仅图生视频需要第一次出片的最短路径不想从零连节点的话直接加载仓库自带的示例工作流改一下提示词即可运行。文生视频最短路径加载example_workflows/wanvideo_2_1_14B_T2V_example_03.json把 WanVideoTextEncode 节点里的提示词换成你想生成的一句描述在 WanVideoEmptyEmbeds 节点设置分辨率 832x480、帧数 81点 Queue Prompt 运行这个示例用的是 Lightx2v 蒸馏 LoRA采样器只要 4 步就出结果想要更稳的效果把步数调到 20 左右、换 dpm_sde 调度器即可。常用玩法按场景挑工作流示例工作流全部在 example_workflows/ 目录命名规则是模型_版本_场景照着文件名挑就行。文生视频一句话出片推荐工作流wanvideo_2_1_14B_T2V_example_03.json14B或wanvideo_1_3B_EchoShot_example.json1.3B低显存首选8 步 euler 调度器93 帧。小建议1.3B 模型配 EchoShot 变体在低显存下出片速度最快适合先跑通流程追求画质再上 14B fp8。图生视频让一张照片动起来推荐工作流wanvideo_2_1_14B_I2V_example_03.json。它比文生视频多一个 CLIPVisionLoader 节点负责读懂首帧图片示例中 14B fp8 模型只交换 10 个块即可运行。输入一张人像或静物图首帧和提示词冲突时比如图片是猫、提示词写狗模型会两边妥协出奇怪结果把提示词写成对图片内容的客观描述即可。音频驱动给图配上口型和声音推荐工作流wanvideo_2_2_5B_Ovi_image_to_video_audio_example_01.json。这是 Ovi 模型的工作流输入一张人物图 一段音频同时生成带声音的视频121 帧、50 步、unipc 调度器交换 15 个块。仓库里还备好人像示例图human.png和音频woman.wav可以直接试。同类玩法还有 FantasyTalkingwanvideo_2_1_14B_I2V_FantasyTalking_example_01.json和 HuMo都是图 音频 → 说话视频侧重点不同可以逐个对比效果。进阶控制镜头、姿态、换主体玩法工作流文件一句话说明镜头运动控制wanvideo_2_2_Fun_control_camera_example_01.json用相机轨迹控制推拉摇移姿态驱动动画wanvideo_2_1_14B_SteadyDancer_pose_control_example_01.json给姿态序列生成跳舞视频视频重打光wanvideo_1_3B_UniLumos_relight_example_01.json改变已有视频的光照氛围超分放大wanvideo_1_3B_FlashVSR_upscale_example.json低清视频变高清背后原理显存是怎么省下来的先认识整体结构一条流水线把一次视频生成想成快餐店流水线文本编码器是接单员把提示词变成数字特征VAE 是分切台把视频压缩成小块潜变量再还原回来中间的 Transformer 主干是厨师一步步去噪画出画面采样器调度器是时钟控制做几轮、每轮修正多少。这个插件把四站都做成了独立节点你换哪一站都不影响其他站——这就是它模块化的含义源码分别放在 wanvideo/modules/ 和 wanvideo/schedulers/。块交换边看边换书页14B 主干网络有 40 个 Transformer 块全部放显存里 16GB 都不一定够。插件的做法类似书桌放不下所有书就翻到第几页取哪本推理时只把当前用到的块放显卡其余留在内存算到一块就把它换进来、把没用完的换出去。WanVideoBlockSwap 节点里blocks_to_swap填 20意思就是 40 个块中常驻 20 个、交换 20 个——作者实测 14B fp8 模型以 512x512x81 帧、交换 20 块运行时总占用约 16GB。prefetch_blocks填 1 可以提前把下一页书备好掩盖换页等待时间。fp8 量化每个数字少占一半格子fp16 精度下一个参数占 2 字节fp8 只占 1 字节。加载节点里选fp8_e4m3fn_scaled后14B 主模型文件直接从 28GB 左右降到约 14GB画质损失很小——这也是作者推荐下 fp8_scaled 版本的原因。配合块交换量化省一半 交换省一半14B 模型才会在消费级显卡上跑得动。上下文窗口超长视频一段段拼模型训练时见过的帧数有限一般 81 帧左右直接生成 1000 帧会崩。插件的 WanVideoContextOptions 节点把长视频切成多个 81 帧窗口相邻窗口重叠 16 帧做平滑衔接像看长视频一段段拖动进度条。实测配置1025 帧、窗口 81、重叠 16、1.3B 模型显存占用低于 5GB5090 上约 10 分钟跑完。按显存选模型选型对照表显存推荐模型块交换设置帧数步数8GB1.3Bfp16 或 fp8交换 15~20 个块共 30 块81 帧480P8~20 步12GB1.3B 上下文窗口同上500 帧分段8~20 步16GB14B fp8交换 20/40 块81 帧480P20 步蒸馏 LoRA 可 4 步24GB14B bf16 / 5B bf16交换 10 块或不交换121 帧30~50 步补充两点音频驱动的 Ovi 5B 工作流建议交换 15 块、50 步14B 想压 4 步出图用示例里的 Lightx2v 蒸馏 LoRA。新手常踩的 5 个坑坑 1首次运行就爆显存现象Queue 一提交就 OOM 报错原因模型加载节点load_device选了 main_device全部塞显存或没接 WanVideoBlockSwap 节点解法load_device 改回 offload_device并接入块交换14B 从 20 块起步不够就往上加坑 2第一次跑某个分辨率显存特别高第二次又正常现象新输入尺寸首次运行显存异常飙升原因torch.compile 首次编译缓存占用Windows 旧版 triton 缓存时尤其明显解法原样再跑一次反复出现就清空~/.triton和系统 Temp 下的 torchinductor 缓存坑 3装了 LoRA 之后显存反而涨了现象升级插件后同样的 LoRA 占用变多原因新版把未合并 LoRA 权重并入了模型块不再走独立的内存通道解法按作者给的换算补偿——比如 1GB LoRA 摊到 14B 的 40 块交换 20 块时总占用约多 500MB多交换 2 个块即可抵消坑 4长视频中途动作断裂、颜色跳变现象分段生成拼接处不连贯原因上下文窗口重叠太小相邻段衔接信息不足解法把 context_overlap 从默认 16 加大如 24代价是总耗时变长坑 5图生视频的首帧被重画了现象生成的第一帧和输入图长得不太一样原因latent_strength 或 noise_aug_strength 调得太高等于让模型对首帧也自由发挥解法把 WanVideoImageToVideo 节点里的这两个值都调低0.0~0.1 附近首帧就基本保持原样写在最后ComfyUI-WanVideoWrapper 的价值在于三件事用块交换和 fp8 让 14B 视频模型在消费级显卡上落地用统一节点接口把二十多个周边模型姿态、镜头、换主体、重打光挂到同一条 WanVideo 流水线上以及用上下文窗口把 81 帧的限制放开到千帧级。它自述是永久施工中节点接口会随新模型持续变动遇到报错先看节点提示再提问效率最高。如果你打算长期玩视频生成建议从 1.3B EchoShot 的 8 步工作流起步跑通后再按上面的选型表逐级加码。【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表