ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

CogVideoX 视频生成模型仓库全景指南:模型矩阵、推理调优与 LoRA/SFT 微调实战

CogVideoX 视频生成模型仓库全景指南:模型矩阵、推理调优与 LoRA/SFT 微调实战 人工智能大模型媒体生成预训练微调【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址https://gitcode.com/GitHub_Trending/co/CogVideo点击查看免费下载CogVideoX 是智谱 AI「清影」同源的开源视频生成模型系列覆盖文本生成视频T2V、图像生成视频I2V与视频续写V2V三大任务配套 SAT 与 Diffusers 两套推理/微调代码路径。本文以仓库根目录 README_zh.md 为骨架结合 推理入口、提示词优化脚本、微调文档 与 SAT 文档 等源码细节系统讲解模型选型、推理参数、显存/量化优化以及 LoRA 与全参 SFT 微调流程帮助读者从零上手该仓库并完成可复现的实战部署。项目概览与版本更新脉络仓库同时托管了CogVideoX2024 年发布T2V/I2V 扩散模型与早期CogVideoICLR 2023 论文模型位于CogVideo分支两条技术线。从项目更新记录可以清晰看到模型家族的演进节奏2024/8/6开源首个 CogVideoX 系列模型CogVideoX-2B并同步开源可几乎无损重构视频的3D Causal VAECogVideoX-2B 的协议随后调整为Apache 2.0。2024/8/27发布更大规模的CogVideoX-5B大幅优化推理性能官方称可在GTX 1080TI等早期显卡运行 2B 模型、在RTX 3060桌面卡运行 5B 模型并要求严格按照 requirements.txt 更新依赖。2024/9/19开源图生视频模型CogVideoX-5B-I2V可将一张图像作为背景结合提示词生成视频同时开源用于把视频数据转成文本描述的训练配套 Caption 模型 CogVLM2-Caption。2024/11/8发布升级版CogVideoX1.5-5B系列支持10 秒视频与更高分辨率其中CogVideoX1.5-5B-I2V支持任意分辨率生成CogVideoX1.5的 SAT 代码已更新diffusers 版本于 2024/11/15 发布只需调整少量参数即可沿用旧代码。2025/1/8更新基于 diffusers 版本的 LoRA 微调代码占用显存更低。2025/2/28DDIM Inverse 已支持CogVideoX-5B与CogVideoX1.5-5B详见 inference/ddim_inversion.py。2025/3/24推出 CogKit 微调与推理工具包覆盖 CogView4、CogVideoX 系列官方建议后续微调工作迁移至 CogKit 维护。模型矩阵CogVideoX 系列规格对照下表来自 README_zh.md汇总了当前提供的五个模型的核心规格是选型与参数设置的第一手依据模型名CogVideoX1.5-5B (最新)CogVideoX1.5-5B-I2V (最新)CogVideoX-2BCogVideoX-5BCogVideoX-5B-I2V发布时间2024/11/82024/11/82024/8/62024/8/272024/9/19视频分辨率1360×768Min(W,H)768768≤Max(W,H)≤1360Max(W,H)%160720×480720×480720×480帧数16N1N≤10默认 81同左8N1N≤6默认 49同左同左推理精度BF16推荐、FP16、FP32、FP8*、INT8不支持 INT4同左FP16推荐**、BF16、FP32、FP8、INT8不支持 INT4BF16推荐、FP16、FP32、FP8*、INT8不支持 INT4同左单 GPU 显存SAT BF1676GBdiffusers BF1610GB 起*diffusers INT8(torchao)7GB 起*同左SAT FP1618GBdiffusers FP164GB 起*diffusers INT8(torchao)3.6GB 起*SAT BF1626GBdiffusers BF165GB 起*diffusers INT8(torchao)4.4GB 起*同左多 GPU 推理显存BF1624GB* (diffusers)同左FP1610GB* (diffusers)BF1615GB* (diffusers)同左推理速度 (Step50, FP/BF16)单卡 A100约 1000 秒5 秒视频单卡 H100约 550 秒同左单卡 A100约 90 秒单卡 H100约 45 秒单卡 A100约 180 秒单卡 H100约 90 秒同左提示词语言English*统一同左同左同左同左提示词长度上限224 Tokens224 Tokens226 Tokens226 Tokens226 Tokens视频长度5 秒或 10 秒同左6 秒6 秒6 秒帧率16 fps16 fps8 fps8 fps8 fps位置编码3d_rope_pos_embed3d_rope_pos_embed3d_sincos_pos_embed3d_rope_pos_embed3d_rope_pos_embed learnable_pos_embed要点解读帧数是硬约束1.5 系列必须是16N1默认 8110 秒对应 161 帧1.0 系列必须是8N1默认 49。若想自定义帧数必须遵循该公式否则会与模型训练时的时序结构不匹配。训练精度与推理精度需对齐CogVideoX-2B 以FP16训练其余 5B 系列以BF16训练官方推荐使用与训练一致的精度进行推理。1.5-I2V 支持任意分辨率长边 768~1360 且能被 16 整除其余模型建议使用默认分辨率自定义分辨率会在推理脚本中被自动回退。快速开始两条代码路径仓库为 CogVideoX 提供了SAT与Diffusers两套可运行方案前者适合结构改进与研究迭代后者上手门槛更低、生态兼容性更好。提示词优化强烈建议先行模型是在长提示词下训练的提示词质量直接决定视频质量。仓库提供的 inference/convert_demo.py 使用 GLM-4或同级别的 GPT-4 等大模型把用户的简短输入扩写为符合训练分布的长描述官方文档明确强调这一步很重要。从源码可见其关键设计inference/convert_demo.pyT2V 模式使用sys_prompt_t2v系统提示词通过 few-shot 示例海滩上的女子、足球场跑步、舞蹈等示例引导 LLM 输出极其详细且描述性的单段视频描述调用glm-4-plus模型源码注释表明glm-4-plus和gpt-4o均经过测试参数为temperature0.01、top_p0.7、max_tokens250。I2V 模式使用sys_prompt_i2v系统提示词把输入图片以 base64 形式image_to_url函数随用户输入一起发给gpt-4o提示词要求输出以当前图像为第一帧、描述后续动作的英文视频描述并明确禁止镜头切换/视角变化。脚本内置retry_times3重试机制请求失败时回退返回原始提示词。运行方式# 文本生成视频的提示词优化 python inference/convert_demo.py --prompt A girl riding a bike. --type t2v # 图像生成视频的提示词优化 python inference/convert_demo.py --prompt the cat is running --type i2v --image_path /path/to/your/image.jpg此外模型仅支持英文输入其他语言建议通过大模型润色时翻译为英文。Diffusers 路线环境要求Python 版本需在 3.10 至 3.12 之间含两端。安装依赖后即可开始推理pip install -r requirements.txtrequirements.txt 中的关键依赖包括diffusers0.35.2、accelerate1.11.0、transformers4.57.1、torch2.8.0、torchvision0.23.0、sentencepiece、SwissArmyTransformer0.4.12、gradio5.49.1、imageio、imageio-ffmpeg、openai2.2.0、moviepy、scikit-video、pydantic2.12.0。详细推理参数见下文。SAT 路线查看 sat/README_zh.md内含 SAT 权重的推理与微调代码。SAT 是研究型路径推荐基于 CogVideoX 模型结构做改进的开发者使用详见后文专节。推理实战cli_demo 参数全解inference/cli_demo.py 是官方提供的最详细推理示例一个脚本支持三种生成类型t2v文本生成视频使用CogVideoXPipeline支持THUDM/CogVideoX-5b、THUDM/CogVideoX-2b、THUDM/CogVideoX1.5-5bi2v图像生成视频使用CogVideoXImageToVideoPipeline支持THUDM/CogVideoX-5b-I2V、THUDM/CogVideoX1.5-5b-I2Vv2v视频续写使用CogVideoXVideoToVideoPipeline将已有视频作为背景结合提示词继续生成。命令行调用示例python inference/cli_demo.py --prompt A girl riding a bike. --model_path THUDM/CogVideoX1.5-5b --generate_type t2v脚本内部维护了一张推荐分辨率表RESOLUTION_MAP未显式指定width/height时会按模型自动填充默认分辨率对非 I2V 模型传入自定义分辨率会被警告并回退到默认值RESOLUTION_MAP { cogvideox1.5-5b-i2v: (768, 1360), cogvideox1.5-5b: (768, 1360), cogvideox-5b-i2v: (480, 720), cogvideox-5b: (480, 720), cogvideox-2b: (480, 720), }全部命令行参数参数默认值说明--prompt必填视频内容描述建议先经 LLM 润色为长提示词--model_pathTHUDM/CogVideoX1.5-5B预训练模型路径HuggingFace 仓库名或本地目录--image_or_video_pathNonei2v 的输入图片路径 / v2v 的输入视频路径--generate_typet2v生成类型t2v/i2v/v2v--num_inference_steps50推理步数越多质量越高、耗时越长--num_frames81生成帧数1.0 系列 49 帧6 秒 8fps1.5 系列 81/161 帧5/10 秒 16fps--guidance_scale6.0无分类器引导强度越高与提示词对齐越紧--width/--heightNone自定义分辨率仅 1.5-5B-I2V 生效--fps16输出视频帧率--num_videos_per_prompt1每个提示词生成的视频数量--lora_pathNone微调 LoRA 权重路径--lora_rank128LoRA 秩--dtypebfloat16计算精度float16或bfloat16--seed42随机种子保证可复现性--output_path./output.mp4输出视频保存路径关键实现细节代码级调度器默认使用CogVideoXDPMScheduler.from_config(pipe.scheduler.config, timestep_spacingtrailing)注释提示可换为CogVideoXDDIMScheduler官方建议2B 用 DDIM、5B/5B-I2V 用 DPM。使用 DPM 调度器时管道调用需传use_dynamic_cfgTrueDDIM 下应置False对应 SAT 版配置中的DynamicCFG引导器。显存优化三件套默认开启pipe.enable_sequential_cpu_offload() pipe.vae.enable_slicing() pipe.vae.enable_tiling()显存充足如 H100或多卡场景下可改为pipe.to(cuda)/pipe.enable_model_cpu_offload()以换取速度多 GPU 推理时必须在from_pretrained中加device_mapbalanced并关闭enable_sequential_cpu_offload()。LoRA 加载微调后的权重通过pipe.load_lora_weights(lora_path, weight_namepytorch_lora_weights.safetensors, adapter_nametest_1)加载再用pipe.fuse_lora(components[transformer], lora_scale1.0)融合。生成与导出pipe(...)返回.frames[0]经export_to_video(video_generate, output_path, fpsfps)写入 mp4。显存优化与量化推理README 的数据注释数据解释补充了与上表配套的重要前提实际部署时必须理解上表 diffusers 显存数字是在启用全部 diffusers 自带优化的前提下测得仅在 NVIDIA A100/H100 上验证过一般可适配所有安培架构以上的 NVIDIA 设备。若关闭优化峰值显存约为表格值的3 倍但速度提升 3~4 倍可选择性关闭上文的三项优化。INT8 推理是为低显存显卡保留画质而设计会大幅降低推理速度。只有 diffusers 版本模型支持量化。量化工具包括 PytorchAO 与 Optimum-quanto可量化文本编码器、Transformer 与 VAE 模块这让模型有机会跑在免费的 T4 Colab 或更小显存的 GPU 上TorchAO 量化与torch.compile完全兼容可显著提升推理速度。FP8 精度仅在 NVIDIA H100 及以上设备必须使用且需要从源码安装torch、torchaoPython 包建议 CUDA 12.4FP8仅测试通过官方不建议在生产环境中使用。推理速度测试同样基于上述显存优化方案不采用优化时速度提升约 10%。仓库还提供量化专用脚本 inference/cli_demo_quantization.py可在显存较低设备上运行也可基于它修改以支持 FP8 等精度若只需单独执行 VAE 编解码验证可参考 inference/cli_vae_demo.py。微调实战LoRA 与 SFTdiffusers 版本官方微调方案见 finetune/README_zh.md覆盖LoRA与全参 SFT两种训练方式。注意由于相关代码尚未合入 diffusers 发行版需要基于 diffusers 的 main 分支安装git clone https://github.com/huggingface/diffusers.git cd diffusers pip install -e .硬件要求速查以下为文档给出的官方训练硬件基线loRA rank128模型训练类型分布式策略混合精度训练分辨率(帧数x高x宽)硬件要求cogvideox-t2v-2bloraDDPfp1649x480x72016G 显存 (NVIDIA 4080)cogvideox-{t2v,i2v}-5bloraDDPbf1649x480x72024G 显存 (NVIDIA 4090)cogvideox1.5-{t2v,i2v}-5bloraDDPbf1681x768x136035G 显存 (NVIDIA A100)cogvideox-t2v-2bsftDDPfp1649x480x72036G 显存 (NVIDIA A100)cogvideox-t2v-2bsft1卡 zero-2 opt offloadfp1649x480x72017G 显存 (NVIDIA 4090)cogvideox-t2v-2bsft8卡 zero-2fp1649x480x72017G 显存 (NVIDIA 4090)cogvideox-t2v-2bsft8卡 zero-3fp1649x480x72019G 显存 (NVIDIA 4090)cogvideox-t2v-2bsft8卡 zero-3 opt and param offloadbf1649x480x72014G 显存 (NVIDIA 4080)cogvideox-{t2v,i2v}-5bsft1卡 zero-2 opt offloadbf1649x480x72042G 显存 (NVIDIA A100)cogvideox-{t2v,i2v}-5bsft8卡 zero-2bf1649x480x72042G 显存 (NVIDIA 4090)cogvideox-{t2v,i2v}-5bsft8卡 zero-3bf1649x480x72043G 显存 (NVIDIA 4090)cogvideox-{t2v,i2v}-5bsft8卡 zero-3 opt and param offloadbf1649x480x72028G 显存 (NVIDIA 5090)cogvideox1.5-{t2v,i2v}-5bsft1卡 zero-2 opt offloadbf1681x768x136056G 显存 (NVIDIA A100)cogvideox1.5-{t2v,i2v}-5bsft8卡 zero-2bf1681x768x136055G 显存 (NVIDIA A100)cogvideox1.5-{t2v,i2v}-5bsft8卡 zero-3bf1681x768x136055G 显存 (NVIDIA A100)cogvideox1.5-{t2v,i2v}-5bsft8卡 zero-3 opt and param offloadbf1681x768x136040G 显存 (NVIDIA A100)数据集格式T2V 与 I2V 的数据集结构略有差异I2V 可选提供参考图像目录. ├── prompts.txt # 提示词 ├── videos # .mp4 视频文件 ├── videos.txt # videos 目录中的视频文件列表 ├── images # (可选, I2V) 参考图像 └── images.txt # (可选, I2V) 参考图像列表I2V 若不提供images代码会从视频中提取第一帧作为参考图像。示例数据集可参考迪士尼汽船威利号视频生成数据集如需训练时验证需额外提供与训练集同格式的验证数据集。分辨率与数据预处理约束帧数必须是8 的倍数 18N1例如 49、81……建议使用模型默认分辨率CogVideoX 为 480x720高 x 宽CogVideoX1.5 为 768x1360不满足分辨率的样本在代码中会被直接 resize可能造成宽高比形变、影响训练效果建议提前用 crop resize 保持宽高比。重要训练前代码会自动对视频 encode 并将 latent 缓存到磁盘若训练后修改了数据务必删除videos目录下的latent子目录以使用最新数据。LoRA 微调修改 finetune/train_ddp_t2v.sh 或 finetune/train_ddp_i2v.sh 中的配置后运行bash finetune/train_ddp_t2v.sh # 文本生成视频 (T2V) 微调 bash finetune/train_ddp_i2v.sh # 图像生成视频 (I2V) 微调脚本中需要重点修改的参数与文档及脚本实际参数一一对应参数说明--model_path基础模型如THUDM/CogVideoX1.5-5B/THUDM/CogVideoX1.5-5B-I2V--model_name如cogvideox1.5-t2v/cogvideox1.5-i2v--model_typet2v或i2v--training_typelora本小节或sft--output_dir输出目录--data_root数据集根目录--caption_column提示词文件路径prompt.txt--video_column视频文件列表路径videos.txt--image_columnI2V 可选注释掉该行则默认使用视频第一帧作为 image condition--train_resolution训练分辨率格式帧数x高x宽如81x768x1360--train_epochs训练轮数默认 10--batch_size/--gradient_accumulation_steps批量大小与梯度累积--mixed_precisionbf16/fp16/no仅 CogVideoX-2B 支持 fp16 训练--checkpointing_steps/--checkpointing_limit保存 checkpoint 步数与保留上限--resume_from_checkpoint从 checkpoint 恢复训练默认注释--do_validation/--validation_dir/--validation_steps训练中验证开关与配置validation_steps应为checkpointing_steps的倍数--gen_fps验证生成视频的帧率16SFT 全参微调仓库在 finetune/configs 目录提供 zero 系列配置模板zero2.yaml、zero2_offload.yaml、zero3.yaml、zero3_offload.yaml在 finetune/accelerate_config.yaml 中通过deepspeed_config_file选项切换即可。启动脚本为bash finetune/train_zero_t2v.sh # 文本生成视频 (T2V) 微调 bash finetune/train_zero_i2v.sh # 图像生成视频 (I2V) 微调使用 SFT 训练注意两点文档明确提示SFT 训练时validation 不会使用 model offload显存峰值可能超过 24GB24GB 以下显卡建议关闭 validation开启 zero-3 时 validation 较慢同样建议关闭。另外需确保 zero 配置文件与 bash 脚本中的batch_size、gradient_accumulation_steps、mixed_precision等参数保持一致。加载微调后的模型LoRA 微调结果可直接参考 inference/cli_demo.py 的--lora_path参数加载。SFT 全参训练产物是 DeepSpeed checkpoint需先使用checkpoint-*/目录下的zero_to_fp32.py脚本合并权重后再用于推理。官方微调最佳实践文档 finetune/README_zh.md 给出了社区实践沉淀的经验数据集规模25 个及以上概念相似、分辨率约为 200x480x720帧数 x 高 x 宽的训练视频在训练新概念与风格时效果最佳建议使用--id_token指定的标识符 token 进行训练类似 Dreambooth但常规微调不使用也能工作lora_alpha官方原值 1 在多轮运行中效果不佳建议设为与rank 相同或 rank // 2LoRA rank 建议64 及以上。SAT 版本推理与微调SAT 文档 对应 sat 目录基于 SwissArmyTransformer 权重体系仅支持CogVideoX1.5系列1.0 版本见仓库 v1.0 标签。SAT 路径对 transformer 结构研究者更友好便于快速堆叠和开发。权重下载与目录组织以 CogVideoX1.5 为例git lfs克隆会同时下载 Transformer、VAE、T5 Encoder 三个模型git lfs install git clone https://huggingface.co/THUDM/CogVideoX1.5-5B-SATCogVideoX-2B/5B 的旧版本模型需按文档从清华云盘下载 vae.zip、transformer.zip 并解压最终整理为如下结构latest指向当前mp_rank_00_model_states.pt所在目录. ├── transformer │ ├── 1000 (or 1) │ │ └── mp_rank_00_model_states.pt │ └── latest └── vae └── 3d-vae.ptT5 文本编码器不参与训练但必须使用可克隆THUDM/CogVideoX-2b后将text_encoder/与tokenizer/内容合并进t5-v1_1-xxl目录得到含model-*.safetensors、spiece.model等 8 个文件的完整目录避免 DeepSpeed 微调时读入报错。推理配置与运行修改 sat/configs/cogvideox_*.yaml 中的模型配置first_stage_config.ckpt_path指向 vae 权重、conditioner_config中model_dir指向 t5 目录再修改 sat/configs/inference.yamlargs: latent_channels: 16 mode: inference load: {absolute_path}/transformer # Transformer 权重绝对路径 batch_size: 1 input_type: txt # 也可改为 cli 从命令行输入 input_file: configs/test.txt sampling_num_frames: 13 # CogVideoX1.5-5B 必须为 42 或 22CogVideoX-5B/2B 必须为 13/11/9 sampling_fps: 8 fp16: True # CogVideoX-2B 用 FP16 # bf16: True # CogVideoX-5B 用 BF16 output_dir: outputs/ force_inference: True然后运行bash sat/inference.sh。若使用 txt 输入每行一个提示词建议先用 convert_demo.py 润色若希望自定义分辨率或使用 I2V可在 yaml 中调整sampling_image_size等参数。SAT 微调与权重导出SAT 微调仅针对transformer 部分VAE 固定不变T5 仅作 Encoder。支持 LoRA 与全参两种方式全参 SFT修改 sat/configs/sft.yaml含train_iters、save_interval、train_data、deepspeed的 bf16/fp16 开关等并切换运行脚本中的配置组合torchrun --standalone --nproc_per_node8 train_video.py --base configs/cogvideox_2b.yaml configs/sft.yaml --seed $RANDOMLoRA在cogvideox_*_lora.yaml中取消not_trainable_prefixes: [all]与lora_configtarget: sat.model.finetune.lora2.LoraMixinr: 256的注释再切换启动脚本torchrun --standalone --nproc_per_node8 train_video.py --base configs/cogvideox_2b_lora.yaml configs/sft.yaml --seed $RANDOM单卡/多卡分别使用bash sat/finetune_single_gpu.sh/bash sat/finetune_multi_gpus.sh启动风格微调建议准备至少 50 条风格相似的视频与标签。微调后的权重需转换才能在 diffusers 生态中使用python tools/convert_weight_sat2hf.py # SAT - HF 全量权重 python tools/export_sat_lora_weight.py --sat_pt_path {args.save}/{experiment_name}-*/1000/mp_rank_00_model_states.pt --lora_save_directory {args.save}/export_hf_lora_weights_1/LoRA 导出时tools/export_sat_lora_weight.py 会把 SAT 的attention.query_key_value.matrix_A/B等结构映射为 HF 的attn1.to_q/to_k/to_v.lora_A/B.weight等键名导出后用 tools/load_cogvideox_lora.py 即可加载推理。完整项目代码结构导览仓库按功能划分为五大区块官方给出如下导航相对路径均已在本文转换为仓库根目录视角Colab 快速使用免费 Colab T4 可直接运行的四个示例CogVideoX-5B-T2V、CogVideoX-5B-T2V-Int8量化推理单次约 30 分钟、CogVideoX-5B-I2V、CogVideoX-5B-V2V。inference推理inference/cli_demo.py最详细的推理讲解常见参数含义均在此提及inference/cli_demo_quantization.py量化推理代码可运行于低显存设备也可修改以支持 FP8 精度FP8 需源码安装torch-nightly与torchao不建议生产环境使用inference/cli_vae_demo.py单独执行 VAE 推理inference/gradio_composite_demoHuggingFace Space 同款 GUI 代码内置插帧RIFE与超分工具快速部署入口为 inference/gradio_composite_demo/app.pyinference/convert_demo.py用户输入到长提示词的转换脚本默认 GLM-4可替换为 GPT、Gemini 等任意 LLMinference/ddim_inversion.pyDDIM Inverse 支持脚本。finetune微调finetune/README_zh.mddiffusers 版本 CogVideoX 模型微调方案与细节LoRA/SFT 的完整流程见上文专节。satSAT 权重推理与微调sat/README_zh.mdSAT 权重的推理与微调代码适合结构改进研究。tools工具链tools/convert_weight_sat2hf.pySAT 权重转 HuggingFace 权重tools/export_sat_lora_weight.pySAT LoRA Adapter 导出为 diffusers 格式tools/load_cogvideox_lora.py加载 diffusers 版微调 LoRA Adaptertools/caption/README_zh.md视频理解 Caption 工具CogVLM2-Caption说明tools/llm_flux_cogvideox/llm_flux_cogvideox.py开源本地大模型 Flux CogVideoX 的自动化视频生成tools/parallel_inference/parallel_inference_xdit.py基于 xDiT 的多 GPU 并行视频生成。历史模型 CogVideoICLR23CogVideo论文 CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers是首个开源的基于 Transformer 的大型文本生成视频模型其官方实现位于仓库的CogVideo分支能够生成高帧率视频如 32 帧的 4 秒片段官方演示站点支持中文提示词输入体验。该模型与当前的 CogVideoX 扩散模型系列共同构成了仓库的两代技术积淀。引用与模型协议若工作受益于本项目可引用以下两篇论文BibTeX 见 README_zh.mdCogVideoX: Text-to-Video Diffusion Models with An Expert TransformerarXiv:2408.060722024CogVideo: Large-scale Pretraining for Text-to-Video Generation via TransformersarXiv:2205.158682022协议要点仓库代码按 Apache 2.0 发布CogVideoX-2B 模型含 Transformer 与 VAE 模块同样为 Apache 2.0CogVideoX-5B 系列模型含 I2V 与 T2V 的 Transformer 模块则按 CogVideoX 专属 LICENSE 发布商用前需核对相应条款。结语从模型矩阵到两条推理路径从显存/量化优化到 LoRA 与 SFT 微调本仓库为 CogVideoX 提供了完整的开箱即用体验研究结构改进走 sat 路径快速落地与生态集成走 diffusers 路径数据集打磨与超参经验则沉淀在 finetune/README_zh.md。上手时牢记三条主线——长提示词先行润色、帧数遵循 8N1/16N1 约束、训练精度与推理精度对齐即可把官方基准快速复现到自己的视频生成与微调任务中。赞分享人工智能大模型媒体生成预训练微调【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址https://gitcode.com/GitHub_Trending/co/CogVideo点击查看免费下载相关推荐Mochi 1 视频生成模型的LoRA微调指南Mochi 1 视频生成模型的LoRA微调指南 项目概述 Mochi 1是一个先进的视频生成模型本指南将详细介绍如何使用LoRALow Rank Adapt抖音无水印批量下载3步保存创作者全部作品抖音无水印批量下载3步保存创作者全部作品 把抖音视频存进手机还带着水印想把一位创作者的作品全部备份却只能一条一条点开保存耗时数小时、文件还散落在相册里。网页爬虫CLIFront-End Checklist 安全规则实战用 httpOnly Cookie 杜绝 XSS 窃取认证 TokenFront End Checklist 安全规则实战用 httpOnly Cookie 杜绝 XSS 窃取认证 Token 本篇技术指南围绕 Front En人工智能大模型媒体生成预训练微调上一篇5分钟快速上手 Lazy Load XT图片懒加载插件入门教程下一篇Banana Slides 桌面版Electron架构与打包实践从交接文档到源码级拆解创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表