
mirrors/ali-vilab/text-to-video-ms-1.7b震撼发布1.7B参数开启文本转视频新纪元【免费下载链接】text-to-video-ms-1.7b项目地址: https://ai.gitcode.com/hf_mirrors/ali-vilab/text-to-video-ms-1.7btext-to-video-ms-1.7b是 ModelScope魔搭推出的 1.7B 参数文本转视频扩散模型输入一段英文描述即可生成与文字内容相符的短视频。它以 UNet3D 为骨干通过多步去噪把纯高斯噪声雕刻成连续画面是目前开源社区中极具代表性的文生视频方案。模型架构三大子网络如何协作整个文本转视频流水线由三个核心子网络串联完成模块文件路径作用文本特征提取text_encoder/CLIP 文本模型把英文提示词编码为语义向量噪声到潜空间视频unet/UNet3DConditionModel3D 扩散去噪主干逐帧生成视频潜空间到画面视频vae/AutoencoderKL把压缩潜变量解码为真实像素画面采样调度器scheduler/DDIMScheduler控制去噪步数与速度分词器tokenizer/CLIP 分词处理提示词输入 整体参数约 17 亿支持fp16半精度权重各模块均提供.fp16.safetensors可显著降低显存占用。快速上手三步生成第一条AI视频第一步安装依赖pip install diffusers transformers accelerate torch第二步获取模型仓库git clone https://gitcode.com/mirrors/ali-vilab/text-to-video-ms-1.7b第三步加载并生成视频import torch from diffusers import DiffusionPipeline, DPMSolverMultistepScheduler from diffusers.utils import export_to_video pipe DiffusionPipeline.from_pretrained( text-to-video-ms-1.7b, torch_dtypetorch.float16, variantfp16) pipe.scheduler DPMSolverMultistepScheduler.from_config(pipe.scheduler.config) pipe.enable_model_cpu_offload() frames pipe(Spiderman is surfing, num_inference_steps25).frames export_to_video(frames) # 输出 mp4可用 VLC 播放仅 5 行核心代码即可跑通enable_model_cpu_offload()会自动在 CPU 与 GPU 间搬运参数让消费级显卡也能体验文本转视频。⚡长视频生成16GB 显存也能出片想生成更长的视频开启 VAE 切片即可pipe.enable_vae_slicing() frames pipe(Spiderman is surfing, num_inference_steps25, num_frames200).frames配合 PyTorch 2.0 与注意力切片优化16GB 以下显存即可生成约 25 秒的长视频对新手非常友好。使用限制与注意事项仅支持英文提示词中文输入效果无法保证模型基于 Webvid、ImageNet、LAION 等公开数据训练复杂场景组合生成能力有限无法生成清晰的文字内容达不到影视级画质请遵守 CC-BY-NC 协议禁止用于生成违规或虚假内容总结text-to-video-ms-1.7b 用 1.7B 的轻量化参数把文本转视频从云端搬到了本地显卡是入门 AI 视频生成的绝佳起点。从 CLIP 文本编码到 UNet3D 去噪、再到 VAE 解码它的架构正是理解扩散式文生视频技术栈的最佳活教材。【免费下载链接】text-to-video-ms-1.7b项目地址: https://ai.gitcode.com/hf_mirrors/ali-vilab/text-to-video-ms-1.7b创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考