
输入一个主题3 分钟拿到成片Pixelle-Video 实操上手【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video想做短视频但写不出文案、剪不动视频、也不会录音Pixelle-Video 就是一个 AI 短视频制作引擎你只需要给一个主题文案撰写、AI 配图、语音解说、配乐合成全部自动完成几分钟后得到一条能直接发布的竖屏视频还能把旁白换成你自己的声音声音克隆。这篇文章按真实创作路径走第一次跑通 → 调出你想要的风格 → 翻车了怎么修。第一次跑通5 步拿到第一条成片界面长这样左边填内容中间配语音和视觉右边点「生成视频」。整个流程背后是一条固定的流水线先把这张流程图看一遍后面每一步操作你都能对上号第一步把项目跑起来。Windows 用户直接下载官方整合包解压后双击start.bat浏览器自动打开http://localhost:8501零环境配置。其他系统执行git clone https://link.gitcode.com/i/7775af9c0257ead4bb1cb9dcddb04860 cd Pixelle-Video uv run streamlit run web/app.pyuv是一个比 pip 更快的 Python 包管理器它会自动装好所有依赖另外系统里需要装ffmpeg音视频处理工具macOS 用brew install ffmpegUbuntu 用apt install ffmpeg。第二步配置 LLM。展开「⚙️ 系统配置」面板从下拉菜单选一个大模型通义千问、GPT-4o、DeepSeek 都行也有本地免费的 Ollama填入 API Key保存。LLM大语言模型就是那个帮你写文案的 AI是整个流程里唯一必填的配置。第三步输入主题。左侧「 内容输入」选「AI 生成内容」输入一个主题比如为什么要养成阅读习惯分镜数量保持默认 5 个。如果你已经有现成文案也可以切到「固定文案内容」直接粘贴跳过 AI 写稿。第四步语音和视觉保持默认。TTSText-to-Speech文字转语音的工作选默认的 Edge-TTS 即可它免费且无需本地环境图像生成工作流和模板也都用默认值。第五步点「 生成视频」。界面会实时显示进度生成文案 → 生成配图 → 合成语音 → 合成视频一条 5 分镜的视频大约 2-5 分钟跑完完成后自动播放文件落在output/文件夹。跑通第一条之后你可能会觉得能出片了但这画面不是我想要的。别急下面三个旋钮就是为这事准备的。调出想要的风格模板、提示词前缀、生图工作流视频好不好看由两层东西决定画面布局模板和配图长相AI 生图。这两层是独立的可以分开调。模板控制布局。打开 模板目录 就能看到全部预置模板文件名本身说明了类型image_*.html用 AI 生成的图片做背景video_*.html用 AI 生成的动态视频做背景static_*.html则是纯文字样式、完全不依赖 AI 生图。界面里按尺寸分组显示——竖屏 1080x1920发抖音、快手、横屏 1920x1080发 B 站、YouTube、方形 1080x1080发小红书各有一组。比如这套电影感的横屏模板黑底白图加居中构图配知识科普类内容就很对味提示词前缀控制配图风格。这是最容易出效果的一个旋钮在「 视觉设置」的提示词前缀里填一段英文风格描述它会拼在每个分镜的生图提示词前面统一锁定画风。比如填Minimalist black-and-white illustration, clean lines, simple style出来的配图就是这种水墨极简风不想试错点「预览风格」可以先单独出一张图看看效果满意了再生成整条视频能省不少等待时间。生图工作流控制谁来画。默认走的是 FLUX 模型image_flux.json。如果你会 ComfyUI可以把自己的工作流 JSON 丢进 工作流目录下拉菜单会自动扫出来供选择也支持直连 DashScope、OpenAI、Seedream 等云端生图 API换引擎不用改任何别的配置。风格调顺了下一个让人出戏的问题通常就来了旁白一听就是AI 腔。想让配音变成你自己的声音往下看。上传 20 秒音频让 AI 用你的声音念稿默认 Edge-TTS 快且免费但音色是固定的念多了总有点机器味。Pixelle-Video 的 TTS 也是工作流机制系统自动扫描workflows/目录下所有tts_前缀的 JSON界面上就能切换。想要自己的声音分三步语音设置里把 TTS 工作流切到支持声音克隆的方案比如 Index-TTStts_index2.json上传一段参考音频MP3/WAV/FLAC 都行建议 10-30 秒、人声清晰、没有背景音乐——参考音频的质量基本决定了克隆的上限点「预览语音」输入几句测试文本先试听音色对了再生成正片。注意 Edge-TTS 本身不支持声音克隆选了它上传参考音频也不会生效这是新手最容易疑惑的一点。此外 TTS 工作流也支持多语言音色做英文或其他语言的口播视频时同样可以走这套流程。跑顺之后你可能会开始批量出片也可能会在某一天突然翻车。下面这几个坑基本覆盖了绝大多数报错场景。翻车了怎么修三个最常见的坑坑一TTS 合成失败。这是新手遇到频率最高的问题先别慌——默认的 Edge-TTS 走的是网络在线服务网络波动就容易失败。最稳的解法是切到走本地 ComfyUI 合成的工作流下拉菜单里选tts_前缀、由 ComfyUI 执行的那几个稳定性明显更好。切之前确认 ComfyUI 服务在跑默认http://127.0.0.1:8188并点过「测试连接」。坑二生成太慢。5 分镜要等半天可以按这个顺序排查先把分镜数从 10 砍到 5耗时几乎线性下降生图如果走的是云端 RunningHub换成本地 ComfyUI 通常更快LLM 换响应更快的模型。5 分镜在配置正常时应落在 2-5 分钟内。坑三声音或画面不对劲。文案跑题换一个 LLM 模型重跑不同模型的写作风格差异很大配图风格不对优先改提示词前缀而不是换模型克隆音色不达标换一段更干净的参考音频再试。以上问题如果都没对上翻 故障排查手册 按错误提示对号入座或者直接看 官方文档 里更细的配置说明。现在就可以试打开 Web 界面在文本框里输入为什么要养成阅读习惯其他全部默认点「生成视频」——三分钟后你会拿到第一条自己做出来的 AI 短视频。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考