ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

用豆包+Skill从零制作AI漫剧:分镜、画面、配音到成片全流程

用豆包+Skill从零制作AI漫剧:分镜、画面、配音到成片全流程 AI漫剧是最近短视频平台上增长很快的一种内容形态用AI生成静态画面或动态视频再配合剧情脚本、配音、字幕和音效组合出介于动态漫画和短剧之间的作品。它不需要剧组、演员和实景拍摄核心成本变成了提示词设计、画面一致性和剪辑合成。很多人想学但资料越找越乱有人只会用豆包聊天不知道Skill怎么配置有人能生成几张AI图却不清楚脚本、分镜、配音、剪辑之间怎么衔接还有人把AI生成视频当成终点结果做出一堆风格割裂的零散片段。这篇文章围绕豆包加Skill这条主线带零基础读者跑通一集AI漫剧的完整生产流程从用豆包写AI脚本到生成分镜、画面和配音再到剪辑合成和成片检查。目标不是让你只学会点按钮而是掌握一套可以复现、可以调整、可以接单交付的制作流程。1. AI漫剧到底是怎么做出来的先看懂整条生产链路1.1 AI漫剧是什么和传统短剧有什么不同AI漫剧可以理解为“用AI工具批量生产的分镜式剧情短片”。它的画面主体通常由AI生成人物形象偏二次元或漫画风格剧情节奏短平快适合短视频平台传播。与传统短剧相比它最大的区别是生产资源发生了转移传统短剧需要演员、摄像机、灯光、场地、后期剧组而AI漫剧把“拍摄成本”压缩成了“提示词工程成本”和“一致性控制成本”。这意味着两件事。第一个人创作者可以独立完成整集内容不需要组建团队第二创作瓶颈从“能不能拍”变成了“能不能把AI输出稳定地拼成一个完整故事”。很多人做不出成片往往不是不会用工具而是没有把流程拆开中间任何一步格式不统一后续环节就会全部卡住。1.2 豆包和Skill在这条链路里担什么角色豆包是字节跳动推出的AI助手支持文本对话、文档理解、代码生成等通用能力。对AI漫剧来说豆包承担的是“智力劳动”把一句话创意扩展成完整剧本把剧本拆成分镜把分镜转换成适合图像和视频工具使用的提示词。Skill技能/Agent是豆包上的一种可配置能力可以把一套固定的指令流程保存下来之后用一句话触发。它解决的是“重复劳动”每次创作都要重新写一遍编剧提示词、分镜格式要求、约束条件既费时间又容易漏。把流程固化进Skill之后你只需要输入故事梗概豆包就会按既定规则输出结构统一的分镜表。这里要提醒一点具体入口名称和配置界面的细节会随版本变化落地前先在自己的豆包网页版或客户端里确认Skill入口是否开放、是否支持自定义配置。如果当前版本没有Skill退而求其次也能走通把预设指令保存成文档每次对话时粘贴到输入框效果接近。1.3 从脚本到成片的六个生产环节完整流程可以拆成六段每个环节的产出就是下一个环节的输入选题确定故事类型、目标受众、主线冲突。剧本生成幕、场、对白和旁白。分镜把每场戏拆成镜头级描述标注画面内容和台词。画面由分镜描述生成角色图、场景图再生成视频片段。配音给每个角色分配音色生成对白音频和旁白。剪辑合成把视频片段、配音、字幕、BGM按分镜顺序合成一集成片。这六段中分镜是承上启下的关键。分镜表写得越规范画面生成越稳定配音和剪辑越省事。很多人做漫剧失败不是因为AI画不出图而是分镜表里缺少“画面提示词”和“镜头运动”信息导致画面生成后无法继续往下一步走。2. 环境准备账号、工具和素材缺一样都会卡住2.1 核心工具清单学习阶段不必追求工具多先把手上最容易上手的组合跑通。按环节整理如下环节工具类型常见选择用途文本生成AI助手豆包网页版或客户端剧本、分镜、提示词技能配置Skill/Agent豆包自定义技能固化生产流程图像生成AI绘图工具即梦、可灵、Midjourney等角色图、场景图视频生成AI视频工具可灵、即梦、Runway等把分镜图转为动态片段配音TTS剪映文本朗读、豆包配音、其他TTS角色对白与旁白剪辑剪辑软件剪映、Premiere、达芬奇合成、字幕、音效原始材料没有限定必须使用哪款具体视频生成工具所以这里只列常见选择。实际项目里先用你账户里已有的工具流程跑通后再根据效果替换更合适的方案。不要一次性购买大量工具漫剧生产的瓶颈在流程不在工具数量。2.2 豆包网页版入口和Skill功能确认使用流程按下面顺序走打开豆包网页版完成账号登录。找到“技能”或类似入口查看是否支持创建自定义Skill。如果支持新建技能把预设指令粘贴到技能描述或系统提示词中。如果不支持当前版本的Skill功能把预设指令保存成独立文档每次对话时复制进输入框。这个环节最常见的坑是用户一上来就找“一键生成漫剧”的官方按钮找不到就认为教程无效。豆包的Skill本质是“指令预设加对话上下文”不是内置好的完整业务系统。真正让Skill稳定出片的能力来自你把脚本结构、分镜规范和提示词模板都写进配置里而不是等待某个隐藏入口。2.3 素材整理规范开始生产之前先建好目录。推荐结构manga_drama/ ├── 01_scripts/ # 剧本和分镜文档 │ ├── script_v1.md │ └── storyboard_v1.md ├── 02_images/ # 生成的角色图和场景图 │ └── scene_001/ ├── 03_videos/ # AI生成的视频片段 │ └── scene_001_v01.mp4 ├── 04_audio/ # 配音和音效 │ ├── voiceover/ │ └── bgm/ ├── 05_edit/ # 剪辑工程和导出成片 └── 06_assets/ # 角色参考图、风格参考图、字体三点规范建议素材命名统一为“场景编号_镜头编号_版本号”例如scene_002_shot_03_v02.png避免后期分不清哪个镜头是哪个版本。角色参考图单独放。这类图片一旦被覆盖后续所有人物一致性都会崩。每个场景的视频、音频、字幕文本尽量同名剪辑时一眼能对应上。这些规范看起来琐碎但在批量生产时非常关键。素材一多命名混乱会导致大量返工。3. 用Skill固化漫剧生产流程把重复劳动变成一键调用3.1 Skill的本质预设指令加结构化输出Skill并不神秘。它本质上是一段提前写好的系统提示词再配上固定的输出格式要求。你在Skill里告诉豆包“你是漫剧编剧接下来我会给你故事梗概你必须按我规定的表格格式输出剧本包含场景、时间、台词、画面提示词、分镜建议。”之后每次对话豆包都会按这套规则回答不用每次重新写提示词。如果套用技术概念Skill类似“指令模板加输出schema”。它把一次性的prompt变成了可重复调用的函数。这正是生产环境需要的同样的输入格式同样的输出结构让后续处理脚本可以根据结构自动解析。3.2 漫剧脚本生成Skill的配置思路一个漫剧Skill至少包含四块内容角色设定你是做什么的输出风格是什么。输入要求用户需要提供什么例如一句话故事、受众、集数、单集时长。处理流程先拆剧情再拆场景再拆镜头。输出格式必须使用表格或JSON字段固定。约束条件不要输出超出镜头描述的内容不要包含不安全、不适合公开发布的画面。配置Skill时最容易被忽略的是“处理流程”。如果不写拆解步骤豆包可能直接给出一大段散文式剧本画面生成阶段根本没法用。处理流程的价值是让AI先想后写每一步有明确产出。3.3 一个可落地的Skill配置示例下面是一份可直接粘贴到自定义Skill里的配置示例用于生成漫剧分镜脚本。实际使用时要根据自己的工具界面和版本调整字段名。你是AI漫剧编剧擅长把故事改成分镜级脚本。 用户会提供 1. 一句话故事 2. 目标受众 3. 单集时长默认2分钟 4. 集数默认1集 你的处理步骤 1. 把故事拆成“起、承、转、合”四幕。 2. 每幕拆成若干场景标记场景编号。 3. 每个场景拆成镜头镜头数量由内容决定单集建议控制在12到20个镜头。 4. 为每个镜头生成画面提示词要求包含人物、动作、镜头景别、环境、光影、画面风格。 输出格式严格遵守 | 镜头编号 | 场景 | 景别 | 画面内容 | 台词/旁白 | 画面提示词 | 预估时长(秒) | 约束 - 台词要口语化适合配音。 - 画面提示词不要包含文字水印。 - 每集开头3秒内出现冲突或钩子。 - 不要生成违法违规或低俗内容。把这段配置保存成Skill之后你只要输入“请根据下面这个故事生成第一集分镜一个外卖员发现顾客就是十年前失联的妹妹”豆包就会按表格输出完整分镜。这里的约束条件不是限制创意而是保证输出能被下一步的视频生成工具直接使用同时避免生产出不适合公开发布的内容。4. AI脚本制作从一句话创意到可直接拍摄的分镜脚本4.1 选题阶段一句话故事怎么提炼AI漫剧的选题建议满足三个条件冲突明确主角想要什么阻碍是什么。情绪钩子强适合做成短视频前3秒有悬念。画面感好能转换成具体的视觉场景避免大段抽象心理描写。一句话故事模板主角身份 遇到事件/人物 产生冲突/任务 结局反转/悬念示例“一个下岗厨师去夜市摆摊发现最火的竞争对手是自己失散多年的父亲。”这句话包含了人物、场景、冲突和悬念直接可以作为剧本生成的基础。如果一句话故事本身空洞后面所有环节都会跟着空洞。4.2 剧本生成提示词模板即使没有配置Skill也可以直接用提示词向豆包要剧本。推荐写法请你作为短剧编剧完成以下任务 1. 将“一个下岗厨师去夜市摆摊发现最火的竞争对手是自己失散多年的父亲”扩写成3幕短剧。 2. 每幕给出场景列表标注场景、时间、地点、出场人物。 3. 台词要口语化每句控制在20字以内。 4. 最后用表格输出包含场景、人物、动作、台词、情绪。 5. 全片时长控制在2分钟台词总量800字以内。提示词的关键在于把“结果要求”写清楚多少幕、多少场景、多少字、什么格式。豆包对模糊需求会自由发挥导致输出结构不稳定。写清楚结果要求输出的可复用性会大幅提升。4.3 分镜表字段设计场景、镜头、台词、画面、时长剧本完成后下一步是分镜。推荐分镜表字段如下字段说明示例镜头编号唯一编号S01-C03场景所属场景夜市摊位前景别远景/全景/中景/近景/特写中景画面内容画面里发生什么厨师把炒锅翻了一下火焰上窜台词/旁白该镜头下的对白或旁白“这道菜我爸当年也这么炒。”画面提示词给图像/视频工具的描述夜晚夜市中年男人站在炒锅前暖黄色灯光烟火气中景写实漫画风格预估时长秒4字段不要多够用即可。字段多了AI生成分镜时容易把内容写散后续解析也麻烦。字段少了画面生成阶段缺信息还得回头补。4.4 直接给视频工具使用的分镜提示词分镜表中的“画面提示词”和“视频生成提示词”可以分开写也可以复用。对视频生成来说提示词必须包含“镜头运动”信息例如“镜头缓慢推进”“固定镜头”“人物从左侧入画”。示例夜晚的夜市一位中年厨师站在冒热气的炒锅前火焰从锅底窜起他翻动炒锅神情专注。 画面风格2D漫画风格细腻光影城市霓虹背景。 镜头中景缓慢推进。 时长4秒。很多新手直接把画面提示词原样扔给视频工具结果画面静止、构图混乱。原因是视频生成提示词需要额外说明“运动”“时长”“镜头方式”。图像提示词描述的是静态构图视频提示词描述的是动态过程二者不能直接混用。5. 画面生成把分镜文字变成AI图像和视频5.1 画面提示词的六要素一个稳定的画面提示词建议包含六类信息主体谁在画面里。动作在做什么。环境在哪什么时间。光影氛围光线、色调、情绪。画面风格写实、漫画、3D、水彩等。画幅与镜头景别、镜头运动、比例。六要素越完整结果越可控。缺环境信息AI容易乱补背景缺风格信息前后镜头风格会不一致缺画幅信息生成的图片可能是横图发布到短视频平台还要裁剪。5.2 从分镜表自动拼装画面提示词如果分镜表是用豆包按固定格式生成的可以进一步要求豆包把每一行转换成图像提示词和视频提示词。转换规则示例请把分镜表中的每一行分别生成 1. 图像提示词包含主体、动作、环境、光影、风格、画幅不包含镜头运动。 2. 视频提示词在图像提示词基础上增加镜头运动和时长描述。 输出格式为JSON数组字段是 shot_id, image_prompt, video_prompt。输出示例[ { shot_id: S01-C03, image_prompt: 2D漫画风格夜晚夜市中年厨师站在炒锅前翻动炒锅火焰上窜暖黄色灯光写实漫画光影竖屏9:16, video_prompt: 2D漫画风格夜晚夜市中年厨师站在炒锅前翻动炒锅火焰上窜暖黄色灯光中景镜头缓慢推进画面稳定4秒 } ]拿到JSON之后可以用脚本批量生成也可以逐条粘贴到图像或视频工具中。这里推荐把输出固定为JSON因为后续如果需要脚本自动化JSON是最容易解析的结构。5.3 人物一致性参考图与固定描述AI漫剧最容易翻车的地方是人物不统一第一镜是黑发第三镜变成棕发第五镜衣服又换了。控制人物一致性通常有三种做法方式原理优点缺点固定文字描述每镜都写同一段人物外貌简单风格漂移仍可能发生参考图上传角色参考图再生成稳定性高部分工具不支持角色库保存角色特征模型或角色ID最稳定成本高学习门槛高零基础阶段推荐“固定文字描述加参考图”组合先把角色外貌写成一段固定文本复制到每个分镜里再在支持参考图的工具里上传同一种参考图。固定人物描述示例人物阿诚35岁男性厨师黑色短发左眉有一道疤穿深灰色围裙内搭白色T恤身材结实。这段文字在整个项目里不要改动。改一个字后期一致性都会受影响。如果一定要改需要重新验证所有已生成画面的兼容性。5.4 视频生成阶段的常规参数不同视频生成工具有一定的通用参数整理如下参数含义常见范围建议宽高比画幅比例9:16、16:9、1:1短视频平台选9:16时长生成视频长度3到10秒单镜头建议4到6秒运动幅度画面动态强弱0到10或低/中/高对话镜头调低动作镜头调高种子值随机数种子整数相同种子可复现构图参考图强度参考图对结果的影响0到10.6到0.8较稳注意这些参数是通用表述不同工具的名称和取值范围不同。生成前先看工具的帮助文档确认参数名。种子值尤其重要同一个提示词配合同一个种子值往往能复现相似的构图这是批量生产时控制风格一致性的有效手段。6. 配音、剪辑与合成让漫剧从素材变成成片6.1 配音方案选择配音有几条路径可以选豆包自带配音或语音能力适合快速试听但批量效率不高。剪映的文本朗读支持多音色、语速调节适合短视频。专业TTS工具适合批量生产但需要额外配置和接口。零基础推荐先用剪映文本朗读原因是可以直接对着字幕听改字也方便。批量生产时再切换到带API的TTS按角色分配音色。一个漫剧通常需要三种声音男角色、女角色、旁白。旁白建议选沉稳的中性音色角色配音要区分情绪。生成对白时把台词按角色分组避免一个文件里混合多个角色否则剪辑阶段很难对齐到具体镜头。每个音频文件的命名也建议与分镜编号一致例如S01-C03_voice.mp3。6.2 剪辑合成流程剪辑阶段按以下顺序处理按分镜顺序导入视频片段。把每个镜头的配音拖到对应时间轴。调整片段时长与配音对齐。添加字幕。加入BGM和音效。统一转场和画面滤镜。导出成片。单集控制在2到3分钟方便短视频平台分发。每个镜头最多保留6秒超过会显得拖。如果某个镜头画面质量差但剧情不可删优先用“缩短时长加文字遮罩”的方式补救而不是硬留长。6.3 用FFmpeg做基础合成如果希望批量合成多个视频片段可以用FFmpeg做基础拼接。下面的命令把多个MP4片段按顺序拼接成一个文件。# 先创建文本清单每行写一个文件路径 printf file scene_001.mp4\nfile scene_002.mp4\nfile scene_003.mp4\n list.txt # 按清单拼接 ffmpeg -f concat -safe 0 -i list.txt -c copy output.mp4这条命令使用-c copy直接复制编码流速度最快前提是所有片段的编码格式、分辨率、帧率一致。如果片段参数不一致需要先统一转码ffmpeg -i scene_001.mp4 -vf scale1080:1920,fps30 -c:a aac scene_001_std.mp4注意concat协议要求文件编码参数一致。如果拼接后出现花屏或声音卡顿先检查所有片段的编码参数用ffprobe查看元信息。ffprobe scene_001.mp47. 成片验证、素材归档和接单准备7.1 成片自检清单导出前按这个清单逐项检查分镜顺序是否和脚本一致。每个镜头是否有配音或合适的环境音。台词和字幕是否完全一致。人物形象是否前后统一。视频比例是否为9:16。总时长是否在目标范围内。开头3秒是否有钩子。是否有AI生成的水印或文字残留。是否包含不适合公开发布的画面或台词。满足以上全部条件再导出正式版本。学习阶段建议导出两个版本一个带字幕的成片一个不带字幕的干净版方便后续发布到不同平台时自行添加平台字幕。7.2 素材归档规范一个项目完成后把最终分镜表、提示词、成片按版本归档manga_drama/ ├── release_v1/ │ ├── final_ep01.mp4 │ ├── storyboard_final.md │ └── prompts_final.json版本号用v1、v2递增不要用“最终版”“最终版2”这种命名。归档完成后把过程中生成但未使用的素材移到单独目录不要覆盖已确认的成片版本。7.3 接单前要做什么准备“学完即接单”是教程标题里的目标但接单前至少要准备三样东西作品集2到3集完整成片比任何口头承诺都有说服力。报价清单按“每分钟成片”报价明确包含脚本、画面、配音、剪辑哪些环节。交付规范明确修改次数、交付格式、交付周期、版权归属。这里要多说一句如果不是个人原创剧本接单前要和需求方确认剧本版权、配音授权、素材版权。AI生成内容的版权规则在不同平台有差异不要默认生成结果一定可以商用。生产环境里版权和交付规范比技术能力更容易引发纠纷。8. 常见问题排查和最佳实践8.1 常见问题排查表问题现象常见原因检查方式处理建议豆包输出不稳定有时有表格有时没有提示词里没有固定输出格式检查提示词是否写明“必须输出Markdown表格”把输出格式写进Skill或提示词并给出表头画面中人物长相不一致每个分镜换了人物描述对比各分镜中人物描述文本项目内固定人物描述配合参考图视频画面静止不动视频提示词没写动作和镜头运动检查video_prompt是否包含动作词补充“火焰上窜”“镜头缓慢推进”等动态描述生成的视频有文字水印提示词未排除或工具默认水印查看工具设置提示词加“无文字水印”或按工具说明关闭水印配音和画面时长对不上先剪视频再配音或配音前未按分镜拆句对比单镜头时长和音频时长先按台词生成配音再调整视频片段长度FFmpeg拼接后花屏片段编码参数不一致用ffprobe查看各片段先统一分辨率、帧率、编码格式再拼接8.2 新手最容易踩的三个坑第一个坑把“生成脚本”当成“做成漫剧”。脚本只是文本画面、配音、剪辑、一致性控制才是成片的核心工作。只做到脚本就宣布会做漫剧交付时会非常被动。第二个坑提示词反复改但没有做版本管理。建议每个提示词版本加到文件名里例如prompt_story_v3.md不然改到最后不知道哪个版本效果最好无法复盘也无法沉淀自己的提示词库。第三个坑一次性把整集所有镜头都生成完再剪辑。正确节奏是先做一个“三镜头验证”生成第一镜的图像、视频、配音剪辑出来看效果确认风格可行后再批量生产剩余镜头。这样避免了整集做完才发现风格错误的大返工。8.3 可以直接复用的最佳实践清单把角色描述、画面风格、输出格式都固化进Skill不依赖每次对话的运气。单镜头时长控制在4到6秒短视频节奏更快别让观众等待。每个分镜的“画面提示词”和“视频提示词”分开管理图像更稳定视频更动态。项目目录按“脚本、图像、视频、音频、剪辑、素材”划分命名统一带场景号和版本号。先做小样验证再批量化生产批量前确认参考图和人物描述已冻结。接单前准备完整作品集和交付规范明确修改次数和版权归属。8.4 扩展方向如果零基础流程已经跑通下一步可以往三个方向深入。一是用API批量生产。把分镜表存成JSON调用视频生成、TTS的接口按脚本自动拉取素材减少手动复制粘贴。二是建立自己的角色库。在支持训练的工具中保存固定角色的特征再次生成时人物一致性会明显提升这也是漫剧能长期连载的关键。三是沉淀一套自己的分镜资产库。把验证过的场景、镜头、提示词模板按类型归档例如“雨天对峙”“夜市烟火”“都市夜景”后续新剧本可以直接复用素材和提示词片段生产效率会明显提高。对于真正想靠AI漫剧接单或持续更新的读者最值得投入的方向是把流程标准化而不是每次都从头写提示词。标准化的程度越高可交付的速度越快质量也越稳定。建议从今天开始就按这套流程做第一集做完之后把分镜表、提示词、目录结构都保存好那就是你后续所有作品的基础工程模板。
返回列表