ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI漫剧制作全流程:从剧本到成片的6道工序与提示词设计实战

AI漫剧制作全流程:从剧本到成片的6道工序与提示词设计实战 1. 先搞清楚AI漫剧到底在做什么很多人第一次听到“AI漫剧”这个词脑子里浮现的是那种一张图配一段机械配音的粗糙视频。如果你也这么想那说明你还没真正接触过2026年这一波工具链迭代后的产物。我现在做的AI漫剧单集三到五分钟画面有分镜、有运镜、有角色情绪变化打斗场面能做出冲击帧和速度线配乐和音效是分层铺进去的。整个流程走下来一个人、一台电脑、一套提示词模板库就能把过去需要七八个人协作的活干完。这篇文章要拆的就是一场戏从文字到成片的6道工序。我会把每一步用什么工具、参数怎么设、提示词怎么写、哪里容易翻车全部摊开来讲。不管你是完全零基础想入门还是已经在用即梦、Seedance跑单镜头但不知道怎么串成完整叙事这篇内容都能直接拿去抄作业。核心关键词我先摆出来AI漫剧、Seedance、即梦、LibTV、提示词设计后面每一道工序都会围绕这些展开。先说清楚一个前提AI漫剧不是“让AI自己拍一部剧”而是你用AI工具把导演、摄影、美术、剪辑的活都干了。工具再强决策权在你手里。所以下面讲的6道工序本质上是一套决策流程工具只是执行端。2. 六道工序的整体拆解与工具选型逻辑2.1 为什么是6道工序而不是更多我试过把流程拆成十几步结果发现太碎每一步之间的衔接成本反而变高。也试过压缩成三步结果发现角色一致性根本保不住。6道工序是我实测下来最平衡的切法剧本拆解、主体图库搭建、分镜提示词设计、视频生成、配音配乐、剪辑合成。每一步都有明确的输入和输出前一步的输出就是后一步的输入不会出现“这一步做完了不知道下一步干嘛”的情况。这6道工序对应的时间分配大概是剧本拆解占15%主体图库占20%分镜提示词占25%视频生成占25%配音配乐占5%剪辑合成占10%。你会发现提示词设计和视频生成加起来占了一半时间这是正常的因为这两步直接决定画面质量。2.2 工具选型的核心考量2026年这个时间点市面上能用的工具不少但真正能串成工作流的就那么几个。我选工具的标准有三条角色一致性保持能力、中文提示词理解能力、批量生成效率。Seedance 2.0在角色一致性上是我目前用过最稳的它的skill导演台功能可以锁定角色特征向量换场景换动作的时候脸不会崩。即梦在中文提示词理解上做得很好你写“她眼眶微红但嘴角带着倔强的笑”这种复杂情绪描述它能给出比英文提示词更准的结果。LibTV我主要用来做主体图库管理和分镜预览它的素材库功能可以给每个角色建独立文件夹生成的时候直接调用不用每次重新描述。注意不要在一个项目里混用太多工具。我见过有人主体图用A工具、视频生成用B工具、配音用C工具结果角色脸型在三个工具之间来回漂移最后剪辑的时候根本对不上。选定一套主工具链从头用到尾。2.3 提示词工程在AI漫剧里的特殊地位普通文生视频提示词写个大概就行反正就一个镜头。但AI漫剧不一样你要保证同一场戏里十几个分镜的风格统一、角色统一、光影统一。这就要求提示词不能是“一次性”的必须是模板化、可复用、带变量的。我的做法是建三层提示词结构基础层锁定画风和角色特征场景层描述当前分镜的环境和动作情绪层微调表情和氛围。三层拼起来才是完整提示词。这样改的时候只需要动场景层和情绪层基础层不动角色就不会崩。3. 第一道工序剧本拆解与分镜表生成3.1 从文字剧本到可执行分镜拿到一个剧本不管是自己写的还是AI辅助生成的第一步不是急着去生成画面而是拆成分镜表。分镜表要包含这些字段镜号、场景描述、角色动作、情绪基调、镜头类型、预估时长、对白/旁白。我一般用表格来管理LibTV里可以直接建分镜表每个分镜关联对应的主体图库素材。举个例子一场“雨夜对峙”的戏拆出来大概是这样的镜号场景描述角色动作情绪基调镜头类型预估时长01雨夜巷口全景两人对峙站立紧张压抑远景定场4秒02角色A面部特写雨水沿脸颊滑落隐忍愤怒特写3秒03角色B手部特写握紧拳头蓄势待发特写2秒04两人中景同时向对方冲去爆发中景跟拍3秒05打斗动作出拳、格挡、踢腿激烈多角度快切6秒这张表就是后面所有工序的施工图纸。没有这张表你生成到一半就会乱不知道下一个镜头该接什么。3.2 拆解时的节奏控制技巧一场戏三分钟大概需要35到50个分镜。平均每个镜头3到5秒。但你不能平均分配要有节奏起伏。对话戏镜头可以长一点4到6秒一个打斗戏要短1到2秒一个靠快切制造冲击感。我踩过的坑是一开始把打斗戏也按4秒一个镜头生成结果剪出来软绵绵的像慢动作回放。后来改成打斗段落每个镜头只生成1.5到2秒生成时让动作在镜头中段完成剪辑时首尾各裁掉几帧节奏一下就起来了。实操心得分镜表里一定要标“镜头意图”。比如“这个镜头是为了展示角色A的犹豫”而不是只写“角色A特写”。意图清晰了写提示词的时候才知道要突出什么。3.3 用AI辅助拆解剧本的提示词模板如果你不想手动拆可以用大语言模型辅助。我常用的提示词模板是这样的你是一个专业的动画分镜师。请将以下剧本片段拆解为分镜表输出格式为表格包含镜号、场景描述、角色动作、情绪基调、镜头类型、预估时长秒、镜头意图。 要求 1. 对话密集处镜头时长控制在4-6秒 2. 动作密集处镜头时长控制在1-2秒 3. 每5个镜头中至少包含一个远景、一个特写、一个中景 4. 情绪转折点必须用特写镜头强调 剧本片段[粘贴你的剧本]这个模板我用了大半年拆出来的分镜表基本可以直接用只需要微调时长和镜头类型。4. 第二道工序主体图库搭建与角色一致性锁定4.1 为什么必须建主体图库角色一致性是AI漫剧的生命线。观众可以接受画风粗糙但绝对不能接受主角上一秒是圆脸下一秒变方脸。主体图库的作用就是给每个角色建立一套视觉锚点后面所有分镜生成都从这里调用角色特征。我在LibTV里给每个角色建一个独立文件夹里面放正面全身图、侧面全身图、背面全身图、面部特写中性表情、面部特写微笑、面部特写愤怒、面部特写悲伤。这七张图就是角色的“身份证”。生成新分镜时把对应角色的参考图拖进Seedance的skill导演台锁定特征向量生成出来的脸就不会跑偏。4.2 主体图生成的提示词设计生成主体图的时候提示词要极度具体不能有歧义。我常用的角色主体图提示词结构是[角色名][年龄]岁[性别][发型描述][发色][瞳色][脸型][服装描述][体型][站姿]纯色背景正面全身均匀光照无阴影高细节动漫风格8k举个例子一个“冷面剑客”的角色凌霜25岁男性黑色长发束成高马尾发尾微卷深灰色瞳孔棱角分明的瘦削脸型身穿玄色交领长袍腰间系暗红色腰带佩长剑体型修长挺拔自然站姿纯白背景正面全身均匀光照无阴影高细节动漫风格8k生成之后如果脸型或服装有偏差不要将就重新生成直到满意为止。主体图阶段多花十分钟后面分镜阶段能省两个小时。4.3 角色特征向量的锁定与调用Seedance 2.0的skill导演台里有一个“角色锁定”功能你上传七张主体图后它会提取一个特征向量。这个向量就是角色的“DNA”。后面生成分镜时在提示词里加上凌霜这样的标记系统就会自动调用这个特征向量。但这里有个坑特征向量不是万能的。如果分镜里角色是侧脸或者俯视角度而你的主体图里没有对应角度的参考生成出来还是可能崩。我的解决办法是主体图库里除了七张标准图再补几张极端角度的图仰视、俯视、侧后方。这样覆盖角度更全。注意主体图库建好之后不要随意修改。一旦修改之前生成的所有分镜可能都要重新生成。我一般是在项目开始前花半天时间把主要角色的图库全部建好、验证好然后再进入分镜生成阶段。4.4 多角色同框的处理方案一场戏里两个角色同框是最容易翻车的地方。两个特征向量同时锁定有时候会互相干扰导致A的脸跑到B身上。我的处理方案是分图层生成后期合成。具体操作是先单独生成角色A在场景中的画面再单独生成角色B在同样场景中的画面注意保持背景提示词完全一致。然后在剪辑软件里把两个画面叠在一起用蒙版抠出各自区域。这样虽然多花一道工序但角色绝对不会串脸。如果两个角色有肢体接触比如打斗中的格挡那就需要生成一张“双人互动”的图。这时候提示词要写得非常明确凌霜黑色长发玄色长袍右手持剑格挡苏月白色短发青色短衫左手匕首刺向凌霜右肩两人面部清晰可见动作定格在兵器接触瞬间背景为竹林动态模糊动漫风格8k关键是把两个角色的特征描述都写全不能只写名字否则系统不知道凌霜和苏月分别长什么样。5. 第三道工序分镜提示词设计与生成参数配置5.1 三层提示词结构的实际写法回到前面说的三层结构我拿一个具体分镜来演示。分镜内容是“凌霜在雨夜中拔剑眼神凌厉”。基础层锁定画风和角色动漫风格赛璐璐上色高对比度光影电影级构图8k凌霜黑色长发束高马尾深灰瞳孔玄色长袍场景层描述环境和动作雨夜青石板街道积水反射霓虹灯光凌霜右手握住剑柄剑身出鞘三寸雨滴打在剑身上溅起水花情绪层微调表情和氛围眼神凌厉眉头微压嘴角紧绷冷色调压抑氛围雨丝倾斜三层拼起来就是完整提示词。生成的时候基础层不变只改场景层和情绪层这样同一场戏里所有分镜的画风和角色都统一。5.2 Seedance 2.0的关键参数设置Seedance 2.0的生成参数里有几个直接影响成片质量参数名推荐值作用调整逻辑运动强度3-5控制画面动态幅度对话戏用2-3打斗戏用5-7一致性权重0.75-0.85角色特征锁定强度太高会僵硬太低会漂移帧率24fps输出帧率动漫风格24fps足够60fps反而失去动画感分辨率1080p输出分辨率4k生成太慢1080p后期放大足够种子固定值保证同场景风格统一同一场戏所有分镜用同一个种子种子这个参数特别重要。同一场戏里所有分镜用同一个种子值生成出来的光影色调会高度一致。如果每个分镜随机种子剪在一起就会像不同剧集拼的。5.3 打斗场面的提示词技巧打斗是AI漫剧里最难做的部分。普通提示词生成出来的打斗要么像跳舞要么像慢动作。我摸索出来的打斗提示词要包含这几个要素动作定格、速度线、冲击帧、动态模糊。一个出拳的镜头提示词这样写凌霜右拳全力挥出拳面朝向镜头手臂肌肉紧绷速度线从拳面放射状散开背景动态模糊冲击帧效果对手面部在画面边缘露出惊恐表情低角度仰拍动漫风格高对比度8k关键词是“速度线”“冲击帧”“动态模糊”。这三个词加上去画面立刻有力量感。另外“低角度仰拍”能增强压迫感打斗戏里多用。实操心得打斗镜头生成时运动强度拉到6-7但一致性权重降到0.7左右。因为打斗动作幅度大一致性权重太高会导致动作僵硬。降一点权重让动作更流畅脸稍微有点变化观众在快切中注意不到。5.4 文戏的情绪传递提示词文戏难在情绪传递。AI很容易把“悲伤”生成成“面无表情流泪”。要让情绪到位提示词要写身体语言不能只写情绪词。比如“隐忍的愤怒”不要只写“愤怒”要写凌霜下颌线紧绷嘴唇抿成一条直线鼻翼微微扩张眉心有极浅的竖纹右手在身侧握拳但克制着没有抬起肩膀微微前倾眼神直视前方但瞳孔微缩冷色调侧光背景虚化这些身体细节堆上去情绪自然就出来了。AI对具体身体描述的理解远好于抽象情绪词。6. 第四道工序视频生成与批量出片6.1 单镜头生成到批量队列分镜提示词全部写好后不要一个一个手动生成。Seedance支持批量队列把提示词表导入设置好每个镜头的时长和参数让它自己跑。我一般晚上挂机跑第二天早上收片。批量生成的时候要注意同一场戏的镜头放在同一个队列里用同一个种子值。不同场戏可以分队列种子值不同这样场与场之间有视觉区分。6.2 生成结果的筛选标准批量生成出来的片子不可能每条都能用。我的筛选标准是三条角色脸不崩、动作意图清晰、光影与同场戏其他镜头一致。三条里有一条不满足就重新生成。重生成的时候不要原封不动再跑一次要微调提示词。脸崩了就提高一致性权重动作不清晰就增加动作描述细节光影不一致就检查种子值是不是设对了。6.3 镜头衔接的预留处理生成的时候每个镜头首尾各多生成0.5秒。比如分镜表写3秒实际生成4秒。剪辑的时候把首尾各裁掉0.5秒用中间3秒。这样做的原因是AI生成的视频首尾几帧往往不稳定有轻微变形或闪烁裁掉之后画面更干净。另外相邻镜头之间要预留“动作衔接帧”。比如镜头A是出拳镜头B是击中那镜头A的最后一帧和镜头B的第一帧动作要能接上。我的做法是生成镜头A时让动作在结尾处刚好完成到80%镜头B从动作的100%开始。剪辑时把A的结尾和B的开头叠两帧过渡就自然了。7. 第五道工序配音配乐与音效分层7.1 配音的生成与对轨配音我用的是AI语音合成选好音色后把对白文本导进去生成。关键是对轨配音的时间轴要和画面对齐。我的做法是先把配音生成好拖进剪辑软件然后根据配音的节奏去微调画面时长。而不是先定画面再配声音。如果口型对不上有两个解决方案一是用AI口型同步工具把配音和画面一起丢进去自动对齐口型二是镜头切到背影或侧脸避开正面口型。我一般优先用第二种因为口型同步工具处理动漫风格的脸效果时好时坏。7.2 配乐的情绪匹配配乐不要一首歌从头铺到尾。我的做法是按情绪段落分紧张段落用低频弦乐打斗段落用打击乐抒情段落用钢琴或吉他。LibTV的素材库里有一些免版税配乐按情绪标签分类直接拖进来用。音量控制上对白永远在最上层配乐比对白低6到8分贝音效根据画面动作点缀。打斗时的打击音效要对准出拳和击中的帧差一两帧观众就能感觉到“软”。7.3 音效的细节处理音效是提升沉浸感的关键。雨声、脚步声、剑出鞘的金属摩擦声、衣服摩擦声这些细节加上去画面立刻“活”了。我一般从素材库找基础音效然后在剪辑软件里做微调雨声加一点混响剑声加一点高频激励脚步声根据地面材质换不同的采样。注意音效不要堆太多。一场戏里同时响的音效不要超过三种否则会浑浊。对白出现的时候背景音效要自动降低音量这个在剪辑软件里用侧链压缩就能实现。8. 第六道工序剪辑合成与成片输出8.1 剪辑节奏的把控剪辑是最后一道工序也是把前面所有素材串成叙事的关键。我的剪辑原则是对话戏跟着情绪走打斗戏跟着动作走。对话戏里谁说话镜头给谁但不要机械地切。角色A说了一句重要的话镜头可以停留在角色B的反应上让观众看到B的表情变化。这种“反应镜头”比直接切到说话人更有戏剧张力。打斗戏里每个动作的起势、发力、收势要完整。不要在一个动作中间切镜头除非你是故意要制造混乱感。我一般是一个动作一个镜头动作完成后再切下一个。8.2 转场与特效的适度使用转场效果不要滥用。淡入淡出、黑场、白闪这些基础转场足够用了。打斗段落可以用快速白闪转场制造冲击感。场景切换用淡入淡出给观众一个呼吸的间隙。特效方面速度线、冲击帧这些在生成阶段已经做进画面了剪辑阶段不需要再加。如果画面亮度不统一用调色工具统一一下色温和对比度不要加滤镜滤镜会破坏动漫风格的干净感。8.3 输出参数与平台适配成片输出的时候分辨率1080p帧率24fps码率10到15Mbps。这个参数在手机和电脑上观看都足够清晰文件大小也可控。如果平台有特殊要求比如竖屏那在生成阶段就要按竖屏构图不要横屏生成再裁切裁切会损失画面信息。输出格式用MP4H.264编码兼容性最好。音频用AAC采样率48kHz比特率192kbps。9. 常见问题与排查技巧实录9.1 角色脸崩的排查路径脸崩是最常见的问题。排查顺序是先检查主体图库是否完整再看一致性权重是否设对最后看提示词里角色描述是否被场景描述覆盖。如果主体图库完整、权重也设对了但脸还是崩那大概率是提示词里场景描述太强把角色特征压过去了。解决办法是在场景描述后面再加一遍角色特征关键词比如...雨夜街道...凌霜黑色长发深灰瞳孔用标记强制调用。9.2 动作僵硬的调整方法动作僵硬通常是运动强度太低或者一致性权重太高。先把运动强度提高1到2档如果还僵硬把一致性权重降到0.7。另外提示词里加“动态模糊”“速度线”这些词也能让动作看起来更流畅。9.3 光影不统一的修复同一场戏里光影不统一九成是种子值没固定。检查批量队列里每个镜头是不是用了同一个种子。如果种子固定了还不统一那就是提示词里的光照描述不一致。同一场戏里光照描述要完全一致比如都用“冷色调侧光”不要一个镜头写“侧光”另一个写“顶光”。9.4 生成速度太慢的优化生成速度慢优先降分辨率。4k生成比1080p慢三到四倍但成片质量提升肉眼几乎看不出来。另外批量生成的时候不要开太多并行任务并行太多会抢显存反而更慢。我一般同时跑2到3个任务速度最稳。问题现象可能原因排查步骤解决方案角色脸崩主体图库不完整/权重过低检查图库七张图是否齐全权重是否≥0.75补图库提高权重提示词加标记动作僵硬运动强度低/权重过高检查运动强度和一致性权重运动强度1权重降到0.7光影不统一种子值不固定/光照描述不一致检查队列种子值对比各镜头光照词固定种子统一光照描述生成速度慢分辨率过高/并行任务过多检查输出分辨率和并行数降到1080p并行数控制在2-3口型对不上配音与画面时间轴偏差检查配音起始帧和画面口型帧用背影/侧脸避开或口型同步工具9.5 批量生成时的文件管理批量生成几十个镜头文件命名一定要规范。我的命名规则是场号-镜号-版本号.mp4比如S01-012-v3.mp4。这样剪辑的时候按文件名排序就是分镜顺序不会乱。版本号用来标记重生成的次数v1是首版v2是第一次重生成以此类推。最后剪辑只用最新版本。10. 提示词模板库的积累与复用10.1 建立自己的提示词资产做AI漫剧提示词就是你的核心资产。我每做完一个项目都会把验证有效的提示词整理进模板库。模板库按场景分类对话、打斗、抒情、转场、定场。每个分类下再按情绪细分。比如“打斗-出拳”这个模板我积累了十几个版本有正面出拳、侧面出拳、低角度出拳、高速出拳。下次遇到类似分镜直接调出来改角色名和场景描述就行不用从头写。10.2 提示词模板的变量化改造模板要变量化把角色名、场景、动作这些可变部分用占位符标出来。比如[角色A]右拳全力挥出拳面朝向镜头速度线从拳面放射状散开背景为[场景描述]动态模糊冲击帧效果[镜头角度]动漫风格高对比度8k用的时候把[角色A]换成凌霜[场景描述]换成雨夜街道[镜头角度]换成低角度仰拍。这样一套模板能覆盖几十个分镜。10.3 跨项目复用的注意事项跨项目复用提示词模板时画风描述要改。不同项目画风可能不同有的赛璐璐有的厚涂有的水彩。复用的时候把基础层里的画风关键词替换掉角色层和场景层可以保留。另外不同项目的角色特征向量不同复用模板时记得把标记换成新项目的角色。这个很容易忘忘了就会生成出上一个项目的角色脸。11. 从单场戏到整部剧的扩展思路一场戏走通6道工序之后扩展到整部剧就是复制流程。但有几个地方需要调整角色图库要扩充整部剧的角色更多每个角色的角度图要更全提示词模板库要分项目隔离不同项目的模板不要混用种子值要按场次管理同一场戏一个种子不同场戏不同种子。整部剧的剪辑还要考虑集与集之间的衔接。每集结尾留一个钩子下一集开头接上。这个在分镜阶段就要设计好不能等剪辑的时候再想。我目前做一集三分钟的AI漫剧从剧本到成片熟练之后大概需要六到八个小时。其中视频生成占一半时间因为要等批量队列跑完。如果赶时间可以同时开两个项目一个生成的时候另一个写提示词效率能再提三成。最后分享一个我踩过最深的坑不要追求一次生成完美。AI生成有随机性同一个提示词跑三次可能第三次才出好片。我的做法是每个镜头至少生成三个版本选最好的用。多生成的版本不要删有时候剪辑的时候发现某个镜头需要另一种情绪回头去废片里翻经常能翻到能用的。这个习惯让我省了很多重生成的时间。
返回列表