
1. 项目概述从“生成视频”到“导演视频”最近Sora的火爆让“用AI生成视频”这件事从科幻走进了现实。但如果你和我一样真正上手试过几次就会发现一个尴尬的现实输入“一个宇航员在月球漫步”得到的可能是一个构图混乱、镜头乱跳、动作不连贯的片段。这离我们想象中的“电影级短片”还差得很远。问题的核心往往不在于模型本身的能力而在于我们给它的“指令”——也就是提示词——太过笼统。我们还在用对待静态图片生成器的思维去指挥一个动态的视频模型这就像让一个交响乐团只凭一句“来段音乐”就开始演奏结果可想而知。“Sora关于视频分镜的提示词技巧”这个主题正是为了解决这个痛点。它不再是简单地探讨如何让Sora“画”出某个物体而是深入探讨如何像导演一样通过结构化的语言向AI清晰地传达你的视觉叙事意图。这涉及到镜头语言、节奏控制、场景衔接等一系列影视工业的概念。掌握这些技巧意味着你能从被动的“抽卡”式生成转变为主动的“创作”式引导真正释放Sora这类视频生成模型的潜力。无论你是内容创作者、影视爱好者还是营销人员这套方法都能帮你将天马行空的想法转化为逻辑清晰、观感专业的动态影像。2. 核心理念将提示词视为“分镜脚本”在传统的AI绘画中提示词更像是一份“静态画面需求清单”列出了主体、风格、光影、质感等元素。但到了视频领域时间维度的加入让一切变得复杂。一个优秀的视频提示词其本质应该是一份简化的“分镜脚本”或“导演阐述”。它不仅要描述“有什么”更要规定“怎么拍”。2.1 分镜思维与提示词结构的对应关系我们可以将影视制作中的分镜要素映射到Sora提示词的撰写中场景 (Scene): 对应提示词中的主场景描述。这是基础需要明确时间、地点、环境氛围。例如“黄昏时分一座被藤蔓覆盖的废弃古城堡天际有紫色的晚霞”。镜头 (Shot): 这是核心。你需要指定景别远景、全景、中景、近景、特写、角度俯拍、仰拍、平视、过肩和镜头运动固定、推、拉、摇、移、跟。例如“镜头从城堡的远景缓缓推进穿过残破的拱门变为一个中景跟随一个探险者的背影”。动作 (Action): 描述主体在时间线上的连续行为。动作描述要连贯且有逻辑避免跳跃。例如“探险者手持火把小心翼翼地踏过碎石他停下举起火把照亮墙壁上的古老壁画”。转场 (Transition): 虽然Sora目前对复杂剪辑指令的理解可能有限但我们可以通过描述场景或主体的变化来暗示转场。例如“随着他触摸壁画壁画发出微光整个画面被光芒吞没光芒散去后场景已切换至壁画描绘的古代战场”。节奏与时长: 可以通过描述动作的快慢和事件的密度来间接影响视频节奏。例如“慢动作雨滴打在荷叶上溅起晶莹的水花”。对于时长目前更多依赖模型默认或参数设置但在提示词中强调“一个短暂的瞬间”或“一个漫长的过程”可能产生心理暗示。注意不要指望Sora能像专业剪辑软件一样精确理解“淡入淡出”、“交叉溶解”这类术语。它的强项在于理解视觉空间的连续变化。因此最好的“转场”描述是描绘一个连贯的、合理的空间或时间演变过程。2.2 从“描述画面”到“设计运镜”的思维转变这是最关键的一步。我们来看一个对比初级提示词画面描述“一只猫在沙发上玩耍。”结果预测Sora可能会生成一个静态角度比如正面平视下猫做出一些随机动作的视频。画面可能单调缺乏叙事感。进阶提示词分镜脚本“电影感浅景深。开场是一个从客厅窗户向外看的城市夜景空镜远景固定镜头持续2秒。然后镜头缓缓下摇并后拉变为一个全景我们看到一只橘猫正蜷在柔软的布艺沙发一角睡觉镜头运动下摇后拉。突然一个毛线球从画面外滚入停在猫爪边。猫的耳朵动了一下特写镜头它睁开眼睛瞳孔放大大特写。接着是一个猫的主观视角POV镜头略带晃动看着眼前的毛线球。猫突然扑出镜头跟随猫的动作快速横移跟镜头猫与毛线球在木地板上嬉戏。”结果分析这份提示词规划了多个镜头序列包含了起幅空镜、景别变化、镜头运动、主观视角和特写强调。它给了Sora一个清晰的、按时间线排列的拍摄指南大大提高了生成视频在叙事连贯性和视觉丰富度上的上限。这个转变要求我们在构思时内心就要有一个“虚拟摄像机”并思考这个摄像机该如何运动来讲述故事。3. 核心技巧详解构建你的导演指令集掌握了分镜思维接下来我们需要一套可操作的“语法”和“词汇”来将其转化为Sora能更好理解的提示词。3.1 镜头语言的关键词库建立你的常用术语库并在提示词中准确使用景别关键词极端特写 (Extreme Close-up, ECU): 仅展示物体的极小部分如眼睛、戒指。用于强调强烈情绪或细节。大特写 (Close-up, CU): 拍摄对象头部或物体整体充满画面。用于表现面部表情或重要物品。中景 (Medium Shot, MS): 拍摄人物膝部以上。常用于对话场景兼顾表情和肢体语言。全景 (Full Shot, FS): 展示人物全身及其所处环境。用于建立人物与环境的关系。远景 (Long Shot, LS) / 大远景 (Extreme Long Shot, ELS): 人物在画面中很小以展示宏大环境为主。用于定场或渲染氛围。镜头运动关键词推 (Dolly in) / 拉 (Dolly out): 摄像机本身向前或向后移动。强调“接近”或“远离”的沉浸感。变焦 (Zoom in) / 缩焦 (Zoom out): 通过镜头焦距变化实现类似推拉的效果但透视感不同变焦会压缩空间。摇 (Pan): 摄像机水平旋转。展示广阔水平景观或跟随水平运动物体。移 (Truck): 摄像机横向移动。常用于跟随行走中的人物。跟 (Tracking shot): 摄像机跟随运动主体一起移动。营造强烈的参与感和动感。升降 (Crane shot): 摄像机在垂直方向运动。常用于展现场景的宏伟或视角的转换。角度关键词鸟瞰视角 (Bird‘s-eye view)俯角 (High angle)水平视角 (Eye-level)仰角 (Low angle)荷兰角 (Dutch angle): 倾斜镜头制造不安、紧张感。风格与质感关键词电影感 (Cinematic)浅景深 (Shallow depth of field)手持摄影质感 (Handheld camera aesthetic)斯坦尼康稳定效果 (Steadicam smooth movement)高速摄影 (慢动作) (Slow motion)延时摄影 (Time-lapse)3.2 结构化提示词公式与实例拆解一个高结构化的提示词通常遵循以下层次我们可以将其视为一个公式【氛围与风格】 【场景定位】 【镜头序列描述】 【视觉质量强化】我们来拆解一个复杂案例提示词“一部科幻短片赛博朋克风格霓虹灯光与阴雨天气。场景始于一条拥挤的未来都市小巷大远景俯角雨水在霓虹招牌上反光。镜头快速下坠并向前推进穿过层层叠叠的广告全息投影第一人称视角快速移动最终停在一个穿着透明雨衣的行人背后镜头变为第三人称跟随。行人抬起手手腕上的植入体发出蓝色光芒投射出一个全息界面特写手腕。此时镜头围绕行人缓慢旋转360度环绕镜头同时小巷的背景逐渐虚化数字信息流在空气中浮现场景渐变。最后行人握拳全息界面收缩镜头猛地推向其瞳孔瞳孔中倒映出不断滚动的数据流极端特写镜头推进。”逐层分析氛围与风格“科幻短片赛博朋克风格霓虹灯光与阴雨天气”——设定了整体基调和视觉主题。场景定位“一条拥挤的未来都市小巷”——明确了初始空间。镜头序列描述这是核心部分它被清晰地分成了几个镜头段落镜头1定场镜头大远景俯角。镜头2动态转场镜头第一人称快速推进兼具运镜和场景穿梭功能。镜头3主体引入第三人称跟随。镜头4动作细节特写。镜头5情绪/状态渲染环绕镜头背景渐变。镜头6悬念收尾极端特写推进。视觉质量强化描述中包含了“雨水反光”、“全息投影”、“背景虚化”、“数据流”等具体视觉元素这些都能引导模型生成更丰富的质感。3.3 时间线与节奏控制在单次生成中Sora对时间的理解是连续的。我们可以通过描述动作的持续时间和顺序来控制节奏。明确时间顺序使用“首先”、“然后”、“接着”、“与此同时”、“最后”等连接词。虽然Sora不是严格按文本顺序生成每一帧但这些词汇有助于它理解事件的逻辑流。描述速度变化“缓慢地”、“逐渐地”、“突然”、“迅猛地”、“以慢动作”。利用重复与循环“钟摆有规律地左右摆动”、“一个跑者在环形跑道上不断奔跑”这种描述能强化节奏感有时能生成出人意料的连贯循环视频。实操心得对于复杂的多镜头叙事目前更稳妥的策略是“分而治之”。即用高度分镜化的提示词分别生成几个关键镜头片段后期再用视频编辑软件进行剪辑、拼接和调色。试图让AI一次性生成一个包含复杂剪辑点的长视频失败率和不可控性仍然很高。我们的提示词目标是让每一个生成的片段本身在运镜和叙事上就是高质量、可用的。4. 高级策略与“炼丹”避坑指南掌握了基础技巧后一些高级策略和常见陷阱能帮你进一步提升出片质量和工作效率。4.1 利用“负面提示词”规避常见问题就像在AI绘画中一样明确告诉Sora“不要什么”有时和告诉它“要什么”同样重要。以下是一些针对视频分镜的常见负面提示词规避逻辑错误- illogical scene transition, - discontinuous action, - teleporting object, - morphing (除非需要)保持物理稳定- shaky camera (除非需要手持感), - unstable horizon, - fluctuating gravity, - inconsistent lighting提升主体一致性- multiple subjects confusing, - changing appearance of main character/clothing mid-video, - floating objects保证画面质量- blurry, - distorted faces (when not intended), - bad proportions, - ugly, - deformed你可以将这些负面提示词组合成一个常用集合在每次生成时作为基础参数附加进去。4.2 迭代优化从“草稿”到“成片”不要指望一蹴而就。将提示词撰写视为一个迭代过程第一版概念草稿用最简单的句子写出核心创意和主体动作。例如“一个机器人学习浇花。”第二版分镜初稿加入基础分镜。例如“中景一个老旧的家用机器人站在阳台它笨拙地拿起水壶。特写它的光学传感器对着枯萎的花盆。它尝试倾斜水壶但水洒了一地。”第三版风格化与细化加入风格、光影、细节和镜头运动。例如“温馨的午后阳光风格化3D渲染柔和阴影。开场是阳台的广角镜头机器人静止。镜头推至中景机器人关节发出轻微的‘吱呀’声它抬起机械臂。特写镜头它的摄像头对焦到土壤裂缝。它尝试浇水水流控制不稳溅出水花慢动作溅水细节。机器人低头‘看’着地上的水渍头部微微倾斜拟人化表情。”第四版参数微调根据生成结果调整有问题的部分。如果机器人动作太僵硬可以加入- robotic movement (paradoxically, sometimes asking for less of a quality can help)或强调fluid, lifelike attempt。如果场景太乱可以强调clean background, focus on robot and plant。4.3 常见问题排查与解决实录即使提示词写得再仔细生成结果也可能不尽如人意。以下是一些典型问题及解决思路问题现象可能原因排查与解决思路主体“突变”或“闪烁”提示词中对主体的描述不够唯一、稳定场景过于复杂导致模型注意力分散。1. 为主体重命名使用更独特的标识符如“穿着红色条纹毛衣的机器人小R”而非“一个机器人”。2. 简化背景使用simple background, studio lighting等词强化主体。3. 在负面提示词中加入- multiple versions of the same subject。镜头运动不连贯或生硬镜头运动描述过于复杂或存在物理矛盾如既快速推进又缓慢平移。1. 一次只描述一种主要的镜头运动确保运动逻辑简单清晰。2. 使用明确的起始和结束画面来锚定运动。例如“从书桌的特写开始镜头平稳向后拉最终揭示整个杂乱的书房全景。”3. 参考电影术语使用steady cam smooth movement来追求稳定感。场景转换生硬或扭曲试图在单提示词中实现硬切、淡入淡出等后期剪辑效果超出了模型当前连续生成的能力。1.首选方案分别生成不同场景的片段后期剪辑。2.实验方案尝试用自然的时间/空间变化来描述转场如“夜幕降临城市灯光逐一亮起”、“雾气弥漫遮盖了整个画面当雾气散去已是另一个地方”。这利用了模型擅长处理渐变的特点。动作不符合物理规律对动作的描述忽略了物理约束或模型对复杂动力学理解不足。1. 将复杂动作拆解为更简单、更基础的步骤。2. 加入符合物理的细节如“由于重量他举起箱子时膝盖微微弯曲”、“纸张飘落时呈现不规则的旋转轨迹”。3. 查阅真实的物理运动视频用更精准的动词描述如“弹跳”、“滚动”、“滑行”、“飞溅”等。画面风格不一致提示词中风格关键词冲突或模型在长序列中难以保持统一美学。1. 坚持使用一种主导风格关键词如Studio Ghibli style避免混用如同时使用photorealistic和anime。2. 在描述中不断强化风格元素例如在吉卜力风格中可以多次提及soft watercolor textures, gentle wind, whimsical details。3. 考虑生成较短、风格一致性更容易保持的片段。5. 实战工作流从创意到成片的完整路径理论需要结合实践。下面我将分享一个我个人常用的利用分镜化提示词制作短视频的完整工作流。5.1 第一步创意构思与文字分镜在打开任何AI工具之前先用最传统的方式把想法落实在纸上或文档里。一句话梗概明确你想讲什么。例如“一个孤独的宇航员在空间站通过照料一株小植物获得慰藉。”情绪板与关键词收集收集视觉参考图可以是真实照片、电影截图、画作并提炼关键词zero gravity, sleek space station interior, isolated, hopeful, tiny green plant, Earth view from window, soft humming of machines。撰写文字分镜不要考虑AI只考虑电影。为你的梗概写下4-6个关键镜头。镜头1远景空间站舷窗外是巨大的地球内部是冷色调的金属走廊一个宇航员的小小身影漂浮在远处。镜头2中景跟拍宇航员用手推着墙壁轻盈地漂向一个储物柜。他打开柜门里面有一盏小小的LED生长灯。镜头3特写在生长灯的柔和光线下一株小小的、绿油油的豌豆苗在特制的容器里。宇航员戴着手套的手指极其轻柔地触碰了一片叶子。镜头4主观视角从宇航员的视角看向舷窗地球和豌豆苗在同一个画面中一远一近一大一小形成对比。镜头5中景缓慢拉远宇航员漂浮在舷窗前手里捧着那盆植物静静地看着地球。镜头慢慢拉远他的身影在巨大的空间站和地球背景下显得愈发孤独又充满温情。5.2 第二步将分镜转化为Sora提示词现在将文字分镜“翻译”成富含导演指令的提示词。我通常选择其中最具表现力的1-2个镜头进行单次生成而不是把所有镜头塞进一个提示词。这里以镜头3和镜头5为例。提示词 for 镜头3 (特写)Cinematic close-up shot, macro photography style. Inside a futuristic space station. A single, vibrant green pea seedling grows in a transparent hexagonal hydroponic pod. A soft, warm LED grow light glows from above, creating a tiny halo of light in the otherwise cool, dark metallic environment. A astronaut‘s gloved finger enters the frame from the bottom, moving in slow motion to gently stroke one of the delicate leaves. The leaf trembles slightly upon contact. Extreme detail on water droplets on the leaf, the texture of the glove, and the condensation on the pod walls. Shot on ARRI Alexa, shallow depth of field, focusing on the connection between the finger and the leaf.提示词 for 镜头5 (结尾镜头)Wide shot, slowly pulling back (dolly out). An astronaut in a standard white EVA suit, helmet visor reflecting the blue Earth, floats weightlessly in front of a large observation window of a space station. He cradles the small hexagonal plant pod in both hands, holding it like something precious. The view outside is the breathtaking curvature of Earth against the blackness of space. The interior of the station is dim, with only emergency lights, making the Earth and the pod‘s own gentle glow the primary light sources. The camera pulls back steadily over 5 seconds, revealing the vastness of the station module and the astronaut‘s small, contemplative figure within it. Epic, emotional, and serene atmosphere. Cinematic color grading, high dynamic range.5.3 第三步生成、筛选与后期处理批量生成与筛选将每个镜头的提示词可附带调整后的负面提示词生成多个版本例如每个提示词生成3-4次。从结果中挑选出画面质量最高、最符合你构想的版本。后期剪辑与合成使用DaVinci Resolve、Premiere Pro甚至CapCut等工具将选中的镜头片段导入时间线。剪辑按照你的分镜顺序排列镜头修剪掉开头结尾多余的部分。转场在镜头间添加简单的交叉溶解、淡入淡出或匹配剪辑使过渡更流畅。调色统一所有片段的色彩风格增强电影感。可以套用LUT或手动调整。音效与配乐这是点睛之笔添加环境音空间站嗡嗡声、呼吸声、细微动作音效以及贴合情绪的背景音乐能极大提升视频的感染力。最终输出渲染导出成片。一个由AI生成片段经专业后期组装的短片就完成了。这套工作流将AI的生成能力与人的审美把控、叙事节奏掌控完美结合。AI负责解决高质量单镜头画面的生产问题而人则负责最核心的创意、导演和后期合成工作。随着视频生成模型能力的进化未来我们或许能在提示词中直接描述更复杂的剪辑点但现阶段这种“人机协作”模式是最可靠、最能出效果的创作路径。记住最好的工具不是替代你而是扩展你的能力边界。分镜化提示词技巧就是你与Sora这类强大模型进行高效、精准对话的“导演语言”。