ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

MiniMax H3提示词优化:用导演Skill实现一键分镜与专业成片

MiniMax H3提示词优化:用导演Skill实现一键分镜与专业成片 最近在利用 MiniMax H3 这类视频生成模型产出 AI 短片时我遇到一个很典型的问题同一句话放进模型里不同时间生成出来的画面差异可能非常大。真正拉开效果差距的并不是模型参数调得有多花哨而是提示词是否足够结构化、可执行。换句话说模型理解不了“氛围感拉满”但能理解“逆光、浅景深、暖色调”。这篇文章想分享一套我整理的提示词进阶方案利用 llm 专属“导演 Skill”做提示词管家把一句话创意自动扩展成包含智能分镜、镜头语言、风格变量和专业负面约束的视频提示词尽量做到“一句话一键生成专业 AI 短片”。内容包含设计思路、Skill 配置、可运行的代码示例以及我在实际使用中遇到的坑点。这篇文章适合正在用 MiniMax H3 或其他文生视频工具做 AI 短片、短视频素材、广告样片的人也适合对提示词工程、LLM Agent、Skill 机制感兴趣的开发者。读完你就能搭建一个属于自己的导演 Skill并把提示词体系管理起来。1. MiniMax H3 提示词的痛点与解决思路1.1 视频生成模型的输入并不“随意”很多人第一次用文生视频模型时习惯把平时写文生图提示词的方式照搬过来。比如输入“一只橘猫在街上奔跑”结果模型确实生成了橘猫奔跑的画面但背景不统一、镜头乱跳、动作幅度不稳定。原因在于视频模型不仅要理解画面里有什么还要理解画面如何随时间变化。MiniMax H3 这类模型在生成视频时对提示词的连续性、动作动词、镜头运动、光线变化都非常敏感。你越是能把一段描述拆成“时间上连续的画面片段”模型越容易按照你的预期去生成。这也是本文强调智能分镜的原因分镜不是给剪辑师看的而是给视频生成模型看的执行清单。1.2 一个提示词 vs 一套提示词体系单个提示词可以描述一个具体的画面但很难覆盖多个镜头的连续性。“提示词管家”并不是一个固定的提示词而是一套沉淀下来的模板、变量、规则和组合工具。当你把“创意捕捉 → 要素解析 → 分镜拆分 → 风格注入 → 负面约束 → 最终合并”这条链路做成一个可复用流程后每次创作就不再是从头写提示词而是像套用一套导演工作流。聪明的地方在于这套流程可以交给 LLM 来做人只负责一句话灵感LLM 负责把灵感变成导演能看懂的分镜脚本再把分镜脚本变成模型能执行的提示词。1.3 导演 Skill 的身份定位Skill 是最近在 LLM Agent 场景中非常流行的能力封装方式。一个 Skill 可以理解为一个“带说明文档 固定工作流”的提示词模块。导演 Skill 则专门解决视频提示词生产问题它让 LLM 先扮演导演把用户的一句话变成分镜脚本再输出成模型能直接执行的提示词。你可以把导演 Skill 理解为团队的副导演它不负责最终画面的渲染只负责把模糊想法转成标准化的拍摄方案。MiniMax H3 是摄影师导演 Skill 是分镜师而你才是真正的导演。这个分工清晰以后批量产出视频素材就变成了一条流水线。2. 理解 MiniMax H3 提示词的底层逻辑2.1 文生视频提示词与文生图提示词的区别先看一个对比表格这决定了你写视频提示词时应该把注意力放在哪里。维度文生图提示词文生视频提示词画面状态静态构图连续动作序列时间信息不需要需要描述动作起始、持续变化镜头语言可选加分项影响成片观感的重要项多镜头通常单画面建议按分镜拆分保证主体一致性转场节奏不涉及涉及镜头衔接、动作连贯性从表里能看出视频提示词最核心的增量是“时间维度”。你不仅要告诉模型画面里有什么还要告诉它这些元素如何运动、镜头如何运动、光线如何改变。很多生成结果看起来“死板”就是因为用户只写了静态画面描述没有给出动态过程。2.2 强遵循度从哪里来所谓强遵循度指的是模型按照提示词执行的完整程度。想要提高遵循度最有效的办法不是堆形容词而是降低提示词的歧义。我总结了一个判断标准把提示词中的每个描述词换成“能不能被明确渲染成画面”。如果能保留如果不能改成具体可执行的描述。例如“很有氛围”可以改成“傍晚蓝调时刻远处的路灯亮起地面有积水反射光”。再比如“很震撼”可以改成“大远景低角度仰拍云层快速流动”。这种写法能让模型每一步都知道该生成什么。2.3 常用镜头语言与景别速查为了后续 Skill 设计这里把镜头语言的基础词汇做一个速查表新手可以先把这套词库背下来写视频提示词基本够用。类型常用词汇说明运镜推近、拉远、平移、摇镜、环绕、跟随、升降每个镜头建议只选一种主运镜景别远景、全景、中景、近景、特写决定主体在画面中的大小和距离感转场硬切、叠化、淡入淡出、甩镜决定镜头之间的衔接方式分镜时建议每个镜头只给一种主运镜这样镜头语言更纯粹。如果“推近 环绕 跟随”全部写进同一个镜头模型往往不知道优先执行哪个最终效果就是镜头乱飘。3. 导演 Skill 设计思路让提示词生产变成流水线3.1 Skill 与普通提示词模板的区别很多同学手里有一堆“万能提示词模板”但用起来效果并不稳定。原因是模板解决的是“填空”而 Skill 解决的是“完整工作流”。一个 Skill 通常包含触发描述、执行步骤、输入输出格式、使用约束。放到提示词场景里它就是一个可以复用的“导演工作说明书”。普通模板只能帮你把字填上去导演 Skill 能帮助你完成从创意到成片提示词的全链路转换包括分镜数量、字段结构、质量检查规则。以 Claude Code 中常见的 Skill 目录为例SKILL.md 放在技能目录下LLM Agent 识别后会自动按其中定义的流程工作。这个格式是通用的你完全可以迁移到其他支持 Agent 能力的工具中。3.2 导演 Skill 的四个核心模块我把导演 Skill 拆成四个模块每个模块对应一段独立的提示词指令输入解析模块从用户自然语言中提取主体、动作、场景、情绪、风格取向。脑洞扩展模块在关键词之间建立意外关联解决创意枯竭问题。分镜生成模块按叙事逻辑把一句话拆成 3 到 6 个镜头。提示词渲染模块把分镜字段、风格变量、负面词库合并成最终提示词。其中分镜生成和提示词渲染对最终成片影响最大。输入解析出错后面全错渲染出错分镜再好也无法被模型理解。因此我会在下一章的实战部分重点演示这两个模块的写法。3.3 三种工作模式设计为了让 Skill 同时满足普通创作者和进阶创作者的需求我设计了三种工作模式标准模式standard忠实于用户输入拆分为 3 个镜头适合快速出片。脑洞模式brainstorm加入跨界联想、夸张比喻和意外元素适合创意灵感枯竭时使用。细节模式detail生成 5 到 6 个镜头补充更多动作细节、环境互动和声音描述适合追求品质的成片。脑洞模式是最有“惊喜感”的模式。比如说输入“一杯咖啡”标准模式会生成咖啡在桌面上冒热气的镜头脑洞模式可能会生成“一杯咖啡在办公桌上慢慢蒸发周围的空间扭曲成宇宙星云”。这类联想如果做成固定模板会非常生硬但让 LLM 现场发挥就自然很多。4. 实战搭建一个 llm 专属导演 Skill4.1 Skill 工程目录结构为了方便管理和复用建议把导演 Skill 做成一个独立目录。下面是一个可参考的目录结构director-skill/ ├── SKILL.md # 技能主文件定义工作流 ├── modes/ # 模式配置 │ ├── standard.yaml │ ├── brainstorm.yaml │ └── detail.yaml └── templates/ # 提示词模板 ├── base_prompt.md └── negative_prompt.md在实际使用时你可以把这个 Skill 放到自己的 Agent 技能目录中。如果你使用 Claude Code可以放在技能目录下如果使用其他支持 Skill 的 Agent 框架通常也支持类似的目录约定。核心不是目录位置而是 SKILL.md 的内容设计。4.2 编写 SKILL.md 工作流指令SKILL.md 是整个导演 Skill 的核心。它用 Markdown YAML frontmatter 格式描述自己让 LLM Agent 能自动识别并调用。下面是一个可直接使用的示例--- name: director-skill description: 将一句话创意扩展为专业视频分镜脚本和 MiniMax H3 提示词 version: 1.0.0 --- # 导演 Skill ## 你的角色 你是一名资深 AI 短片导演精通镜头语言、叙事节奏和提示词工程。 ## 任务流程 1. 读取用户输入提取主体、动作、场景、情绪、风格取向。 2. 如果用户没有指定模式默认使用 standard 模式。 3. 根据模式确定分镜数量 - standard: 3 个分镜 - brainstorm: 3 个分镜加入创意联想 - detail: 5 个分镜包含动作与声音细节 4. 针对每个分镜生成以下字段 scene_no, duration, shot, camera, subject, action, environment, lighting, style, transition 5. 合并所有分镜为最终 positive_prompt并输出 negative_prompt。 ## 输出协议 必须输出合法 JSON不要输出解释性文字。 字段结构见下一节。 ## 质量检查 输出前检查 - 每个分镜是否有明确动作或时间变化。 - 是否只有一个主运镜。 - 是否避免模糊词汇。这里最关键的设置是“输出协议”和“质量检查”。让 LLM 以 JSON 输出能最大限度避免自由发挥增加质量检查项能约束它在最终输出前做一次自我校对。很多提示词之所以执行效果差就是因为缺少最后一步“检查”模型把不该出现的错误直接带入了生成结果。4.3 定义智能分镜输出协议JSON为了让分镜结果可以被程序读取并合并成真实可用的提示词我建议把 LLM 输出固定为 JSON 结构。下面是一个示例{ title: 纸飞机与橘猫, mode: standard, scenes: [ { scene_no: 1, duration: 5, shot: 全景, camera: 镜头缓慢推近, subject: 橘猫站在老街的石板路上, action: 纸飞机从画面右侧飞过橘猫抬头注视, environment: 黄昏老街暖黄色路灯斑驳墙壁, lighting: 夕阳逆光暖橙色地面拉出长影, style: 写实电影风格35mm 胶片质感, transition: 硬切 } ], positive_prompt: 分镜合并后的提示词, negative_prompt: 变形、多余肢体、文字乱码、镜头抖动 }JSON 的好处是稳定、可解析。后续哪怕要接入自动化批量生成流程也可以直接把这份 JSON 传给下游生成调度。字段中 duration 建议控制在 3 到 6 秒这是大多数视频生成模型比较稳定的单镜时长shot 和 camera 一组合模型就能明白画面的景别和运动方式。4.4 用 Python 组装 H3 提示词拿到分镜 JSON 后还需要把它渲染成 MiniMax H3 能理解的提示词文本。下面这段 Python 代码负责把分镜结构合并成带段落结构的正负面提示词import json from pathlib import Path def load_json(path: str) - dict: return json.loads(Path(path).read_text(encodingutf-8)) def render_prompt(data: dict) - str: lines [f短片主题{data[title]}, ] for scene
返回列表