
AI绘画这两年从圈内玩物变成了很多设计师、运营、插画爱好者的日常工具Midjourney和Stable Diffusion这两套东西几乎是绕不开的。但真正上手的人都知道工具本身不难难的是脑子里没有一套完整的出图逻辑——提示词怎么写、模型怎么选、参数怎么调、出问题了怎么排查这些没人系统讲全靠自己瞎试效率极低。知乎知学堂这套AI绘画MJSD课程本质上就是把这套从零到能独立出商业级图的路径给串起来了。我前后跟过几轮类似的课程内容也自己带过一些朋友入门这篇就把这类课程里真正值钱的部分拆开讲清楚它到底覆盖了什么、哪些环节是新手最容易卡住的、MJ和SD各自该在什么场景下用、以及那些课程里不一定明说但实操中一定会踩的坑。不管你是完全没碰过AI绘画的小白还是已经能出图但总觉得不够稳定的半新手下面这些内容都能直接拿去用。1. 先搞清楚MJ和SD到底该学哪个很多人一上来就问“我该学MJ还是SD”这个问题本身就问错了。这两套工具不是替代关系而是互补关系课程里如果只讲其中一个那基本可以判断是不完整的。我见过太多人只学了MJ结果遇到需要精确控制构图、需要固定角色形象、需要批量生成统一风格素材的时候直接抓瞎也见过只钻SD的人花大量时间调参数结果发现有些创意探索类的需求用MJ几分钟就能出好几版方向。1.1 两者的核心差异不在“好不好用”而在“控制粒度”Midjourney的核心优势是审美下限高、出图快、风格化强。你给它一段描述它大概率能给你一张看起来“很对”的图光影、构图、质感都在线。但它的控制手段相对有限虽然现在有垫图、风格参考、角色参考这些功能但本质上你还是在一个“黑盒”里做微调。Stable Diffusion的核心优势是控制粒度极细、可本地部署、生态庞大。从ControlNet控制姿态和线稿到LoRA微调特定风格或角色再到各种采样器、CFG、步数的组合你能精确到像素级别去干预出图结果。代价是学习曲线陡环境配置、模型管理、显存优化这些事就够折腾一阵。课程里如果能把这两者的定位讲清楚让学员知道“什么需求用什么工具”那这个课程的地基就是稳的。我自己的习惯是创意探索期用MJ快速出方向确定方向后用SD做精确落地。比如做一个品牌视觉海报先用MJ跑十几版风格方向选定后再用SD配合ControlNet把构图和元素位置卡死。1.2 学习顺序建议先MJ建立审美直觉再SD建立控制能力如果你是零基础我强烈建议先学MJ。原因很简单MJ能让你在最短时间内建立“什么样的提示词能出什么样的图”的直觉。这种直觉是后续学SD的基础因为SD的提示词逻辑和MJ有大量相通之处只是SD对提示词的响应更“机械”需要你写得更精确。先学MJ的另一个好处是你能快速积累一批“好图”的参考知道什么样的构图、光影、色彩搭配是好看的。这个审美判断力在后面用SD的时候极其重要因为SD能出的图范围太广了没有审美判断力你根本不知道该怎么选。课程如果按照“MJ入门→提示词体系→SD基础→ControlNet进阶→LoRA训练→商业落地”这个顺序来编排那是比较合理的。如果一上来就讲SD的环境配置和模型原理小白很容易在第三步就放弃了。1.3 别被“无禁词免费”这类词带偏了方向搜索热词里出现了一些关于“无禁词免费”“无审核”之类的词这里必须说清楚这类需求本身就不是学AI绘画的正确切入点。真正有价值的AI绘画能力是你能稳定地、可控地、高效地出符合商业需求的图而不是去钻什么空子。课程的价值也在于教你正经的出图能力而不是教你绕开什么限制。把精力放在提示词工程、模型理解、工作流搭建上这些才是能真正提升你出图水平的东西。2. 提示词不是“咒语”是一套结构化描述系统新手对提示词最大的误解就是把它当成“咒语”——觉得只要找到那串神秘的词就能出好图。实际上提示词是一套结构化的描述系统你需要按照一定的逻辑去组织它。课程里如果能把提示词的结构讲透那学员的出图成功率至少能提升一倍。2.1 提示词的五个核心维度我自己的提示词框架基本围绕这五个维度来组织主体描述画面里有什么人物、物体、场景的核心特征。这部分要具体但不要堆砌。比如“一个穿红色连衣裙的女孩站在雨中”就比“一个女孩”好得多。风格定义你想要什么风格写实、插画、油画、赛博朋克、极简主义等。风格词往往决定了整张图的基调。构图与视角特写、全身、俯视、仰视、广角、长焦等。这部分很多人会忽略但它对出图结果的影响非常大。光影与氛围柔光、硬光、逆光、黄金时刻、冷色调、暖色调等。光影是决定画面质感的关键。质量修饰词高细节、8K、电影级、专业摄影等。这部分在MJ里作用明显在SD里需要配合具体的模型来用。这五个维度不是死板的顺序但你在写提示词的时候脑子里要有这个框架知道自己缺了哪一块。课程里如果能带着学员一个维度一个维度地练比直接给一堆“万能提示词”有用得多。2.2 权重和语序的实战影响在SD里提示词的权重是可以用括号和数字来控制的比如(red dress:1.3)表示红色连衣裙的权重是1.3倍。MJ虽然不直接支持这种语法但通过语序和重复也能实现类似效果——越靠前的词权重越高。我实测下来权重调整是解决“某个元素出不来”或“某个元素太抢眼”最直接的手段。比如你写“一个女孩在森林里”结果森林总是占满画面女孩很小那你就把女孩的权重调高或者把森林的权重调低。这个操作在SD里很精确在MJ里则需要通过调整语序和增减描述来实现。还有一个容易被忽略的点是负面提示词。SD里负面提示词的作用极其关键你不想出现的东西——多余的手指、模糊、低质量、水印——都可以通过负面提示词来压制。MJ现在也有--no参数来做类似的事。课程里如果负面提示词讲得少那学员出图的质量上限会受限。2.3 提示词网站和工具的正确用法热词里出现了“ai绘画提示词网站”这类网站确实有用但用法要对。它们最大的价值不是让你直接复制粘贴而是让你观察别人是怎么组织提示词的。你看多了就会发现好的提示词都有清晰的结构而不是一堆词的随机堆砌。我自己的习惯是看到一个喜欢的图先拆解它的提示词结构主体是什么、风格是什么、光影怎么描述的、有没有特殊的构图词。拆多了之后你自己写提示词的速度和质量都会明显提升。课程里如果能带着学员做这种拆解练习那比给一百个“万能提示词”都有价值。3. Stable Diffusion的模型体系别在下载模型上浪费太多时间SD新手最容易陷入的一个坑就是疯狂下载模型。看到什么模型都想下硬盘塞满了结果每个模型都没用明白。课程里如果能把模型体系讲清楚让学员知道什么场景用什么模型那能省下大量时间。3.1 大模型、LoRA、ControlNet的分工SD的模型体系可以粗略分为三层模型类型作用典型使用场景大模型Checkpoint决定整体风格和基础能力写实、二次元、插画等大方向LoRA微调特定风格、角色、概念固定角色形象、特定画风ControlNet控制构图、姿态、线稿、深度精确控制画面结构大模型是地基LoRA是在地基上盖的房子ControlNet是房子的框架结构。三者配合使用才能实现精确可控的出图。我自己的模型库常年保持在3-5个大模型、10个左右的LoRA、常用的ControlNet模型各一套。多了真的用不过来而且每个模型都需要时间去熟悉它的脾气。课程里如果鼓励学员疯狂下载模型那方向就偏了。3.2 模型下载渠道和选择标准热词里出现了“sd模型下载网站”“sd的模型下载”说明很多人卡在找模型这一步。主流的模型分享平台就那么几个但关键是选择标准不要只看预览图好不好看要看这个模型的训练数据偏向什么、适合什么场景、社区反馈如何。一个实用的判断方法是看这个模型在你不擅长的场景下表现如何。比如你主要做写实人像那就找一个在复杂光影和皮肤质感上表现好的模型你主要做二次元那就找线条干净、色彩鲜明的模型。课程里如果能给出这种选择标准比直接给一堆下载链接有用。3.3 模型混用的实战技巧大模型之间是可以混用的比如用A模型出基础图再用B模型做img2img细化。LoRA也可以叠加使用但要注意权重不能太高否则容易过拟合导致画面崩坏。我实测下来LoRA权重在0.6-0.8之间是比较安全的区间超过1.0很容易出现画面扭曲。多个LoRA叠加时总权重最好控制在1.5以内。这些数值不是绝对的但可以作为起点去调。4. ControlNet才是SD真正的杀手锏如果说SD和MJ最大的差异在哪我的答案是ControlNet。MJ能出很好看的图但你要它精确控制人物姿态、精确复现一个构图、精确把线稿变成成品图它做起来很吃力。ControlNet就是干这个的。4.1 常用ControlNet类型和适用场景ControlNet有很多种预处理方式新手不需要全学先掌握这几种就够覆盖大部分需求OpenPose控制人物姿态。你给一张参考图它能提取骨骼点让你的出图保持同样的姿势。做角色设计、动作参考时极其有用。Canny/Lineart控制线稿。你画一个草图它能保证出图的线条结构和你的草图一致。做产品设计、建筑草图渲染时常用。Depth控制深度信息。它能保证画面的空间关系一致适合做场景类的图。IP-Adapter控制风格参考。你给一张风格图它能让你的出图带上类似的风格。课程里如果能把这几种的用法讲透配合实际案例练几遍那学员的SD控制能力就基本够用了。4.2 ControlNet的权重和引导时机ControlNet不是权重越高越好。权重太高出图会完全被参考图绑死失去AI的创造力权重太低又起不到控制作用。我自己的经验是OpenPose权重0.8-1.0引导时机0.0-1.0Canny/Lineart权重0.6-0.9引导时机0.0-0.8Depth权重0.7-1.0引导时机0.0-1.0IP-Adapter权重0.5-0.8引导时机0.0-1.0引导时机Start/End的意思是在去噪过程的哪个阶段开始和结束应用ControlNet。比如End设为0.8意味着后20%的去噪步骤不再受ControlNet影响给AI留出细化空间。这个参数很多人不知道但调好了对出图质量影响很大。4.3 多ControlNet叠加的实战一个ControlNet不够用的时候可以叠加多个。比如做角色设计你可以同时用OpenPose控制姿态、用IP-Adapter控制风格、用Depth控制场景空间。三个一起上出图的可控性会大幅提升。但叠加也有代价显存占用增加、出图速度变慢、参数调优变复杂。我的建议是先从单个ControlNet练起把每个类型都摸熟了再尝试叠加。课程里如果一上来就讲多ControlNet叠加小白很容易懵。5. 从出图到落地商业场景中的实际应用学AI绘画最终是要用的。课程如果只教出图不教怎么把图用到实际场景里那价值就少了一半。我接触过的实际需求里AI绘画主要用在这么几个场景5.1 电商和产品视觉电商场景对AI绘画的需求很大比如产品场景图、模特换装图、广告banner等。这类需求的特点是要求精确、要求一致、要求可批量。MJ在这里的作用是快速出创意方向SD配合ControlNet和LoRA做精确落地。我做过一个案例给一款护肤品做场景图需要产品在不同氛围下的展示。用MJ跑了十几版氛围方向选定后用SD配合Depth和IP-Adapter把产品的位置和光影固定下来然后批量生成不同色调的版本。整个过程从创意到成品比传统拍摄快了不止一倍。5.2 插画和角色设计插画和角色设计是AI绘画的另一大应用场景。这里SD的LoRA训练就派上用场了——你可以训练一个特定角色的LoRA然后在不同场景下复用这个角色保持形象一致。训练LoRA需要准备一批同一角色的图一般20-30张就够。训练参数里学习率、训练步数、网络维度是关键。学习率太高容易过拟合太低又学不到东西。我自己的经验是学习率设在1e-4到5e-4之间步数在1000-2000步左右具体要看数据集的质量和数量。5.3 课程里不一定讲但实际很重要的细节有几个细节课程里不一定会讲但实际做项目的时候一定会遇到图片的版权和商用问题不同模型的使用协议不一样商用前一定要看清楚。MJ的付费订阅有商用权限SD的模型则要看具体模型的协议。出图的一致性同一个项目里多张图的风格、色调、角色形象要一致。这需要你在提示词、模型、LoRA、ControlNet上都做好固定。后期处理AI出的图不是终点很多时候还需要PS做后期。放大、修细节、调色、合成这些传统技能在AI时代依然有用。6. 学习路径和避坑指南最后说点实在的。AI绘画这个领域工具更新快、模型更新快、玩法更新快但底层的能力是不变的审美判断力、提示词工程能力、模型理解能力、工作流搭建能力。课程如果能帮你把这四个能力建立起来那它就是有价值的。6.1 一个可执行的学习路径如果你现在从零开始我建议按这个路径走第一周只学MJ每天出20张图重点练提示词的结构化写法。不要追求出好图追求的是理解“什么词对应什么效果”。第二周开始学SD的基础操作重点理解大模型、采样器、CFG、步数这几个核心参数的作用。每天用同一个提示词换不同参数出图观察差异。第三周学ControlNet从OpenPose和Canny开始每个类型练10张图。重点理解权重和引导时机的作用。第四周尝试一个完整的小项目比如给一个虚构产品做一套场景图。从创意到成品走一遍把遇到的问题记下来逐个解决。这个路径不追求快追求的是每一步都扎实。我见过太多人一个月学完所有工具结果出图还是靠碰运气。6.2 新手最容易踩的五个坑坑一疯狂下载模型。前面说过了模型不在多而在精。先把一个模型用透再考虑扩展。坑二迷信“万能提示词”。提示词是结构化的描述不是咒语。理解结构比背模板重要。坑三忽略负面提示词。负面提示词对出图质量的提升非常明显尤其是SD里。坑四参数调得太随意。CFG、步数、采样器这些参数是有逻辑的不是随便调的。每次只调一个参数观察变化。坑五不做后期。AI出的图直接拿去用质量往往不够。后期处理是必须的环节。6.3 关于课程选择的个人建议市面上AI绘画课程很多质量参差不齐。我自己的判断标准是看它有没有完整的项目实战环节。只讲工具操作的课程价值有限因为工具操作看文档就能学。真正有价值的是带着你做完整项目从需求分析到出图到后期到交付把整个流程走一遍。这个过程中遇到的坑、解决的问题、积累的经验才是课程真正值钱的地方。另外课程有没有持续更新也很重要。AI绘画领域变化太快半年前的模型和玩法可能现在已经不适用了。一个好的课程应该有持续的更新机制跟上工具和模型的迭代。我在实际带人入门的过程中发现进步最快的人往往不是学得最多的而是练得最狠的。每天出图、每天复盘、每天调整一个月下来水平就能有明显提升。工具和课程都是辅助真正的功夫在你自己手上。