说实话,刚开始接触 AI 绘画的时候,我也是踩了无数坑过来的。
记得第一次用 Stable Diffusion 本地部署,装好环境、下载模型,兴致勃勃地点了“生成”,结果等了一个小时,屏幕闪了一下,报错 CUDA Out of Memory。那一刻我真的想砸电脑。后来又听说 Midjourney 好用,开通会员后兴致勃勃去跑图,结果因为提示词里带了一些稍微擦边的词,账号直接被封,钱打了水漂。那种心情,真的比失恋还难受。
所以今天这篇内容,不是那种冷冰冰的技术文档,而是一个从“小白”一路摸爬滚打到“稳定出图”的实战总结。我会把那些让人头秃的技术细节,拆解得连你家初中生都能听懂;同时,我会重点讲讲如何合规、稳定、高效地使用这些工具,避免你像我当年一样,辛辛苦苦画的图没了,账号还封了。
不管你是想用来做自媒体配图、产品设计灵感,还是纯粹觉得好玩,这篇指南都能让你少走半年弯路。
一、 先搞懂:你手里拿的到底是什么武器?
在动手之前,我们得先弄清楚,现在市面上主流的 AI 绘画工具到底有哪些,它们有什么区别。很多人一上来就乱下载,结果装了一堆东西,根本不知道自己在用啥。
1. Midjourney:艺术家的最爱,但门槛也最高
Midjourney(简称 MJ)是目前公认“审美最好”的工具。它的出图质量非常高,尤其是光影、构图和质感,很多时候不需要太多后期处理,直接就能用。
它的优点:
- 成片率高:你随便输几个词,它给你出来的图可能比你自己想的还好看。
- 社区活跃:有大量的参考图、提示词可以借鉴。
- 无需显卡:全云端运行,你拿个办公本也能用。
它的缺点(也是封号重灾区):
- 收费制:每月订阅费不便宜(目前约 $10 起)。
- 审核极严:MJ 的审核机制非常敏感。什么不能画?裸体、暴力、知名人物(比如特朗普、玛丽莲·梦露)、甚至某些特定品牌的 Logo,都很容易触发审核。
- 操作界面奇葩:它没有网页后台,全在 Discord 里用。对于不习惯 Discord 的年轻人来说,入门有点晕。
新手建议: 如果你只是想快速出图,且不介意付费,MJ 是最省心的选择。但千万不要试图绕过它的审核,比如用生僻词、拼音、或者把敏感词拆开来写。MJ 的识别能力比你想象的要强得多,被封号真的是一瞬间的事。
2. Stable Diffusion(SD):可控性的王者,本地部署的自由
Stable Diffusion(简称 SD)是一个开源模型,这意味着你可以把它装在自己的电脑上跑。它是目前专业设计师、插画师最常用的工具。
它的优点:
- 完全免费:只要你电脑够硬,装多少次都没问题。
- 极其可控:你可以精确控制画面里人物的姿势、构图、光影、甚至只修改画面的某一个小部分(局部重绘)。
- 无审查:只要在你的本地电脑上,你想画什么就画什么,没有任何人能封你的号(除非你上传到第三方平台)。
- 生态丰富:网上有海量的模型(Checkpoint)、LoRA、ControlNet 插件,你可以定制出任何风格。
它的缺点:
- 硬件要求高:需要一张 NVIDIA 的独立显卡,显存至少 8GB,建议 12GB 以上。
- 学习曲线陡峭:参数多,插件多,界面复杂。刚开始你会面对一堆看不懂的按钮。
新手建议: 如果你有一台性能不错的电脑,或者你打算长期深入做图,SD 是你的终极归宿。它虽然难学,但学会了之后,你的创作自由度是 MJ 无法比拟的。
3. 国内平台:文心一格、通义万相、Liblib 等
现在国内有很多基于 SD 或自研模型的平台,比如百度的文心一格、阿里的通义万相,还有专门分享 SD 模型的 LiblibAI。
优点:
- 中文友好:支持中文输入,不用绞尽脑汁想英文提示词。
- 速度快:服务器在国内,生成速度通常比 MJ 快。
- 模型丰富:Liblib 上有很多国内作者训练的特定风格模型,比如国风、动漫、电商产品设计等。
缺点:
- 合规限制:所有国内平台都有严格的审核机制,敏感内容一律屏蔽。
- 版权模糊:部分平台的生成结果版权归属需要仔细看条款。
新手建议: 如果你不想折腾本地部署,只是想快速出点图发朋友圈或做简单的自媒体,国内平台是最稳妥的起点。
二、 本地部署 Stable Diffusion:小白避坑指南
既然我推荐 SD 作为进阶首选,那我们就得聊聊怎么把它装起来。别被“本地部署”四个字吓到,现在有很多一键安装包,连技术小白都能搞定。
1. 检查你的电脑配置
在动手之前,先看看你的电脑是不是那块“料”。
- 显卡(GPU):必须是 NVIDIA 的显卡。AMD 和 Intel 的显卡在 SD 环境下的兼容性非常差,踩坑概率极高。显存(VRAM)是硬指标:
- 4GB 显存:勉强能跑,但很难,基本别想高分辨率。
- 8GB 显存:入门门槛,可以跑主流模型,但需要优化参数。
- 12GB 显存:甜蜜点,推荐配置,流畅度很好。
- 24GB 显存(如 RTX 3090/4090):专业级,想怎么画就怎么画。
- 内存(RAM):建议 32GB 起步。SD 启动和加载模型时需要大量内存。
- 硬盘:至少留出 50GB 的空闲空间。一个 SD 安装包加上几个大模型(每个模型 2-7GB),空间消耗很快。
2. 选择靠谱的安装包
网上有很多一键安装包,我推荐几个经过大量用户验证的:
- 秋叶整合包(Akira):这是目前中文圈最火的一键包。界面友好,带有一个启动器,可以自动管理模型、插件和扩展。它把复杂的命令行操作都封装成了点击按钮。对于新手,首选这个。
- Stable Diffusion WebUI (Automatic1111):这是 SD 的官方 Web 界面,功能最全,插件最多,但需要手动安装 Python、Git 等环境,适合愿意折腾、想深入了解原理的人。
- ComfyUI:基于节点的工作流界面,看起来像连连看。虽然上手最难,但它是目前性能最好、自定义程度最高的界面。很多专业工作流大神都在用它。如果你以后想走职业路线,建议早点接触。
安装步骤简述(以秋叶包为例):
- 去 B 站或秋叶的 GitHub 仓库下载最新版本的整合包。
- 解压到一个路径中没有中文、没有空格的文件夹(比如
D:\SD,千万别放C:\用户\小明\下载\SD这种地方)。 - 双击启动器,它会自行检查环境、下载必要的依赖。
- 等待下载完成,点击“启动 WebUI”。
3. 第一个模型:从 Stable Diffusion XL 开始
现在有两个主流架构:SD 1.5 和 SDXL。
- SD 1.5:模型体积小(2-3GB),生成速度快,社区资源极其丰富,但出图分辨率较低,细节有时候会糊。
- SDXL:新一代架构,原生支持 1024x1024 高分辨率,人体结构、文字识别、光影质感都大幅提升。但模型大(6-7GB),对显卡要求更高。
建议: 如果你的显卡是 12GB 以上,直接上 SDXL。如果只有 8GB,先玩 SD 1.5 找找感觉,或者开启一些优化参数。
去 HuggingFace 或 Civitai(C 站)下载模型。新手推荐下载 Juggernaut XL 或 Realistic Vision 这类写实风格的基础大模型,兼容性最好。
三、 提示词(Prompt):与 AI 沟通的艺术
很多新手以为提示词就是“输入文字”,其实不是。提示词是一种编码语言,你需要用 AI 能听懂的方式,描述你脑海中的画面。
1. 提示词的基本结构
一个完整的提示词通常包含以下几个部分:
[主体] + [细节描述] + [环境/背景] + [艺术风格] + [光影/色彩] + [质量修饰词]
举个例子,你想画一个“在雨夜中行走的少女”:
- 主体:A girl walking (一个女孩在行走)
- 细节:Young, delicate face, wet hair, wearing a transparent raincoat, holding an umbrella (年轻,精致的脸,湿头发,穿透明雨衣,打伞)
- 环境:Rainy night, city street, neon lights reflection on puddles (雨夜,城市街道,霓虹灯在积水中倒影)
- 风格:Cinematic, realistic, 8k, highly detailed (电影感,写实,8k,高细节)
- 质量词:Masterpiece, best quality, ultra-detailed (杰作,最佳质量,超细节)
组合起来:
A girl walking, young, delicate face, wet hair, wearing a transparent raincoat, holding an umbrella, rainy night, city street, neon lights reflection on puddles, cinematic, realistic, 8k, highly detailed, masterpiece, best quality, ultra-detailed
2. 正向提示词 vs 负向提示词
SD 界面上有两个框:Positive Prompt(正向)和 Negative Prompt(负向)。
- 正向提示词:你想要什么,就写什么。
- 负向提示词:你不想要什么,就写什么。这非常重要!
通用的负向提示词模板(建议保存下来,每次都能用):
(worst quality, low quality:1.4), bad anatomy, bad proportions, deformed, distorted, disfigured, mutation, bad hands, missing limbs, blurry, watermark, text, signature, cropped, out of frame, ugly, extra limbs, duplicate
这段词的意思是:排除低质量、人体结构错误、肢体畸形、模糊、水印、文字、裁剪、丑陋、多余肢体等情况。加上它,你的图能干净很多。
3. 权重与语法
在提示词中,你可以通过括号和数字来调整重点。
(word:1.2):提高该词的重要性,权重为 1.2 倍。(word:0.8):降低该词的重要性,权重为 0.8 倍。[word1|word2]:随机二选一。
比如,你想让“雨伞”更突出,可以写 (umbrella:1.3)。如果你不确定是“红色”还是“蓝色”的雨衣,可以写 (red|blue) raincoat。
4. 英文还是中文?
虽然现在很多模型支持中文,但强烈建议养成用英文写提示词的习惯。
原因很简单:SD 的核心模型是在英文语料库上训练的。英文提示词的准确度、丰富度和兼容性远高于中文。很多专业的 LoRA(风格插件)也只接受英文提示词。你可以用翻译软件辅助,但最终的提示词最好是地道的英文。
四、 无封号、稳定出图的核心技巧
这是你最关心的部分。为什么很多人用 AI 绘画总是被封号?因为他们在违规的边缘疯狂试探,或者使用了来源不明的软件。
1. 避开“红线”:什么是绝对不能做的
无论是在 Midjourney 还是国内平台,以下类型的内容都是高危区:
- NSFW(成人内容):裸体、性暗示、暴露穿着。这是所有平台的底线。即使你在本地跑 SD,也不要上传到任何云服务平台尝试这些内容,一旦被举报,账号必封。
- 政治敏感人物:各国元首、政治领袖。
- 知名 IP 角色:米老鼠、哈利波特、漫威英雄等。商业用途尤其危险,平台会响应版权投诉。
- 暴力恐怖内容:血腥、自残、恐怖主义相关。
- 儿童色情:这是全球法律的红线,任何形式的涉及未成年人的不雅或暗示性内容,都会导致永久封禁甚至法律责任。
小技巧: 如果你在 MJ 上画图,发现某个词一直被屏蔽,不要尝试用同音字、乱码去绕过。这说明该词属于严重违规,换个思路重新构思画面,比硬刚更安全。
2. 本地部署的优势:彻底解决封号焦虑
选择 Stable Diffusion 本地部署,是你摆脱封号威胁的最根本解决方案。
- 数据在你手里:生成的图片保存在你的本地硬盘,没有任何人能看到,也没有人能审核。
- 模型随意下:C 站(Civitai)上有无数 LoRA 模型,其中有些是为了解决特定艺术风格或人物形象的,只要不涉及非法内容,你随便用。
- 无网络依赖:断网也能跑,不用担心服务器波动。
注意: 虽然本地部署没有封号风险,但传播风险依然存在。如果你在社交媒体上公开发布由 AI 生成的敏感内容,依然可能面临平台处罚。所以,本地跑图图个爽,公开分享还是要谨慎。
3. 提高出图效率:避免“抽卡”心态
很多新手抱怨“AI 不听话”、“出图太随机”。其实,高效出图是有方法论的。
技巧一:固定种子(Seed)
Seed 是生成图片的“随机数种子”。相同的提示词 + 相同的 Seed,理论上会生成完全相同的图片。
- 怎么用? 在 SD 界面底部,你会看到一个种子号。点击“复制”或手动输入一个数字(比如
12345)。 - 实战场景: 你生成了一张很满意的图,但人物表情有一点点不对,或者衣服颜色差了一点。这时候,不要改提示词,保持 Seed 不变,只微调提示词中的某个词,或者使用“局部重绘”功能。这样能保证画面主体不变,只修改细节。
技巧二:学会使用 ControlNet
这是 SD 区别于 MJ 的最大杀手锏。ControlNet 可以让你精确控制画面的构图、姿势、边缘。
- OpenPose(姿态控制):你可以找一张真人摆姿势的照片,导入 ControlNet,让 AI 生成的人物保持一模一样的动作。这对于想画特定动作角色的用户来说,简直是神器。
- Canny/Lineart(线稿控制):你可以自己画一个简单的草图,或者把一张照片的边缘提取出来,让 AI 根据你的线稿填充细节。
- Depth(深度控制):控制画面的前后景深,保证人物不会和背景融在一起。
操作很简单: 在 SD 界面找到 ControlNet 扩展,勾选“Enable”,然后上传你的参考图,选择对应的模型(如 control_openpose),调整权重(通常 0.8-1.0)。
技巧三:迭代优化,而不是重来
不要指望第一次生成就能出神图。高效的工作流是:
- 粗选:生成 4-16 张图,快速筛选出构图、色调满意的。
- 放大:对满意的图使用“Hires. fix”(高清修复)或“Upscale”功能,将分辨率提高,增加细节。
- 精修:使用“Vary (Region)”或“Inpaint”(重绘)功能,修改局部错误(比如修手指、改表情)。
- 后期:导出图片,用 PS 或 Lightroom 进行最后的调色和修饰。
4. 硬件稳定性的维护
本地部署虽然自由,但硬件不稳定也会导致“出图失败”或“报错”。
- 驱动更新:保持 NVIDIA 显卡驱动是最新版,但不要太新(偶尔会有兼容性问题),稳定版(Studio Driver)更适合 AI 绘画。
- 显存优化:如果显存不足,可以在启动参数里添加
--lowvram或--xformers(如果是较老版本)来节省显存。秋叶包通常有“优化”选项,一键开启即可。 - 模型清理:定期清理不用的模型。SD 的模型文件很大,把没用的删掉,能提升加载速度。
五、 从“能画”到“画得好”:进阶之路
当你已经能稳定出图,不再担心封号,开始追求质量时,你就需要进入进阶阶段了。
1. 训练你自己的 LoRA
LoRA 是一种轻量级的模型微调技术。你可以上传几张特定风格或特定人物的图片,训练出一个专属的 LoRA 模型。
应用场景:
- 自家宠物:训练一个宠物的 LoRA,以后想画它穿什么衣服都行。
- 个人 IP 形象:训练一个固定画风或虚拟形象,确保所有输出保持一致。
- 产品原型:电商卖家可以训练自己产品的 LoRA,快速生成各种场景下的产品图,无需实拍。
工具推荐:
- kohya_ss:最流行的 LoRA 训练脚本,功能强大但界面稍显复杂。
- Liblib 在线训练:国内平台,无需本地高配电脑,云端训练,适合小白。
2. 深入学习摄影与美学
AI 绘画的本质是“基于大量数据的重组”。你的审美上限,决定了 AI 出图的上限。
- 学习光影:观察经典油画和摄影作品中的光线如何照射在物体上。尝试在提示词中加入
golden hour(黄金时刻)、volumetric lighting(体积光)、chiaroscuro(明暗对照法)等词。 - 学习构图:三分法、黄金螺旋、对称构图。在提示词中描述
rule of thirds、`
