最后更新:2026-07-27 · 一句话结论: 稳定出图靠结构化提示词——主体→风格→光线→构图→细节五层写清楚,配合负面提示词排除瑕疵,CFG 7–12、Steps 20–40、固定 Seed 可复现,进阶用 ControlNet 和图生图精确控图。
理解提示词的基本结构
| 层级 | 作用 | 示例 |
|---|---|---|
| 主体 | 决定画面内容 | 一只橘猫坐在窗台上 |
| 风格 | 决定艺术表现 | 水彩画风 / 赛博朋克 |
| 光线 | 影响氛围 | 金色夕阳 / 冷调蓝光 |
| 构图 | 控制视角 | 近景特写 / 俯视角度 |
| 细节补充 | 材质、背景等精细控制 | 材质、背景元素 |
AI 绘画提示词的核心结构可以概括为五层:主体 → 风格 → 光线 → 构图 → 细节补充。其中主体决定画面内容(如「一只橘猫坐在窗台上」),风格决定艺术表现(如「水彩画风」「赛博朋克」),光线影响氛围(如「金色夕阳」「冷调蓝光」),构图控制视角(如「近景特写」「俯视角度」),细节补充则包括材质、背景元素等精细控制。理解这五层后,你就能写出结构清晰的提示词。
常见风格关键词与组合
写实类常用:photorealistic, 8K, ultra-detailed, studio lighting。插画类:flat illustration, vector style, minimalist。赛博朋克:cyberpunk, neon glow, futuristic city。水彩:watercolor, soft edges, paper texture。不同工具对风格关键词的响应有差异,Midjourney 对艺术家风格引用效果更好,而 Stable Diffusion 更依赖 LoRA 模型和权重控制。建议将常用组合保存为模板方便复用。
负面提示词的作用
负面提示词(Negative Prompt)用于排除不想要的元素。常见的通用负面词包括:blurry, low quality, deformed, extra fingers, watermark, text。对于人物生成,建议加入 bad anatomy, disfigured face, asymmetrical eyes 等控制词。负面提示词的优先级高于正面描述,合理使用可以大幅提高出图质量。
参数调节与稳定输出
CFG Scale(提示词权重)通常设在 7~12 之间,值越高画面越贴合描述但可能过度饱和。Steps(采样步数)推荐 20~40 步,过高会增加生成时间但画质提升有限。Seed(随机种子)固定后可以复现相同构图,适合批量生成系列作品。分辨率建议先用 512×512 出草图,确认构图后再提高到 1024 或使用 Upscale 放大。
进阶技巧:ControlNet 与图生图
ControlNet 可以通过线稿、深度图、姿态检测等辅助输入精确控制画面构图。例如上传一张人物姿态图,AI 会按照该姿态生成全新的画面。图生图(img2img)则是基于参考图做风格转换或细节调整,配合去噪强度参数可控制与原图的相似度。这两种进阶用法可以大幅提升创作效率和一致性。
常见问题
AI 绘画提示词的基本结构是什么?
五层:主体→风格→光线→构图→细节补充。理解这五层就能写出结构清晰的提示词。
负面提示词有什么用?
用于排除不想要的元素(如 blurry、low quality、deformed、extra fingers、watermark、text);人物生成可加 bad anatomy 等。它优先级高于正面描述,能大幅提升出图质量。
参数怎么设才稳定?
CFG Scale 常设 7–12(越高越贴合但可能过饱和),Steps 20–40,固定 Seed 可复现同一构图;先用 512×512 出草图,确认后再放大到 1024 或用 Upscale。
Midjourney 和 Stable Diffusion 写法一样吗?
不完全一样。Midjourney 对艺术家风格引用响应更好,Stable Diffusion 更依赖 LoRA 模型和权重控制;建议把常用组合存成模板复用。