AI 绘画与图像生成实操

AI 绘画已经从小众玩具变成设计、营销、内容创作的基础工具。本文先建立”扩散模型”的直觉,再分别讲 Midjourney、Stable Diffusion(含 ControlNet)与国内工具即梦的实操,最后说清版权边界。

一、扩散模型:从噪声里”雕刻”图像

主流文生图模型大多基于扩散(Diffusion)思路,直觉可以这样理解:

  • 训练时,往清晰图片逐步加噪,直到变成纯噪声;模型学习”每一步去噪该怎么做”。
  • 生成时,从一张随机噪声出发,模型一步步预测并去除噪声,最终”显影”出与提示词匹配的图像。

这也解释了两个常见现象:同样的提示词每次结果不同(起点噪声随机);加”负面提示词”(negative prompt)就是告诉模型”别往某个方向去噪”。

关键认知:模型不是在”拼贴素材库”,而是在高维空间里按语义约束逐步生成像素,因此风格、构图、细节都可由提示词与参数引导。

二、Midjourney:风格与质感优先

Midjourney 以”美学质量高、开箱即用”著称,主要通过网页与 Discord 的 /imagine 命令使用。

提示词结构

一个高效的 MJ 提示词通常包含:主体 + 环境 + 风格 + 镜头/光线 + 参数。

a lonely lighthouse on a cliff at dusk, cinematic lighting,
rough sea, photorealistic, 35mm lens --ar 16:9 --v 8 --stylize 250

常用参数

参数作用
--ar画面比例,如 16:9、9:16
--v模型版本
--stylize风格化强度(高更艺术、低更贴近描述)
--chaos多样性(高更随机)
图片 URL 作参考控制构图/风格(Image Prompt、Style Reference)

MJ 当前版本持续迭代(官方文档显示为 V8.x),新版本对个性化与美学有增强。建议用英文提示词,质量更稳定。

三、Stable Diffusion:可控与本地部署

Stable Diffusion 是开源生态的代表,最大优势是”可控 + 可本地跑”。

本地部署思路

借助 AUTOMATIC1111 的 WebUI 或节点式 ComfyUI,在带显卡的机器上跑:

  • 下载基础模型(checkpoint)与 LoRA(风格/角色微调)。
  • 用 WebUI 的 txt2img / img2img 出图。
  • 接 ControlNet 做精确控制。
# 以 AUTOMATIC1111 WebUI 为例(需先装 Python 与 Git)
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui
cd stable-diffusion-webui
# Windows 下运行 webui-user.bat;Linux 下运行 ./webui.sh

ControlNet:把”姿势/构图”钉死

ControlNet 是一类控制器,能让生成严格遵循你给的条件图,例如:

  • 用一张人体骨架图,固定人物姿势。
  • 用线稿/深度图,控制画面结构。
  • 用边缘图,做”按轮廓上色”。

这让 SD 从”随机出图”变成”按稿生产”,特别适合产品概念图、角色一致性等严肃场景。

四、国内工具:即梦与可灵

  • 即梦 AI(字节/剪映):网页即可用,支持文/图生图与生视频,中文提示词理解好,提供智能画布、局部重绘、扩图等编辑能力,对国内用户门槛低。
  • 可灵(快手):以图生视频见长,但其图像模型”可图”也支持复杂语义理解与风格转绘,可作为出图补充。
即梦提示词示例:电影质感,盔甲勇士在火光下奔赴战场,
黄昏逆光,细节丰富,超写实插画风格

五、提示词结构通用模板

无论哪种工具,提示词都可按”主体 / 风格 / 光线 / 镜头 / 参数”组织:

  1. 主体:谁、在什么动作、什么情绪。
  2. 风格:写实、插画、赛博朋克、水彩……
  3. 光线:自然光、霓虹、逆光、柔光。
  4. 镜头:广角、特写、35mm、俯拍。
  5. 参数:比例、版本、负面词。

负面提示词(Negative Prompt)同样重要:列出”模糊、多余手指、水印、畸形”等要避免的内容。

六、版权与商用注意事项

  • 平台条款差异大:订阅用户的商用权限通常更宽,但不同套餐不同,务必读当前版服务条款。
  • 真实人物/品牌/艺术品:避免生成可识别的真实人物或受版权保护的角色用于商用。
  • 可溯源工作流:保留提示词、参考图与生成记录,便于合规与复盘。
  • 国内合规:留意《生成式人工智能服务管理暂行办法》等对内容标识的要求。

小结

  • 扩散模型本质是”从噪声逐步去噪”,所以结果随机但可被提示词引导。
  • Midjourney 胜在美学与易用,适合追求质感的出图。
  • Stable Diffusion + ControlNet 胜在可控与本地部署,适合生产级需求。
  • 即梦等国内工具中文友好、门槛低,适合快速起步。
  • 提示词按”主体/风格/光线/镜头/参数”组织,并善用负面提示词。
  • 商用前务必核对各平台条款与内容合规要求,保留生成记录。

参考来源

本文累计阅读