AI 绘画与图像生成实操
AI 绘画已经从小众玩具变成设计、营销、内容创作的基础工具。本文先建立”扩散模型”的直觉,再分别讲 Midjourney、Stable Diffusion(含 ControlNet)与国内工具即梦的实操,最后说清版权边界。
一、扩散模型:从噪声里”雕刻”图像
主流文生图模型大多基于扩散(Diffusion)思路,直觉可以这样理解:
- 训练时,往清晰图片逐步加噪,直到变成纯噪声;模型学习”每一步去噪该怎么做”。
- 生成时,从一张随机噪声出发,模型一步步预测并去除噪声,最终”显影”出与提示词匹配的图像。
这也解释了两个常见现象:同样的提示词每次结果不同(起点噪声随机);加”负面提示词”(negative prompt)就是告诉模型”别往某个方向去噪”。
关键认知:模型不是在”拼贴素材库”,而是在高维空间里按语义约束逐步生成像素,因此风格、构图、细节都可由提示词与参数引导。
二、Midjourney:风格与质感优先
Midjourney 以”美学质量高、开箱即用”著称,主要通过网页与 Discord 的 /imagine 命令使用。
提示词结构
一个高效的 MJ 提示词通常包含:主体 + 环境 + 风格 + 镜头/光线 + 参数。
a lonely lighthouse on a cliff at dusk, cinematic lighting,
rough sea, photorealistic, 35mm lens --ar 16:9 --v 8 --stylize 250
常用参数
| 参数 | 作用 |
|---|---|
--ar | 画面比例,如 16:9、9:16 |
--v | 模型版本 |
--stylize | 风格化强度(高更艺术、低更贴近描述) |
--chaos | 多样性(高更随机) |
| 图片 URL 作参考 | 控制构图/风格(Image Prompt、Style Reference) |
MJ 当前版本持续迭代(官方文档显示为 V8.x),新版本对个性化与美学有增强。建议用英文提示词,质量更稳定。
三、Stable Diffusion:可控与本地部署
Stable Diffusion 是开源生态的代表,最大优势是”可控 + 可本地跑”。
本地部署思路
借助 AUTOMATIC1111 的 WebUI 或节点式 ComfyUI,在带显卡的机器上跑:
- 下载基础模型(checkpoint)与 LoRA(风格/角色微调)。
- 用 WebUI 的 txt2img / img2img 出图。
- 接 ControlNet 做精确控制。
# 以 AUTOMATIC1111 WebUI 为例(需先装 Python 与 Git)
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui
cd stable-diffusion-webui
# Windows 下运行 webui-user.bat;Linux 下运行 ./webui.sh
ControlNet:把”姿势/构图”钉死
ControlNet 是一类控制器,能让生成严格遵循你给的条件图,例如:
- 用一张人体骨架图,固定人物姿势。
- 用线稿/深度图,控制画面结构。
- 用边缘图,做”按轮廓上色”。
这让 SD 从”随机出图”变成”按稿生产”,特别适合产品概念图、角色一致性等严肃场景。
四、国内工具:即梦与可灵
- 即梦 AI(字节/剪映):网页即可用,支持文/图生图与生视频,中文提示词理解好,提供智能画布、局部重绘、扩图等编辑能力,对国内用户门槛低。
- 可灵(快手):以图生视频见长,但其图像模型”可图”也支持复杂语义理解与风格转绘,可作为出图补充。
即梦提示词示例:电影质感,盔甲勇士在火光下奔赴战场,
黄昏逆光,细节丰富,超写实插画风格
五、提示词结构通用模板
无论哪种工具,提示词都可按”主体 / 风格 / 光线 / 镜头 / 参数”组织:
- 主体:谁、在什么动作、什么情绪。
- 风格:写实、插画、赛博朋克、水彩……
- 光线:自然光、霓虹、逆光、柔光。
- 镜头:广角、特写、35mm、俯拍。
- 参数:比例、版本、负面词。
负面提示词(Negative Prompt)同样重要:列出”模糊、多余手指、水印、畸形”等要避免的内容。
六、版权与商用注意事项
- 平台条款差异大:订阅用户的商用权限通常更宽,但不同套餐不同,务必读当前版服务条款。
- 真实人物/品牌/艺术品:避免生成可识别的真实人物或受版权保护的角色用于商用。
- 可溯源工作流:保留提示词、参考图与生成记录,便于合规与复盘。
- 国内合规:留意《生成式人工智能服务管理暂行办法》等对内容标识的要求。
小结
- 扩散模型本质是”从噪声逐步去噪”,所以结果随机但可被提示词引导。
- Midjourney 胜在美学与易用,适合追求质感的出图。
- Stable Diffusion + ControlNet 胜在可控与本地部署,适合生产级需求。
- 即梦等国内工具中文友好、门槛低,适合快速起步。
- 提示词按”主体/风格/光线/镜头/参数”组织,并善用负面提示词。
- 商用前务必核对各平台条款与内容合规要求,保留生成记录。
参考来源
- Midjourney 官方文档 https://docs.midjourney.com
- AUTOMATIC1111 Stable Diffusion WebUI 官方仓库 https://github.com/AUTOMATIC1111/stable-diffusion-webui
- 即梦 AI 官方网站 https://jimeng.jianying.com/
- 可灵 AI 官方网站 https://kling.ai/
本文累计阅读 — 次