生成式 AI 全景图:从扩散模型到多模态

ChatGPT 写文章、Midjourney 画图、Suno 作曲——生成式 AI 正在重塑内容生产。但它到底”生成”了什么、靠什么生成、有哪些边界?这篇给你一张全景图。

生成式 vs 判别式:目标是”造”还是”判”

  • 判别式模型(Discriminative)学的是 P(标签 | 输入),回答”这是猫还是狗""这句话是正面还是负面”;
  • 生成式模型(Generative)学的是数据本身的分布 P(数据),能”无中生有”地采样出新样本。

一句话:判别式做判断,生成式做创造。两者并非对立——现代生成系统常把判别模型(如 CLIP)当”评委”来引导生成,让结果更贴合描述。

自回归生成:一个词一个词”接龙”

自回归(Autoregressive, AR)是最主流的文本生成方式。模型在海量文本上学”给定前文,预测下一个词”:

P(x) = P(x₁) · P(x₂|x₁) · ... · P(xₜ|x₁...xₜ₋₁)

GPT 系列就是典型:先由用户输入(prompt)起头,模型反复采样下一个 token,拼成完整回答。温度(temperature)、top-p 等参数控制”随机度”与”多样性”。

输入:"今天天气真好,我们"
模型逐词续写:去 → 公 → 园 → 散 → 步
输出:"今天天气真好,我们去公园散步"

扩散模型:从噪声里”洗”出图像

扩散模型(Diffusion Model)是当前图像生成的主力(Stable Diffusion、DALL·E 3 等的底层)。直觉分两步:

  1. 前向加噪:逐步往真实图片里掺高斯噪声,直到变成纯噪声;
  2. 反向去噪:训练一个神经网络学”把噪声一步步去掉”,生成时从随机噪声出发,迭代去噪得到清晰图像。

Rombach 等人在 2022 年《High-Resolution Image Synthesis with Latent Diffusion Models》(arXiv:2112.10752)中提出”潜空间扩散”,把扩散放到压缩后的潜空间,大幅降低算力,这正是 Stable Diffusion 的核心。

随机噪声 ──去噪 step1──> 模糊轮廓 ──...──> 清晰图像
            (U-Net 预测每步该去掉的噪声)

GAN:开山鼻祖与其局限

生成对抗网络(GAN, Goodfellow et al. 2014, arXiv:1406.2661)用”生成器 vs 判别器”的对抗训练:生成器努力造假骗过判别器,判别器努力识破。两者博弈,直至生成器以假乱真。

GAN 贡献巨大,但有明显局限:

  • 训练不稳定,易模式崩溃(mode collapse),只生成少数几种样本;
  • 难以用文字精细控制生成内容;
  • 不像扩散模型那样天然支持”一步步可控生成”。

这也是为何 Stable Diffusion 之后,扩散模型在图像领域逐渐压过 GAN。

多模态生成概览

模态代表技术代表产品
文本自回归(GPT 类)ChatGPT, Claude, 文心一言
图像扩散模型 / GANStable Diffusion, DALL·E, Midjourney
音频自回归 + 扩散Stable Audio, Suno
视频扩散 + 时序建模Sora, 可灵, Runway

趋势是”统一架构”:用同一个 Transformer 同时理解并生成多种模态(如 GPT-4o、Gemini)。

开源 vs 闭源格局

  • 闭源阵营:OpenAI、Anthropic、Google 等提供 API/产品,模型权重不公开,强在整体体验与对齐;
  • 开源/开放权重阵营:Stable Diffusion(Stability AI)、LLaMA(Meta)、Mistral 等公开权重,社区可本地部署、微调。

选择建议:追求快速落地用闭源 API;追求可控、私有、可定制用开源权重。Stability AI(stability.ai)是开源图像生成的重要推动者;OpenAI(openai.com)则代表了闭源前沿。

怎么选:自回归还是扩散

  • 要生成”连贯文字/代码”,自回归(逐 token)目前最稳,因为语言天然是序列;
  • 要生成”高质量图像”,扩散模型更占优,可控且细节好;
  • 视频则是两者的结合:用扩散去噪,同时用时序模块保证帧间连贯。

给新手的落地建议

先用成熟产品/API 跑通需求(如用 ChatGPT 写文案、Stable Diffusion 出图),再决定要不要本地部署开源模型。开源模型对显存有要求(如 7B 级别模型约需 8GB 显存),闭源 API 则按调用量计费。不要一上来就训练,成本和门槛都很高。

当前能力边界

生成式 AI 很强,但要清楚边界:

  • 擅长”像”:在统计分布上模仿训练数据,不等于理解事实;
  • 会编造(幻觉):文本模型可能给出流畅但错误的内容;
  • 视频/3D 仍不成熟,长程一致性与物理合理性常出错;
  • 版权、隐私、深度伪造是真实风险,落地需护栏。

小结

  • 判别式做判断,生成式学数据分布、能创造新样本。
  • 文本靠自回归”逐词接龙”;图像靠扩散模型”从噪声去噪”;GAN 是开山祖但有训练不稳定等局限。
  • 多模态正走向统一 Transformer 架构;开源(Stable Diffusion/LLaMA)与闭源(OpenAI)各有适用场景。
  • 生成式 AI 有幻觉与版权等边界,使用时需评估与护栏。

参考来源

  1. Rombach, R., Blattmann, A., Lorenz, D., et al. High-Resolution Image Synthesis with Latent Diffusion Models. arXiv:2112.10752, 2022. https://arxiv.org/abs/2112.10752
  2. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. Generative Adversarial Networks. arXiv:1406.2661, 2014. https://arxiv.org/abs/1406.2661
  3. Stability AI 官方网站. https://stability.ai
  4. OpenAI 官方网站. https://openai.com
  5. Vaswani, A., et al. Attention Is All You Need. arXiv:1706.03762, 2017. https://arxiv.org/abs/1706.03762
本文累计阅读