多模态大模型:让 AI 看懂图与世界

过去两年的大模型突破,不止于”会聊天”。CLIP 让模型理解图文关系,GPT-4V、LLaVA 让模型能看图说话,Stable Diffusion、DALL·E 让文字变成图像,Sora、可灵又把生成推进到视频。这些能力背后有一条共同主线:把不同模态(文本、图像、视频、音频)映射到可统一处理的表示空间,再让一个模型跨模态理解与生成。本文梳理这条技术脉络的关键节点与挑战。

什么是多模态

“模态”指信息的载体形式:文本、图像、音频、视频、点云等。多模态模型的目标,是让 AI 能同时理解多种模态,并在它们之间转换(文生图、图生文、文生视频)。难点在于:不同模态的原始数据形态天差地别——文本是离散 token,图像是像素网格——必须先把它们”对齐”到同一个语义空间,模型才能跨模态推理。

CLIP:图文对比学习

CLIP(Radford 等人 2021)是多模态领域的奠基工作。它的训练任务极简:给定一个.batch 的 (图片, 文本) 对(来自互联网约 4 亿对),训练两个编码器——图像编码器(ViT/CNN)和文本编码器(Transformer)——让”正确配对”的图文向量相似,错误配对的疏远。这本质是一个对比学习(contrastive learning)的二分类排序问题。

损失直觉(InfoNCE):
  对 N 个配对,构造 N×N 的相似度矩阵
  对角线(正确配对)相似度尽量高
  非对角线(错误配对)相似度尽量低

CLIP 的威力在零样本迁移:训练好后不用再训,直接拿自然语言当分类器(“a photo of a cat”)就能在新任务上取得不错效果,因为它学会了”语言描述”与”视觉概念”的对应。后续几乎所有图文模型(包括 DALL·E 2、Stable Diffusion 的条件机制)都建立在 CLIP 的联合嵌入之上。

视觉语言模型(VLM):让模型看图说话

VLM(Vision-Language Model)要解决的问题是:给模型一张图,它能回答关于图的问题、描述内容、做推理。主流思路是”视觉编码器 + 投影层 + 大语言模型”三段式:

  1. 用预训练视觉编码器(如 CLIP 的 ViT)把图片变成一串视觉 token;
  2. 用一个可学习的投影层(projector)把视觉 token 对齐到 LLM 的词嵌入空间;
  3. 把对齐后的视觉 token 拼到文本 token 前,交给 LLM 自回归生成回答。

LLaVA(Liu 等人 2023)是这一范式的代表:它用 CLIP ViT 作视觉编码器、Llama 作语言模型,并巧妙地用 GPT-4 生成多模态指令数据来训练”视觉指令跟随”能力。Qwen-VL、GPT-4V 等也走类似路线——GPT-4 技术报告明确其可接受图像与文本输入并输出文本。

VLM 推理流程(以 LLaVA 式为例):
  图像 → ViT → 视觉 token 序列
  视觉 token ──projector──→ 对齐到 LLM 嵌入空间
  [视觉 token] + [用户问题 token] → LLM → 文本回答

关键在工程细节:投影层怎么训、视觉 token 数量怎么压(避免吃掉上下文)、高分辨率图像怎么切片。这些决定了 VLM 能否既”看得清”又”答得对”。

文生图:扩散模型

要让”文字变图像”,主流方案是扩散模型(Diffusion Model)。Stable Diffusion 背后的潜在扩散模型(Latent Diffusion,Rombach 等人 2022)做了一件关键优化:不在像素空间、而在自编码器压缩后的潜空间里做扩散,大幅降低算力;并用**交叉注意力(cross-attention)**把文本条件注入去噪过程,实现”按描述生成”。

DALL·E 2(Ramesh 等人 2022)则采用两阶段:先用”先验(prior)“由文本生成 CLIP 图像嵌入,再用”解码器(decoder)“由该嵌入生成图像。二者都证明:借助 CLIP 的联合嵌入空间,文本能有效地”指挥”图像生成。

文生图推理(简化):
  随机噪声 z_T ──去噪步──> z_0(潜空间图像)
  每步去噪都 conditioning on 文本嵌入(cross-attention)
  z_0 ──解码器(VAE decoder)──> 像素图像

文生视频:现状与挑战

文生视频把”时序”加入生成:模型要在每一帧保持一致的角色、场景与运动,难度远高于单图。Sora(OpenAI)展示了用扩散 Transformer 生成长达一分钟、时空一致的视频;国内的可灵等模型也在时长、分辨率和运动质量上快速跟进。当前瓶颈在于:长时序一致性、物理合理性(物体运动符合常识)、以及高昂的训练与推理成本。

模态对齐的挑战

多模态远未完美,核心难题集中在”对齐”:

  • 语义鸿沟:同一概念在不同模态的分布不一致,简单拼接易”各说各话”;
  • 幻觉:VLM 可能”看到”图中不存在的物体,根因是语言模型先验压过了视觉证据;
  • 数据稀缺:高质量”图文+推理”配对数据远比纯文本少,训练易偏科;
  • 细粒度:识别整体容易,定位”图中第三只猫的尾巴”仍困难;
  • 评测难:多模态生成的主观性强,缺乏像文本困惑度那样的统一指标。

小结

  • 多模态=让模型跨文本/图像/视频等模态理解并转换,前提是模态对齐。
  • CLIP 用 4 亿图文对做对比学习,学会”语言-视觉”联合嵌入,支撑零样本与后续生成。
  • VLM 通用架构:视觉编码器 + 投影层 + LLM,LLaVA 用 GPT-4 造指令数据确立范式。
  • 文生图靠扩散模型;潜在扩散在潜空间去噪并用交叉注意力注入文本,Stable Diffusion 是其代表。
  • DALL·E 2 用”先验+解码器”两段式在 CLIP 嵌入空间生成图像。
  • 文生视频(Sora/可灵)受时序一致与成本制约;模态对齐、幻觉与细粒度仍是开放难题。

参考来源

本文累计阅读