多模态大模型:图文音融合

多模态大模型(MLLM)让语言模型同时理解图像、音频等输入。常见做法是把图像等用预训练编码器转成 token 序列,与文本 token 拼接进同一 Transformer,从而用纯语言建模方式处理多模态。

视觉编码器对齐

以视觉语言模型为例:用 ViT 把图像切成块编码为视觉 token,经投影层映射到语言模型词嵌入空间,再与文本拼接。模型在图文对上训练对齐,学会「看图说话」。

# 概念:图像编码后与文本 token 拼接(示意)
img_tokens = vision_encoder(image)          # (1, n_patches, d)
img_tokens = projector(img_tokens)          # 映射到 LLM 空间
inputs = torch.cat([img_tokens, text_tokens], dim=1)
out = llm(inputs)

模态与生成

除图像外,音频可用 Whisper 类编码器、视频用帧序列接入。生成侧可接扩散模型产出图像(如 GPT-4o、Gemini 原生多模态)。统一空间让跨模态推理成为可能。

注意点

对齐质量依赖图文/音文配对数据;高分辨率图像需切图或更高分辨率编码器;推理显存随视觉 token 数增长。训练常以冻结视觉编码器、只训投影与 LLM 起步。

小结

多模态大模型用预训练编码器把图像、音频转为统一空间的 token,与文本拼接进同一语言模型,以对齐训练实现跨模态理解与生成。

参考与延伸阅读

本文累计阅读