多模态大模型:图文音融合
多模态大模型(MLLM)让语言模型同时理解图像、音频等输入。常见做法是把图像等用预训练编码器转成 token 序列,与文本 token 拼接进同一 Transformer,从而用纯语言建模方式处理多模态。
视觉编码器对齐
以视觉语言模型为例:用 ViT 把图像切成块编码为视觉 token,经投影层映射到语言模型词嵌入空间,再与文本拼接。模型在图文对上训练对齐,学会「看图说话」。
# 概念:图像编码后与文本 token 拼接(示意)
img_tokens = vision_encoder(image) # (1, n_patches, d)
img_tokens = projector(img_tokens) # 映射到 LLM 空间
inputs = torch.cat([img_tokens, text_tokens], dim=1)
out = llm(inputs)
模态与生成
除图像外,音频可用 Whisper 类编码器、视频用帧序列接入。生成侧可接扩散模型产出图像(如 GPT-4o、Gemini 原生多模态)。统一空间让跨模态推理成为可能。
注意点
对齐质量依赖图文/音文配对数据;高分辨率图像需切图或更高分辨率编码器;推理显存随视觉 token 数增长。训练常以冻结视觉编码器、只训投影与 LLM 起步。
小结
多模态大模型用预训练编码器把图像、音频转为统一空间的 token,与文本拼接进同一语言模型,以对齐训练实现跨模态理解与生成。
参考与延伸阅读
- “Learning Transferable Visual Models From Natural Language Supervision”(CLIP, Radford 等, 2021)。已核验。https://arxiv.org/abs/2103.00020
- Hugging Face Transformers 多模态文档首页。已核验。https://huggingface.co/docs/transformers/
本文累计阅读 — 次