多模态提示:图文混合地驱动大模型

过去几年,大模型的交互方式从「纯文字」走向「多模态」。你不再只能打字,也可以直接把一张截图、一份 PDF、一段音频或一段视频丢给模型,让它边看边回答。这种在同一轮对话里混用文字、图像、音频、文档、表格等输入的提示方式,就是多模态提示(Multimodal Prompting)。它没有改变提示工程的核心逻辑——说清目标、给足上下文、规定输出格式——只是输入的组织方式更丰富了。

什么是多模态提示

传统提示只有文本。多模态提示把多种模态塞进同一个请求:你上传一张图,再用文字告诉模型你想让它做什么;你给一段录音,再附上一句「把这段会议录音转写成要点」;你丢进一份带表格的 PDF,再问「第三页的合计是多少」。模型会把不同模态作为输入一并理解,而不是先把图转成文字再处理。

需要强调的是,多模态提示「暂无单一权威论文」作为统一规范,各厂商能力以官方文档为准。因此写这类提示时,最好先确认目标模型支持哪些输入类型,再动手。

典型场景

多模态提示真正好用的地方,往往是纯文本说不清楚、或要花费大量文字才能描述的任务:

  • 看图问答:识别照片里的物体、植物、地标,或解释一张梗图。
  • 截图调试:把报错截图或 UI 截图发给模型,让它定位问题、给出修复建议。
  • 图表解读:上传折线图、柱状图、热力图,让它读出趋势、拐点、异常值。
  • 文档抽取:上传扫描合同或发票,提取关键字段填入表格。
  • 视频理解:把一段演示视频交给模型,让它总结步骤或找出某一时刻发生了什么。

这些场景的共同点是:信息主要「长在」非文本载体上,文字只是用来下达指令和约束输出。

图文混合提示的写法

图文混合提示的骨架和纯文本提示一致:先讲任务,再讲关注点,最后规定输出格式。区别在于,你要明确告诉模型「这张图里你该看哪里」「你想让它产出什么形态的结果」。

下面是一个图表解读的示例:

请阅读下面这张柱状图,并回答:

1. 2023 年与 2024 年相比,哪一季度营收增长最快?
2. 给出增长百分比,保留两位小数。
3. 用三句话总结整体趋势,并指出最值得关注的风险点。

要求:所有结论都必须能在这张图里找到依据,不要凭空补充图外数据。

这个提示做对了三件事:第一,明确任务(比较两年、找最快增长);第二,指出关注点(季度、营收、风险点);第三,规定输出格式(分点、百分比精度、句子数)。如果省略这些,模型很可能给出笼统且不可追溯的回答。

视觉指代与歧义消除

当图里只有一个对象时,直接说「这个」就够了。但现实中的图往往很拥挤:一张货架照片里有十几种商品,一张架构图里有多个方框。此时用「上面的」「左边的」这类空间词极易产生歧义,模型对坐标和方位的判断本来就是近似的。

消除歧义最稳妥的办法是人工编号或圈注,再在文字里引用编号:

图中有三个产品,请按编号回答:
[图 1] 最左侧的红色包装
[图 2] 中间的蓝色包装
[图 3] 右侧的绿色包装

问题:图 2 的净含量标注是多少克?请直接引用包装上的文字。

如果工具支持上传带标注的图(比如你用画图工具把目标框出来并标了号),效果比纯文字描述更好。核心原则是:把「模型要指哪个对象」这件事,从模糊的空间描述转成确定的索引,能显著降低答非所问的概率。

能力边界与局限

多模态不是万能的,了解边界才能写出靠谱的提示。以下限制均来自各厂商官方文档,可直接采信。

分辨率与数量限制。 不同模型对单图尺寸、单请求图片数都有上限。GPT-4o 家族会把图像缩放处理:先等比缩放到 2048×2048 的方形内,再把最短边缩放到 768px 来计算 token;单请求最多可包含 1500 个图像输入,总负载不超过 512MB(已核验)。Claude 单张图最大 8000×8000px,claude.ai 每消息最多 20 张,API 视上下文长度最多 100 到 600 张(已核验)。Gemini 单请求最多 3600 个图像文件,内联图像请求总大小不超过 20MB(已核验)。

小字与长图的识别误差。 官方文档均提示:图像里的文字必须清晰可读,过小、旋转、过度压缩(如强 JPEG 压缩)都会让模型读错甚至读不出。长图被缩放后,边缘的小字最容易失真。若任务依赖图中的精确文字,最好裁切放大后再上传,并让模型「逐字引用」。

对精确数值与文字的幻觉。 模型可能把图中近似的数值「取整」或「脑补」成它以为合理的数字;对坐标、计数(尤其是大量小物体)也只能给近似值。涉及金额、规格、编号等关键数据时,一定要要求模型引用图中证据,必要时人工复核。

其他待核实点。 各模型对视频、音频、PDF 的完整支持范围与对应限制,请以具体模型官方文档为准;本文仅对已逐页核验的图像能力给出确定结论,其余细节标注为「待核实」。

与纯文本提示的差异

写多模态提示时,有三处和纯文本提示明显不同,需要额外留心。

第一,上下文组织方式变了。纯文本提示靠分段、示例、占位符来组织;多模态提示要把「图」当作一等公民,明确图与文字的对应关系,必要时编号引用。

第二,token 计费不同。图像不是免费输入。GPT-4o 按瓦片计费:detail 为 low 时固定 85 个基础 token,high 时按最短边 768px 缩放后每 512px 方块计 170 token 再加 85 基础 token(已核验)。Claude 的视觉 token 约为「宽除以 28 向上取整乘以高除以 28 向上取整」(已核验)。图越多、分辨率越高,成本与延迟越高,上传前先想清楚是否真需要原图。

第三,隐私风险更高。一张截图可能包含账号、密钥、个人信息。把敏感截图随便上传到云端模型,比贴一段文字更容易在无意中泄露。涉及机密时,先打码或脱敏,再考虑是否上传。

最佳实践清单

把上面的要点收敛成一份可直接套用的清单:

  • 先说清目标:想让模型做什么,避免「帮我看看这张图」这种开放式指令。
  • 给上下文:说明图的来源、背景、你已知的信息,减少模型猜测。
  • 指明确认点:用编号或圈注锁定你关注的对象,别只依赖「左边那个」。
  • 规定输出格式:分点、表格、引用原文,越具体越好。
  • 要求引用图中证据:让结论可回溯,抑制对数值和文字的幻觉。
  • 控制成本与隐私:只传必要图像,敏感内容先脱敏,长图先裁切放大。
  • 分步验证:复杂任务先让它描述看到了什么,确认理解正确后再要最终答案。

小结

多模态提示把图像、音频、文档等模态纳入同一轮对话,让模型能「边看边答」。它的写法逻辑和纯文本提示一致——说清目标、给足上下文、规定格式——只是多了「视觉指代」这一层,需要用编号或圈注消除歧义。同时必须正视其局限:分辨率与图片数量有上限,小字和长图易识别出错,精确数值存在幻觉风险;计费与隐私也和纯文本提示不同。掌握这些边界,才能让多模态提示真正可靠地落地。

参考与延伸阅读

本文累计阅读