一、一个直观的例子:从“看图说话”到“看图答题”
我们先来看一个具体的场景。过去,传统的图像识别模型可能只能告诉你图片里“有一只猫,一个沙发”。而今天的多模态大模型,不仅能识别物体,还能理解它们之间的关系、状态,甚至进行推理和互动。比如,给模型一张图片和一个问题:“图中的猫可能在想什么?为什么?”,它可能会回答:“这只猫蜷缩在沙发角落,眼神警惕,可能因为窗外有陌生人或陌生动物路过,它感到不安。”
这个简单例子揭示了多模态能力(尤其是图文理解)的核心飞跃:从识别(Recognition) 走向了理解与推理(Understanding & Reasoning)。它不再仅仅是贴标签,而是能够像人一样,整合视觉和语言信息,进行复杂的认知活动。
二、技术发展的两个关键阶段:“缝合”与“融合”
回顾发展历程,图文理解能力的构建大致经历了两个阶段,这体现了技术思路的根本性转变。
第一个阶段可以称为 “缝合”或“后接”模式。其典型思路是:一个强大的语言模型(如GPT-3)作为主干,在其前端接一个独立的视觉编码器(如ViT),通过一个简单的连接层(如线性投影)将图像特征“翻译”成语言模型能理解的“词向量”。这种模型在诞生初期展示了令人惊叹的零样本能力,但其本质是两个独立模块的协作,视觉信息和语言信息的交互深度有限,更像一个“拼接”的系统。
第二个阶段,也是当前的主流,是 “原生融合”或“一体化预训练”。代表模型如