Skip to content

多模态模型

本页速览 多模态模型让 AI 同时理解文本、图像、音频与视频。本文拆解 CLIP/ALIGN 的对比学习对齐、LLaVA/Qwen-VL/GPT-4V 的"视觉编码器+投影+LLM"架构、模态融合的早期/晚期/跨注意力方案,并介绍 Gemini/Omni 统一模型、MMMU 等评估、多模态 Agent 与 RAG,以及当下局限。

多模态模型

一句话定义:多模态模型(Multimodal Model)在同一套模型里处理文本、图像、音频、视频等多种模态,通过"对齐"让不同模态的表示互相对应、互相推理——它是深度学习从"单一感官"走向"通用智能"的关键一步,也是大语言模型(LLM)之后最活跃的模型家族。

一、为什么需要多模态

单一模态的极限:文本模型"知道"长颈鹿脖子长,但没"见过";视觉模型"见过"但说不清。多模态的收益有三层:

  1. 对齐补全信息:图像给文本补充常识细节,文本给图像补充抽象关系;
  2. 互监督训练:图文对、语音-文本对本身就是免费的"伪标签"——弱监督信号量级远超人工标注;
  3. 统一接口:一个模型处理"看图说话、听音理解、问答、创作",是交互与 Agent 的基础。

支撑它的是表征学习的思想:不同模态经过编码后在同一个向量空间里可比、可运算(框架见表征学习与预训练)。

二、模态对齐:CLIP 与 ALIGN

CLIP(2021,OpenAI)是多模态对齐的里程碑:用 4 亿(image, text)对对比学习(contrastive learning)——拉近"配对图文"的向量距离、推远"不配对"的向量距离。训好后,CLIP 的图像编码器与文本编码器共享一个语义空间:图像检索文本、文本检索图像、零样本分类("把这张图归到{狗,猫,鸟}中最相近的类别")都成了向量最近邻问题。

ALIGN(2021,Google)把数据量推到 18 亿对,用"弱对齐"的网页图片与其 alt-text 做同样的对比学习,证明了数据噪声可以由规模补偿。CLIP/ALIGN 确立的"双塔对比对齐"模式,是后续 VLM 与文生图系统(Stable Diffusion 的文本编码器,见扩散模型与生成式 AI)的共同地基。

三、视觉-语言模型:VLM 三件套

**VLM(Vision-Language Model)**是当下"看图说话"的主流形态,架构高度统一,三件套:

  1. 视觉编码器:把图像切成 patch 喂给 ViT(或用 CLIP 预训练过的视觉塔),输出图像 token(见CNN 与计算机视觉中 ViT 一节);
  2. 投影层(projector):把图像 token 的维度投影到 LLM 的词向量空间,让两种模态"说得上话";
  3. 大语言模型:把投影后的图像 token 拼进文本序列,继续做自回归生成(架构详见Transformer 架构)。

代表模型:LLaVA(2023)用"视觉指令数据"做 SFT,证明了这条路的性价比;Qwen-VL(2023)加入可动态分辨率输入与视觉定位能力;GPT-4V(2023)则是闭源旗舰的标杆。VLM 的能力覆盖视觉问答、OCR、图表理解、图像描述、指代定位——训练方法(对比预训练→指令微调→RLHF)与大语言模型(LLM)的三段式如出一辙。

四、文生图 / 视频:跨模态生成

对齐之外,另一条主线是从文本生成另一种模态

  • 文生图:扩散模型 + CLIP 文本编码器 = Stable Diffusion/DALL·E(原理见"扩散模型与生成式 AI"一文);
  • 文生视频:Sora(2024)等把视频 token 化后做时空扩散,是"生成时长与一致性"的突破,见前沿进展
  • 文生音 / 音生文:AudioLDM、Whisper 等,见语音与音频

跨模态生成与理解共享同一批基础组件(视觉编码器、文本编码器、扩散/自回归生成器),这正是多模态"大一统"趋势的注脚。

五、模态融合:早期、晚期与跨注意力

多模态模型的设计核心是"何时、如何融合":

融合方式做法特点
早期融合输入就拼接各模态 token(串接送入同一 Transformer)交互最充分,但训练数据与算力要求高;Gemini 属此类
晚期融合各模态各自编码,最后合并(拼接/加权/门控)做决策可复用单模态模型,工程简单;信息交互浅
跨注意力一个模态作为查询、另一模态作为键值(Encoder-Decoder 式)理解类任务(VQA)效果好,训练可控

实践中普遍是混合式:视觉编码器(晚期组件)→ 投影 → 与文本在 LLM 内自注意力融合(相当于"融合位置偏深")。"在哪一层融合"没有统一答案,取决于数据、任务与算力预算。

六、统一模型:Gemini 与 Omni

"多模态多任务一个模型"是终极形态:

  • Gemini(2023,Google):原生多模态——从预训练起就把文本/图像/音频/视频统一成 token 序列输入同一 Transformer,而非"事后接个视觉塔",长上下文与跨模态推理是其卖点;
  • Omni 路线(GPT-4o 等,2024):语音到语音直通——不把音频转文本中间态,而是直接在模态间映射,实现低延迟、带情感的实时语音对话;
  • Any-to-Any:输入输出都支持多模态(图像、音频、文本),代表如 Meta 的 ImageBind/AnyMAL、各类统一大模型。

统一模型的代价是训练极其昂贵、模态间可能"互相拖累"(灾难性遗忘式的模态退化),学界仍在探索"共享 vs 专用参数"的最优解。

七、评估:MMMU 与多模态基准

  • MMMU(2023):覆盖大学学科的多模态多选题基准(30 学科、跨学科推理),是 VLM 综合能力的主力标杆;
  • 其他:MMBench、MM-Vet(能力分项)、OCRBench(文档理解)、Video-MME(视频);
  • 方法与批判:多模态评测的难点是**"看到了吗"与"想明白了吗"难以分离**(答错可能因为 OCR 失败而非推理失败);图文泄漏进训练集、题目更新滞后也是常态——评测方法论见深度学习评估与实验评估实践

八、多模态 Agent 与 RAG

多模态正在长出"行动力":

  • 多模态 RAG:检索库不只是文本,还能检图片/视频/音频——把检索到的多模态证据拼进提示词让 VLM 作答,解决知识时效与幻觉,是大语言模型(LLM)中 RAG 的多模态扩展;
  • 多模态 Agent:VLM 看懂屏幕截图后调用工具(点击、输入、拖拽),实现"看图操作电脑/手机"的 GUI Agent,是 Agent 研究的热点(Agent 基础见大语言模型(LLM));
  • 机器人/具身智能:VLM 提供"场景理解+指令跟随",与深度强化学习应用结合,是具身智能的主流技术路线。

九、局限与开放问题

  • 幻觉放大:VLM 对图像细节的幻觉("看见"不存在的物体)比文本模型更隐蔽、更难防;
  • 对齐深度:CLIP 式对齐常停在"表面语义",细粒度空间关系、数量、时序推理仍弱;
  • 数据瓶颈:高质量多模态数据稀缺、图文对噪声大,且文化差异(语种、场景)让通用模型在长尾场景失灵;
  • 成本:多模态训练与推理算力需求远高于纯文本,长视频/高分辨率输入尤其昂贵;
  • 安全与公平:图像生成与多模态理解都涉及隐私、虚假信息与偏见,治理讨论见可解释性与公平性

务实视角

多模态模型的"测评高分"与"产品可用"之间隔着大量工程:分辨率、帧率、延迟、流式、跨语言。读论文看架构,落地时先跑通"最小可用闭环"再谈花活。

十、权衡与取舍

  • 原生多模态 vs 外接视觉塔:原生(Gemini 路线)上限高但贵;"预训练视觉编码器+投影+LLM"(LLaVA 路线)灵活可复用、见效快——多数团队选后者;
  • 融合位置:深层融合交互强但训练难,浅层融合稳但效果有限,按任务选;
  • 统一 vs 专用:一个模型全干 vs 各模态专用模型路由,前者优雅但难优化,后者工程成熟但接口割裂;
  • 闭源 vs 开源 VLM:闭源 API 快但受数据主权约束,开源(Qwen-VL、InternVL、LLaVA)可控但需自行部署维护,权衡见MLOps 与模型部署

延伸阅读

参考资料