外观
多模态模型
一句话定义:多模态模型(Multimodal Model)在同一套模型里处理文本、图像、音频、视频等多种模态,通过"对齐"让不同模态的表示互相对应、互相推理——它是深度学习从"单一感官"走向"通用智能"的关键一步,也是大语言模型(LLM)之后最活跃的模型家族。
一、为什么需要多模态
单一模态的极限:文本模型"知道"长颈鹿脖子长,但没"见过";视觉模型"见过"但说不清。多模态的收益有三层:
- 对齐补全信息:图像给文本补充常识细节,文本给图像补充抽象关系;
- 互监督训练:图文对、语音-文本对本身就是免费的"伪标签"——弱监督信号量级远超人工标注;
- 统一接口:一个模型处理"看图说话、听音理解、问答、创作",是交互与 Agent 的基础。
支撑它的是表征学习的思想:不同模态经过编码后在同一个向量空间里可比、可运算(框架见表征学习与预训练)。
二、模态对齐:CLIP 与 ALIGN
CLIP(2021,OpenAI)是多模态对齐的里程碑:用 4 亿(image, text)对做对比学习(contrastive learning)——拉近"配对图文"的向量距离、推远"不配对"的向量距离。训好后,CLIP 的图像编码器与文本编码器共享一个语义空间:图像检索文本、文本检索图像、零样本分类("把这张图归到{狗,猫,鸟}中最相近的类别")都成了向量最近邻问题。
ALIGN(2021,Google)把数据量推到 18 亿对,用"弱对齐"的网页图片与其 alt-text 做同样的对比学习,证明了数据噪声可以由规模补偿。CLIP/ALIGN 确立的"双塔对比对齐"模式,是后续 VLM 与文生图系统(Stable Diffusion 的文本编码器,见扩散模型与生成式 AI)的共同地基。
三、视觉-语言模型:VLM 三件套
**VLM(Vision-Language Model)**是当下"看图说话"的主流形态,架构高度统一,三件套:
- 视觉编码器:把图像切成 patch 喂给 ViT(或用 CLIP 预训练过的视觉塔),输出图像 token(见CNN 与计算机视觉中 ViT 一节);
- 投影层(projector):把图像 token 的维度投影到 LLM 的词向量空间,让两种模态"说得上话";
- 大语言模型:把投影后的图像 token 拼进文本序列,继续做自回归生成(架构详见Transformer 架构)。
代表模型:LLaVA(2023)用"视觉指令数据"做 SFT,证明了这条路的性价比;Qwen-VL(2023)加入可动态分辨率输入与视觉定位能力;GPT-4V(2023)则是闭源旗舰的标杆。VLM 的能力覆盖视觉问答、OCR、图表理解、图像描述、指代定位——训练方法(对比预训练→指令微调→RLHF)与大语言模型(LLM)的三段式如出一辙。
四、文生图 / 视频:跨模态生成
对齐之外,另一条主线是从文本生成另一种模态:
- 文生图:扩散模型 + CLIP 文本编码器 = Stable Diffusion/DALL·E(原理见"扩散模型与生成式 AI"一文);
- 文生视频:Sora(2024)等把视频 token 化后做时空扩散,是"生成时长与一致性"的突破,见前沿进展;
- 文生音 / 音生文:AudioLDM、Whisper 等,见语音与音频。
跨模态生成与理解共享同一批基础组件(视觉编码器、文本编码器、扩散/自回归生成器),这正是多模态"大一统"趋势的注脚。
五、模态融合:早期、晚期与跨注意力
多模态模型的设计核心是"何时、如何融合":
| 融合方式 | 做法 | 特点 |
|---|---|---|
| 早期融合 | 输入就拼接各模态 token(串接送入同一 Transformer) | 交互最充分,但训练数据与算力要求高;Gemini 属此类 |
| 晚期融合 | 各模态各自编码,最后合并(拼接/加权/门控)做决策 | 可复用单模态模型,工程简单;信息交互浅 |
| 跨注意力 | 一个模态作为查询、另一模态作为键值(Encoder-Decoder 式) | 理解类任务(VQA)效果好,训练可控 |
实践中普遍是混合式:视觉编码器(晚期组件)→ 投影 → 与文本在 LLM 内自注意力融合(相当于"融合位置偏深")。"在哪一层融合"没有统一答案,取决于数据、任务与算力预算。
六、统一模型:Gemini 与 Omni
"多模态多任务一个模型"是终极形态:
- Gemini(2023,Google):原生多模态——从预训练起就把文本/图像/音频/视频统一成 token 序列输入同一 Transformer,而非"事后接个视觉塔",长上下文与跨模态推理是其卖点;
- Omni 路线(GPT-4o 等,2024):语音到语音直通——不把音频转文本中间态,而是直接在模态间映射,实现低延迟、带情感的实时语音对话;
- Any-to-Any:输入输出都支持多模态(图像、音频、文本),代表如 Meta 的 ImageBind/AnyMAL、各类统一大模型。
统一模型的代价是训练极其昂贵、模态间可能"互相拖累"(灾难性遗忘式的模态退化),学界仍在探索"共享 vs 专用参数"的最优解。
七、评估:MMMU 与多模态基准
- MMMU(2023):覆盖大学学科的多模态多选题基准(30 学科、跨学科推理),是 VLM 综合能力的主力标杆;
- 其他:MMBench、MM-Vet(能力分项)、OCRBench(文档理解)、Video-MME(视频);
- 方法与批判:多模态评测的难点是**"看到了吗"与"想明白了吗"难以分离**(答错可能因为 OCR 失败而非推理失败);图文泄漏进训练集、题目更新滞后也是常态——评测方法论见深度学习评估与实验与评估实践。
八、多模态 Agent 与 RAG
多模态正在长出"行动力":
- 多模态 RAG:检索库不只是文本,还能检图片/视频/音频——把检索到的多模态证据拼进提示词让 VLM 作答,解决知识时效与幻觉,是大语言模型(LLM)中 RAG 的多模态扩展;
- 多模态 Agent:VLM 看懂屏幕截图后调用工具(点击、输入、拖拽),实现"看图操作电脑/手机"的 GUI Agent,是 Agent 研究的热点(Agent 基础见大语言模型(LLM));
- 机器人/具身智能:VLM 提供"场景理解+指令跟随",与深度强化学习应用结合,是具身智能的主流技术路线。
九、局限与开放问题
- 幻觉放大:VLM 对图像细节的幻觉("看见"不存在的物体)比文本模型更隐蔽、更难防;
- 对齐深度:CLIP 式对齐常停在"表面语义",细粒度空间关系、数量、时序推理仍弱;
- 数据瓶颈:高质量多模态数据稀缺、图文对噪声大,且文化差异(语种、场景)让通用模型在长尾场景失灵;
- 成本:多模态训练与推理算力需求远高于纯文本,长视频/高分辨率输入尤其昂贵;
- 安全与公平:图像生成与多模态理解都涉及隐私、虚假信息与偏见,治理讨论见可解释性与公平性。
务实视角
多模态模型的"测评高分"与"产品可用"之间隔着大量工程:分辨率、帧率、延迟、流式、跨语言。读论文看架构,落地时先跑通"最小可用闭环"再谈花活。
十、权衡与取舍
- 原生多模态 vs 外接视觉塔:原生(Gemini 路线)上限高但贵;"预训练视觉编码器+投影+LLM"(LLaVA 路线)灵活可复用、见效快——多数团队选后者;
- 融合位置:深层融合交互强但训练难,浅层融合稳但效果有限,按任务选;
- 统一 vs 专用:一个模型全干 vs 各模态专用模型路由,前者优雅但难优化,后者工程成熟但接口割裂;
- 闭源 vs 开源 VLM:闭源 API 快但受数据主权约束,开源(Qwen-VL、InternVL、LLaVA)可控但需自行部署维护,权衡见MLOps 与模型部署。
延伸阅读
- 大语言模型(LLM)——VLM 的文本大脑与对齐范式
- Transformer 架构——跨模态注意力的统一引擎
- 扩散模型与生成式 AI——文生图/视频的生成引擎
- CNN 与计算机视觉——视觉编码器的源头
- 语音与音频——音频模态的加入
- 深度学习评估与实验——MMMU 等基准的批判性阅读
参考资料
- Radford et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP) (ICML 2021)
- Jia et al. Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision (ALIGN) (ICML 2021)
- Liu et al. Visual Instruction Tuning (LLaVA) (NeurIPS 2023)
- Bai et al. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond (2023)
- OpenAI. GPT-4V(ision) System Card (2023)
- Team Gemini. Gemini: A Family of Highly Capable Multimodal Models (2023)
- Yue et al. MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI (CVPR 2024)
- Brooks et al. Video Generation Models as World Simulators (Sora) (2024)