Skip to content

多模态 AI 全景:从 VLM 到全模态模型

摘要:从多模态 AI 的技术演进出发,系统阐述了视觉语言模型(VLM)的'视觉编码器 + 投影层 + LLM'双塔融合架构及其两阶段训练方法(预训练对齐与指令微调),并对 GPT-4V/GPT-4o、Gemini、Qwen-VL、LLaVA 等主流 VLM 模型进行了对比分析。随后梳理了多模态输入从纯文本到文本+图像+音频+视频的四代演进路径,以及多模态输出从文本到图像生成(扩散模型)、语音合成、视频生成的技术路线。最后,以 GPT-4o、Gemini 2.5、Qwen2.5-Omni 为代表分析了 Omni-Model 的端到端统一架构理念,并总结了多模态 AI 在教育、医疗、电商、内容创作等领域的应用前景。

核心思想

多模态 AI 不仅能"读懂文字",还能"看见图片"、"听懂声音"、"生成图像"。它打破了文本的单一通道,让 AI 像人类一样通过多种感官理解世界。

1. VLM(Vision-Language Model,视觉语言模型)

1.1 什么是 VLM?

人类理解世界的方式远不止于文字——我们通过眼睛观察图像、图表、手势和表情,通过耳朵聆听声音,通过多种感官综合感知环境。VLM(视觉语言模型)的核心目标正是让 AI 突破纯文本的局限,获得"看图说话"的能力,从而像人类一样实现视觉与语言的深度融合理解。

VLM 的基本能力

  ┌─────────────────────────────────────────────────────────┐
  │                                                         │
  │  输入                  输出                              │
  │  ─────────────────────────────────────────────          │
  │                                                         │
  │  [一张猫的照片]    →   "这是一只橘色的虎斑猫,          │
  │                         正躺在窗台上晒太阳"              │
  │                                                         │
  │  [一份财报图表]    →   "Q3 营收同比增长 15%,           │
  │                         主要由海外市场驱动..."           │
  │                                                         │
  │  [手写数学题照片]  →   "解题步骤:首先将方程移至...     │
  │                         最终解得 x = 3"                 │
  │                                                         │
  │  [UI 设计稿]       →   "这是一个登录页面,包含:        │
  │                         用户名输入框、密码输入框、       │
  │                         登录按钮和忘记密码链接"          │
  │                                                         │
  └─────────────────────────────────────────────────────────┘

1.2 VLM 架构:视觉编码器 + 语言模型

现代 VLM 的架构通常采用双塔融合的设计:

                      ┌─────────────────────────┐
                      │      输入(图片+文字)    │
                      └───────────┬─────────────┘

              ┌───────────────────┴───────────────────┐
              │                                       │
              ▼                                       ▼
  ┌───────────────────────┐             ┌───────────────────────┐
  │   视觉编码器           │             │   文本 Tokenizer       │
  │   (Vision Encoder)    │             │   (Text Tokenizer)     │
  │                       │             │                       │
  │  例如:                │             │  图片可选配以下方式:    │
  │  • ViT (Vision        │             │  • 直接输入图片像素    │
  │    Transformer)       │             │  • 切分为 Patch 序列  │
  │  • SigLIP             │             │  • CNN 提取特征       │
  │  • CLIP 视觉分支      │             │                       │
  │                       │             │  输出:                 │
  │  输出:                │             │  文本 Token Embeddings │
  │  图像特征向量序列     │             │  [t1][t2][t3]...[tn]  │
  │  [v1][v2][v3]...[vm]  │             │                       │
  └───────────┬───────────┘             └───────────┬───────────┘
              │                                     │
              │          ┌──────────────┐            │
              │          │  投影层 (MLP) │            │
              │          │              │            │
              │          │ 将视觉特征映射 │            │
              │          │ 到与文本相同的 │            │
              │          │ Embedding 空间 │            │
              │          └───────┬──────┘            │
              │                  │                   │
              └──────────┬───────┘                   │
                         │                           │
                         ▼                           ▼
              ┌─────────────────────────────────────────────┐
              │         拼接后的 Token 序列                   │
              │                                             │
              │  [v1][v2]...[vm][t1][t2][t3]...[tn]          │
              │  ├─ 图像 token ─┤├─ 文本 token ─┤            │
              └──────────────────────┬──────────────────────┘


              ┌─────────────────────────────────────────────┐
              │              LLM(大语言模型)                │
              │                                             │
              │  标准的 Transformer Decoder 架构              │
              │  处理视觉 token + 文本 token 的混合序列       │
              │  输出:文本 Token                             │
              └────────────────────────┬────────────────────┘


                              ┌─────────────────┐
                              │   生成的文本回答  │
                              └─────────────────┘

架构的三个关键组件:

组件作用类比
视觉编码器把图像"翻译"成向量序列眼睛 → 视网膜的神经信号
投影层把视觉向量映射到语言文字空间视觉皮层 → 语言皮层的信号转换
LLM综合视觉和文字信息进行推理和生成大脑进行跨模态理解

1.3 主流 VLM 模型

  ┌──────────────────────────────────────────────────────────┐
  │  模型                     架构特点             开放程度  │
  ├──────────────────────────────────────────────────────────┤
  │  GPT-4V / GPT-4o         闭源,多模态原生      API      │
  │  Gemini 3.1             闭源,多模态原生      API      │
  │  Qwen-VL (阿里)           开源,基于 Qwen      开源      │
  │  LLaVA (学术界)           开源,Vicuna+CLIP    开源      │
  │  InternVL (上海AI实验室)  开源,评测领先       开源      │
  │  Phi-3-Vision (微软)     开源,小模型+视觉    开源      │
  │  CogVLM2 (智谱)          开源,双语视觉       开源      │
  └──────────────────────────────────────────────────────────┘

LLaVA 架构详解(最具代表性的开源 VLM):

  图片输入 ──> CLIP 视觉编码器 ──> 视觉特征


                               ┌─────────────┐
                               │  Projection │  ← 一个简单的线性层
                               │  (投影层)   │     (不是复杂的 Q-Former)
                               └──────┬──────┘


                              视觉 Token 嵌入

                                      ├──> 与文本 Token 拼接


                              ┌───────────────┐
                              │  LLM (Vicuna  │  ← 训练时只训练投影层
                              │   或 LLaMA)   │     和部分 LLM 参数
                              └───────────────┘


                                 文本回答

LLaVA 的设计哲学:Simple is better.

  • 不用复杂的 Q-Former(如 BLIP-2)
  • 一个简单的线性投影层就能让视觉特征与语言特征对齐
  • 两阶段训练:① 预训练投影层 ② 指令微调

1.4 VLM 训练方法

VLM 训练的两个阶段:

  阶段一:预训练(对齐视觉和语言空间)
  目标:让投影层学会将视觉特征映射到 LLM 能理解的表示空间
  数据:图文对(Image-Text Pairs)
  ┌──────────────────────────────────────────────┐
  │  图片: [一只金毛犬在海滩奔跑]                  │
  │  文本: "A golden retriever running on a beach"│
  └──────────────────────────────────────────────┘

  训练内容:
  ┌──────────────────┐       ┌──────────────────┐
  │  视觉编码器      │       │  冻结!不训练     │
  │  投影层          │       │  训练!这是重点   │
  │  LLM             │       │  冻结!不训练     │
  └──────────────────┘       └──────────────────┘

  阶段二:指令微调(学会遵循指令、回答问题)
  目标:让模型学会理解用户的视觉问题并给出合理回答
  数据:多模态指令数据(Image + Question + Answer)
  ┌─────────────────────────────────────────────────────┐
  │  图片: [一份复杂的表格]                              │
  │  指令: "这个表格中Q3的总收入是多少?"                │
  │  回答: "根据表格数据,Q3总收入为156.2亿美元..."      │
  └─────────────────────────────────────────────────────┘

  训练内容:
  ┌──────────────────┐       ┌──────────────────┐
  │  视觉编码器      │       │  冻结!           │
  │  投影层          │       │  训练!           │
  │  LLM             │       │  训练!(LoRA/全参)│
  └──────────────────┘       └──────────────────┘

1.5 VLM 的核心挑战

挑战说明当前进展
幻觉(对象幻觉)VLM 可能"看到"不存在的物体需要更好的训练数据和视觉-语言对齐
细粒度理解对复杂图表、密集文字、小物体的理解弱高分辨率输入 + 注意力机制改进
多图推理跨多张图片的逻辑推理困难长上下文 VLM + 交叉注意力
时空理解视频中的时间序列理解视频 VLM 正在快速发展
计算成本图像 token 远多于文本 token视觉 token 压缩技术
多语言视觉非英文图片文字识别差多语言训练数据 + OCR 增强

2. 多模态输入与输出

2.1 输入模态的扩展

从纯文本到多模态输入,AI 的"感官"在逐步扩展:

  第一代: 纯文本
  ┌─────────────────────────────────────┐
  │ GPT-1/2/3, LLaMA 1                 │
  │ 只能理解和生成文字                   │
  │                                     │
  │ in: "描述一下埃菲尔铁塔"             │
  │ out: "埃菲尔铁塔是法国巴黎的..."     │
  └─────────────────────────────────────┘

  第二代: 文本 + 图像输入
  ┌─────────────────────────────────────┐
  │ GPT-4V, Claude Vision, Qwen-VL     │
  │ 能"看到"和理解图像                   │
  │                                     │
  │ in: [埃菲尔铁塔照片] + "这是哪里?"  │
  │ out: "这是巴黎的埃菲尔铁塔..."       │
  └─────────────────────────────────────┘

  第三代: 文本 + 图像 + 音频输入
  ┌─────────────────────────────────────┐
  │ GPT-4o, Gemini 2.0                 │
  │ 能"听"和"看"                        │
  │                                     │
  │ in: [一段法语录音] + "翻译成中文"    │
  │ out: "录音内容:'您好,请问...'"     │
  └─────────────────────────────────────┘

  第四代: 文本 + 图像 + 音频 + 视频输入
  ┌─────────────────────────────────────┐
  │ Gemini 2.0, GPT-4o                 │
  │ 能"看视频"(理解时间序列视觉信息)    │
  │                                     │
  │ in: [一段产品演示视频] + "总结功能"   │
  │ out: "该产品展示了三个核心功能..."   │
  └─────────────────────────────────────┘

2.2 输出模态的扩展

不仅输入在多样化,AI 的输出也在从纯文本走向多模态:

Text → Image(文生图)

  代表模型:DALL-E 3, Midjourney, Stable Diffusion, Flux
  
  输入: "一只穿着宇航服的柴犬,站在月球表面,背景是地球,
        写实风格,4K画质"
  
  输出: [生成对应图片]

  技术路线:
  1. 扩散模型 (Diffusion Model) — 主流技术
     从纯噪声开始,逐步"去噪"形成图像

  2. 自回归模型 — 类似 LLM 生成文本
     将图像也视为 token 序列,逐个"预测"下一个图像 token

  ┌─────────────────────────────────────────────────────────┐
  │              Text-to-Image Pipeline (扩散模型)           │
  │                                                         │
  │  文本 ──> Text Encoder ──> 文本嵌入                      │
  │                                  │                      │
  │                                  ▼                      │
  │  随机噪声 ──> U-Net / DiT ──> 逐步去噪 ──> 最终图像     │
  │                    ▲                                    │
  │                    │                                    │
  │              条件注入(文本嵌入指导生成方向)              │
  └─────────────────────────────────────────────────────────┘

Text → Audio / Speech(文生音频 / 语音)

  语音合成 (TTS — Text-to-Speech):
  代表模型:OpenAI TTS, ElevenLabs, FishSpeech, CosyVoice
  
  输入: "你好,欢迎来到今天的节目"  (文字)
  输出: [自然流畅的语音]              (音频波形)

  音乐生成:
  代表模型:Suno, Udio, MusicGen
  
  输入: "一首欢快的爵士乐,钢琴为主,有萨克斯solo"  (文字描述)
  输出: [一段3分钟的爵士乐曲]                          (音乐)

  音效生成:
  代表模型:ElevenLabs SFX, AudioLDM
  
  输入: "雨滴打在铁皮屋顶上的声音,远处有雷声"
  输出: [逼真的雨声音效]

Text → Video(文生视频)

  代表模型:Sora (OpenAI), Kling (快手), Runway Gen-3, 即梦(字节)
  
  输入: "一个年轻女子在东京街头漫步,霓虹灯闪烁,地面雨后湿润
        反光,电影质感,慢镜头"
  
  输出: [一段10秒的高质量视频]

  技术挑战:
  • 时间一致性:物体在帧之间不能变形或消失
  • 物理正确性:运动要符合物理规律
  • 计算成本:视频比图像多 24~60 倍数据量

2.3 Omni-Model(全模态模型)

Omni-Model 是"全能型"的——同一模型既能理解多模态输入,也能生成多模态输出。

  GPT-4o (OpenAI)
  ├─ 输入: 文本 + 图像 + 音频
  ├─ 输出: 文本 + 图像(通过 DALL-E 集成)+ 语音
  ├─ 特点: 端到端多模态,极低音频延迟(~320ms)
  └─ 定位: "一个模型处理所有模态"

  Gemini 2.5 (Google)
  ├─ 输入: 文本 + 图像 + 音频 + 视频 + 代码
  ├─ 输出: 文本 + 图像(Imagen 集成)+ 语音
  ├─ 特点: 原生多模态,超长上下文(1M+ tokens)
  └─ 定位: "Google 生态的全模态入口"

  Qwen2.5-Omni (阿里)
  ├─ 输入: 文本 + 图像 + 音频 + 视频
  ├─ 输出: 文本 + 语音
  ├─ 特点: 开源 Omni-Model
  └─ 定位: "开源的 GPT-4o 替代"

Omni-Model 的统一架构理念

  传统多模态:每个模态独立模型

  ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐
  │ 视觉  │ │ 语音  │ │ 文本  │ │ 生成  │
  │ 模型  │ │ 模型  │ │ 模型  │ │ 模型  │
  └──┬───┘ └──┬───┘ └──┬───┘ └──┬───┘
     │        │        │        │
     └────────┴────────┴────────┘
           "胶水代码"串联

  Omni-Model:统一的多模态表示

  ┌─────────────────────────────────────┐
  │                                     │
  │          单一 Transformer           │
  │                                     │
  │  输入: 所有模态                    │
  │  ┌────┐ ┌────┐ ┌────┐ ┌────┐     │
  │  │文本 │ │图像│ │音频 │ │视频 │     │
  │  └──┬─┘ └──┬─┘ └──┬─┘ └──┬─┘     │
  │     └──────┴──────┴──────┘        │
  │              │                     │
  │     统一的 Token 序列              │
  │              │                     │
  │         ┌────┴────┐              │
  │         │ Transformer│            │
  │         └────┬────┘              │
  │              │                     │
  │  输出: 多模态                      │
  │  ┌────┐ ┌────┐ ┌────┐            │
  │  │文本│ │语音│ │图像│  (可扩展)  │
  │  └────┘ └────┘ └────┘            │
  │                                     │
  └─────────────────────────────────────┘

2.4 多模态的应用场景

  教育
  ├─ 拍照解题(数学、物理、化学)
  ├─ 手写批改
  └─ 图文并茂的教学内容生成

  医疗
  ├─ 医学影像分析(X光、CT、MRI解读)
  ├─ 病理切片辅助诊断
  └─ 手术视频理解

  电商
  ├─ 以图搜图(拍照找商品)
  ├─ 虚拟试穿
  └─ 商品图片自动描述

  内容创作
  ├─ 文生图/视频(海报、广告素材)
  ├─ 视频自动剪辑和字幕
  └─ 播客生成(文本→语音对话)

  无障碍
  ├─ 盲人辅助(拍照描述周围环境)
  ├─ 手语翻译(视频→文字)
  └─ 实时语音转文字(听障人士)

  工业
  ├─ 产品质量检测(视觉质检)
  ├─ 设备仪表读数(工业OCR)
  └─ 安全监控(异常行为检测)

3. 总结

多模态是 AI 从"单一文本通道"走向"类人多感官"的关键进化。

  层级                代表技术/模型
  ════════════════════════════════════════════════════════════════
  全模态 (Omni)       GPT-4o, Gemini 2.5, Qwen2.5-Omni
  ────────────────────────────────────────────────────────────────
  视频理解/生成        Sora, Kling, Runway Gen-3
  ────────────────────────────────────────────────────────────────
  图像生成             DALL-E 3, Midjourney, Stable Diffusion 3
  ────────────────────────────────────────────────────────────────
  语音合成/识别        ElevenLabs, FishSpeech, CosyVoice
  ────────────────────────────────────────────────────────────────
  视觉语言模型 (VLM)   GPT-4V, Claude Vision, Qwen-VL, LLaVA
  ────────────────────────────────────────────────────────────────
  纯文本 LLM           GPT-4, Claude, LLaMA, Qwen
  ════════════════════════════════════════════════════════════════

关键要点:

  1. VLM 的核心架构是"视觉编码器 + 投影层 + LLM",让模型能理解图像
  2. 多模态输入正从"文字"扩展到"文字+图像+音频+视频"
  3. 多模态输出正从"文字"扩展到"文字+图像+音频+视频"
  4. Omni-Model 是趋势——一个模型处理所有模态,而非多个独立模型
  5. 多模态正在从"研究玩具"走向"产业落地"(教育、医疗、工业等)