多模态 AI 全景:从 VLM 到全模态模型
摘要:从多模态 AI 的技术演进出发,系统阐述了视觉语言模型(VLM)的'视觉编码器 + 投影层 + LLM'双塔融合架构及其两阶段训练方法(预训练对齐与指令微调),并对 GPT-4V/GPT-4o、Gemini、Qwen-VL、LLaVA 等主流 VLM 模型进行了对比分析。随后梳理了多模态输入从纯文本到文本+图像+音频+视频的四代演进路径,以及多模态输出从文本到图像生成(扩散模型)、语音合成、视频生成的技术路线。最后,以 GPT-4o、Gemini 2.5、Qwen2.5-Omni 为代表分析了 Omni-Model 的端到端统一架构理念,并总结了多模态 AI 在教育、医疗、电商、内容创作等领域的应用前景。
核心思想
多模态 AI 不仅能"读懂文字",还能"看见图片"、"听懂声音"、"生成图像"。它打破了文本的单一通道,让 AI 像人类一样通过多种感官理解世界。
1. VLM(Vision-Language Model,视觉语言模型)
1.1 什么是 VLM?
人类理解世界的方式远不止于文字——我们通过眼睛观察图像、图表、手势和表情,通过耳朵聆听声音,通过多种感官综合感知环境。VLM(视觉语言模型)的核心目标正是让 AI 突破纯文本的局限,获得"看图说话"的能力,从而像人类一样实现视觉与语言的深度融合理解。
VLM 的基本能力:
┌─────────────────────────────────────────────────────────┐
│ │
│ 输入 输出 │
│ ───────────────────────────────────────────── │
│ │
│ [一张猫的照片] → "这是一只橘色的虎斑猫, │
│ 正躺在窗台上晒太阳" │
│ │
│ [一份财报图表] → "Q3 营收同比增长 15%, │
│ 主要由海外市场驱动..." │
│ │
│ [手写数学题照片] → "解题步骤:首先将方程移至... │
│ 最终解得 x = 3" │
│ │
│ [UI 设计稿] → "这是一个登录页面,包含: │
│ 用户名输入框、密码输入框、 │
│ 登录按钮和忘记密码链接" │
│ │
└─────────────────────────────────────────────────────────┘1.2 VLM 架构:视觉编码器 + 语言模型
现代 VLM 的架构通常采用双塔融合的设计:
┌─────────────────────────┐
│ 输入(图片+文字) │
└───────────┬─────────────┘
│
┌───────────────────┴───────────────────┐
│ │
▼ ▼
┌───────────────────────┐ ┌───────────────────────┐
│ 视觉编码器 │ │ 文本 Tokenizer │
│ (Vision Encoder) │ │ (Text Tokenizer) │
│ │ │ │
│ 例如: │ │ 图片可选配以下方式: │
│ • ViT (Vision │ │ • 直接输入图片像素 │
│ Transformer) │ │ • 切分为 Patch 序列 │
│ • SigLIP │ │ • CNN 提取特征 │
│ • CLIP 视觉分支 │ │ │
│ │ │ 输出: │
│ 输出: │ │ 文本 Token Embeddings │
│ 图像特征向量序列 │ │ [t1][t2][t3]...[tn] │
│ [v1][v2][v3]...[vm] │ │ │
└───────────┬───────────┘ └───────────┬───────────┘
│ │
│ ┌──────────────┐ │
│ │ 投影层 (MLP) │ │
│ │ │ │
│ │ 将视觉特征映射 │ │
│ │ 到与文本相同的 │ │
│ │ Embedding 空间 │ │
│ └───────┬──────┘ │
│ │ │
└──────────┬───────┘ │
│ │
▼ ▼
┌─────────────────────────────────────────────┐
│ 拼接后的 Token 序列 │
│ │
│ [v1][v2]...[vm][t1][t2][t3]...[tn] │
│ ├─ 图像 token ─┤├─ 文本 token ─┤ │
└──────────────────────┬──────────────────────┘
│
▼
┌─────────────────────────────────────────────┐
│ LLM(大语言模型) │
│ │
│ 标准的 Transformer Decoder 架构 │
│ 处理视觉 token + 文本 token 的混合序列 │
│ 输出:文本 Token │
└────────────────────────┬────────────────────┘
│
▼
┌─────────────────┐
│ 生成的文本回答 │
└─────────────────┘架构的三个关键组件:
| 组件 | 作用 | 类比 |
|---|---|---|
| 视觉编码器 | 把图像"翻译"成向量序列 | 眼睛 → 视网膜的神经信号 |
| 投影层 | 把视觉向量映射到语言文字空间 | 视觉皮层 → 语言皮层的信号转换 |
| LLM | 综合视觉和文字信息进行推理和生成 | 大脑进行跨模态理解 |
1.3 主流 VLM 模型
┌──────────────────────────────────────────────────────────┐
│ 模型 架构特点 开放程度 │
├──────────────────────────────────────────────────────────┤
│ GPT-4V / GPT-4o 闭源,多模态原生 API │
│ Gemini 3.1 闭源,多模态原生 API │
│ Qwen-VL (阿里) 开源,基于 Qwen 开源 │
│ LLaVA (学术界) 开源,Vicuna+CLIP 开源 │
│ InternVL (上海AI实验室) 开源,评测领先 开源 │
│ Phi-3-Vision (微软) 开源,小模型+视觉 开源 │
│ CogVLM2 (智谱) 开源,双语视觉 开源 │
└──────────────────────────────────────────────────────────┘LLaVA 架构详解(最具代表性的开源 VLM):
图片输入 ──> CLIP 视觉编码器 ──> 视觉特征
│
▼
┌─────────────┐
│ Projection │ ← 一个简单的线性层
│ (投影层) │ (不是复杂的 Q-Former)
└──────┬──────┘
│
▼
视觉 Token 嵌入
│
├──> 与文本 Token 拼接
│
▼
┌───────────────┐
│ LLM (Vicuna │ ← 训练时只训练投影层
│ 或 LLaMA) │ 和部分 LLM 参数
└───────────────┘
│
▼
文本回答LLaVA 的设计哲学:Simple is better.
- 不用复杂的 Q-Former(如 BLIP-2)
- 一个简单的线性投影层就能让视觉特征与语言特征对齐
- 两阶段训练:① 预训练投影层 ② 指令微调
1.4 VLM 训练方法
VLM 训练的两个阶段:
阶段一:预训练(对齐视觉和语言空间)
目标:让投影层学会将视觉特征映射到 LLM 能理解的表示空间
数据:图文对(Image-Text Pairs)
┌──────────────────────────────────────────────┐
│ 图片: [一只金毛犬在海滩奔跑] │
│ 文本: "A golden retriever running on a beach"│
└──────────────────────────────────────────────┘
训练内容:
┌──────────────────┐ ┌──────────────────┐
│ 视觉编码器 │ │ 冻结!不训练 │
│ 投影层 │ │ 训练!这是重点 │
│ LLM │ │ 冻结!不训练 │
└──────────────────┘ └──────────────────┘
阶段二:指令微调(学会遵循指令、回答问题)
目标:让模型学会理解用户的视觉问题并给出合理回答
数据:多模态指令数据(Image + Question + Answer)
┌─────────────────────────────────────────────────────┐
│ 图片: [一份复杂的表格] │
│ 指令: "这个表格中Q3的总收入是多少?" │
│ 回答: "根据表格数据,Q3总收入为156.2亿美元..." │
└─────────────────────────────────────────────────────┘
训练内容:
┌──────────────────┐ ┌──────────────────┐
│ 视觉编码器 │ │ 冻结! │
│ 投影层 │ │ 训练! │
│ LLM │ │ 训练!(LoRA/全参)│
└──────────────────┘ └──────────────────┘1.5 VLM 的核心挑战
| 挑战 | 说明 | 当前进展 |
|---|---|---|
| 幻觉(对象幻觉) | VLM 可能"看到"不存在的物体 | 需要更好的训练数据和视觉-语言对齐 |
| 细粒度理解 | 对复杂图表、密集文字、小物体的理解弱 | 高分辨率输入 + 注意力机制改进 |
| 多图推理 | 跨多张图片的逻辑推理困难 | 长上下文 VLM + 交叉注意力 |
| 时空理解 | 视频中的时间序列理解 | 视频 VLM 正在快速发展 |
| 计算成本 | 图像 token 远多于文本 token | 视觉 token 压缩技术 |
| 多语言视觉 | 非英文图片文字识别差 | 多语言训练数据 + OCR 增强 |
2. 多模态输入与输出
2.1 输入模态的扩展
从纯文本到多模态输入,AI 的"感官"在逐步扩展:
第一代: 纯文本
┌─────────────────────────────────────┐
│ GPT-1/2/3, LLaMA 1 │
│ 只能理解和生成文字 │
│ │
│ in: "描述一下埃菲尔铁塔" │
│ out: "埃菲尔铁塔是法国巴黎的..." │
└─────────────────────────────────────┘
第二代: 文本 + 图像输入
┌─────────────────────────────────────┐
│ GPT-4V, Claude Vision, Qwen-VL │
│ 能"看到"和理解图像 │
│ │
│ in: [埃菲尔铁塔照片] + "这是哪里?" │
│ out: "这是巴黎的埃菲尔铁塔..." │
└─────────────────────────────────────┘
第三代: 文本 + 图像 + 音频输入
┌─────────────────────────────────────┐
│ GPT-4o, Gemini 2.0 │
│ 能"听"和"看" │
│ │
│ in: [一段法语录音] + "翻译成中文" │
│ out: "录音内容:'您好,请问...'" │
└─────────────────────────────────────┘
第四代: 文本 + 图像 + 音频 + 视频输入
┌─────────────────────────────────────┐
│ Gemini 2.0, GPT-4o │
│ 能"看视频"(理解时间序列视觉信息) │
│ │
│ in: [一段产品演示视频] + "总结功能" │
│ out: "该产品展示了三个核心功能..." │
└─────────────────────────────────────┘2.2 输出模态的扩展
不仅输入在多样化,AI 的输出也在从纯文本走向多模态:
Text → Image(文生图)
代表模型:DALL-E 3, Midjourney, Stable Diffusion, Flux
输入: "一只穿着宇航服的柴犬,站在月球表面,背景是地球,
写实风格,4K画质"
输出: [生成对应图片]
技术路线:
1. 扩散模型 (Diffusion Model) — 主流技术
从纯噪声开始,逐步"去噪"形成图像
2. 自回归模型 — 类似 LLM 生成文本
将图像也视为 token 序列,逐个"预测"下一个图像 token
┌─────────────────────────────────────────────────────────┐
│ Text-to-Image Pipeline (扩散模型) │
│ │
│ 文本 ──> Text Encoder ──> 文本嵌入 │
│ │ │
│ ▼ │
│ 随机噪声 ──> U-Net / DiT ──> 逐步去噪 ──> 最终图像 │
│ ▲ │
│ │ │
│ 条件注入(文本嵌入指导生成方向) │
└─────────────────────────────────────────────────────────┘Text → Audio / Speech(文生音频 / 语音)
语音合成 (TTS — Text-to-Speech):
代表模型:OpenAI TTS, ElevenLabs, FishSpeech, CosyVoice
输入: "你好,欢迎来到今天的节目" (文字)
输出: [自然流畅的语音] (音频波形)
音乐生成:
代表模型:Suno, Udio, MusicGen
输入: "一首欢快的爵士乐,钢琴为主,有萨克斯solo" (文字描述)
输出: [一段3分钟的爵士乐曲] (音乐)
音效生成:
代表模型:ElevenLabs SFX, AudioLDM
输入: "雨滴打在铁皮屋顶上的声音,远处有雷声"
输出: [逼真的雨声音效]Text → Video(文生视频)
代表模型:Sora (OpenAI), Kling (快手), Runway Gen-3, 即梦(字节)
输入: "一个年轻女子在东京街头漫步,霓虹灯闪烁,地面雨后湿润
反光,电影质感,慢镜头"
输出: [一段10秒的高质量视频]
技术挑战:
• 时间一致性:物体在帧之间不能变形或消失
• 物理正确性:运动要符合物理规律
• 计算成本:视频比图像多 24~60 倍数据量2.3 Omni-Model(全模态模型)
Omni-Model 是"全能型"的——同一模型既能理解多模态输入,也能生成多模态输出。
GPT-4o (OpenAI)
├─ 输入: 文本 + 图像 + 音频
├─ 输出: 文本 + 图像(通过 DALL-E 集成)+ 语音
├─ 特点: 端到端多模态,极低音频延迟(~320ms)
└─ 定位: "一个模型处理所有模态"
Gemini 2.5 (Google)
├─ 输入: 文本 + 图像 + 音频 + 视频 + 代码
├─ 输出: 文本 + 图像(Imagen 集成)+ 语音
├─ 特点: 原生多模态,超长上下文(1M+ tokens)
└─ 定位: "Google 生态的全模态入口"
Qwen2.5-Omni (阿里)
├─ 输入: 文本 + 图像 + 音频 + 视频
├─ 输出: 文本 + 语音
├─ 特点: 开源 Omni-Model
└─ 定位: "开源的 GPT-4o 替代"Omni-Model 的统一架构理念
传统多模态:每个模态独立模型
┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐
│ 视觉 │ │ 语音 │ │ 文本 │ │ 生成 │
│ 模型 │ │ 模型 │ │ 模型 │ │ 模型 │
└──┬───┘ └──┬───┘ └──┬───┘ └──┬───┘
│ │ │ │
└────────┴────────┴────────┘
"胶水代码"串联
Omni-Model:统一的多模态表示
┌─────────────────────────────────────┐
│ │
│ 单一 Transformer │
│ │
│ 输入: 所有模态 │
│ ┌────┐ ┌────┐ ┌────┐ ┌────┐ │
│ │文本 │ │图像│ │音频 │ │视频 │ │
│ └──┬─┘ └──┬─┘ └──┬─┘ └──┬─┘ │
│ └──────┴──────┴──────┘ │
│ │ │
│ 统一的 Token 序列 │
│ │ │
│ ┌────┴────┐ │
│ │ Transformer│ │
│ └────┬────┘ │
│ │ │
│ 输出: 多模态 │
│ ┌────┐ ┌────┐ ┌────┐ │
│ │文本│ │语音│ │图像│ (可扩展) │
│ └────┘ └────┘ └────┘ │
│ │
└─────────────────────────────────────┘2.4 多模态的应用场景
教育
├─ 拍照解题(数学、物理、化学)
├─ 手写批改
└─ 图文并茂的教学内容生成
医疗
├─ 医学影像分析(X光、CT、MRI解读)
├─ 病理切片辅助诊断
└─ 手术视频理解
电商
├─ 以图搜图(拍照找商品)
├─ 虚拟试穿
└─ 商品图片自动描述
内容创作
├─ 文生图/视频(海报、广告素材)
├─ 视频自动剪辑和字幕
└─ 播客生成(文本→语音对话)
无障碍
├─ 盲人辅助(拍照描述周围环境)
├─ 手语翻译(视频→文字)
└─ 实时语音转文字(听障人士)
工业
├─ 产品质量检测(视觉质检)
├─ 设备仪表读数(工业OCR)
└─ 安全监控(异常行为检测)3. 总结
多模态是 AI 从"单一文本通道"走向"类人多感官"的关键进化。
层级 代表技术/模型
════════════════════════════════════════════════════════════════
全模态 (Omni) GPT-4o, Gemini 2.5, Qwen2.5-Omni
────────────────────────────────────────────────────────────────
视频理解/生成 Sora, Kling, Runway Gen-3
────────────────────────────────────────────────────────────────
图像生成 DALL-E 3, Midjourney, Stable Diffusion 3
────────────────────────────────────────────────────────────────
语音合成/识别 ElevenLabs, FishSpeech, CosyVoice
────────────────────────────────────────────────────────────────
视觉语言模型 (VLM) GPT-4V, Claude Vision, Qwen-VL, LLaVA
────────────────────────────────────────────────────────────────
纯文本 LLM GPT-4, Claude, LLaMA, Qwen
════════════════════════════════════════════════════════════════关键要点:
- VLM 的核心架构是"视觉编码器 + 投影层 + LLM",让模型能理解图像
- 多模态输入正从"文字"扩展到"文字+图像+音频+视频"
- 多模态输出正从"文字"扩展到"文字+图像+音频+视频"
- Omni-Model 是趋势——一个模型处理所有模态,而非多个独立模型
- 多模态正在从"研究玩具"走向"产业落地"(教育、医疗、工业等)