【大模型】前沿方向:Early Fusion 与 VLM 的下一代范式|多模态大模型专栏⑨(完结篇)
前沿方向:Early Fusion 与 VLM 的下一代范式|多模态大模型专栏⑨(完结篇)
一句话讲透本篇:前 8 篇讲的 LLaVA 类"拼接"路线(视觉编码器 + Projector + LLM)属于 late fusion;而 Chameleon / Emu3 / Llama 4 代表的 early fusion,把图像离散化为 token,文本与图像共用一套 vocab、单模型单 loss,统一了理解与生成。这是 VLM 的下一代范式。
写在前面
前八篇 完成了从架构理解到训练、对齐、评测、部署的完整闭环。本篇作为完结篇,做两件事:一是聚焦 VLM 的下一代范式——early fusion(早期融合);二是速览其余前沿方向,并回顾整个专栏的路径。
本篇无配套可运行 demo(前沿方向多为外部库起步),偏概念与趋势论述,辅以可上手的研究机会。
阅读本篇后可获得:
- ✅ 区分 late fusion(拼接)与 early fusion(统一)两大范式及其权衡
- ✅ 理解 early fusion 的核心技术——图像 tokenizer(VQ)与 codebook 设计
- ✅ 掌握一个具体可上手的研究点(codebook size 的 sweet spot)
- ✅ 了解视频、Agent、推理、数据评测等其余前沿方向,明确深入路径
一、两大范式:late fusion vs early fusion
本专栏前 8 篇讲的 LLaVA / Qwen-VL / InternVL 都属于 late fusion(后期融合/拼接):视觉编码器产出连续特征,经 Projector 翻译后拼进 LLM 的文本流。其特征是"理解强、生成弱"——模型能看图答问,却无法直接生成图像。
early fusion(早期融合/统一) 走另一条路:用图像 tokenizer 把 H×W×3 编码成离散 token 序列,与文本 token 共用同一套 vocab,由单一 Transformer 做 next-token prediction。理解与生成由此统一在一个范式下。
核心区别
| 维度 | Late Fusion(拼接) | Early Fusion(统一) |
|---|---|---|
| 视觉表示 | 连续特征向量 | 离散 token |
| 模型结构 | 编码器 + Projector + LLM | 单一 Transformer |
| vocab | 文本独占 | 文本 + 图像共用 |
| 训练目标 | 多个(对比 + LM + 偏好) | 单一 next-token |
| 理解能力 | 强(当前主流) | 追平中(Emu3 已接近) |
| 生成能力 | 弱(需外接 diffusion) | 原生支持 |
| 工程成熟度 | 高 | 高难度(训练不稳、codebook 设计) |
二、early fusion 的代表工作
| 工作 | 思路 |
|---|---|
| Chameleon(Meta, 2024) | 图像离散化为 token,文本 + 图像 token 一起 next-token prediction,早期统一模型代表 |
| Emu3 | 纯 next-token 范式覆盖生成与理解,生成质量追上 diffusion |
| Show-o | 自回归(理解)+ diffusion(生成)混合 |
| Llama 4 | MoE + early fusion 的工业级实现 |
| TokenFlow / Luna | 将视觉与文本 token 投到同一空间 |
Emu3 的意义在于证明了一个关键命题:纯 next-token 范式不必输给 diffusion——只要图像 tokenizer 足够好,统一的自回归模型能在生成任务上追平专用 diffusion 模型。这让"统一基础模型"从理想变为可行路径。
三、核心技术:图像 tokenizer 与 codebook
early fusion 的成败系于图像 tokenizer:把连续图像压缩成离散 code 序列(通常基于 VQ-VAE / VQGAN)。codebook(码本)大小是其核心 trade-off。
- codebook 越大(如 65536):重建越清晰,但 token 越稀疏,next-token 学习越困难;
- codebook 越小(如 4096):token 集中、易学,但重建质量损失。
- Emu3 选用 32768 作为折中。
一个可上手的研究机会:codebook size 的 sweet spot
问题陈述:codebook size 的最优值通常以重建 PSNR 衡量,但下游 VLM 任务(理解/问答)的最优值未必与重建最优一致。是否存在一个 sweet spot,使得下游任务(而非重建)表现最优?
入手方法:固定 LLM backbone,扫描 4 个 codebook size(4096 / 16384 / 65536 / 262144),在 MMMU 与 DocVQA 上观察精度拐点。这是一个算力可控、问题明确的实验型研究点。
四、其余前沿方向速览
除统一基础模型外,VLM 还有数个活跃方向,每个附带最小起点与一个具体研究机会:
| 方向 | 关键问题 | 代表工作 |
|---|---|---|
| 视频理解 | 长时序、高帧数、时序位置编码;长视频关键帧选择 | Video-LLaVA、LLaVA-OneVision、InternVideo2、LongVA |
| 多模态 Agent | VLM 调工具、看屏幕、操作 GUI | CogAgent、ShowUI、OS-Atlas、OmniParser、Mobile-Agent |
| 视觉生成与编辑 | 指令式编辑的指令鲁棒性 | Stable Diffusion 3、Flux、InstructPix2Pix |
| 多模态推理(o1/R1 风格) | "看图思考"再回答;CoT 长度与精度 scaling | Qwen2.5-VL+RLVR、LLaVA-CoT、R1-Onevision |
| 数据与评测 | 数据蒸馏、自训练过滤阈值、防污染评测 | ShareGPT4V、MMMU-Pro、LiveBench-VL |
其中多模态推理与本专栏第⑦篇的 GRPO 直接衔接——将 reward 替换为"几何题/图表答案精确匹配",即可用 code/04_rl/grpo_advantage_demo.py 的框架训练视觉推理模型。
选方向建议(按出成果难度 × 影响力)
| 方向 | 难度 | 影响力 | 适合人群 |
|---|---|---|---|
| 多模态 Agent | 中 | 高(落地清晰) | 工程倾向、想做产品 |
| 多模态 RL + 推理 | 中高 | 高(学术热点) | 有 RL 基础、想发论文 |
| 垂直文档 VLM | 低 | 中(本专栏已奠基) | 想快速出业务价值 |
| 数据 / 评测前沿 | 低 | 中 | 算力有限但想有贡献 |
| 统一基础模型 | 高 | 高(前沿) | 有大算力、能拼工程 |
| 视频理解 | 高(算力门槛) | 中高 | 有视频数据或算力 |
五、专栏回顾
九篇专栏走过的完整路径:
① 全景图 ──── 建立 VLM 三组件心智模型
② 手写 CLIP ── 对比学习训练"那双眼睛"
③ 张量 walkthrough ── 亲眼看图像如何变成 token
④ 对齐(上) ── MLP vs Q-Former,Projector 设计
⑤ 对齐(下) ── M-RoPE 与动态分辨率
⑥ 训练 Pipeline ── 单卡 LoRA SFT(显存 120→17 GB)
⑦ 多模态 RL ── DPO + GRPO 抗幻觉
⑧ 评测与部署 ── lmms-eval + SGLang 上线
⑨ 前沿方向 ── early fusion 与下一代范式(本篇)
走完这条路径,已具备三项能力:从零理解并实现 ViT / CLIP / SigLIP / LLaVA 的核心组件;在单卡 A100 上完成训练、对齐、评测、部署一个垂直 VLM;看懂 Qwen2-VL / InternVL / LLaVA-OneVision 等主流模型的论文与源码。
小结
| 概念 | 要点 |
|---|---|
| late fusion | 视觉连续特征 + Projector 拼接(LLaVA 类,本专栏主线) |
| early fusion | 图像离散 token + 单 vocab 单 loss(Chameleon/Emu3/Llama4) |
| 图像 tokenizer | VQ-VAE 编码离散 code,codebook size 是核心 trade-off |
| 研究机会 | codebook size 的下游任务 sweet spot |
| 深入路径 | Agent / 推理 / 视频 / 统一模型,按算力与目标选择 |
📎 本篇涉及代码
本篇为前沿展望,无新增配套 demo。其中多模态推理方向可直接复用第⑦篇的 GRPO 框架:
| 文件 | 复用方式 |
|---|---|
code/04_rl/grpo_advantage_demo.py |
将 reward 替换为"几何题/图表答案精确匹配",即可训练视觉推理模型 |
本专栏全部代码 GitHub:multi_large_model。
写在最后:从教程到项目
至此,《从 NLP 到 VLM:多模态大模型研发实战》九篇全部完成。
本专栏的所有原理、代码、demo 均开源于此仓库。最后一步,是把 code/03_sft/ 的示例数据替换为真实业务数据——文档、票据、合同、报告——让这套教程变成一个真正落地的垂直 VLM 项目。
专栏:《从 NLP 到 VLM:多模态大模型研发实战》(全 9 篇完结)
上一篇:⑧ 评测与部署 | 本篇:⑨ 前沿方向(完结篇)
全部代码:GitHub · multi_large_model 🚀
更多推荐

所有评论(0)