前沿方向:Early Fusion 与 VLM 的下一代范式|多模态大模型专栏⑨(完结篇)

一句话讲透本篇:前 8 篇讲的 LLaVA 类"拼接"路线(视觉编码器 + Projector + LLM)属于 late fusion;而 Chameleon / Emu3 / Llama 4 代表的 early fusion,把图像离散化为 token,文本与图像共用一套 vocab、单模型单 loss,统一了理解与生成。这是 VLM 的下一代范式。


写在前面

前八篇 完成了从架构理解到训练、对齐、评测、部署的完整闭环。本篇作为完结篇,做两件事:一是聚焦 VLM 的下一代范式——early fusion(早期融合);二是速览其余前沿方向,并回顾整个专栏的路径。

本篇无配套可运行 demo(前沿方向多为外部库起步),偏概念与趋势论述,辅以可上手的研究机会。

阅读本篇后可获得:

  • ✅ 区分 late fusion(拼接)与 early fusion(统一)两大范式及其权衡
  • ✅ 理解 early fusion 的核心技术——图像 tokenizer(VQ)与 codebook 设计
  • ✅ 掌握一个具体可上手的研究点(codebook size 的 sweet spot)
  • ✅ 了解视频、Agent、推理、数据评测等其余前沿方向,明确深入路径

一、两大范式:late fusion vs early fusion

本专栏前 8 篇讲的 LLaVA / Qwen-VL / InternVL 都属于 late fusion(后期融合/拼接):视觉编码器产出连续特征,经 Projector 翻译后拼进 LLM 的文本流。其特征是"理解强、生成弱"——模型能看图答问,却无法直接生成图像。

early fusion(早期融合/统一) 走另一条路:用图像 tokenizer 把 H×W×3 编码成离散 token 序列,与文本 token 共用同一套 vocab,由单一 Transformer 做 next-token prediction。理解与生成由此统一在一个范式下。

Early Fusion · Chameleon/Emu3/Llama 4

图像

VQ Tokenizer
离散 image token

文本

BPE
text token

统一 Transformer
单 vocab 单 loss

→ 文本 / 图像 token(理解+生成统一)

Late Fusion · LLaVA/Qwen-VL/InternVL(前 8 篇)

图像

Vision Encoder
连续特征

Projector 翻译

拼接进 LLM 文本流

→ 文本(不能直接生成图)

核心区别

维度 Late Fusion(拼接) Early Fusion(统一)
视觉表示 连续特征向量 离散 token
模型结构 编码器 + Projector + LLM 单一 Transformer
vocab 文本独占 文本 + 图像共用
训练目标 多个(对比 + LM + 偏好) 单一 next-token
理解能力 强(当前主流) 追平中(Emu3 已接近)
生成能力 弱(需外接 diffusion) 原生支持
工程成熟度 高难度(训练不稳、codebook 设计)

二、early fusion 的代表工作

工作 思路
Chameleon(Meta, 2024) 图像离散化为 token,文本 + 图像 token 一起 next-token prediction,早期统一模型代表
Emu3 纯 next-token 范式覆盖生成与理解,生成质量追上 diffusion
Show-o 自回归(理解)+ diffusion(生成)混合
Llama 4 MoE + early fusion 的工业级实现
TokenFlow / Luna 将视觉与文本 token 投到同一空间

Emu3 的意义在于证明了一个关键命题:纯 next-token 范式不必输给 diffusion——只要图像 tokenizer 足够好,统一的自回归模型能在生成任务上追平专用 diffusion 模型。这让"统一基础模型"从理想变为可行路径。


三、核心技术:图像 tokenizer 与 codebook

early fusion 的成败系于图像 tokenizer:把连续图像压缩成离散 code 序列(通常基于 VQ-VAE / VQGAN)。codebook(码本)大小是其核心 trade-off。

  • codebook 越大(如 65536):重建越清晰,但 token 越稀疏,next-token 学习越困难;
  • codebook 越小(如 4096):token 集中、易学,但重建质量损失。
  • Emu3 选用 32768 作为折中。

一个可上手的研究机会:codebook size 的 sweet spot

问题陈述:codebook size 的最优值通常以重建 PSNR 衡量,但下游 VLM 任务(理解/问答)的最优值未必与重建最优一致。是否存在一个 sweet spot,使得下游任务(而非重建)表现最优?

入手方法:固定 LLM backbone,扫描 4 个 codebook size(4096 / 16384 / 65536 / 262144),在 MMMU 与 DocVQA 上观察精度拐点。这是一个算力可控、问题明确的实验型研究点。


四、其余前沿方向速览

除统一基础模型外,VLM 还有数个活跃方向,每个附带最小起点与一个具体研究机会:

方向 关键问题 代表工作
视频理解 长时序、高帧数、时序位置编码;长视频关键帧选择 Video-LLaVA、LLaVA-OneVision、InternVideo2、LongVA
多模态 Agent VLM 调工具、看屏幕、操作 GUI CogAgent、ShowUI、OS-Atlas、OmniParser、Mobile-Agent
视觉生成与编辑 指令式编辑的指令鲁棒性 Stable Diffusion 3、Flux、InstructPix2Pix
多模态推理(o1/R1 风格) "看图思考"再回答;CoT 长度与精度 scaling Qwen2.5-VL+RLVR、LLaVA-CoT、R1-Onevision
数据与评测 数据蒸馏、自训练过滤阈值、防污染评测 ShareGPT4V、MMMU-Pro、LiveBench-VL

其中多模态推理与本专栏第⑦篇的 GRPO 直接衔接——将 reward 替换为"几何题/图表答案精确匹配",即可用 code/04_rl/grpo_advantage_demo.py 的框架训练视觉推理模型。

选方向建议(按出成果难度 × 影响力)

方向 难度 影响力 适合人群
多模态 Agent 高(落地清晰) 工程倾向、想做产品
多模态 RL + 推理 中高 高(学术热点) 有 RL 基础、想发论文
垂直文档 VLM 中(本专栏已奠基) 想快速出业务价值
数据 / 评测前沿 算力有限但想有贡献
统一基础模型 高(前沿) 有大算力、能拼工程
视频理解 高(算力门槛) 中高 有视频数据或算力

五、专栏回顾

九篇专栏走过的完整路径:

① 全景图 ──── 建立 VLM 三组件心智模型
② 手写 CLIP ── 对比学习训练"那双眼睛"
③ 张量 walkthrough ── 亲眼看图像如何变成 token
④ 对齐(上) ── MLP vs Q-Former,Projector 设计
⑤ 对齐(下) ── M-RoPE 与动态分辨率
⑥ 训练 Pipeline ── 单卡 LoRA SFT(显存 120→17 GB)
⑦ 多模态 RL ── DPO + GRPO 抗幻觉
⑧ 评测与部署 ── lmms-eval + SGLang 上线
⑨ 前沿方向 ── early fusion 与下一代范式(本篇)

走完这条路径,已具备三项能力:从零理解并实现 ViT / CLIP / SigLIP / LLaVA 的核心组件;在单卡 A100 上完成训练、对齐、评测、部署一个垂直 VLM;看懂 Qwen2-VL / InternVL / LLaVA-OneVision 等主流模型的论文与源码。


小结

概念 要点
late fusion 视觉连续特征 + Projector 拼接(LLaVA 类,本专栏主线)
early fusion 图像离散 token + 单 vocab 单 loss(Chameleon/Emu3/Llama4)
图像 tokenizer VQ-VAE 编码离散 code,codebook size 是核心 trade-off
研究机会 codebook size 的下游任务 sweet spot
深入路径 Agent / 推理 / 视频 / 统一模型,按算力与目标选择

📎 本篇涉及代码

本篇为前沿展望,无新增配套 demo。其中多模态推理方向可直接复用第⑦篇的 GRPO 框架:

文件 复用方式
code/04_rl/grpo_advantage_demo.py 将 reward 替换为"几何题/图表答案精确匹配",即可训练视觉推理模型

本专栏全部代码 GitHub:multi_large_model


写在最后:从教程到项目

至此,《从 NLP 到 VLM:多模态大模型研发实战》九篇全部完成。

本专栏的所有原理、代码、demo 均开源于此仓库。最后一步,是把 code/03_sft/ 的示例数据替换为真实业务数据——文档、票据、合同、报告——让这套教程变成一个真正落地的垂直 VLM 项目。

专栏:《从 NLP 到 VLM:多模态大模型研发实战》(全 9 篇完结)
上一篇:⑧ 评测与部署 | 本篇:⑨ 前沿方向(完结篇)
全部代码:GitHub · multi_large_model 🚀

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐