一、课程概述

本周课程围绕“视觉大模型”这一前沿主题展开,系统介绍了大模型的技术背景、训练方法、多模态发展方向,并深入讲解了视觉领域的经典Transformer模型——Vision Transformer(ViT)。课程内容从自然语言处理中的大语言模型出发,逐步过渡到多模态理解与视觉Transformer的设计思路,形成了从语言到图像、从理论到实践的完整学习路径。


二、大语言模型:视觉大模型的技术基石

大语言模型(LLM)如GPT系列、文心一言、通义千问等,是基于海量文本数据训练的深度学习模型。它们通过“单字接龙”的方式生成自然语言文本,具备强大的文本理解与生成能力。

训练三阶段:

  1. 无监督学习:模型通过海量文本自学语言规律。
  2. 有监督学习:使用人工标注的问答数据,提升回答质量。
  3. 强化学习:通过奖励模型(RM)和PPO算法,优化模型输出,使其更符合人类偏好。

这一训练范式为大语言模型的发展奠定了基础,也为视觉大模型的设计提供了重要参考。


三、多模态大模型:视觉与语言的融合

多模态大模型(MM-LLM)旨在整合视觉、语言、声音等多种信息模态。其核心挑战在于如何将不同模态的预训练模型(如LLM和视觉模型)有效连接,实现协同推理。

解决方案包括:

  • 多模态预训练:对齐不同模态的特征空间。
  • 指令微调:使模型输出更符合人类意图。

典型模型包括GPT-4、Gemini、Claude、DeepSeek、Qwen等,均具备强大的多模态理解能力。


四、Vision Transformer(ViT):视觉领域的Transformer创新

1. ViT的诞生与意义

2020年,Google团队提出ViT,首次将Transformer架构直接应用于图像分类任务。其核心思想是:将图像视为一系列图像块(patches),每个patch相当于NLP中的一个单词

2. 工作流程

  • 图像切分:将输入图像划分为固定大小的patch,例如224×224图像切为16×16的patch,共196个。
  • 线性映射:将每个patch映射为固定维度的向量(如768维)。
  • 添加位置编码:引入一维位置编码,保留图像块之间的空间顺序。
  • 输入Transformer编码器:使用多头注意力(MSA)和MLP层进行特征提取。
  • 分类输出:通过添加的类别token(cls token)和MLP头完成分类任务。

3. 关键设计

  • 一维位置编码:实验证明,一维编码在ViT中足以学习到二维空间信息。
  • 层标准化(LN):在每个子层之前进行归一化,提升训练稳定性。
  • GELU激活函数:相比ReLU,GELU更平滑,效果更优。

4. 模型规模与性能

ViT提供了三种规模:Base、Large、Huge,参数从86M到632M不等。在大规模数据集(如JFT-300M)上预训练后,ViT在ImageNet、CIFAR-100等任务上优于传统CNN(如BiT)。

5. 微调策略

ViT支持通过2D插值调整位置编码,以适应不同分辨率的输入图像,从而灵活迁移到下游任务(如目标检测、细粒度分类)。


五、视觉大模型的技术延伸

课程还介绍了以下关键视觉大模型技术:

  • CLIP:通过图像-文本对进行联合预训练,实现跨模态理解。
  • 知识蒸馏与DINO:利用自监督学习和蒸馏方法,高效训练视觉Transformer,无需大量标注数据。

这些技术共同构建了现代视觉大模型的核心能力,推动了图像理解、多模态检索、视觉问答等任务的快速发展。


六、总结与展望

本次课程系统梳理了从大语言模型到视觉大模型的技术演进。ViT作为视觉Transformer的奠基之作,证明了Transformer架构在视觉任务中的强大潜力。未来,随着多模态大模型的进一步发展,视觉与语言的边界将不断模糊,通用人工智能的愿景也将在这一过程中逐步实现。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐