记录每天的学习内容2026.3.4--了解vit(AI总结)与ai问答全部对话在github:https://github.com/101per/learning.git
·
太棒了!今天我们深度拆解了计算机视觉(CV)领域近年来最重大的范式转移。以下是为你整理的复盘总结:
📝 学习笔记:从 CNN 跨越到 Vision Transformer (ViT)
1. 核心定义:什么是 ViT?
- 本质:直接将原本用于处理文字的 Transformer 架构迁移到图像领域。
- 跨界逻辑:把图片看作一篇文章,把图像块(Patches)看作单词(Words)。
2. 关键流程:图片是如何变成向量的?
- 分块 (Patching):将 的图片切成一个个固定大小的小方块(如 )。
- 线性投影 (Linear Projection):
- 将三维小方块“拉直”成一维序列。
- 通过矩阵乘法映射到高维空间(Embedding),使其具备语义表达能力。
- 位置编码 (Position Embedding):给每个块打上“坐标标签”,弥补 Transformer 缺乏空间位置感的弱点。
3. 核心差异:ViT vs CNN
- 视野:CNN 像“局部扫描仪”(由近及远);ViT 像“全局扫描仪”(第一层就能看到整张图)。
- 食量:ViT 极度“吃数据”,需要海量预训练才能发挥潜力;CNN 则在小数据集上更稳健。
4. 必看论文地图(进阶路径)
- 奠基:[ViT] 证明了 Transformer 搞视觉可行。
- 进化:[Swin Transformer] 引入滑动窗口,解决计算量大、不擅长小目标的问题。
- 提效:[DeiT] 解决了小数据集训练难的问题。
- 理解:[MAE] 通过“完形填空”让模型自学视觉特征。
- 联通:[CLIP] 让模型学会用文字理解图像,开启多模态时代。
💡 总结感悟
ViT 的出现不仅是换了一个算法,它代表了视觉与语言处理在架构上的大统一。这种统一性正是目前多模态大模型(如 GPT-4V、Gemini)能够同时理解图片和文字的技术根基。
接下来,你想尝试从代码层面看看如何用 PyTorch 实现一个简单的 Patch Embedding,还是想深入聊聊 Swin Transformer 是如何“滑动窗口”的?
更多推荐

所有评论(0)