神经网络与深度学习课堂笔记(第二次)
摘要: 本周课程我们正式迈入了深度学习在计算机视觉(CV)领域的实战应用。内容主要围绕四大核心板块展开:奠定深度学习基石的主流视觉数据集、评估模型好坏的核心任务评价指标(混淆矩阵、P-R曲线、mAP)、经典目标检测框架(YOLO系列的发展脉络),以及全卷积网络(FCN)与语义分割的基础概念。以下是对本周课堂内容的全面知识梳理。
一、 计算机视觉常用数据集汇总
深度学习的发展离不开高质量大数据的支撑。本周课堂梳理了工业界与学术界最常用的几大明星数据集:
| 数据集名称 | 特点与主要用途 | 关键参数 / 数据量级 |
| MNIST | 手写数字图片及标签集,经典的入门“Hello World”。 | 包含 10 个类别(对应数字 0~9)。 |
| CIFAR-10 | 基础通用物体分类数据集。 | 包含 10 个常见物体与交通工具类(如飞机、汽车、鸟等)。 |
| PASCAL VOC | 经典的多目标检测、图像分割主流基准数据集。 | 涵盖人类、动植物、车辆及室内物品等大类。 |
| MS COCO | 微软发布的大规模目标检测、分割和关键点检测数据集,小目标多、场景复杂。 | 包含更丰富的上下文信息,是目前业界衡量检测算法的主流标杆之一。 |
| ImageNet | 由李飞飞团队与Google合作推出的超大型分层图像数据库,直接催生了现代深度学习的爆发。 | 总图像数超 1419万张,超过 2.1万个 类别,其中带标记框的图像数超 103 万张。 |
| JFT-300M | 谷歌内部超大规模工业级分类数据集(不公开)。 | 包含 3亿张 图像,产生了超过 10亿个 算法及人工标签。 |
二、 核心任务评价指标(重点、难点)
如何科学地评价一个视觉模型到底准不准?以“飞机与大雁分类”为例,层层推导了经典指标:
2.1 混淆矩阵(Confusion Matrix)基础概念
-
TP (True Positive):实际为正例,且被分类器正确划分为正例的个数。
-
FP (False Positive):实际为负例,但被分类器错误划分为正例的个数。
-
FN (False Negative):实际为正例,但被分类器错误划分为负例的个数。
-
TN (True Negative):实际为负例,且被分类器正确划分为负例的个数。
2.2 核心公式与通俗理解
-
精确率 / 准确率 (Precision):所有被模型预测为正例的样本中,真正为正例的比例。标识了模型的“挑剔”程度。
-
召回率 (Recall):所有实际为正例的样本中,被模型成功找回来的比例。标识了模型的“通过”程度。
-
准确度 (Accuracy):所有样本中被模型预测正确的比例。
2.3 P-R曲线与平均精度(AP / mAP)
阈值的影响: 模型的输出通常是一个置信度(Confidence Score)。通过调整判定为正样本的阈值,Precision 和 Recall 的值会发生联动变化。一般来说,精确率越高,召回率往往越低。
-
P-R 曲线:以纵轴为 Precision、横轴为 Recall 绘制的曲线,展示了两者之间的博弈关系。
-
AP(平均准确率):P-R 曲线下的面积。:
-
mAP(平均精度均值):在多类别检测任务中,分别计算出每一个类别的 AP 值,然后对所有类别的 AP 取算术平均值。
三、 目标检测与 YOLO 核心思想
3.1 什么是目标检测?
目标检测任务不仅要在给定的图片中精确定位物体所在的位置(标出 bounding box),还要同时识别出该物体的具体类别。它的难点在于物体的尺寸变化大、摆放角度和姿态不定、位置随机,且可能在一张图里密集出现多个类别的物体。
3.2 发展脉络与 YOLO 的诞生
课堂梳理了目标检测从传统多阶段(Two-stage)演进到单阶段(One-stage)的集大成之路:
-
演进路线:R-CNN - SPP NET-Fast R-CNN - Faster R-CNN-YOLO。
-
YOLO (You Only Look Once):作为 One-stage 的开山鼻祖,它抛弃了传统繁琐的候选区域提取(Region Proposal)步骤,直接将目标检测问题转化为一个端到端的回归问题。通过精妙的损失函数设计,网络仅需“看一眼”图片,就能同步输出所有物体的边界框位置和类别概率,实现了极高且实用的推理速度。
四、 全卷积网络(FCN)与语义分割
-
任务定义:与目标检测(画框)不同,语义分割属于像素级的分类任务,即需要给图像中的每一个像素点都打上对应的类别标签。
-
FCN (Fully Convolutional Networks):作为语义分割领域的奠基之作,FCN 的核心创新点在于将传统 CNN 尾部的全连接层悉数替换为了卷积层。这一改动使得网络不仅可以接受任意尺寸的图像输入,还能通过上采样(反卷积)操作让输出特征图恢复到原始图像的大小,从而实现了端到端的像素级语义分割。
-
现代前沿拓展:课堂还提及了目前在工业界和学术界被更广泛应用的语义分割架构 DeepLab v3,其通过引入空洞卷积(Atrous Convolution)和空间金字塔池化(ASPP)等机制,进一步提升了多尺度上下文信息的捕获能力。
五、 学习体会与收获
本周的课程完整地展示了深度学习在计算机视觉领域的全景应用落地。从数据、指标再到任务,逻辑环环相扣。我深刻体会到,要设计并训练好一个优秀的目标检测或分割模型,仅仅懂得如何搭建网络是不够的:
-
我们必须深刻理解诸如 ImageNet / MS COCO 的数据特性以做好预训练与数据增强;
-
必须精通 mAP、Precision、Recall 的联动调优,通过科学操纵置信度阈值来平衡实际业务中的错检与漏检;
-
从 YOLO 到 FCN 的演进更向我们展示了深度学习如何通过打破传统网络结构的思维定势(如干掉全连接层、将检测化为回归),从而带来执行效率与表现上的质的飞跃。这些工程和理论上的巧妙权衡,为我们接下来进行具体的课程项目实践提供了宝贵的指导意义。
更多推荐




所有评论(0)