神经网络与深度学习作业2
一、课程内容概述
本周课程围绕深度学习在计算机视觉中的典型应用展开,主要介绍了视觉任务中常用的数据集、模型评价指标、目标检测与 YOLO 方法,以及全卷积网络在语义分割中的应用。课程内容从基础数据集入手,逐步过渡到分类、检测、分割等视觉任务的评价方法和经典模型,使学生能够建立对深度学习视觉应用整体框架的认识。
课程整体可以划分为四个部分:第一部分介绍常用视觉数据集,包括 MNIST、Fashion-MNIST、CIFAR-10、PASCAL VOC、MS COCO、ImageNet 和 JFT-300M;第二部分讲解视觉模型的评价指标,重点包括精确率、召回率、P-R 曲线、AP 和 mAP;第三部分介绍目标检测问题及 YOLO 的基本思想;第四部分简要介绍全卷积网络 FCN 与 DeepLab v3 在语义分割任务中的应用。
二、常用视觉数据集学习总结
课程首先介绍了深度学习视觉任务中常用的数据集。MNIST 是最基础的手写数字识别数据集,由 0 到 9 的手写数字灰度图像及其标签组成,包含 60000 个训练样本和 10000 个测试样本,每张图像大小为 28×28 像素。该数据集结构简单,常用于入门级图像分类算法验证。
Fashion-MNIST 是 MNIST 的替代数据集,图像大小、数据格式以及训练集和测试集划分方式与 MNIST 基本一致,但内容由手写数字变为服装商品图像,共包含 10 类商品。由于 Fashion-MNIST 相比 MNIST 更接近真实图像分类问题,因此更适合用于测试模型在稍复杂场景下的分类性能。
CIFAR-10 数据集由 10 类共 60000 张 32×32 彩色图像组成,其中 50000 张用于训练,10000 张用于测试。与 MNIST 和 Fashion-MNIST 不同,CIFAR-10 是彩色自然图像数据集,类别包括飞机、汽车、鸟、猫、鹿、狗、青蛙、马、船和卡车等,因此更能体现卷积神经网络在自然图像分类中的应用价值。
PASCAL VOC 是目标分类、目标检测和语义分割领域的重要数据集之一,常用版本为 PASCAL VOC 2012。该数据集包含 20 个目标类别,例如 person、bird、cat、dog、car、bus、chair、sofa、tv/monitor 等。课程还介绍了 VOC 数据集的文件组织方式和 XML 标注格式,使学生理解了目标检测数据集中图像、标注文件、分割标签之间的对应关系。
MS COCO 数据集是当前目标检测和场景理解领域非常重要的数据集之一,全称为 Microsoft Common Objects in Context。它主要面向复杂日常场景,包含目标分类、检测、分割和语义标注等任务。COCO 数据集提供 80 类目标标注,包含超过 33 万张图片,其中约 20 万张图片带有标注,目标实例数量超过 150 万。相比 VOC,COCO 场景更复杂、目标数量更多,因此对模型的检测和分割能力提出了更高要求。
ImageNet 是大规模视觉识别任务中的代表性数据集,始于 2009 年,包含超过 1400 万张图像、2 万余个类别,并推动了 ILSVRC 竞赛的发展。ImageNet 的出现极大促进了深度卷积神经网络的发展,尤其是大规模预训练方法的应用。课程还提到了 ImageNet-21K 和 Google 内部使用的 JFT-300M 数据集,说明当前视觉模型的发展越来越依赖大规模数据和预训练技术。
三、评价指标学习总结
课程第二部分重点讲解了分类和检测任务中的评价指标。首先介绍了混淆矩阵中的四个基本概念:TP、FP、FN 和 TN。TP 表示实际为正例且被正确预测为正例的样本;FP 表示实际为负例但被错误预测为正例的样本;FN 表示实际为正例但被错误预测为负例的样本;TN 表示实际为负例且被正确预测为负例的样本。
基于这些概念,可以进一步定义精确率、召回率和准确率:
Precision = TP / (TP + FP)
Recall = TP / (TP + FN)
Accuracy = (TP + TN) / (TP + FP + TN + FN)
精确率反映模型预测为正例的样本中有多少是真正的正例,可以理解为模型预测结果的“可靠程度”;召回率反映真实正例中有多少被模型成功找出,可以理解为模型的“覆盖程度”。在实际任务中,精确率和召回率往往存在权衡关系。提高分类阈值通常会提升精确率,但可能降低召回率;降低分类阈值则可能提升召回率,但会引入更多误检。
课程通过飞机与大雁分类的例子说明了 TP、FP、FN、TN 的含义,并进一步展示了当置信度阈值变化时,Precision 和 Recall 会随之变化。为了综合评价模型在不同阈值下的性能,课程介绍了 P-R 曲线。P-R 曲线反映了精确率和召回率之间的变化关系,在目标检测任务中非常常用。
在 P-R 曲线基础上,课程进一步讲解了 AP,即 Average Precision。AP 可以理解为 P-R 曲线下的加权面积,其计算形式为:
AP = Σ P(k) Δr(k)
其中,P(k) 表示识别出 k 个样本时的精确率,Δr(k) 表示召回率的变化量。课程强调,当 Recall 没有变化时,对 AP 的增加没有贡献。对于多类别检测任务,每个类别都可以计算一个 AP,将所有类别的 AP 取平均值,就得到 mAP。mAP 是目标检测任务中最常见、最重要的综合评价指标之一。
四、目标检测与 YOLO 学习总结
课程第三部分介绍了目标检测问题。目标检测的任务是在给定图像中精确找到目标的位置,并标注出目标所属类别。与图像分类不同,目标检测不仅需要判断“图像中有什么”,还需要判断“目标在哪里”。因此,目标检测同时包含分类和定位两个子任务。
目标检测任务具有较高复杂度,主要体现在以下几个方面:第一,目标可能出现在图像中的任意位置;第二,目标尺寸变化范围很大;第三,目标姿态、角度和遮挡情况复杂;第四,一张图像中可能同时存在多个类别、多个实例。因此,目标检测模型需要同时具备特征提取、目标定位和类别判别能力。
课程简要回顾了目标检测方法的发展过程,包括 R-CNN、SPPNet、Fast R-CNN、Faster R-CNN,最后引出 YOLO 方法。YOLO 的全称是 You Only Look Once,其核心思想是将目标检测看作一个端到端的回归问题,通过一次前向传播同时预测目标类别和边界框位置。相比传统两阶段检测方法,YOLO 更加注重检测速度,因此适合实时目标检测任务。
虽然本次 PPT 对 YOLO 的具体结构和损失函数没有展开详细说明,但课程指出,理解 YOLO 需要先掌握目标检测问题的基本形式以及前期目标检测方法的发展脉络。YOLO 作为目标检测领域的经典方法,将分类、定位和置信度预测整合在一个统一框架中,是后续许多实时检测模型的重要基础。
五、全卷积网络与语义分割学习总结
课程最后介绍了全卷积网络与语义分割。语义分割是比目标检测更细粒度的视觉任务,其目标是为图像中的每一个像素分配类别标签。与目标检测只输出目标框不同,语义分割需要得到像素级的分类结果,因此在自动驾驶、医学图像分析、遥感影像处理和工业缺陷检测等领域具有重要应用价值。
FCN,即 Fully Convolutional Network,是语义分割任务中的经典方法。它将传统卷积神经网络中的全连接层替换为卷积层,使网络能够输入任意尺寸图像并输出空间结构保持一致的像素级预测结果。FCN 的提出使深度学习方法能够有效应用于端到端语义分割任务。
课程还提到 DeepLab v3 是目前广泛使用的语义分割方法之一。DeepLab 系列方法通过空洞卷积、多尺度上下文建模等技术提升分割性能,能够更好地处理目标尺度变化和边界细节问题。通过 FCN 和 DeepLab v3 的介绍,可以看出语义分割模型的发展重点在于如何兼顾全局语义信息和局部空间细节。
六、课程收获与思考
通过本次课程学习,我对深度学习视觉应用的基本体系有了更加清晰的认识。首先,视觉任务的发展离不开高质量数据集的支撑。从 MNIST、CIFAR-10 到 VOC、COCO、ImageNet,不同数据集对应不同任务难度和应用场景,也推动了图像分类、目标检测和语义分割模型的不断发展。
其次,模型评价指标是理解实验结果的基础。仅使用 Accuracy 往往不能全面反映模型性能,尤其是在类别不均衡或目标检测任务中,Precision、Recall、AP 和 mAP 更能反映模型的实际表现。通过课程中的飞机与大雁示例,可以更直观地理解阈值变化对精确率和召回率的影响。
再次,目标检测与语义分割代表了计算机视觉从图像级理解向实例级、像素级理解的发展趋势。目标检测关注目标类别和位置,语义分割进一步关注每个像素的类别归属。这些任务在工业检测、自动驾驶、安防监控和医学图像等领域都有广泛应用。
结合自己的学习方向来看,深度学习视觉应用中的数据集构建、评价指标选择和模型任务定义都非常重要。对于实际工业视觉检测问题,除了模型结构本身,还需要关注数据标注格式、缺陷类别定义、评价指标设计以及模型在复杂场景下的鲁棒性。本次课程中的 VOC、COCO 标注体系以及 AP、mAP 指标,对后续开展目标检测和缺陷检测实验具有重要参考价值。
更多推荐




所有评论(0)