1. YOLO 是什么  YOLO = You Only Look Once

模型只看一遍图片,就能检测出物体的类别和位置。

目标检测要解决两个问题: 物体是什么+物体在哪里

输出结果一般是: 类别+位置框+置信度


2. 目标框表示方法

第一种:(x1​,y1​,x2​,y2​) 表示左上角和右下角坐标。

第二种:(xc​,yc​,w,h) 表示中心点坐标和宽高。

YOLO 常用:(xc​,yc​,w,h)


3. YOLO 的基本思想

YOLO 会把图片划分成网格,每个网格负责预测附近的目标。

模型输出可以理解为:

其中:S×S 表示网格数量。 B 表示每个网格预测几个框。

5 表示:x,y,w,h,confidence。 C 表示类别数量。


4. 置信度 Confidence

置信度表示:这个框里有没有目标,以及框准不准。

经典公式: 注意:置信度 ≠ 类别概率。

置信度判断有没有目标。 类别概率判断是什么目标。


5. IoU 交并比

IoU 用来衡量预测框和真实框重叠程度。

                I

如果两个框完全重合:IoU=1

如果完全不重合:IoU=0 IoU 越大,框越准。

例子:预测框面积 200,真实框面积 300,重叠面积 100。

IoU=200+300−100100​=0.25


6. YOLO 损失函数

YOLO 的损失主要有三部分:

其中:Lbox​ 表示框位置损失。 Lobj​ 表示目标置信度损失。 Lcls​ 表示类别损失。


7. NMS 非极大值抑制

YOLO 会对同一个物体预测出多个框。NMS 的作用是:删除重复框,只保留置信度最高的框。

步骤:                  

                第一,按照置信度从高到低排序。

                第二,选择置信度最高的框。

                第三,计算这个框和其他框的 IoU。

                第四,如果 IoU 超过设定阈值,就删除低置信度框。

                第五,重复以上步骤,直到没有多余框。

8. YOLO 的完整检测流程

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐