这篇论文是 《DETRs Beat YOLOs on Real-time Object Detection》,核心贡献是提出 RT-DETR:一种实时、端到端、无需 NMS 的目标检测器。它的目标很明确:把 DETR 系列的“端到端、无需后处理”优势带到实时检测场景里,并在速度和精度上超过 YOLO 系列。

1. 论文要解决什么问题?

传统实时检测器,比如 YOLOv5、YOLOv7、YOLOv8,速度快、效果好,但通常需要 NMS 后处理

NMS 的作用是:模型会预测很多重叠框,NMS 根据置信度和 IoU 阈值删掉重复框,只保留最可能的检测结果。

问题在于:

  1. NMS 会增加推理延迟
    论文第 3 页分析了 YOLOv5 和 YOLOv8 在不同置信度阈值下剩余框数量的变化。阈值越低,留下的框越多,NMS 越慢。

  2. NMS 有手工超参数
    包括 confidence threshold 和 IoU threshold。不同阈值会影响 AP,也会影响速度。论文表 1 显示,YOLOv8 在不同 NMS 阈值下,AP 和 NMS 耗时都有明显变化。

  3. YOLO 报告速度时经常不包含 NMS 时间
    所以论文提出要用“端到端速度”来公平比较,也就是把后处理时间算进去。

而 DETR 的优点是天然端到端,不需要 NMS;缺点是 Transformer 编码器计算量大,速度不够实时。RT-DETR 就是想解决这个矛盾:既保留 DETR 的端到端结构,又达到 YOLO 级甚至更好的实时性能

2. RT-DETR 的整体结构

论文第 5 页的 Figure 4 给出了 RT-DETR 总体结构:

Backbone → Efficient Hybrid Encoder → Query Selection → Transformer Decoder → 检测结果

具体来说:

  1. Backbone
    提取多尺度特征,论文中使用最后三个阶段的特征:S3、S4、S5。

  2. 高效混合编码器 Efficient Hybrid Encoder
    这是 RT-DETR 的核心之一,用来替代传统 DETR 中昂贵的 Transformer encoder。

  3. 不确定性最小查询选择 Uncertainty-minimal Query Selection
    从 encoder 输出中选出高质量特征,作为 decoder 的初始 object queries。

  4. Transformer Decoder + 检测头
    逐层优化 object queries,最后输出类别和边界框。

可以把 RT-DETR 理解成:
用 CNN 的高效性处理多尺度融合,用 Transformer 的全局建模能力处理高层语义,再用 DETR 的端到端预测方式避免 NMS。

3. 核心创新一:Efficient Hybrid Encoder

传统 DETR 变体为了提升检测效果,会使用多尺度特征。但多尺度特征送进 Transformer encoder 后,序列长度大幅增加,计算开销很高。

RT-DETR 的想法是:
不要把所有尺度的特征都丢进 Transformer 做全局交互,而是把“尺度内交互”和“跨尺度融合”拆开做。

论文第 4 页 Figure 3 展示了几种 encoder 设计的对比:

  • A:没有 encoder;
  • B:单尺度 Transformer encoder;
  • C:多尺度 Transformer encoder;
  • D:把尺度内交互和跨尺度融合解耦;
  • E:最终的高效混合 encoder。

最终的 Efficient Hybrid Encoder 包含两个模块:

AIFI:Attention-based Intra-scale Feature Interaction

AIFI 只在最高层特征 S5 上做 Transformer 自注意力。

为什么只处理 S5?

因为 S5 语义最强,包含更抽象的目标信息。低层特征 S3、S4 更偏纹理和局部细节,在它们上面做全局注意力不仅贵,而且可能带来冗余和干扰。

论文表 3 的消融实验显示,只在 S5 上做尺度内交互,不仅速度更快,还能略微提升精度。

CCFF:CNN-based Cross-scale Feature Fusion

跨尺度融合不用 Transformer,而是用 CNN 风格的结构做。论文第 5 页 Figure 5 展示了 fusion block,包括:

  • 1×1 convolution 调整通道;
  • RepBlock 做特征融合;
  • element-wise add 融合两路输出。

这相当于用更便宜的卷积模块完成多尺度特征融合。

最终效果是:
Transformer 只负责最值得做注意力的高层语义特征,CNN 负责高效的多尺度融合。

这就是 RT-DETR 能实时的关键。

4. 核心创新二:Uncertainty-minimal Query Selection

DETR 里有一个重要概念叫 object query。你可以把它理解成 decoder 里的“检测槽位”:每个 query 最终负责预测一个目标或背景。

普通 DETR 的 query 是可学习向量,优化比较难。后来的 DETR 变体会从 encoder 特征里选择 top-K 特征作为初始 query,通常依据是分类置信度。

RT-DETR 认为这还不够。

因为一个好的检测特征不仅要“分类置信度高”,还要“定位质量高”。
也就是说,某个特征可能很确定“这里有一只狗”,但框的位置可能不准。只看分类分数,会选到定位不可靠的 query。

所以论文提出 uncertainty-minimal query selection

它的核心思想是:
选择那些分类预测和定位预测都可靠、二者不确定性更小的特征作为 query。

论文把特征不确定性定义为分类分布和定位分布之间的差异:

[
U(\hat{X}) = |P(\hat{X}) - C(\hat{X})|
]

直观理解:

  • ©:分类侧认为这个特征有多可靠;
  • §:定位侧认为这个特征有多可靠;
  • 二者差异越大,不确定性越高;
  • 训练时把这个不确定性纳入损失函数,让模型学会选择更稳定、更高质量的 query。

论文第 6 页 Figure 6 显示,使用 uncertainty-minimal query selection 后,被选中的特征更多集中在右上角,也就是 分类分数高、IoU 分数也高 的区域。表 4 进一步显示,该策略让 AP 从 47.9 提升到 48.7,提升了 0.8 AP。

5. 为什么 RT-DETR 不需要 NMS?

YOLO 这类检测器通常会产生大量候选框,然后靠 NMS 删除重复框。

DETR 系列不同。它通过 匈牙利匹配 bipartite matching 训练模型,让每个真实目标只匹配一个预测结果。这样模型学习的是一组不重复的目标预测,天然是端到端的,所以不需要 NMS。

RT-DETR 继承了 DETR 的这个优点。
因此它的推理流程更干净:

输入图像 → 网络前向 → 直接输出检测结果

没有 NMS,也就没有 NMS 阈值调参问题。

6. 实验结果怎么看?

论文第 7 页 Table 2 是最重要的结果表。

RT-DETR 在 COCO val2017 上的主要结果是:

模型APFPS
RT-DETR-R5053.1108
RT-DETR-R10154.374

对比 YOLO:

  • RT-DETR-R50 比 YOLOv8-L 精度略高,速度也更快;
  • RT-DETR-R101 比 YOLOv8-X 精度略高,速度也更快;
  • 相比传统 DETR,优势更明显。

尤其是和 DINO-Deformable-DETR-R50 对比:

模型APFPS
DINO-Deformable-DETR-R5050.95
RT-DETR-R5053.1108

这说明 RT-DETR 不只是“比 DETR 快”,而是把 DETR 真正推到了实时检测范围。

7. 另一个实用点:不用重训就能调速度

论文第 8 页 Table 5 做了 decoder 层数的消融。

RT-DETR 默认有多层 decoder,但推理时可以少用后面的几层。比如 RT-DETR-R50 使用 6 层 decoder 时 AP 是 53.1,延迟 9.3 ms;使用第 5 层输出时 AP 只掉到 53.0,但延迟降到 8.8 ms。

这意味着:

训练一次模型,部署时可以根据速度需求动态裁剪 decoder 层数。

这对实际部署很重要。比如:

  • 云端推理可以用完整 decoder,追求精度;
  • 边缘设备可以少用几层 decoder,追求速度;
  • 不需要重新训练模型。

8. 局限性

论文也承认 RT-DETR 有一个问题:
小目标检测能力仍然不如一些强 YOLO 模型。

在 Table 2 中,RT-DETR-R50 的小目标 AP 低于 YOLOv8-L,RT-DETR-R101 的小目标 AP 也低于 YOLOv7-X。原因可能是 DETR 类模型对小目标、密集目标的 query 分配和特征分辨率仍然比较敏感。

所以 RT-DETR 的优势主要体现在:

  • 端到端;
  • 无 NMS;
  • 综合速度/精度强;
  • 部署更简洁;
  • 中大目标表现优秀。

但在特别依赖小目标检测的场景,比如遥感、交通远距离小车、小缺陷检测等,还需要进一步改进。

9. 一句话总结

这篇论文的核心可以概括为:

RT-DETR 通过高效混合编码器降低 DETR 的计算成本,通过不确定性最小查询选择提升 query 质量,从而实现了一个无需 NMS、端到端、速度和精度都能超过主流 YOLO 的实时目标检测器。

从研究意义上看,它打破了一个常见印象:
实时检测不一定只能靠 YOLO,DETR 也可以做到实时,而且可以更简洁地部署。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐