CVPR 2026 | 当Transformer邂逅Mamba:一种面向视频目标检测的Transformer-Mamba混合网络

论文信息

  • 论文题目:When Transformers Meet Mamba: A Hybrid Transformer-Mamba Network
    for Video Object Detection
  • 论文作者:Qiang Qi Xiao Wang* Zongyuan Du Yu Zhang
  • 发表单位:青岛科技大学数据科学学院
  • 发表会议\期刊:CVPR 2026
  • 代码链接:

02 论文主要贡献

随着Transformer技术的发展,视频目标检测领域取得了显著进展。Transformer擅长对长距离上下文依赖关系进行建模,但其二次复杂度限制了在长序列处理中的效率。相比之下,Mamba在长序列建模方面具备更高的效率,但与Transformer相比,其上下文学习能力相对有限,且目前尚未有研究将其应用于视频目标检测任务。为充分融合Transformer与Mamba的互补优势,本文提出了一种面向视频目标检测的Transformer-Mamba混合网络TMambaDet,这是该领域内首个结合Transformer长距离建模能力与Mamba高效长序列处理能力的框架。

本文提出的TMambaDet包含三大核心组件:1)空间自适应可变形Transformer编码器,可有效建模单帧内部的长距离依赖关系,实现帧内特征聚合,显著提升目标的空间特征表达能力;2)时序级联双向Mamba编码器,以线性复杂度高效捕捉视频序列中跨帧的长距离依赖关系,实现帧间特征聚合,有效增强目标的时序特征表达;3)Mamba纠缠式Transformer解码器,充分挖掘目标查询与时空特征之间的交互关系,实现细粒度的查询-特征对齐,有效丰富目标查询的实例级特征表达。

本文在ImageNet VID与EPIC-KITCHENS-55数据集上开展了大量实验,结果表明TMambaDet取得了当前最优的检测性能。

03 论文创新点

  • 提出了TMambaDet,一种面向视频目标检测的新型Transformer-Mamba混合网络。该网络融合了Transformer的长距离建模优势与Mamba的高效长序列处理能力,在ImageNet VID与EPIC-KITCHENS-55数据集上取得了当前最优性能。
  • 设计了空间自适应可变形Transformer编码器,可有效建模帧内长距离依赖关系并完成帧内特征聚合,显著提升了目标的空间特征表达能力。
  • 提出了时序级联双向Mamba编码器,以线性复杂度高效建模跨帧长距离依赖关系并完成帧间特征聚合,有效提升了目标的时序特征表达能力。
  • 设计了Mamba纠缠式Transformer解码器,充分挖掘目标查询与时空特征的交互关系,实现细粒度的查询-特征对齐,为目标查询注入更多与目标相关的实例级信息。

3 方法

3.1 框架概述

本文提出的TMambaDet整体框架如图2所示。具体而言,每帧输入图像首先经过共享的骨干网络提取特征图,随后对特征图进行投影与展平处理,得到令牌(token)特征。接着,将令牌特征与对应的位置编码(由Deformable DETR[67]生成)相加,输入至空间自适应可变形Transformer编码器中,有效建模帧内长距离依赖关系并完成帧内特征聚合,输出空间编码特征。
在这里插入图片描述

之后,将来自多帧的空间编码特征进行拼接,输入至时序级联双向Mamba编码器,高效建模跨帧长距离依赖关系并完成帧间特征聚合,生成时空编码特征。时空编码特征与目标查询(由Deformable DETR预测得到)共同输入至Mamba纠缠式Transformer(MaET)解码器,输出时空解码特征。MaET的核心目标是有效挖掘目标查询与编码特征之间的交互关系,实现细粒度的查询-特征对齐,从而为目标查询注入更丰富的实例级上下文信息。

最后,将MaET的输出输入至共享的前馈网络中,完成分类与边界框回归,得到最终的检测结果。

TMambaDet相较于现有方法的三大核心创新为:用于提升目标空间特征表达的空间自适应可变形Transformer编码器、用于增强目标时序特征表达的时序级联双向Mamba编码器,以及为目标查询赋予更多实例级信息的Mamba纠缠式Transformer解码器。各模块的详细介绍将在下文展开。

3.2 空间自适应可变形Transformer编码器

空间自适应可变形Transformer(SADT)编码器的核心目标是:通过有效建模帧内长距离空间依赖关系、聚合单帧内的注意力特征,提升目标的空间特征表达能力。由于视频帧中存在大量背景信息,直接采用原生Transformer编码器[49]会引入大量无效计算。尽管已有基于掩码机制的方法[5, 61]被提出以缓解该问题,但这类方法通常需要设置额外的超参数或依赖人工设计的启发式规则。
在这里插入图片描述

基于可变形注意力[67]的研究进展,本文提出了一种改进版本——自适应可变形注意力。该机制仅根据可学习的偏移量,关注少量信息丰富的采样点。与标准可变形注意力对所有查询采用固定数量采样点的设计不同,本文的自适应可变形注意力可根据每个查询对应的特征表达,自适应预测其采样点数量:为遮挡、模糊等复杂场景下的目标分配更多采样点,为简单目标分配更少采样点。

SADT的结构如图3所示。具体而言,首先将单帧的令牌特征与对应的位置编码进行逐元素相加,随后输入至多尺度自适应可变形注意力(Multi-scale Adaptive Deformable Attention, MADAttn)模块中,在有效捕捉帧内长距离空间依赖的同时,完成帧内注意力特征的聚合。

MADAttn的计算公式定义如下:
MADAttn(zq,p^q,{xl}l=1L)=∑h=1HWh[∑l=1L∑k=1KqOhlqk⋅Wh′xl(ψl(p^q)+Δphlqk)], \begin{aligned} & \text{MADAttn}\left(z_{q}, \hat{p}_{q},\left\{x^{l}\right\}_{l=1}^{L}\right) \\ & =\sum_{h=1}^{H} W_{h}\left[\sum_{l=1}^{L} \sum_{k=1}^{K_{q}} \mathcal{O}_{hlqk} \cdot W_{h}' x^{l}\left(\psi_{l}\left(\hat{p}_{q}\right)+\Delta p_{hlqk}\right)\right], \end{aligned} MADAttn(zq,p^q,{xl}l=1L)=h=1HWh l=1Lk=1KqOhlqkWhxl(ψl(p^q)+Δphlqk) ,
其中,qqq 表示查询元素,zq∈RDz_{q} \in \mathbb{R}^{D}zqRD 表示维度为 DDD 的查询特征;p^q∈[0,1]2\hat{p}_{q} \in [0,1]^{2}p^q[0,1]2 表示查询元素 qqq 对应参考点的归一化坐标,其中 (0,0)(0,0)(0,0)(1,1)(1,1)(1,1) 分别表示图像帧的左上角与右下角;xlx^{l}xl 表示第 lll 个尺度的特征图;hhhlllkkk 分别为注意力头、特征尺度、采样点的索引;Ohlqk∈[0,1]\mathcal{O}_{hlqk} \in [0,1]Ohlqk[0,1] 表示第 hhh 个注意力头、第 lll 个特征尺度下,第 qqq 个查询对应第 kkk 个采样点的注意力权重,且满足归一化条件 ∑l=1L∑k=1KqOhlqk=1\sum_{l=1}^{L} \sum_{k=1}^{K_{q}} \mathcal{O}_{hlqk} = 1l=1Lk=1KqOhlqk=1Wh∈RD×DvW_{h} \in \mathbb{R}^{D \times D_{v}}WhRD×DvWh′∈RDv×DW_{h}' \in \mathbb{R}^{D_{v} \times D}WhRDv×D 表示可学习的投影权重,其中 Dv=D/HD_{v} = D / HDv=D/Hψl(p^q)\psi_{l}(\hat{p}_{q})ψl(p^q) 用于将归一化坐标 p^q\hat{p}_{q}p^q 映射至第 lll 个尺度的输入特征图上;Δphlqk\Delta p_{hlqk}Δphlqk 表示第 hhh 个注意力头、第 lll 个特征尺度下,第 qqq 个查询对应第 kkk 个采样点的采样偏移量。

由于 ψl(p^q)+Δphlqk\psi_{l}(\hat{p}_{q})+\Delta p_{hlqk}ψl(p^q)+Δphlqk 为分数坐标,本文采用双线性插值[7]计算 xl(ψl(p^q)+Δphlqk)x^{l}\left(\psi_{l}\left(\hat{p}_{q}\right)+\Delta p_{hlqk}\right)xl(ψl(p^q)+Δphlqk) 的值。HHHLLL 分别表示注意力头的总数与特征尺度的总数。KqK_{q}Kq 表示查询元素 qqq 对应的采样点总数。

为自适应预测 KqK_{q}Kq,本文在查询特征 zqz_{q}zq 上接入一个轻量级多层感知机,随后经过Sigmoid函数得到采样强度得分 α∈(0,1)\alpha \in (0,1)α(0,1),再通过如下线性映射将其转换为离散值:
Kq=round(Kmin⁡+α⋅(Kmax⁡−Kmin⁡)),(2) K_{q}=\text{round}\left(K_{\min }+\alpha \cdot\left(K_{\max }-K_{\min }\right)\right), \tag{2} Kq=round(Kmin+α(KmaxKmin)),(2)
其中,round(⋅)\text{round}(\cdot)round() 表示四舍五入取整函数,Kmin⁡K_{\min}KminKmax⁡K_{\max}Kmax 分别为预定义的最小与最大采样点数量。

如图3所示,MADAttn的输出经过逐元素相加与层归一化操作后,接入一个简单的前馈网络(FFN),最终输出空间编码特征 FsF^{s}Fs

3.3 时序级联双向Mamba编码器

时序级联双向Mamba(TCBM)编码器的核心目标是:通过高效建模跨帧长距离时序依赖关系、聚合跨帧的有效特征,提升目标的时序特征表达能力。由于特征数量随帧数成比例增长,采用Transformer建模多帧长距离依赖关系时,注意力计算量呈二次增长,往往带来可扩展性挑战与巨大的计算开销。

尽管已有高效Transformer架构[34, 55]被提出以解决该问题,但这类方法通常以牺牲部分长距离建模能力为代价提升计算效率。本文并未采用Transformer,而是专为视频目标检测任务设计了时序级联双向Mamba编码器。该编码器强调在空间维度上沿正反两个方向进行时序建模,能够显式建模动态时序依赖关系,高效聚合跨帧特征,同时维持线性计算复杂度。

TCBM的结构如图4所示。具体而言,SADT输出的空间编码特征 FsF^{s}Fs 首先经过层归一化(LN)处理,随后被拆分为两条信息通路。
第一条通路依次经过线性投影(Linear)与一维卷积(Conv1d)处理,随后输入至时序优先前向状态空间模型(Temporal-prioritized Forward State Space Model, TF-SSM),捕捉前向的长距离时序依赖。
第二条通路依次经过线性投影与激活函数处理。
随后,两条通路的结果通过哈达玛积(Hadamard product)运算进行融合,生成前向特征表达 FfwdF_{\text{fwd}}Ffwd
在这里插入图片描述

对应的计算公式如下:
Fmid=TF-SSM(Conv1d(Linear(LN(Fs)))),(3) F_{\text{mid}}=\text{TF-SSM}\left(\text{Conv1d}\left(\text{Linear}\left(\text{LN}\left(F^{s}\right)\right)\right)\right), \tag{3} Fmid=TF-SSM(Conv1d(Linear(LN(Fs)))),(3)
Ffwd=Fmid⊗σ(Linear(LN(Fs))),(4) F_{\text{fwd}}=F_{\text{mid}} \otimes \sigma\left( \text{Linear}\left(\text{LN}\left( F^{s}\right) \right) \right), \tag{4} Ffwd=Fmidσ(Linear(LN(Fs))),(4)
其中,⊗\otimes 表示哈达玛积运算,σ(⋅)\sigma(\cdot)σ() 表示激活函数。

随后,对得到的特征级联执行完全相同的操作序列:层归一化、线性投影、一维卷积,接着输入至时序优先后向状态空间模型(Temporal-prioritized Backward State Space Model, TB-SSM),以反向空间顺序捕捉后向的长距离时序依赖,最终输出时空编码特征 FtF^{t}Ft

TCBM的核心是本文提出的全新时序优先双向扫描(Temporal-prioritized Bidirectional Scan, TPBS)算法,该算法包含前向扫描(在TF-SSM中实现)与后向扫描(在TB-SSM中实现),两种扫描均在固定空间坐标下沿时序维度的正方向执行。当完成某一空间坐标下所有帧的特征扫描后,再移动至下一个空间坐标,重复上述过程直至遍历所有特征。

为便于解释,记待处理的特征为 Fi,jsF_{i,j}^{s}Fi,js,其中 i∈{0,1,⋯ ,N}i \in \{0,1,\cdots,N\}i{0,1,,N} 为帧的时序索引,j∈{0,1,⋯ ,M}j \in \{0,1,\cdots,M\}j{0,1,,M} 为单帧内特征的空间位置索引。

  • 前向扫描从 F0,0sF_{0,0}^{s}F0,0s 开始,在固定空间位置 j=0j=0j=0 处沿时序维度依次扫描:F1,0s,F2,0s,⋯ ,FN,0sF_{1,0}^{s}, F_{2,0}^{s}, \cdots, F_{N,0}^{s}F1,0s,F2,0s,,FN,0s。完成该空间位置下所有帧的扫描后,移动至下一个空间位置 j=1j=1j=1,按同样的时序优先方式扫描 F0,1s,F1,1s,⋯ ,FN,1sF_{0,1}^{s}, F_{1,1}^{s}, \cdots, F_{N,1}^{s}F0,1s,F1,1s,,FN,1s,直至覆盖所有空间位置。
  • 后向扫描从第一帧的最后一个空间位置 j=Mj=Mj=M 开始,即起始点为 F0,MsF_{0,M}^{s}F0,Ms,随后按时序顺序依次扫描:F1,Ms,F2,Ms,⋯ ,FN,MsF_{1,M}^{s}, F_{2,M}^{s}, \cdots, F_{N,M}^{s}F1,Ms,F2,Ms,,FN,Ms。完成该空间位置下所有帧的扫描后,移动至 j=M−1j=M-1j=M1 的位置,继续以时序优先的方式扫描,直至扫描完 F0,0s,F1,0s,⋯ ,FN,0sF_{0,0}^{s}, F_{1,0}^{s}, \cdots, F_{N,0}^{s}F0,0s,F1,0s,,FN,0s 后结束。

3.4 Mamba纠缠式Transformer解码器

Mamba纠缠式Transformer(MaET)解码器的核心目标是:充分挖掘目标查询与编码特征的交互关系,完成细粒度的查询-特征对齐,从而为目标查询注入更丰富的实例级信息。

现有基于Transformer的视频目标检测方法通常采用交叉注意力及其变体,实现目标查询与编码特征的交互,利用时空上下文优化目标查询的实例级表达。尽管记忆交叉注意力[1]、引导式交叉注意力[9]等先进交叉注意力机制被提出,以拓展目标查询可获取的上下文信息,但这类方法仍局限于注意力机制的范式之内。

基于Mamba的研究成果,本文将Mamba融入Transformer解码器架构,提出了Mamba纠缠式Transformer解码器。该解码器依次堆叠注意力层与Mamba层,从而充分发挥两种范式的优势。

MaET的结构如图5所示。它由四类层级结构构成,在标准Transformer解码器的组件基础上,新增了多尺度自适应可变形注意力层与级联双向Mamba层。
在这里插入图片描述

具体而言,目标查询首先经过多头自注意力层处理,实现查询之间的通信与交互,使每个目标查询都能从其他查询中收集上下文信息。随后,多头自注意力层的输出与TCBM生成的时空编码特征共同输入至多尺度自适应可变形注意力层,通过从编码特征中收集上下文信息优化目标查询。

之后,接入级联双向Mamba层,通过整合正反两个方向的有效长距离上下文,进一步细化目标查询的特征表达。

该过程可由如下公式表示:
QSA=MHSAttn(Q,Q,Q),(5) \mathcal{Q}_{SA}=\text{MHSAttn}(\mathcal{Q}, \mathcal{Q}, \mathcal{Q}), \tag{5} QSA=MHSAttn(Q,Q,Q),(5)
QDA=MADAttn(QSA,P,Ft),(6) \mathcal{Q}_{DA}=\text{MADAttn}\left(\mathcal{Q}_{SA}, P, F^{t}\right), \tag{6} QDA=MADAttn(QSA,P,Ft),(6)
QMA=CBi-Mamba(QDA),(7) \mathcal{Q}_{MA}=\text{CBi-Mamba}\left(\mathcal{Q}_{DA}\right), \tag{7} QMA=CBi-Mamba(QDA),(7)
其中,Q\mathcal{Q}Q 表示目标查询,PPP 表示参考点坐标张量,FtF^{t}Ft 表示编码特征;MHSAttn(⋅,⋅,⋅)\text{MHSAttn}(\cdot, \cdot, \cdot)MHSAttn(,,) 表示多头自注意力运算[49];MADAttn(⋅,⋅,⋅)\text{MADAttn}(\cdot, \cdot, \cdot)MADAttn(,,) 表示多尺度自适应可变形注意力运算,计算方式见公式(1);CBi-Mamba(⋅)\text{CBi-Mamba}(\cdot)CBi-Mamba() 表示级联双向Mamba运算,其结构如图4所示,计算细节见公式(3)-(4)。

CBi-Mamba的输出 QMA\mathcal{Q}_{MA}QMA 输入至前馈网络,最终生成时空解码特征。得益于精心设计的MaET解码器,每个目标查询都能同时利用注意力与Mamba的优势,从编码特征中获取丰富的、与目标相关的实例级上下文信息。

4 实验

4.1 评估数据集与评价指标

为保证对比的公平性与说服力,本文在广泛使用的ImageNet VID数据集[41]上评估TMambaDet的性能。该数据集是视频目标检测领域的大规模基准数据集,包含3862个训练视频与555个验证视频,覆盖30个目标类别。

此外,本文还采用EPIC-KITCHENS-55数据集[8]作为额外基准,评估模型的泛化性能。该数据集包含272个视频,标注了290个目标类别用于目标检测任务。

与现有视频目标检测方法[6, 20, 21, 38, 39, 42]保持一致,本文采用交并比(IoU)阈值为0.5时的平均精度均值(mean Average Precision, mAP)作为评价指标,报告模型的检测精度。

4.2 实现细节

本文的TMambaDet基于Deformable DETR[67]实现,采用ResNet-101[25]与Swin Transformer[32]作为骨干网络。SADT编码器包含4层结构与6个注意力头。参考Deformable DETR的设置,特征尺度数量设为4。公式(2)中的最小采样点数量 Kmin⁡K_{\min}Kmin 与最大采样点数量 Kmax⁡K_{\max}Kmax 分别设为2与8,二者的敏感性分析见补充材料。TCBM编码器的层数与MaET解码器的层数分别设为3与4。在ImageNet VID与EPIC-KITCHENS-55数据集上,单帧对应的目标查询数量分别设为60与300。

在ImageNet VID数据集上,本文同时使用ImageNet VID与ImageNet DET数据集训练TMambaDet;遵循[14, 37, 45, 53]中的通用设置,将输入帧的短边 resize 至600像素。模型在4块Nvidia RTX 5090 GPU上训练140K次迭代,采用AdamW[33]优化器;前100K次迭代的学习率设为 1×10−41 \times 10^{-4}1×104,后40K次迭代的学习率设为 1×10−51 \times 10^{-5}1×105

在EPIC-KITCHENS-55数据集上,模型训练220K次迭代;前120K次迭代的学习率设为 2×10−42 \times 10^{-4}2×104,后100K次迭代的学习率设为 2×10−52 \times 10^{-5}2×105。损失函数与Deformable DETR保持一致。训练阶段,除当前帧外,采用随机采样策略[54]从同一段视频中随机抽取4帧。测试阶段,输入25帧视频进行检测。

4.3 与现有最优方法的对比

ImageNet VID数据集对比

表1总结了在ImageNet VID数据集上的性能对比结果。为保证公平对比,本文在相同的Nvidia RTX 5090 GPU上重新测算了部分前沿方法的推理耗时。整体而言,与其他方法相比,本文的TMambaDet实现了更优异的性能-效率权衡。

表1 在ImageNet VID数据集上与现有最优方法的性能对比。⋆表示在相同Nvidia RTX 5090 GPU上重新测算的结果。最优结果以粗体标注。

方法 骨干网络 mAP (%) 推理耗时 (ms) 推理耗时⋆ (ms)
MEGA [4] ResNet-101 82.9 114.5 94.9
HVRNet [18] ResNet-101 83.2 85.0
MINet [11] ResNet-101 80.2 133.0
MAMBA [47] ResNet-101 84.6 110.3
CSMN [17] ResNet-101 85.2 909.1
QueryProp [22] ResNet-101 82.3 37.3
TASA [23] ResNet-101 82.5 125.0
SELSA [54] ResNet-101 82.7 78.1
MSTA [59] ResNet-101 83.3 105.7
GMLCN [16] ResNet-101 78.6 39.6
TransVOD Lite [65] ResNet-101 80.5 32.3 28.4
BoxMask [19] ResNet-101 83.2
LSTFE-Net [57] ResNet-101 83.4 81.7
ClipVID [9] ResNet-101 84.7 25.5
CETR [1] ResNet-101 79.6 42.9
DNFM [62] ResNet-101 84.5 47.6
DGC-Net [39] ResNet-101 86.3 90.2
TGBFormer [37] ResNet-101 86.5 24.3
TMambaDet (本文) ResNet-101 87.9 20.6 20.6
TransVOD Lite [65] Swin-B 90.1 67.1 49.3
STPN [48] Swin-B 90.6
ODND [31] Swin-B 91.3 55.2
YOLOV++ [46] Swin-B 90.7 15.9 15.7
TGBFormer [37] Swin-B 90.3 49.7
TMambaDet (本文) Swin-B 92.1 39.0 39.0

具体而言,当采用ResNet-101作为骨干网络时,本文的TMambaDet取得了87.9%的mAP,分别比近期发表的CETR[1]与DGC-Net[39]高出8.3%与1.6%。与ClipVID[9]、TransVOD Lite[65]等基于Transformer的方法相比,TMambaDet的mAP分别提升了3.2%与7.4%。这是因为TMambaDet融合了Transformer与Mamba的互补优势,能够挖掘更全面的长距离依赖关系,从而提升视频目标检测性能。

此外,得益于Mamba在多帧时序信息建模上的高效性,采用ResNet-101骨干的TMambaDet推理耗时仅为20.6ms。将骨干网络从ResNet-101替换为性能更强的Swin Transformer Base(Swin-B)后,TMambaDet取得了92.1%的mAP,性能超越所有参与对比的方法。

EPIC-KITCHENS-55数据集对比

表2展示了在EPIC-KITCHENS-55数据集上的性能对比结果。由于大多数视频目标检测方法主要在ImageNet VID上评估,其在EPIC-KITCHENS-55上的基准结果并未公开。因此,本文在该数据集上重新实现了部分方法以进行性能对比。

表2 在EPIC-KITCHENS-55数据集上与现有最优方法的性能对比

方法 骨干网络 mAP (%) 推理耗时 (ms)
SELSA [54] ResNet-101 40.6 81.2
MEGA [4] ResNet-101 40.8 96.7
HVRNet [18] ResNet-101 41.4 88.3
RDN [10] ResNet-101 40.3 87.5
TransVOD Lite [65] ResNet-101 39.9 31.4
LSTFE-Net [57] ResNet-101 41.9 85.9
TMambaDet (本文) ResNet-101 45.1 23.2
TransVOD Lite [65] Swin-B 47.2 52.9
YOLOV++ [46] Swin-B 48.3 18.7
TMambaDet (本文) Swin-B 50.8 41.3

如表2所示,采用ResNet-101与Swin-B作为骨干网络时,本文的TMambaDet分别取得了45.1%与50.8%的mAP,在相同骨干网络下性能优于所有对比方法,证明了TMambaDet的有效性与泛化能力。

4.4 消融实验与分析

若无特殊说明,所有消融实验均采用ResNet-101作为骨干网络,在ImageNet VID数据集上开展。

各组件的贡献分析

本文通过消融实验分析TMambaDet中每个组件的贡献,结果如表3所示。

表3 在ImageNet VID数据集上TMambaDet各组件的性能分析。下标数值表示相对于基线(a)的mAP提升量

方法 (a) (b) © (d) (e) (f)
SADT编码器
TCBM编码器
MaET解码器
整体mAP (%) 78.3 80.6 83.8 80.9 86.1 87.9+9.6
慢速目标mAP (%) 86.4 87.5 88.9 87.5 91.4 93.3+6.9
中速目标mAP (%) 76.5 79.2 82.6 79.8 85.2 86.8+10.3
快速目标mAP (%) 57.8 62.5 67.5 63.0 71.3 73.1+15.3
  • 方法(a)为基线检测器Deformable DETR[67],采用ResNet-101骨干时整体mAP为78.3%。
  • 方法(b)在基线中加入空间自适应可变形Transformer(SADT)编码器,用于建模长距离空间依赖,整体mAP从78.3%提升至80.6%。此外,不同运动速度的目标均获得了性能提升,证明了SADT的有效性。
  • 方法©在基线中加入时序级联双向Mamba(TCBM)编码器,用于建模时序依赖,整体mAP从78.3%提升至83.8%。
  • 方法(d)在基线中集成Mamba纠缠式Transformer(MaET)解码器,用于增强目标查询的实例级表达,整体mAP达到80.9%,相较于基线提升了2.6%。
  • 方法(e)在方法(d)的基础上加入TCBM编码器,整体mAP达到86.1%,相较于方法(d)提升了5.2%,进一步证明了TCBM的有效性。
  • 方法(f)即本文提出的TMambaDet,在方法(e)的基础上加入SADT编码器,整体mAP从86.1%提升至87.9%。
固定与自适应采样模式的对比分析

本文通过消融实验分析SADT中固定采样与自适应采样两种模式的性能,结果如表4所示。

表4 SADT编码器中固定与自适应采样模式的性能分析

采样模式 ImageNet VID EPIC-KITCHENS-55
mAP (%) 推理耗时 (ms) mAP (%) 推理耗时 (ms)
固定 (K=2) 85.3 15.3 42.2 18.3
固定 (K=4) 87.4 21.1 44.1 24.0
固定 (K=6) 87.6 30.2 44.7 32.7
固定 (K=8) 87.5 40.0 44.5 42.1
自适应 (本文) 87.9 20.6 45.1 23.2

由表可见,采用固定采样模式时,增大采样点数量 KKK 可提升mAP,但也会导致推理耗时增加。与之相比,自适应采样模式在取得最优mAP的同时,维持了相对较短的推理耗时。这表明与固定采样模式相比,自适应采样模式能够在精度与推理速度之间实现更优的平衡。

自适应采样模式的泛化性分析

本文通过消融实验评估所提自适应采样模式(ASM)在其他方法上的泛化性能,结果如表5所示。Deformable DETR[67]与TransVOD++[65]的可变形注意力模块均采用固定采样模式(FSM)。将自适应采样模式应用于这两种方法后,mAP均获得了明显提升。该结果证明,本文的自适应采样模式可有效泛化至不同的框架中,并持续提升性能。

表5 自适应采样模式在ImageNet VID数据集上的泛化性分析。∗表示采用Swin-B骨干得到的结果

Deform. DETR TransVOD++ FSM ASM mAP (%) mAP∗ (%)
78.3 82.9
79.6 83.8
82.0 90.0
83.1 90.8
不同扫描算法对比

本文核心创新之一为时序优先双向扫描算法(TPBS),我们将其与 S4 扫描、S6 扫描、Bi-S6 扫描等主流 Mamba 扫描策略进行对比,结果如表6。在两大测试数据集上,TPBS 均取得最优精度。以 ImageNet VID 为例,ResNet-101、Swin-B 骨干下,TPBS 相比 Bi-S6 扫描分别高出 0.6%、0.8%,充分证明了该扫描算法的优势。

表6 不同扫描算法性能对比

算法 ImageNet VID EPIC-KITCHENS-55
mAP (%) mAP∗ (%) mAP (%) mAP∗ (%)
S4 扫描 85.7 89.7 43.1 48.4
S6 扫描 86.4 90.6 43.8 49.3
Bi-S6 扫描 87.3 91.3 44.6 50.0
TPBS(本文) 87.9 92.1 45.1 50.8

06 个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐