
一、核心定位与目标定位在实时目标检测领域提出一种改进的端到端Transformer检测器DETR作为YOLO系列的有力竞争者。目标在不牺牲推理速度的前提下进一步提升检测精度同时解决DETR模型在实际部署中的痛点如算子兼容性问题。二、主要创新点“Bag-of-Freebies”免费午餐套件文章主要从灵活性、实用性和训练策略三个维度进行了改进1. 灵活性提升多尺度可变形注意力的差异化采样问题原RT-DETR在不同尺度的特征图上使用相同数量的采样点忽略了不同尺度特征的差异性。改进提出为不同尺度的特征图设置不同数量的采样点实现更灵活、高效的特征提取在几乎不损失精度的情况下可减少计算量。2. 实用性提升引入离散采样算子Discrete Sampling问题RT-DETR依赖的grid_sample算子双线性插值在某些推理后端如部分移动端或嵌入式平台支持不佳限制了部署范围。改进提出可选的discrete_sample算子通过对采样偏移量取整跳过耗时的双线性插值。由于取整操作不可微训练时先使用grid_sample再微调时切换为discrete_sample推理时完全使用后者。效果消除部署限制且精度下降极小AP50下降仅0.1~0.4。3. 训练策略优化动态数据增强训练早期使用较强的数据增强如色彩扭曲、随机裁剪、多尺度训练以提升泛化能力。训练最后2个epoch关闭这些增强使模型更好地适应目标域分布。尺度自适应超参数定制针对不同大小的模型S/M/L/X为主干网络Backbone设置不同的学习率轻量级主干如ResNet18特征质量低 →提高学习率。重量级主干如ResNet101特征质量高 →降低学习率。检测头Detector部分保持统一学习率1e-4。三、实验结果摘要数据集COCO train2017训练COCO val2017验证。性能对比在S/M/L/X四种模型规模上RT-DETRv2相比RT-DETR均取得精度提升AP提升0.3~1.4且推理速度完全不变FPS相同。消融实验减少采样点数量从86k降至21kAP仅下降0.6说明可进一步加速。离散采样替换后AP50下降在0.1~0.4之间实用性得到验证。四、总体贡献总结维度贡献学术价值为DETR系列实时检测器提供了新的改进思路尤其是多尺度采样和训练策略方面。工程价值通过离散采样算子显著降低了DETR模型在工业部署中的门槛使其更接近YOLO的易用性。性能效果在保持实时速度T4 GPU上74~217 FPS的同时提升了检测精度部分模型达到54.3 AP。作者希望RT-DETRv2能为DETR家族提供参考基线并推动实时检测Transformer在更广泛实际场景中的应用。代码和模型已开源便于社区复现和二次开发。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要在本报告中我们提出了 RT-DETRv2一个改进的实时检测TransformerReal-Time DEtection TRansformer。RT-DETRv2 构建于先前最先进的实时检测器 RT-DETR 之上并开放了一系列“免费午餐”套件以提升灵活性和实用性同时优化了训练策略以实现性能增强。为了提高灵活性我们建议在可变形注意力机制中为不同尺度的特征设置不同的采样点数量从而实现解码器选择性的多尺度特征提取。为了增强实用性我们提出了一种可选的高散采样算子用以替换 RT-DETR 相较于 YOLO 所特有的grid_sample算子。这消除了通常与 DETR 相关的部署限制。在训练策略方面我们提出了动态数据增强和尺度自适应超参数定制以在不损失速度的前提下提升性能。1 引言目标检测是一项基础的视觉任务涉及识别和定位图像中的物体。其中实时目标检测是一个重要领域具有广泛的应用例如自动驾驶 (Atakishiyev 等2024)。在过去几年的发展中YOLO 检测器 (Redmon 和 Farhadi20172018Bochkovskiy 等2020Glenn2022Xu 等2022Li 等2023Wang 等2023Glenn2023Wang 等2024a,b) 无疑是该领域最负盛名的框架。究其原因是 YOLO 检测器实现了合理的平衡。RT-DETR (Zhao 等2024) 的出现为实时目标检测开辟了一条新的技术途径打破了该领域对 YOLO 的依赖。RT-DETR 提出了一种高效的混合编码器用以替换 DETR (Carion 等2020) 中的标准 Transformer 编码器通过解耦多尺度特征的尺度内交互和跨尺度融合显著提高了推理速度。为了进一步提升性能RT-DETR 提出了不确定性最小化查询选择通过显式优化不确定性为解码器提供高质量的初始查询。此外RT-DETR 提供了多种检测器尺寸并支持灵活的速度调整以适应各种实时场景而无需重新训练。RT-DETR 代表了一种新颖的、端到端的实时检测器标志着 DETR 家族的重大进步。在本报告中我们提出了 RT-DETRv2一个改进的实时检测Transformer。这项工作基于最新的 RT-DETR并在 DETR 家族中开放了一系列“免费午餐”套件以提升灵活性和实用性同时优化了训练策略以实现性能增强。具体而言RT-DETRv2 建议在可变形注意力模块中为不同尺度的特征设置不同的采样点数量以实现解码器选择性的多尺度特征提取。在增强实用性方面RT-DETRv2 提供了一种可选的高散采样算子以替换 DETR 特有的原始grid_sample算子从而消除了通常与检测Transformer相关的部署限制。此外RT-DETRv2 优化了训练策略包括动态数据增强和尺度自适应超参数定制目标是在不损失速度的情况下提升性能。结果表明RT-DETRv2 为 RT-DETR 提供了一个带有“免费午餐”套件的改进基线增加了灵活性和实用性并且所提出的训练策略优化了性能和训练成本。2 方法RT-DETRv2 的整体框架与 RT-DETR 保持一致仅对解码器的可变形注意力模块进行了修改。2.1 框架不同尺度的不同采样点数量。当前的 DETR 利用可变形注意力模块 (Zhu 等2020) 来缓解由多尺度特征组成的长序列输入所带来的高计算开销。RT-DETR 解码器保留了这个模块该模块为每个尺度的特征定义了相同数量的采样点。我们认为这种约束忽略了不同尺度特征的内在差异并限制了可变形注意力模块的特征提取能力。因此我们建议为不同尺度设置不同的采样点数量以实现更灵活、更高效的特征提取。离散采样。为了提高 RT-DETR 的实用性并使其能够随处可用我们重点比较了 YOLO 和 RT-DETR 的部署要求其中 RT-DETR 特有的grid_sample算子限制了其广泛的适用性。因此我们提出了一种可选的discrete_sample算子来替换grid_sample从而消除 RT-DETR 的部署限制。具体来说我们对预测的采样偏移量执行取整操作省略了耗时的双线性插值。然而取整操作是不可微的因此我们关闭了用于预测采样偏移量的参数的梯度。在实践中我们首先使用grid_sample算子进行训练然后将其替换为discrete_sample算子进行微调。在推理和部署时模型使用discrete_sample算子。2.2 训练方案动态数据增强。为了使模型具备稳健的检测性能我们提出了动态数据增强策略。考虑到检测器在训练初期的泛化能力较差我们应用更强的数据增强而在训练后期我们降低其强度以使检测器适应目标域的检测。具体来说我们在训练初期保持 RT-DETR 的数据增强方式而在最后两个 epoch 中关闭RandomPhotometricDistort、RandomZoomOut、RandomIoUCrop和MultiScaleInput。尺度自适应超参数定制。我们还观察到不同尺寸的缩放版 RT-DETR 使用相同的优化器超参数进行训练导致其性能并非最优。因此我们为缩放版 RT-DETR 提出了尺度自适应超参数定制。考虑到轻量级检测器例如 ResNet18 (He 等2016)的预训练主干网络特征质量较低我们提高了其学习率。相反大型检测器例如 ResNet101 (He 等2016)的预训练主干网络具有较高的特征质量我们降低了其学习率。3 实验3.1 实现细节与 RT-DETR 一样我们使用在 ImageNet 上预训练的 ResNet (He 等2016) 作为主干网络并使用 AdamW (Loshchilov 和 Hutter2018) 优化器以批次大小 16 训练 RT-DETRv2并应用指数移动平均EMA其中ema_decay 0.9999。对于可选的高散采样我们首先使用grid_sample算子进行 6×6× 的预训练然后使用discrete_sample算子进行 1×1× 的微调。对于尺度自适应超参数定制超参数如 Tab. 1 所示其中 lrlr 代表学习率。表 1: RT-DETRv2 的超参数。模型主干网络lr_backbonelr_detRT-DETRv2-SResNet181e-41e-4RT-DETRv2-MResNet345e-51e-4RT-DETRv2-LResNet501e-51e-4RT-DETRv2-XResNet1011e-61e-43.2 评估RT-DETRv2 在 COCO (Lin 等2014) train2017 数据集上训练并在 COCO val2017 数据集上进行验证。我们报告标准的 AP 指标在 0.50 到 0.95 之间、步长为 0.05 的 IoU 阈值上取平均以及实际场景中常用的 AP50valAP50val。3.3 结果与 RT-DETR (Zhao 等2024) 的比较如 Tab. 2 所示。在不同规模的检测器上RT-DETRv2 均优于 RT-DETR且未损失速度。表 2: RT-DETR 和 RT-DETRv2 的比较。FPS 是在 T4 GPU 上使用 TensorRT FP16 报告的。评估时所有输入尺寸固定为 640×640。模型主干网络数据集#参数 (M)FPS (b1)APsupval/supAPsub50/subsupval/supRT-DETR-SResNet18COCO2021746.563.8RT-DETR-MResNet34COCO3116148.966.8RT-DETR-M*ResNet50COCO3614551.369.6RT-DETR-LResNet50COCO4210853.171.3RT-DETR-XResNet101COCO767454.372.7RT-DETRv2-SResNet18COCO2021747.9 (↑ 1.4)64.9 (↑ 1.1)RT-DETRv2-MResNet34COCO3116149.9 (↑ 1.0)67.5 (↑ 0.7)RT-DETRv2-M*ResNet50COCO3614551.9 (↑ 0.6)69.9 (↑ 0.3)RT-DETRv2-LResNet50COCO4210853.4 (↑ 0.3)71.6 (↑ 0.3)RT-DETRv2-XResNet101COCO767454.3 (↑ 0.0)72.8 (↑ 0.1)3.4 消融实验采样点数量的消融实验。我们对grid_sample算子的总采样点数进行了消融研究。总采样点数计算为num_head × num_point × num_query × num_decoder其中num_point代表每个网格中每个尺度特征的采样点总数。结果表明减少采样点数量不会导致性能显著下降参见 Tab. 3。这意味着在实际应用的大多数工业场景中不太可能受到影响。表 3: 采样点数量的消融实验。模型采样方法#PointsAPsupval/supAPsub50/subsupval/supRT-DETRv2-Sgrid_sample86,40047.964.9RT-DETRv2-Sgrid_sample64,80047.864.8 (↓ 0.1)RT-DETRv2-Sgrid_sample43,20047.764.7 (↓ 0.2)RT-DETRv2-Sgrid_sample21,60047.364.3 (↓ 0.6)离散采样的消融实验。然后我们移除grid_sample并将其替换为discrete_sample进行消融实验。结果表明此操作不会导致 AP50val 显著下降但确实消除了 DETR 的部署限制参见 Tab. 4。表 4: 离散采样的消融实验。模型主干网络采样方法APsupval/supAPsub50/subsupval/supRT-DETRv2-SResNet18discrete_sample47.464.8 (↓ 0.1)RT-DETRv2-MResNet34discrete_sample49.267.1 (↓ 0.4)RT-DETRv2-M*ResNet50discrete_sample51.469.7 (↓ 0.2)RT-DETRv2-LResNet50discrete_sample52.971.3 (↓ 0.3)4 结论在本报告中我们提出了 RT-DETRv2一个改进的实时检测Transformer。RT-DETRv2 开放了一系列“免费午餐”套件以增加 RT-DETR 的灵活性和实用性并优化了训练策略以在不损失速度的情况下实现性能增强。我们希望本报告能为 DETR 家族提供见解并拓宽 RT-DETR 的应用范围。