本文提出RiO-DETR,一种面向实时旋转目标检测的DETR框架。针对方向语义依赖、角度周期性和搜索空间扩大等挑战,设计了内容驱动的角度估计、旋转校正正交注意力、解耦周期细化以及定向密集O2O机制,在保持实时效率的同时提升角度收敛速度与检测精度。在DOTA-1.0、DIOR-R和FAIR-1M-2.0上的实验表明,该方法实现了新的速度-精度平衡。
D-FINE是一种实时目标检测器,通过重新定义DETR中的边界框回归任务实现高精度定位。其核心包含细粒度分布细化(FDR)和全局最优定位自蒸馏(GO-LSD)。FDR将回归从预测固定坐标改为迭代细化概率分布,提供细粒度中间表示;GO-LSD通过自蒸馏将定位知识从最终层传递到浅层,并简化深层残差预测。在COCO上达到54.0%/55.8% AP,124/78 FPS,预训练后达57.1%/59.3% AP,超越现有实时检测器,并显著提升多种DETR模型性能。
本文针对事件相机目标检测中Transformer计算成本过高的问题,提出场景自适应稀疏Transformer(SAST)。该方法通过窗口-令牌协同稀疏化与场景特定稀疏优化,在保持低计算量的同时实现高检测性能,并能根据场景复杂度自适应调整稀疏程度,有效平衡了检测精度与效率。
本文针对事件相机目标检测任务,提出高效事件表示Hyper Histogram,充分保留事件极性与时间信息;设计自适应事件转换模块AEC,基于事件密度通过自适应队列将事件流转换为超直方图,并适配现有帧基检测器;还提出事件增强方法Shadow Mosaic,提升样本多样性与泛化能力。在YOLOv5、Deformable-DETR和RetinaNet上验证,在1Mpx、Gen1和MVSEC-NIGHTL21数据集上取得显著优势,且推理速度快。