D-FINE是一种实时目标检测器,通过重新定义DETR中的边界框回归任务实现高精度定位。其核心包含细粒度分布细化(FDR)和全局最优定位自蒸馏(GO-LSD)。FDR将回归从预测固定坐标改为迭代细化概率分布,提供细粒度中间表示;GO-LSD通过自蒸馏将定位知识从最终层传递到浅层,并简化深层残差预测。在COCO上达到54.0%/55.8% AP,124/78 FPS,预训练后达57.1%/59.3% AP,超越现有实时检测器,并显著提升多种DETR模型性能。
本文针对事件相机目标检测中Transformer计算成本过高的问题,提出场景自适应稀疏Transformer(SAST)。该方法通过窗口-令牌协同稀疏化与场景特定稀疏优化,在保持低计算量的同时实现高检测性能,并能根据场景复杂度自适应调整稀疏程度,有效平衡了检测精度与效率。
本文针对事件相机目标检测任务,提出高效事件表示Hyper Histogram,充分保留事件极性与时间信息;设计自适应事件转换模块AEC,基于事件密度通过自适应队列将事件流转换为超直方图,并适配现有帧基检测器;还提出事件增强方法Shadow Mosaic,提升样本多样性与泛化能力。在YOLOv5、Deformable-DETR和RetinaNet上验证,在1Mpx、Gen1和MVSEC-NIGHTL21数据集上取得显著优势,且推理速度快。