本文针对事件相机目标检测中Transformer计算成本过高的问题,提出场景自适应稀疏Transformer(SAST)。该方法通过窗口-令牌协同稀疏化与场景特定稀疏优化,在保持低计算量的同时实现高检测性能,并能根据场景复杂度自适应调整稀疏程度,有效平衡了检测精度与效率。
本文提出Panacea,一种面向自动驾驶场景的全景可控视频生成方法。该方法通过创新的4D注意力机制和两阶段生成流程,有效解决了生成视频中的时间与跨视角一致性问题;同时引入ControlNet框架,利用鸟瞰图(BEV)布局对生成内容进行精细控制。在nuScenes数据集上的实验表明,Panacea能够生成高质量的多视角驾驶视频,为BEV感知任务提供丰富的训练数据增强,推动自动驾驶感知技术的发展。
本文提出注意力引导的对比掩码图像建模方法(ACoMIM),融合对比学习与掩码图像建模两种自监督范式,并利用视觉Transformer的注意力机制提升表征能力。该方法包含两个预训练任务:一是根据注意力引导预测掩码区域的特征,二是比较掩码图像与未掩码图像的全局特征。两个任务相互补充,有效缓解了图像信息稀疏与分布不均的问题,在多种下游任务上验证了方法的有效性。
本文提出边缘导向Transformer(EoFormer),用于脑肿瘤MRI图像分割。该方法采用CNN-Transformer混合编码器,CNN提取局部低级特征,Transformer建模长距离依赖以生成全局高级特征;解码器集成边缘导向Sobel与Laplacian锐化模块,增强边缘信息。同时引入高效注意力与重参数化技术,提升特征表示能力与分割精度。