本文提出Spiking Point Transformer(SPT),首个基于Transformer的脉冲神经网络框架,用于三维点云分类。SPT设计队列驱动采样直接编码,在降低计算成本的同时保留关键支撑点;并引入混合动力学积分发放神经元(HD-IF),模拟选择性神经元激活,减少对特定人工神经元的过度依赖。在多个真实与合成点云基准上取得领先结果,理论能耗较ANN对应模型降低至少6.4倍。
本文提出一种基于条件扩散模型的感知图像压缩方法,旨在解决现有生成式压缩方法性能提升有限和模型复杂度高的问题。方法采用扩散Transformer作为解码器,并利用Swin Transformer实现高效架构,以增强生成能力;同时引入多尺度特征融合模块,为解码器提供更丰富的信息特征。实验结果表明该方法在感知图像压缩任务上取得了优越的性能。
本文提出 TMFormer,一种用于缺失模态脑肿瘤分割的 Token 合并 Transformer。该方法通过提取并合并可用模态为更紧凑的 token 序列,解决现有方法以零图填充缺失模态带来的特征偏差与冗余计算问题。其核心包括单模态 Token 合并块(UMB)和多模态 Token 合并块(MMB),分别增强单模态表示并缓解多模态融合偏差。在 BraTS 2018 和 2020 数据集上的实验表明,TMFormer 在缺失模态场景下优于现有方法。
本文提出注意力引导的对比掩码图像建模方法(ACoMIM),融合对比学习与掩码图像建模两种自监督范式,并利用视觉Transformer的注意力机制提升表征能力。该方法包含两个预训练任务:一是根据注意力引导预测掩码区域的特征,二是比较掩码图像与未掩码图像的全局特征。两个任务相互补充,有效缓解了图像信息稀疏与分布不均的问题,在多种下游任务上验证了方法的有效性。
本文提出边缘导向Transformer(EoFormer),用于脑肿瘤MRI图像分割。该方法采用CNN-Transformer混合编码器,CNN提取局部低级特征,Transformer建模长距离依赖以生成全局高级特征;解码器集成边缘导向Sobel与Laplacian锐化模块,增强边缘信息。同时引入高效注意力与重参数化技术,提升特征表示能力与分割精度。
本文提出一种基于分组的事件视觉Transformer骨干网络GET,用于事件相机视觉任务。GET将事件按时间戳和极性分组为Group Token,并在特征提取过程中解耦时空信息与极性信息。通过事件双自注意力模块和分组Token聚合模块,实现空间与时间-极性信息的有效通信与整合,充分利用事件数据特性,提升事件视觉任务性能。