本文首次提出非对称事件引导的视频超分辨率任务,针对事件相机与RGB相机难以严格标定的实际场景,构建了非对称事件引导视频超分辨率网络(AsEVSRN)。该网络通过专门设计的事件特征利用与跨模态融合机制,充分发挥事件相机高时间分辨率优势,有效提升视频超分辨率性能,拓展了事件相机在双摄手机、无人机等新兴高分辨率设备上的应用潜力。
本文针对低光照条件下视频目标分割(VOS)性能严重下降的问题,提出一种利用事件相机数据辅助分割的新框架。该方法包含两个关键模块:自适应跨模态融合(ACMF)模块,用于提取并融合图像与事件模态特征以抑制噪声干扰;事件引导记忆匹配(EGMM)模块,用于修正低光下查询帧与记忆帧之间的相似度计算误差。实验表明,该方法在合成和真实低光数据集上均能显著提升分割精度,生成更准确的目标掩码。
本文提出 TMFormer,一种用于缺失模态脑肿瘤分割的 Token 合并 Transformer。该方法通过提取并合并可用模态为更紧凑的 token 序列,解决现有方法以零图填充缺失模态带来的特征偏差与冗余计算问题。其核心包括单模态 Token 合并块(UMB)和多模态 Token 合并块(MMB),分别增强单模态表示并缓解多模态融合偏差。在 BraTS 2018 和 2020 数据集上的实验表明,TMFormer 在缺失模态场景下优于现有方法。
本文提出一种事件驱动的双向视频超分辨率框架(EBVSR),利用事件相机的高时间分辨率特性捕捉非线性运动,并设计事件辅助的时间对齐模块,以补充光流法在快速光照变化下的不足。同时构建基于事件的帧合成模块,通过双向跨模态融合增强网络对光照变化的鲁棒性。在合成和真实数据上的实验验证了该方法在视频超分辨率任务中的有效性。
本文针对多模态情感分析中文本模态与情感标签之间存在的虚假关联问题,提出了一种名为PriSA的新框架。该框架首先通过优先跨模态融合方法,利用文本模态引导计算跨模态相关性;随后引入距离感知对比学习,利用情感标签之间的距离信息进一步计算混合模态相关性;最终基于混合模态相关性和判别性类内特征识别情感信息。实验表明该方法能有效缓解文本虚假关联带来的影响,提升多模态情感分析性能。
本文提出一种利用外观信息丰富光流表示的动作识别方法。通过将RGB外观特征与光流特征进行融合,增强运动表征的判别能力,从而提升视频动作识别的准确率。该方法在多个基准数据集上验证了有效性,表明外观信息能够有效补充光流在动作识别中的不足。