本文提出一种具有可控变异性的多模态扩散分割网络(MMDSN),用于医学图像分割。该方法通过医学文本注释实现多模态条件控制,增强视觉语义表示的一致性,并建立视觉与语言之间的对应关系。同时,MMDSN 在潜在高斯空间中对多个时间步的不确定性分布进行约束,从而控制每个去噪时间步的变异性,减少扩散模型随机采样带来的分割偏差。在 Qata-Covid19 等数据集上的实验验证了其有效性。
本文首次提出非对称事件引导的视频超分辨率任务,针对事件相机与RGB相机难以严格标定的实际场景,构建了非对称事件引导视频超分辨率网络(AsEVSRN)。该网络通过专门设计的事件特征利用与跨模态融合机制,充分发挥事件相机高时间分辨率优势,有效提升视频超分辨率性能,拓展了事件相机在双摄手机、无人机等新兴高分辨率设备上的应用潜力。
本文针对低光照条件下视频目标分割(VOS)性能严重下降的问题,提出一种利用事件相机数据辅助分割的新框架。该方法包含两个关键模块:自适应跨模态融合(ACMF)模块,用于提取并融合图像与事件模态特征以抑制噪声干扰;事件引导记忆匹配(EGMM)模块,用于修正低光下查询帧与记忆帧之间的相似度计算误差。实验表明,该方法在合成和真实低光数据集上均能显著提升分割精度,生成更准确的目标掩码。
本文提出多模态生成嵌入模型MM-GEM,将生成与嵌入两种目标统一于单个大语言模型中,实现每个模态仅需一个模型。通过引入PoolAggregator提升效率并支持细粒度嵌入与生成。实验表明,生成与嵌入目标并不显著冲突,模型在跨模态检索、零样本分类和图像描述等任务上表现优异,同时具备区域级描述生成与检索能力,并在长文本图像检索中取得显著提升。
本文提出 TMFormer,一种用于缺失模态脑肿瘤分割的 Token 合并 Transformer。该方法通过提取并合并可用模态为更紧凑的 token 序列,解决现有方法以零图填充缺失模态带来的特征偏差与冗余计算问题。其核心包括单模态 Token 合并块(UMB)和多模态 Token 合并块(MMB),分别增强单模态表示并缓解多模态融合偏差。在 BraTS 2018 和 2020 数据集上的实验表明,TMFormer 在缺失模态场景下优于现有方法。
本文提出ACDIS框架,用于解决脑肿瘤分割中MRI模态缺失的问题。通过解剖一致性蒸馏将多模态图像中的共享解剖结构迁移至单模态表示,并利用模态特征合成块生成模态特定特征,从而增强单模态图像在特定区域的组织表现。该方法有效缓解了模态缺失带来的性能下降,提升了分割精度。
本文针对仅使用文本数据训练图像描述模型的任务,提出一种多上下文数据生成方法。通过构造多样化的文本上下文,生成合成图像-描述训练对,使模型学习跨模态对齐与语义描述能力,减少对真实图像标注的依赖。实验表明该方法在多个图像描述基准上取得有效性能,为数据稀缺场景下的多模态学习提供了新思路。