本文针对少样本动作识别中训练样本稀缺且视频结构复杂的问题,提出分层任务感知时间建模与匹配方法(HTTMM)。该方法通过分层结构充分建模时空特征,并利用任务感知机制增强对关键运动模式的感知,从而提升查询样本与支持样本之间的匹配效果。在多个基准数据集上的实验验证了其有效性,尤其适用于需要局部运动感知的细粒度动作分类任务。
本文提出基于SAM的语义增强点框联合提示框架SAM-SPB,用于视频对象分割。该框架通过点跟踪分支维持对象局部结构信息,并利用语义感知的基于记忆的框跟踪分支跨帧传播对象语义一致性,从而结合局部与全局线索实现鲁棒分割。在主流VOS基准上取得了领先性能,验证了点框联合提示相比仅用点提示的优势。
本文针对低光照条件下视频目标分割(VOS)性能严重下降的问题,提出一种利用事件相机数据辅助分割的新框架。该方法包含两个关键模块:自适应跨模态融合(ACMF)模块,用于提取并融合图像与事件模态特征以抑制噪声干扰;事件引导记忆匹配(EGMM)模块,用于修正低光下查询帧与记忆帧之间的相似度计算误差。实验表明,该方法在合成和真实低光数据集上均能显著提升分割精度,生成更准确的目标掩码。
本文针对野外视频预测中变分模型的后验坍缩问题,提出VAE^2方法。通过设计有效的潜在变量建模与训练机制,避免解码器忽略潜在码,从而增强模型对复杂动态场景的表征能力,提升视频预测的长期一致性与运动建模精度。实验表明该方法在多个视频预测基准上取得了优越性能。
本文提出一种利用外观信息丰富光流表示的动作识别方法。通过将RGB外观特征与光流特征进行融合,增强运动表征的判别能力,从而提升视频动作识别的准确率。该方法在多个基准数据集上验证了有效性,表明外观信息能够有效补充光流在动作识别中的不足。
本文从概率视角重新审视三维卷积神经网络中的时空融合机制,提出了一种统一的概率建模框架,以刻画空间与时间信息在卷积过程中的交互关系。通过将时空融合视为潜在变量条件下的概率推断问题,该方法能够更有效地捕捉视频数据中的动态依赖,并提升模型在动作识别等视频理解任务上的表现。