<?xml version="1.0" encoding="utf-8" standalone="yes" ?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>视频理解 | ViLab</title>
    <link>https://vilab.team/tag/%E8%A7%86%E9%A2%91%E7%90%86%E8%A7%A3/</link>
      <atom:link href="https://vilab.team/tag/%E8%A7%86%E9%A2%91%E7%90%86%E8%A7%A3/index.xml" rel="self" type="application/rss+xml" />
    <description>视频理解</description>
    <generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Tue, 01 Apr 2025 00:00:00 +0000</lastBuildDate>
    <image>
      <url>https://vilab.team/media/icon_hu2896232876136423579.png</url>
      <title>视频理解</title>
      <link>https://vilab.team/tag/%E8%A7%86%E9%A2%91%E7%90%86%E8%A7%A3/</link>
    </image>
    
    <item>
      <title>Hierarchical Task-aware Temporal Modeling and Matching for few-shot action recognition</title>
      <link>https://vilab.team/publication/hierarchical-task-aware-temporal-modeling-and-matching-for-f/</link>
      <pubDate>Tue, 01 Apr 2025 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/hierarchical-task-aware-temporal-modeling-and-matching-for-f/</guid>
      <description>&lt;p&gt;本文针对少样本动作识别中训练样本稀缺且视频结构复杂的问题，提出分层任务感知时间建模与匹配方法（HTTMM）。该方法通过分层结构充分建模时空特征，并利用任务感知机制增强对关键运动模式的感知，从而提升查询样本与支持样本之间的匹配效果。在多个基准数据集上的实验验证了其有效性，尤其适用于需要局部运动感知的细粒度动作分类任务。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Semantic-enhanced point-box joint prompting for video object segmentation</title>
      <link>https://vilab.team/publication/semantic-enhanced-point-box-joint-prompting-for-video-object/</link>
      <pubDate>Sun, 27 Oct 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/semantic-enhanced-point-box-joint-prompting-for-video-object/</guid>
      <description>&lt;p&gt;本文提出基于SAM的语义增强点框联合提示框架SAM-SPB，用于视频对象分割。该框架通过点跟踪分支维持对象局部结构信息，并利用语义感知的基于记忆的框跟踪分支跨帧传播对象语义一致性，从而结合局部与全局线索实现鲁棒分割。在主流VOS基准上取得了领先性能，验证了点框联合提示相比仅用点提示的优势。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Event-assisted low-light video object segmentation</title>
      <link>https://vilab.team/publication/event-assisted-low-light-video-object-segmentation/</link>
      <pubDate>Sun, 16 Jun 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/event-assisted-low-light-video-object-segmentation/</guid>
      <description>&lt;p&gt;本文针对低光照条件下视频目标分割（VOS）性能严重下降的问题，提出一种利用事件相机数据辅助分割的新框架。该方法包含两个关键模块：自适应跨模态融合（ACMF）模块，用于提取并融合图像与事件模态特征以抑制噪声干扰；事件引导记忆匹配（EGMM）模块，用于修正低光下查询帧与记忆帧之间的相似度计算误差。实验表明，该方法在合成和真实低光数据集上均能显著提升分割精度，生成更准确的目标掩码。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>VAE^ 2: Preventing Posterior Collapse of Variational Video Predictions in the Wild</title>
      <link>https://vilab.team/publication/vae-2-preventing-posterior-collapse-of-variational-video-pr/</link>
      <pubDate>Fri, 01 Jan 2021 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/vae-2-preventing-posterior-collapse-of-variational-video-pr/</guid>
      <description>&lt;p&gt;本文针对野外视频预测中变分模型的后验坍缩问题，提出VAE^2方法。通过设计有效的潜在变量建模与训练机制，避免解码器忽略潜在码，从而增强模型对复杂动态场景的表征能力，提升视频预测的长期一致性与运动建模精度。实验表明该方法在多个视频预测基准上取得了优越性能。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Enriching optical flow with appearance information for action recognition</title>
      <link>https://vilab.team/publication/enriching-optical-flow-with-appearance-information-for-actio/</link>
      <pubDate>Wed, 01 Jan 2020 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/enriching-optical-flow-with-appearance-information-for-actio/</guid>
      <description>&lt;p&gt;本文提出一种利用外观信息丰富光流表示的动作识别方法。通过将RGB外观特征与光流特征进行融合，增强运动表征的判别能力，从而提升视频动作识别的准确率。该方法在多个基准数据集上验证了有效性，表明外观信息能够有效补充光流在动作识别中的不足。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Spatiotemporal fusion in 3D CNNs: A probabilistic view</title>
      <link>https://vilab.team/publication/spatiotemporal-fusion-in-3d-cnns-a-probabilistic-view/</link>
      <pubDate>Wed, 01 Jan 2020 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/spatiotemporal-fusion-in-3d-cnns-a-probabilistic-view/</guid>
      <description>&lt;p&gt;本文从概率视角重新审视三维卷积神经网络中的时空融合机制，提出了一种统一的概率建模框架，以刻画空间与时间信息在卷积过程中的交互关系。通过将时空融合视为潜在变量条件下的概率推断问题，该方法能够更有效地捕捉视频数据中的动态依赖，并提升模型在动作识别等视频理解任务上的表现。&lt;/p&gt;
</description>
    </item>
    
  </channel>
</rss>
