<?xml version="1.0" encoding="utf-8" standalone="yes" ?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Yijun Pan | ViLab</title>
    <link>https://vilab.team/author/yijun-pan/</link>
      <atom:link href="https://vilab.team/author/yijun-pan/index.xml" rel="self" type="application/rss+xml" />
    <description>Yijun Pan</description>
    <generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Sun, 14 Sep 2025 00:00:00 +0000</lastBuildDate>
    <image>
      <url>https://vilab.team/media/icon_hu2896232876136423579.png</url>
      <title>Yijun Pan</title>
      <link>https://vilab.team/author/yijun-pan/</link>
    </image>
    
    <item>
      <title>Enhancing Visual Question Answering Via Clustered In-Context Sequence Configuration</title>
      <link>https://vilab.team/publication/enhancing-visual-question-answering-via-clustered-in-context/</link>
      <pubDate>Sun, 14 Sep 2025 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/enhancing-visual-question-answering-via-clustered-in-context/</guid>
      <description>&lt;p&gt;本文针对多模态大语言模型在多模态上下文学习中的演示序列配置问题，提出一种基于聚类的上下文配置方法。该方法自适应地对候选数据进行分组，并从每个簇中选取演示样本，以增强序列内多样性并保持语义一致性，从而减少高相似演示带来的归纳偏置，使模型更关注演示的主要意图。在OK-VQA、VQAv2、VizWiz和TextVQA四个视觉问答基准上的实验验证了其有效性。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Hierarchical Task-aware Temporal Modeling and Matching for few-shot action recognition</title>
      <link>https://vilab.team/publication/hierarchical-task-aware-temporal-modeling-and-matching-for-f/</link>
      <pubDate>Tue, 01 Apr 2025 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/hierarchical-task-aware-temporal-modeling-and-matching-for-f/</guid>
      <description>&lt;p&gt;本文针对少样本动作识别中训练样本稀缺且视频结构复杂的问题，提出分层任务感知时间建模与匹配方法（HTTMM）。该方法通过分层结构充分建模时空特征，并利用任务感知机制增强对关键运动模式的感知，从而提升查询样本与支持样本之间的匹配效果。在多个基准数据集上的实验验证了其有效性，尤其适用于需要局部运动感知的细粒度动作分类任务。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Semantic-aware late-stage supervised contrastive learning for fine-grained action recognition</title>
      <link>https://vilab.team/publication/semantic-aware-late-stage-supervised-contrastive-learning-fo/</link>
      <pubDate>Wed, 08 Jan 2025 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/semantic-aware-late-stage-supervised-contrastive-learning-fo/</guid>
      <description>&lt;p&gt;本文针对细粒度动作识别中类间差异小、类内差异大的挑战，提出了一种语义感知的后期监督对比学习方法。该方法通过后期监督对比学习策略，有效减少了对比学习所需的训练轮次，降低了计算成本；同时引入语义距离建模，在调整特征表示时显式考虑细粒度动作之间的语义关系，从而提升判别能力。实验表明该方法在多个细粒度动作识别基准上取得了优越性能。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Enriching optical flow with appearance information for action recognition</title>
      <link>https://vilab.team/publication/enriching-optical-flow-with-appearance-information-for-actio/</link>
      <pubDate>Wed, 01 Jan 2020 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/enriching-optical-flow-with-appearance-information-for-actio/</guid>
      <description>&lt;p&gt;本文提出一种利用外观信息丰富光流表示的动作识别方法。通过将RGB外观特征与光流特征进行融合，增强运动表征的判别能力，从而提升视频动作识别的准确率。该方法在多个基准数据集上验证了有效性，表明外观信息能够有效补充光流在动作识别中的不足。&lt;/p&gt;
</description>
    </item>
    
  </channel>
</rss>
