<?xml version="1.0" encoding="utf-8" standalone="yes" ?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>研究方向 | ViLab</title>
    <link>https://vilab.team/post/</link>
      <atom:link href="https://vilab.team/post/index.xml" rel="self" type="application/rss+xml" />
    <description>研究方向</description>
    <generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Tue, 01 Sep 2026 00:00:00 +0000</lastBuildDate>
    <image>
      <url>https://vilab.team/media/icon_hu2896232876136423579.png</url>
      <title>研究方向</title>
      <link>https://vilab.team/post/</link>
    </image>
    
    <item>
      <title>视频理解</title>
      <link>https://vilab.team/post/video_understanding/</link>
      <pubDate>Wed, 02 Dec 2020 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/post/video_understanding/</guid>
      <description>&lt;p&gt;本方向聚焦于视频理解、生成与具身智能的核心技术突破。在多模态理解方面，构建融合视觉、文本与语音的统一语义框架，攻克跨模态检索、视觉问答及情感分析等难题。在视频动态解析上，利用时空建模技术实现高精度的行为识别与事件预测。同时，我们积极探索跨模态生成技术，结合扩散模型与自监督学习，推动内容可控且具真实感的图像视频创作。此外，团队正拓展视觉-语言-动作模型（VLA）研究，通过多模态指令理解与物理空间交互建模，赋予智能体连接虚拟认知与实体操作的能力，迈向具身智能的新高度。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>类脑计算</title>
      <link>https://vilab.team/post/neuromorphic_computing/</link>
      <pubDate>Wed, 02 Dec 2020 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/post/neuromorphic_computing/</guid>
      <description>&lt;p&gt;本方向专注于事件相机（Event Camera）信号的处理与高阶视觉应用，旨在挖掘类脑视觉传感器的极速与高动态范围优势。主要研究内容包括：构建基于自注意力的事件分组与特征提取框架，通过分层聚合提升表征能力；设计纹理增强网络，利用迭代融合技术还原图像细节；探索事件引导的语义分割与多模态特征融合模型，增强复杂场景下的解析能力。此外，我们还致力于开发高效的事件特征选择与检测架构，利用稀疏选择机制在保证精度的同时大幅提升计算效率，为高速运动目标检测与极端光照场景下的视觉感知提供技术支撑。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>通用视觉感知</title>
      <link>https://vilab.team/post/%E9%80%9A%E7%94%A8%E8%A7%86%E8%A7%89%E6%84%9F%E7%9F%A5/</link>
      <pubDate>Tue, 01 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/post/%E9%80%9A%E7%94%A8%E8%A7%86%E8%A7%89%E6%84%9F%E7%9F%A5/</guid>
      <description>&lt;p&gt;本方向聚焦于复杂开放环境下通用视觉感知的关键技术研究，围绕目标检测、图像分割、目标跟踪与三维场景理解等核心任务，构建统一、高效且具泛化能力的视觉感知体系。在目标检测方面，研究面向多尺度、密集目标及开放类别场景的精准识别与定位技术，提升模型在复杂背景和长尾分布下的鲁棒性。在图像分割方面，探索语义分割、实例分割及全景分割方法，实现对场景中目标区域与细粒度结构的精确解析。同时，结合视觉基础模型、自监督学习与视觉-语言预训练技术，增强模型的开放词汇识别、跨域迁移与少样本泛化能力。此外，团队进一步拓展深度估计、姿态估计、目标跟踪及三维视觉感知等研究，为自动驾驶、机器人、智能制造等应用提供稳定可靠的环境感知基础。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>视频编码</title>
      <link>https://vilab.team/post/video_coding/</link>
      <pubDate>Wed, 02 Dec 2020 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/post/video_coding/</guid>
      <description>&lt;p&gt;本小组深入探索下一代图像与视频编码技术，核心方向涵盖端到端编码架构设计、生成式压缩以及特征编码理论。我们致力于突破传统编码框架的性能瓶颈，设计平衡高保真重建与低延迟需求的端到端架构。利用扩散模型与 GAN 等生成式技术，实现低码率下的高感知质量重建，颠覆传统压缩范式。同时，创新性地引入基于类小波变换的子带融合与混合注意力适配器，显著提升对域外图像的压缩鲁棒性。在特征编码方面，我们构建从像素级到语义级的压缩理论体系，探索面向机器视觉任务的语义信息压缩极限，为智能时代的视频传输提供高效解决方案。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>生物医学图像</title>
      <link>https://vilab.team/post/biomedical_imaging_technology/</link>
      <pubDate>Wed, 02 Dec 2020 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/post/biomedical_imaging_technology/</guid>
      <description>&lt;p&gt;本小组致力于将计算机视觉与人工智能前沿算法深度融入临床实践，面向真实世界的医学挑战构建智能化解决方案。我们聚焦于医学影像分析的核心痛点，研究方向涵盖医学图像分割、跨模态转换、图像生成与增强以及多模态医学大模型等前沿课题。特别关注 CT、MRI、病理及超声等多模态数据的深度融合与统一建模，旨在提升诊断效率、优化治疗路径及推动个性化医疗发展。团队与多家三甲医院及顶尖科研机构保持长期紧密合作，积极承担国家重点科研任务，相关成果已在 MICCAI、AAAI 等国际顶级会议与期刊上发表。&lt;/p&gt;
</description>
    </item>
    
  </channel>
</rss>
