<?xml version="1.0" encoding="utf-8" standalone="yes" ?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Chong Luo | ViLab</title>
    <link>https://vilab.team/author/chong-luo/</link>
      <atom:link href="https://vilab.team/author/chong-luo/index.xml" rel="self" type="application/rss+xml" />
    <description>Chong Luo</description>
    <generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Sun, 16 Jun 2024 00:00:00 +0000</lastBuildDate>
    <image>
      <url>https://vilab.team/media/icon_hu2896232876136423579.png</url>
      <title>Chong Luo</title>
      <link>https://vilab.team/author/chong-luo/</link>
    </image>
    
    <item>
      <title>Microcinema: A divide-and-conquer approach for text-to-video generation</title>
      <link>https://vilab.team/publication/microcinema-a-divide-and-conquer-approach-for-text-to-video-/</link>
      <pubDate>Sun, 16 Jun 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/microcinema-a-divide-and-conquer-approach-for-text-to-video-/</guid>
      <description>&lt;p&gt;本文提出 MicroCinema，一种简洁而有效的文本生成视频框架。它采用分而治之策略，将任务分解为文本生成图像和图像与文本联合生成视频两个阶段，从而充分利用现有文本到图像模型的强大能力，生成逼真且细节丰富的图像，并让视频模型更专注于运动动态的学习。为高效实现该策略，文章设计了外观注入网络和外观噪声先验，以增强外观保持和视频连贯性，在多个基准上取得了优越性能。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Panacea: Panoramic and controllable video generation for autonomous driving</title>
      <link>https://vilab.team/publication/panacea-panoramic-and-controllable-video-generation-for-auto/</link>
      <pubDate>Mon, 01 Jan 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/panacea-panoramic-and-controllable-video-generation-for-auto/</guid>
      <description>&lt;p&gt;本文提出Panacea，一种面向自动驾驶场景的全景可控视频生成方法。该方法通过创新的4D注意力机制和两阶段生成流程，有效解决了生成视频中的时间与跨视角一致性问题；同时引入ControlNet框架，利用鸟瞰图（BEV）布局对生成内容进行精细控制。在nuScenes数据集上的实验表明，Panacea能够生成高质量的多视角驾驶视频，为BEV感知任务提供丰富的训练数据增强，推动自动驾驶感知技术的发展。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Attention-guided contrastive masked image modeling for transformer-based self-supervised learning</title>
      <link>https://vilab.team/publication/attention-guided-contrastive-masked-image-modeling-for-trans/</link>
      <pubDate>Sun, 08 Oct 2023 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/attention-guided-contrastive-masked-image-modeling-for-trans/</guid>
      <description>&lt;p&gt;本文提出注意力引导的对比掩码图像建模方法（ACoMIM），融合对比学习与掩码图像建模两种自监督范式，并利用视觉Transformer的注意力机制提升表征能力。该方法包含两个预训练任务：一是根据注意力引导预测掩码区域的特征，二是比较掩码图像与未掩码图像的全局特征。两个任务相互补充，有效缓解了图像信息稀疏与分布不均的问题，在多种下游任务上验证了方法的有效性。&lt;/p&gt;
</description>
    </item>
    
  </channel>
</rss>
