<?xml version="1.0" encoding="utf-8" standalone="yes" ?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>扩散模型 | ViLab</title>
    <link>https://vilab.team/tag/%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B/</link>
      <atom:link href="https://vilab.team/tag/%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml" />
    <description>扩散模型</description>
    <generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Thu, 18 Jun 2026 00:00:00 +0000</lastBuildDate>
    <image>
      <url>https://vilab.team/media/icon_hu2896232876136423579.png</url>
      <title>扩散模型</title>
      <link>https://vilab.team/tag/%E6%89%A9%E6%95%A3%E6%A8%A1%E5%9E%8B/</link>
    </image>
    
    <item>
      <title>Holo-World: Unified Camera, Object and Weather Control for Video World Model</title>
      <link>https://vilab.team/publication/holo-world-unified-camera-object-and-weather-control-for-vi/</link>
      <pubDate>Thu, 18 Jun 2026 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/holo-world-unified-camera-object-and-weather-control-for-vi/</guid>
      <description>&lt;p&gt;本文提出Holo-World，一种统一的视频世界模型，可从单张图像出发，联合控制相机运动、物体动态和天气状态。作者构建了HoloStateData数据集，将多样视频转换为统一控制样本；并提出统一场景适配器，将世界保持与天气迁移分解到不同参数子空间，利用渲染背景、几何缓冲和物体控制维持场景结构，同时建模天气相关外观与粒子效果。场景-天气分解CFG进一步分别引导场景和天气残差，增强目标天气效果。实验表明，Holo-World在保持精确控制的同时，实现了优于视频到视频基线的天气状态生成。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Facm: Flow-anchored consistency models</title>
      <link>https://vilab.team/publication/facm-flow-anchored-consistency-models/</link>
      <pubDate>Mon, 20 Apr 2026 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/facm-flow-anchored-consistency-models/</guid>
      <description>&lt;p&gt;本文针对连续时间一致性模型（CM）训练不稳定的问题，指出其根源在于捷径目标导致瞬时速度场被灾难性遗忘。为此提出流锚定一致性模型（FACM），以流匹配任务作为动态锚点，并设计扩展时间间隔策略统一优化、解耦两个任务，实现稳定且架构无关的训练。在ImageNet 256×256上，蒸馏LightningDiT模型取得NFE=2时FID 1.32、NFE=1时FID 1.70的SOTA结果；同时提出内存高效的Chain-JVP，将FACM扩展到140亿参数的Wan 2.2模型，加速文本到图像推理至2-8步。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>ReactID: Synchronizing Realistic Actions and Identity in Personalized Video Generation</title>
      <link>https://vilab.team/publication/reactid-synchronizing-realistic-actions-and-identity-in-pers/</link>
      <pubDate>Mon, 20 Apr 2026 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/reactid-synchronizing-realistic-actions-and-identity-in-pers/</guid>
      <description>&lt;p&gt;本文提出ReactID框架，旨在协调个性化视频生成中身份一致性与动作真实性的矛盾。针对主体-视频对齐不精确、训练不稳定、细粒度动作建模不足三大挑战，从数据、训练和动作建模三方面协同改进：构建高精度标注的ReactID-Data数据集；设计由易到难的渐进式训练课程；提出基于时间线的条件机制，通过主体感知交叉注意力和时间自适应RoPE，将子动作与特定主体绑定并嵌入时间坐标，从而生成更自然、可控的视频。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>祝贺实验室科研成果发表于 ICLR 2026！</title>
      <link>https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/</link>
      <pubDate>Mon, 20 Apr 2026 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/</guid>
      <description>&lt;p&gt;热烈祝贺彭岩松同学！论文《Facm: Flow-anchored consistency models》已发表在 &lt;em&gt;ICLR&lt;/em&gt; 2026。&lt;/p&gt;
&lt;h2 id=&#34;facm-flow-anchored-consistency-models&#34;&gt;Facm: Flow-anchored consistency models&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;祝贺彭岩松同学！该论文已发表在 &lt;em&gt;ICLR&lt;/em&gt; 2026。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;















&lt;figure  &gt;
  &lt;div class=&#34;d-flex justify-content-center&#34;&gt;
    &lt;div class=&#34;w-100&#34; &gt;&lt;img alt=&#34;Facm: Flow-anchored consistency models&#34; srcset=&#34;
               /event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/images/paper-01_hu12002391219066891609.webp 400w,
               /event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/images/paper-01_hu15036098972298221130.webp 760w,
               /event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/images/paper-01_hu3776373299308260365.webp 1200w&#34;
               src=&#34;https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/images/paper-01_hu12002391219066891609.webp&#34;
               width=&#34;760&#34;
               height=&#34;207&#34;
               loading=&#34;lazy&#34; data-zoomable /&gt;&lt;/div&gt;
  &lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;作者：&lt;/strong&gt; Yansong Peng、Kai Zhu、Yu Liu、Pingyu Wu、Hebei Li、Xiaoyan Sun、Feng Wu&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;发表载体：&lt;/strong&gt; &lt;em&gt;ICLR&lt;/em&gt; 2026&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;发表时间：&lt;/strong&gt; 2026年4月20日&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;相关链接：&lt;/strong&gt; &lt;a href=&#34;https://proceedings.iclr.cc/paper_files/paper/2026/hash/0d0dac08f4199f0c348dd2feace0305a-Abstract-Conference.html&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;论文链接&lt;/a&gt; · &lt;a href=&#34;https://proceedings.iclr.cc/paper_files/paper/2026/file/0d0dac08f4199f0c348dd2feace0305a-Paper-Conference.pdf&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;PDF&lt;/a&gt; · &lt;a href=&#34;https://github.com/ali-vilab/FACM&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;代码&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;论文介绍&#34;&gt;论文介绍&lt;/h3&gt;
&lt;p&gt;本文针对连续时间一致性模型（CM）训练不稳定的问题，指出其根源在于捷径目标导致瞬时速度场被灾难性遗忘。为此提出流锚定一致性模型（FACM），以流匹配任务作为动态锚点，并设计扩展时间间隔策略统一优化、解耦两个任务，实现稳定且架构无关的训练。在ImageNet 256×256上，蒸馏LightningDiT模型取得NFE=2时FID 1.32、NFE=1时FID 1.70的SOTA结果；同时提出内存高效的Chain-JVP，将FACM扩展到140亿参数的Wan 2.2模型，加速文本到图像推理至2-8步。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>祝贺实验室科研成果发表于 ICLR 2026！</title>
      <link>https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr/</link>
      <pubDate>Mon, 20 Apr 2026 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr/</guid>
      <description>&lt;p&gt;热烈祝贺李蔚同学！论文《ReactID: Synchronizing Realistic Actions and Identity in Personalized Video Generation》已发表在 &lt;em&gt;ICLR 2026&lt;/em&gt;。&lt;/p&gt;
&lt;h2 id=&#34;reactid-synchronizing-realistic-actions-and-identity-in-personalized-video-generation&#34;&gt;ReactID: Synchronizing Realistic Actions and Identity in Personalized Video Generation&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;祝贺李蔚同学！该论文已发表在 &lt;em&gt;ICLR&lt;/em&gt;。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;















&lt;figure  &gt;
  &lt;div class=&#34;d-flex justify-content-center&#34;&gt;
    &lt;div class=&#34;w-100&#34; &gt;&lt;img alt=&#34;ReactID: Synchronizing Realistic Actions and Identity in Personalized Video Generation&#34; srcset=&#34;
               /event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr/images/paper-01_hu10185920340004675066.webp 400w,
               /event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr/images/paper-01_hu15268550746155155384.webp 760w,
               /event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr/images/paper-01_hu4770338007721801293.webp 1200w&#34;
               src=&#34;https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr/images/paper-01_hu10185920340004675066.webp&#34;
               width=&#34;760&#34;
               height=&#34;288&#34;
               loading=&#34;lazy&#34; data-zoomable /&gt;&lt;/div&gt;
  &lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;作者：&lt;/strong&gt; Wei Li、Yiheng Zhang、Fuchen Long、Zhaofan Qiu、Ting Yao、Xiaoyan Sun、Tao Mei&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;发表载体：&lt;/strong&gt; &lt;em&gt;ICLR&lt;/em&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;发表时间：&lt;/strong&gt; 2026年4月20日&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;相关链接：&lt;/strong&gt; &lt;a href=&#34;https://proceedings.iclr.cc/paper_files/paper/2026/hash/6600458132d025c68a01e82081597b32-Abstract-Conference.html&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;论文链接&lt;/a&gt; · &lt;a href=&#34;https://proceedings.iclr.cc/paper_files/paper/2026/file/6600458132d025c68a01e82081597b32-Paper-Conference.pdf&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;PDF&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;论文介绍&#34;&gt;论文介绍&lt;/h3&gt;
&lt;p&gt;本文提出ReactID框架，旨在协调个性化视频生成中身份一致性与动作真实性的矛盾。针对主体-视频对齐不精确、训练不稳定、细粒度动作建模不足三大挑战，从数据、训练和动作建模三方面协同改进：构建高精度标注的ReactID-Data数据集；设计由易到难的渐进式训练课程；提出基于时间线的条件机制，通过主体感知交叉注意力和时间自适应RoPE，将子动作与特定主体绑定并嵌入时间坐标，从而生成更自然、可控的视频。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Perceptual image compression with conditional diffusion transformers</title>
      <link>https://vilab.team/publication/perceptual-image-compression-with-conditional-diffusion-tran/</link>
      <pubDate>Sun, 08 Dec 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/perceptual-image-compression-with-conditional-diffusion-tran/</guid>
      <description>&lt;p&gt;本文提出一种基于条件扩散模型的感知图像压缩方法，旨在解决现有生成式压缩方法性能提升有限和模型复杂度高的问题。方法采用扩散Transformer作为解码器，并利用Swin Transformer实现高效架构，以增强生成能力；同时引入多尺度特征融合模块，为解码器提供更丰富的信息特征。实验结果表明该方法在感知图像压缩任务上取得了优越的性能。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Multi-modal diffusion network with controllable variability for medical image segmentation</title>
      <link>https://vilab.team/publication/multi-modal-diffusion-network-with-controllable-variability-/</link>
      <pubDate>Tue, 03 Dec 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/multi-modal-diffusion-network-with-controllable-variability-/</guid>
      <description>&lt;p&gt;本文提出一种具有可控变异性的多模态扩散分割网络（MMDSN），用于医学图像分割。该方法通过医学文本注释实现多模态条件控制，增强视觉语义表示的一致性，并建立视觉与语言之间的对应关系。同时，MMDSN 在潜在高斯空间中对多个时间步的不确定性分布进行约束，从而控制每个去噪时间步的变异性，减少扩散模型随机采样带来的分割偏差。在 Qata-Covid19 等数据集上的实验验证了其有效性。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Microcinema: A divide-and-conquer approach for text-to-video generation</title>
      <link>https://vilab.team/publication/microcinema-a-divide-and-conquer-approach-for-text-to-video-/</link>
      <pubDate>Sun, 16 Jun 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/microcinema-a-divide-and-conquer-approach-for-text-to-video-/</guid>
      <description>&lt;p&gt;本文提出 MicroCinema，一种简洁而有效的文本生成视频框架。它采用分而治之策略，将任务分解为文本生成图像和图像与文本联合生成视频两个阶段，从而充分利用现有文本到图像模型的强大能力，生成逼真且细节丰富的图像，并让视频模型更专注于运动动态的学习。为高效实现该策略，文章设计了外观注入网络和外观噪声先验，以增强外观保持和视频连贯性，在多个基准上取得了优越性能。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Image captioning with multi-context synthetic data</title>
      <link>https://vilab.team/publication/image-captioning-with-multi-context-synthetic-data/</link>
      <pubDate>Sun, 24 Mar 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/image-captioning-with-multi-context-synthetic-data/</guid>
      <description>&lt;p&gt;本文提出一种基于多上下文合成数据的图像描述生成方法（ICSD）。针对现有合成数据仅能生成单一视角、上下文有限的问题，利用大语言模型从语料中提取同一场景的多视角描述并压缩为多上下文句子，再通过扩散模型生成复杂图像，仅用合成图像-文本对训练描述模型。在MSCOCO、Flickr30k和NoCaps等数据集上取得领先性能。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Panacea: Panoramic and controllable video generation for autonomous driving</title>
      <link>https://vilab.team/publication/panacea-panoramic-and-controllable-video-generation-for-auto/</link>
      <pubDate>Mon, 01 Jan 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/panacea-panoramic-and-controllable-video-generation-for-auto/</guid>
      <description>&lt;p&gt;本文提出Panacea，一种面向自动驾驶场景的全景可控视频生成方法。该方法通过创新的4D注意力机制和两阶段生成流程，有效解决了生成视频中的时间与跨视角一致性问题；同时引入ControlNet框架，利用鸟瞰图（BEV）布局对生成内容进行精细控制。在nuScenes数据集上的实验表明，Panacea能够生成高质量的多视角驾驶视频，为BEV感知任务提供丰富的训练数据增强，推动自动驾驶感知技术的发展。&lt;/p&gt;
</description>
    </item>
    
  </channel>
</rss>
