<?xml version="1.0" encoding="utf-8" standalone="yes" ?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>文本到图像生成 | ViLab</title>
    <link>https://vilab.team/tag/%E6%96%87%E6%9C%AC%E5%88%B0%E5%9B%BE%E5%83%8F%E7%94%9F%E6%88%90/</link>
      <atom:link href="https://vilab.team/tag/%E6%96%87%E6%9C%AC%E5%88%B0%E5%9B%BE%E5%83%8F%E7%94%9F%E6%88%90/index.xml" rel="self" type="application/rss+xml" />
    <description>文本到图像生成</description>
    <generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Mon, 20 Apr 2026 00:00:00 +0000</lastBuildDate>
    <image>
      <url>https://vilab.team/media/icon_hu2896232876136423579.png</url>
      <title>文本到图像生成</title>
      <link>https://vilab.team/tag/%E6%96%87%E6%9C%AC%E5%88%B0%E5%9B%BE%E5%83%8F%E7%94%9F%E6%88%90/</link>
    </image>
    
    <item>
      <title>Facm: Flow-anchored consistency models</title>
      <link>https://vilab.team/publication/facm-flow-anchored-consistency-models/</link>
      <pubDate>Mon, 20 Apr 2026 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/facm-flow-anchored-consistency-models/</guid>
      <description>&lt;p&gt;本文针对连续时间一致性模型（CM）训练不稳定的问题，指出其根源在于捷径目标导致瞬时速度场被灾难性遗忘。为此提出流锚定一致性模型（FACM），以流匹配任务作为动态锚点，并设计扩展时间间隔策略统一优化、解耦两个任务，实现稳定且架构无关的训练。在ImageNet 256×256上，蒸馏LightningDiT模型取得NFE=2时FID 1.32、NFE=1时FID 1.70的SOTA结果；同时提出内存高效的Chain-JVP，将FACM扩展到140亿参数的Wan 2.2模型，加速文本到图像推理至2-8步。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>祝贺实验室科研成果发表于 ICLR 2026！</title>
      <link>https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/</link>
      <pubDate>Mon, 20 Apr 2026 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/</guid>
      <description>&lt;p&gt;热烈祝贺彭岩松同学！论文《Facm: Flow-anchored consistency models》已发表在 &lt;em&gt;ICLR&lt;/em&gt; 2026。&lt;/p&gt;
&lt;h2 id=&#34;facm-flow-anchored-consistency-models&#34;&gt;Facm: Flow-anchored consistency models&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;祝贺彭岩松同学！该论文已发表在 &lt;em&gt;ICLR&lt;/em&gt; 2026。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;















&lt;figure  &gt;
  &lt;div class=&#34;d-flex justify-content-center&#34;&gt;
    &lt;div class=&#34;w-100&#34; &gt;&lt;img alt=&#34;Facm: Flow-anchored consistency models&#34; srcset=&#34;
               /event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/images/paper-01_hu12002391219066891609.webp 400w,
               /event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/images/paper-01_hu15036098972298221130.webp 760w,
               /event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/images/paper-01_hu3776373299308260365.webp 1200w&#34;
               src=&#34;https://vilab.team/event/%E7%A5%9D%E8%B4%BA%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%A7%91%E7%A0%94%E6%88%90%E6%9E%9C%E5%8F%91%E8%A1%A8%E4%BA%8E-iclr-2026/images/paper-01_hu12002391219066891609.webp&#34;
               width=&#34;760&#34;
               height=&#34;207&#34;
               loading=&#34;lazy&#34; data-zoomable /&gt;&lt;/div&gt;
  &lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;作者：&lt;/strong&gt; Yansong Peng、Kai Zhu、Yu Liu、Pingyu Wu、Hebei Li、Xiaoyan Sun、Feng Wu&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;发表载体：&lt;/strong&gt; &lt;em&gt;ICLR&lt;/em&gt; 2026&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;发表时间：&lt;/strong&gt; 2026年4月20日&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;相关链接：&lt;/strong&gt; &lt;a href=&#34;https://proceedings.iclr.cc/paper_files/paper/2026/hash/0d0dac08f4199f0c348dd2feace0305a-Abstract-Conference.html&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;论文链接&lt;/a&gt; · &lt;a href=&#34;https://proceedings.iclr.cc/paper_files/paper/2026/file/0d0dac08f4199f0c348dd2feace0305a-Paper-Conference.pdf&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;PDF&lt;/a&gt; · &lt;a href=&#34;https://github.com/ali-vilab/FACM&#34; target=&#34;_blank&#34; rel=&#34;noopener&#34;&gt;代码&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;论文介绍&#34;&gt;论文介绍&lt;/h3&gt;
&lt;p&gt;本文针对连续时间一致性模型（CM）训练不稳定的问题，指出其根源在于捷径目标导致瞬时速度场被灾难性遗忘。为此提出流锚定一致性模型（FACM），以流匹配任务作为动态锚点，并设计扩展时间间隔策略统一优化、解耦两个任务，实现稳定且架构无关的训练。在ImageNet 256×256上，蒸馏LightningDiT模型取得NFE=2时FID 1.32、NFE=1时FID 1.70的SOTA结果；同时提出内存高效的Chain-JVP，将FACM扩展到140亿参数的Wan 2.2模型，加速文本到图像推理至2-8步。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Microcinema: A divide-and-conquer approach for text-to-video generation</title>
      <link>https://vilab.team/publication/microcinema-a-divide-and-conquer-approach-for-text-to-video-/</link>
      <pubDate>Sun, 16 Jun 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/microcinema-a-divide-and-conquer-approach-for-text-to-video-/</guid>
      <description>&lt;p&gt;本文提出 MicroCinema，一种简洁而有效的文本生成视频框架。它采用分而治之策略，将任务分解为文本生成图像和图像与文本联合生成视频两个阶段，从而充分利用现有文本到图像模型的强大能力，生成逼真且细节丰富的图像，并让视频模型更专注于运动动态的学习。为高效实现该策略，文章设计了外观注入网络和外观噪声先验，以增强外观保持和视频连贯性，在多个基准上取得了优越性能。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Text-Only Image Captioning with Multi-Context Data Generation.</title>
      <link>https://vilab.team/publication/text-only-image-captioning-with-multi-context-data-generatio/</link>
      <pubDate>Sun, 01 Jan 2023 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/text-only-image-captioning-with-multi-context-data-generatio/</guid>
      <description>&lt;p&gt;本文针对仅使用文本数据训练图像描述模型的任务，提出一种多上下文数据生成方法。通过构造多样化的文本上下文，生成合成图像-描述训练对，使模型学习跨模态对齐与语义描述能力，减少对真实图像标注的依赖。实验表明该方法在多个图像描述基准上取得有效性能，为数据稀缺场景下的多模态学习提供了新思路。&lt;/p&gt;
</description>
    </item>
    
  </channel>
</rss>
