<?xml version="1.0" encoding="utf-8" standalone="yes" ?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>图像描述 | ViLab</title>
    <link>https://vilab.team/tag/%E5%9B%BE%E5%83%8F%E6%8F%8F%E8%BF%B0/</link>
      <atom:link href="https://vilab.team/tag/%E5%9B%BE%E5%83%8F%E6%8F%8F%E8%BF%B0/index.xml" rel="self" type="application/rss+xml" />
    <description>图像描述</description>
    <generator>Hugo Blox Builder (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Wed, 29 May 2024 00:00:00 +0000</lastBuildDate>
    <image>
      <url>https://vilab.team/media/icon_hu2896232876136423579.png</url>
      <title>图像描述</title>
      <link>https://vilab.team/tag/%E5%9B%BE%E5%83%8F%E6%8F%8F%E8%BF%B0/</link>
    </image>
    
    <item>
      <title>Multi-modal generative embedding model</title>
      <link>https://vilab.team/publication/multi-modal-generative-embedding-model/</link>
      <pubDate>Wed, 29 May 2024 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/multi-modal-generative-embedding-model/</guid>
      <description>&lt;p&gt;本文提出多模态生成嵌入模型MM-GEM，将生成与嵌入两种目标统一于单个大语言模型中，实现每个模态仅需一个模型。通过引入PoolAggregator提升效率并支持细粒度嵌入与生成。实验表明，生成与嵌入目标并不显著冲突，模型在跨模态检索、零样本分类和图像描述等任务上表现优异，同时具备区域级描述生成与检索能力，并在长文本图像检索中取得显著提升。&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Text-Only Image Captioning with Multi-Context Data Generation.</title>
      <link>https://vilab.team/publication/text-only-image-captioning-with-multi-context-data-generatio/</link>
      <pubDate>Sun, 01 Jan 2023 00:00:00 +0000</pubDate>
      <guid>https://vilab.team/publication/text-only-image-captioning-with-multi-context-data-generatio/</guid>
      <description>&lt;p&gt;本文针对仅使用文本数据训练图像描述模型的任务，提出一种多上下文数据生成方法。通过构造多样化的文本上下文，生成合成图像-描述训练对，使模型学习跨模态对齐与语义描述能力，减少对真实图像标注的依赖。实验表明该方法在多个图像描述基准上取得有效性能，为数据稀缺场景下的多模态学习提供了新思路。&lt;/p&gt;
</description>
    </item>
    
  </channel>
</rss>
