本文提出细粒度补丁对齐网络(FG-PAN),用于脑肿瘤亚型的零样本分类。该方法包含局部特征细化模块,通过建模代表性补丁间的空间关系增强视觉特征;以及细粒度文本描述生成模块,利用大语言模型生成病理感知的类别语义原型。通过对齐细粒度视觉与语义特征,并引入坐标感知聚合机制,FG-PAN在整张病理切片级别实现了更准确的亚型判别,缓解了标注数据稀缺和形态差异细微带来的挑战。
本文提出一种基于多上下文合成数据的图像描述生成方法(ICSD)。针对现有合成数据仅能生成单一视角、上下文有限的问题,利用大语言模型从语料中提取同一场景的多视角描述并压缩为多上下文句子,再通过扩散模型生成复杂图像,仅用合成图像-文本对训练描述模型。在MSCOCO、Flickr30k和NoCaps等数据集上取得领先性能。