本文提出一种基于多上下文合成数据的图像描述生成方法(ICSD)。针对现有合成数据仅能生成单一视角、上下文有限的问题,利用大语言模型从语料中提取同一场景的多视角描述并压缩为多上下文句子,再通过扩散模型生成复杂图像,仅用合成图像-文本对训练描述模型。在MSCOCO、Flickr30k和NoCaps等数据集上取得领先性能。