本文提出 MicroCinema,一种简洁而有效的文本生成视频框架。它采用分而治之策略,将任务分解为文本生成图像和图像与文本联合生成视频两个阶段,从而充分利用现有文本到图像模型的强大能力,生成逼真且细节丰富的图像,并让视频模型更专注于运动动态的学习。为高效实现该策略,文章设计了外观注入网络和外观噪声先验,以增强外观保持和视频连贯性,在多个基准上取得了优越性能。