本文提出Holo-World,一种统一的视频世界模型,可从单张图像出发,联合控制相机运动、物体动态和天气状态。作者构建了HoloStateData数据集,将多样视频转换为统一控制样本;并提出统一场景适配器,将世界保持与天气迁移分解到不同参数子空间,利用渲染背景、几何缓冲和物体控制维持场景结构,同时建模天气相关外观与粒子效果。场景-天气分解CFG进一步分别引导场景和天气残差,增强目标天气效果。实验表明,Holo-World在保持精确控制的同时,实现了优于视频到视频基线的天气状态生成。
本文提出Panacea,一种面向自动驾驶场景的全景可控视频生成方法。该方法通过创新的4D注意力机制和两阶段生成流程,有效解决了生成视频中的时间与跨视角一致性问题;同时引入ControlNet框架,利用鸟瞰图(BEV)布局对生成内容进行精细控制。在nuScenes数据集上的实验表明,Panacea能够生成高质量的多视角驾驶视频,为BEV感知任务提供丰富的训练数据增强,推动自动驾驶感知技术的发展。