本文提出ReactID框架,旨在协调个性化视频生成中身份一致性与动作真实性的矛盾。针对主体-视频对齐不精确、训练不稳定、细粒度动作建模不足三大挑战,从数据、训练和动作建模三方面协同改进:构建高精度标注的ReactID-Data数据集;设计由易到难的渐进式训练课程;提出基于时间线的条件机制,通过主体感知交叉注意力和时间自适应RoPE,将子动作与特定主体绑定并嵌入时间坐标,从而生成更自然、可控的视频。
本文针对传统RGB方法在剧烈运动和极端光照下头部姿态估计困难的问题,引入事件相机的高时间分辨率与高动态范围优势。作者构建了两个大规模事件头部姿态数据集,包含282个序列,覆盖不同分辨率与场景;并提出事件头部姿态估计网络EV-HPE,设计了事件时空融合模块和事件运动感知注意力模块,有效结合事件流时空信息,提升姿态估计精度与鲁棒性。
本文提出Panacea,一种面向自动驾驶场景的全景可控视频生成方法。该方法通过创新的4D注意力机制和两阶段生成流程,有效解决了生成视频中的时间与跨视角一致性问题;同时引入ControlNet框架,利用鸟瞰图(BEV)布局对生成内容进行精细控制。在nuScenes数据集上的实验表明,Panacea能够生成高质量的多视角驾驶视频,为BEV感知任务提供丰富的训练数据增强,推动自动驾驶感知技术的发展。