本文针对传统RGB方法在剧烈运动和极端光照下头部姿态估计困难的问题,引入事件相机的高时间分辨率与高动态范围优势。作者构建了两个大规模事件头部姿态数据集,包含282个序列,覆盖不同分辨率与场景;并提出事件头部姿态估计网络EV-HPE,设计了事件时空融合模块和事件运动感知注意力模块,有效结合事件流时空信息,提升姿态估计精度与鲁棒性。
本文从概率视角重新审视三维卷积神经网络中的时空融合机制,提出了一种统一的概率建模框架,以刻画空间与时间信息在卷积过程中的交互关系。通过将时空融合视为潜在变量条件下的概率推断问题,该方法能够更有效地捕捉视频数据中的动态依赖,并提升模型在动作识别等视频理解任务上的表现。