通用视觉感知
本方向聚焦于复杂开放环境下通用视觉感知的关键技术研究,围绕目标检测、图像分割、目标跟踪与三维场景理解等核心任务,构建统一、高效且具泛化能力的视觉感知体系。在目标检测方面,研究面向多尺度、密集目标及开放类别场景的精准识别与定位技术,提升模型在复杂背景和长尾分布下的鲁棒性。在图像分割方面,探索语义分割、实例分割及全景分割方法,实现对场景中目标区域与细粒度结构的精确解析。同时,结合视觉基础模型、自监督学习与视觉-语言预训练技术,增强模型的开放词汇识别、跨域迁移与少样本泛化能力。此外,团队进一步拓展深度估计、姿态估计、目标跟踪及三维视觉感知等研究,为自动驾驶、机器人、智能制造等应用提供稳定可靠的环境感知基础。