本文针对协作与分布式智能系统中压缩中间特征的语义质量评估问题,提出了一种基于Token级注意力引导的评估方法。该方法利用原始与重建Token之间的内在对应关系,在Token层面进行质量度量,以减少跨Token干扰;同时通过注意力机制区分不同Token对下游任务的重要性,从而更准确地反映压缩特征的语义效用。实验表明,该方法在多种特征编解码器上均优于传统相似性度量,具有良好的鲁棒性。
本文提出空间语义一致模型(SSCM),用于多对比度磁共振成像超分辨率。该方法通过动态空间扭曲模块实现对比度间空间对齐,利用语义感知令牌聚合块建模长程依赖,并结合空间-频率融合块恢复高频细节,从而在结构差异和运动干扰下保持解剖结构的空间语义一致性。实验表明SSCM在效率和性能上优于现有方法。
本文提出RiO-DETR,一种面向实时旋转目标检测的DETR框架。针对方向语义依赖、角度周期性和搜索空间扩大等挑战,设计了内容驱动的角度估计、旋转校正正交注意力、解耦周期细化以及定向密集O2O机制,在保持实时效率的同时提升角度收敛速度与检测精度。在DOTA-1.0、DIOR-R和FAIR-1M-2.0上的实验表明,该方法实现了新的速度-精度平衡。
本文提出 Dome-DETR,一种面向微小物体检测的高效框架。针对现有方法特征利用不充分和计算成本高的问题,引入轻量级密度聚焦提取器(DeFE)生成紧凑前景掩码,并基于掩码的窗口注意力稀疏化(MWAS)将计算资源集中于关键区域。同时提出渐进自适应查询初始化(PAQI),自适应调节查询分布,提升检测效率与精度。
本文针对传统RGB方法在剧烈运动和极端光照下头部姿态估计困难的问题,引入事件相机的高时间分辨率与高动态范围优势。作者构建了两个大规模事件头部姿态数据集,包含282个序列,覆盖不同分辨率与场景;并提出事件头部姿态估计网络EV-HPE,设计了事件时空融合模块和事件运动感知注意力模块,有效结合事件流时空信息,提升姿态估计精度与鲁棒性。
本文提出了一种基于事件相机的微表情识别系统。针对微表情持续时间短、幅度微弱、难以用传统相机捕捉的问题,系统利用事件相机的高时间分辨率特性,设计了事件增强运动提取器(EEME)以放大细微运动,并引入事件引导注意力(EGA)聚焦关键面部区域,从而提升微表情识别的准确性与鲁棒性。该系统为情感计算领域提供了有效工具。
本文针对微表情识别中动作幅度小、持续时间短、难以捕捉的问题,提出了一种事件驱动的时空运动增强网络。该方法引入事件相机捕获的高时间分辨率事件信号,设计事件增强运动提取模块以增强细微运动细节,并利用事件引导注意力模块聚焦特定区域的微小变化,从而获取更精确的空间特征。在合成和真实数据集上的实验结果表明,该方法在微表情识别任务上具有优越性能。