本文针对超分辨率图像质量评估(SRIQA)任务,提出一种结合视觉Transformer(ViT)与卷积神经网络(CNN)的混合无参考评估模型。该方法利用ViT提取非局部特征,并通过多阶段自注意力处理图像令牌,再将其重塑为特征图,由CNN编码映射为质量分数,从而同时捕捉局部与非局部信息,克服了传统全参考指标依赖真实图像且可靠性不足的问题。