现有基于视觉变换器(Vision Transformer, ViT)的图像级弱监督语义分割方法主要依赖自注意力机制提取有限的语义信息,未能充分利用多维特征关系,导致目标区域的识别较为粗略。为此,提出一种时空对比学习驱动的弱监督图像语义分割网络(Spatio-temporal Contrastive Learning, STCL),旨在通过时间、空间角度挖掘监督信息,以提高分割精度。通过ViT的令牌机制,引入了空间特征对比学习模块,结合补丁级令牌和类级令牌对比策略,深入探索图像空间中隐含的语义特征关系;设计了时间上下文对比学习模块,通过构建记忆库,利用历史图像分割中的先验知识来指导当前语义分割任务,并建立了记忆库更新策略和自适应记忆对比度损失,进一步提升了模型对细节区域的辨识能力。实验结果表明,在PASCAL VOC和MS COCO数据集上的平均交并比可以分别达到72.7%以及43.6%,证明了所提出方法的优越性。
Zhen et al. (Thu,) studied this question.