视频情感描述旨在为视频序列生成富含情感语义的自然语言文本, 在人机交互和数字人等领域具有广泛应用前景. 然而, 现有方法大多依赖大规模人工标注的视频-情感描述对进行训练, 导致成本高昂. 尽管近年来视觉-语言基础模型 (如blip) 具备一定的零样本推理能力, 但在细粒度情感理解和描述真实性方面仍存在不足. 为此, 本文提出一种反事实情感因果推理增强blip方法, 以实现无需人工标注的零样本视频情感描述. 该方法包括两个模块: 情感伪标签生成与学习和反事实情感因果推理学习. 前者为每个视频构建涵盖全局内容, 全局情感, 人脸表情三个维度的多粒度情感伪标签, 并结合情感语义描述损失使blip具备细粒度情感建模能力. 后者基于自然直接效应建模视觉与语言间的因果关系, 以缓解情感幻觉问题. 在推理阶段, 将视频输入增强后的blip能够生成准确且连贯的情感描述. 本文在视频情感描述数据集mafw和dfew上进行了域内和域外实验. 实验结果表明, 本文方法在四个描述生成指标上均优于现有方法, 验证了该方法的有效性与优越性.
Ke et al. (Sun,) studied this question.