在精神病房中防止患者自残的有效自动化系统的发展受到真实培训数据稀缺的严重制约。为了解决这一关键问题,本研究引入了一个新的公共数据集,其中包含1120个模拟切割动作的视频,以及来自安全病房的118个真实世界视频的验证集,这些视频包含了更多样化的行为,如挑选和抓挠。我们对最先进的动作识别模型进行了全面的基准测试,包括卷积和变换器架构,以评估它们在模拟与真实世界条件下的性能和泛化能力。我们的结果显示了显著的“模拟到真实”差距:尽管表现最佳的模型VideoMAEv2在模拟数据上使用7折LOAO交叉验证取得了0.65的高F1分数,但其在真实世界数据上的表现降至平均F1分数0.61。这个性能下降归因于模型无法从统一的模拟动作泛化到真实临床环境中观察到的多样且常常被遮挡的行为。通过提供基础数据集、系统的基准以及模型失效点的定性分析,本研究定量展示了当前方法的局限性。我们的发现强调了对更具多样性的数据和先进方法的迫切需求,以开发能提高患者安全性的强大技术。
Lee等(周六)研究了这个问题。