目的在多媒体取证领域,语音证据的来源识别对于司法实践和信息安全至关重要。然而,现有方法大多仅能识别手机型号,而无法精确区分个体设备,导致语音证据多被视为辅助线索而非直接有效证据。方法本文提出一种多尺度特征融合与动态增强的语音来源识别模型(Multi-scale feature fusion and dynamic enhancement for voice source identification, VSI)。首先,通过残差-注意力协同网络,增强模型对不同设备相关特征的捕捉能力,提取语音信号的硬件指纹特征;其次,设计基于表达增强TDNN的整体特征提取模块,能够更好地捕捉丰富的设备特征信息;并设计基于多级残差SE-Res2Net的局部特征提取模块,有效捕捉手机设备个体之间的细微特征差异;然后,设计基于特征重校准与动态全局滤波的特征增强模块,滤除与任务无关的信息,增强与设备个体相关的特征表示;最后,构建细粒度分类模型,实现从型号到个体的跨层级设备识别。结果为了验证所提模型的有效性,论文构建了包含14个手机品牌、121个不同个体设备的语音数据集。所提VSI模型的等错误率(EER)、准确率(ACC)和最小检测代价函数(minDCF)指标分别为7.50%、89.97%和0.38,相较于文中对比的其他四种方法,EER分别降低了4.75%、4.71%、5.44%和3.46%,ACC分别提升了3.98%、2.20%、4.90%和2.52%,minDCF分别下降了0.04、0.04、0.30和0.03。而且,模型在改变语音时长、采样率、编码格式和幅值环境下具有一定的鲁棒性。结论这表明该模型能够将语音数据作为电子证据,为司法取证、智能终端设备身份认证等领域提供有力技术支持。
Zhaopin et al. (Thu,) studied this question.