고급 인공지능 모델을 사용하여 생성된 딥페이크 오디오는 사이버 보안, 허위 정보, 금융 사기 및 신원 사칭과 같은 분야에서 점점 더 큰 우려를 불러일으키고 있습니다. 인위적으로 생성된 음성을 탐지하는 것은 중요한 연구 과제가 됩니다. 이 논문은 양방향 장단기 기억(BI-LSTM) 신경망 기반의 딥페이크 오디오 탐지 시스템인 에코쉴드를 제시합니다. 이 시스템은 오디오 전처리 및 멜 주파수 켑스트럼 계수(MFCC) 특징 추출을 통해 음성 신호를 처리하여 관련 음향 패턴을 포착합니다. 그런 다음 이 특징은 BI-LSTM 모델에 의해 분석되어 진짜 음성과 AI 생성 음성을 구별합니다. 제안된 프레임워크는 오디오 전처리, 특징 추출, 모델 훈련 및 실시간 예측으로 구성된 완전한 파이프라인을 포함합니다. 모델은 공개적으로 사용 가능한 딥페이크 오디오 데이터셋에서 훈련되고 평가됩니다. 또한, 사용자들이 오디오 파일을 업로드하고 실시간 진위 예측을 받을 수 있도록 Flask 기반의 웹 인터페이스가 구현되었습니다. 에코쉴드는 오디오 포렌식 개선과 딥페이크 기반 공격에 대한 방어 강화에 대한 딥러닝 기술의 잠재력을 보여줍니다. 이 시스템은 디지털 보안, 미디어 검증 및 자동 콘텐츠 조정 분야의 응용 프로그램을 지원할 수 있습니다. 키워드: 딥페이크 탐지, 오디오 포렌식, 기계 학습, 음성 처리, BI-LSTM, MFCC, 인공지능.
Singh et al. (Wed,)은 이 질문을 조사했습니다.