A detecção de objetos por sonar subaquático é desafiadora porque os alvos são frequentemente pequenos, as bordas são borradas, a desordem de fundo é intensa e os dados rotulados de sonar são limitados. Para abordar esses problemas, propomos o T2C-DETR, um detector construído sobre o RT-DETR com três melhorias orientadas para a tarefa: (i) uma rede backbone de canal duplo Transformador-Convolução (TCDCNet) para modelagem complementar de contexto global e detalhes locais, (ii) um Módulo de Filtragem de Ruído (NFM) inserido antes da fusão do pescoço para suprimir ativações dominadas por ruído, e (iii) uma estratégia de transferência de aprendizagem em etapas adaptada a pequenos conjuntos de dados de sonar. Avaliamos o método sob três fontes de pré-treinamento (COCO 2017, DOTA e um conjunto de dados infravermelho) e, em seguida, ajustamos finamente em um conjunto de dados de sonar auto-construído. Resultados experimentais mostram que o T2C-DETR alcança AP50 de 97,8%, 98,2% e 98,5% a 72–73 FPS, superando consistentemente a linha de base do RT-DETR, YOLOv5-Imp e MLFFNet na troca entre precisão e velocidade. Esses resultados indicam que combinar aprendizado de representação global-local com supressão de ruído direcionada é eficaz para detecção prática de sonar em tempo real.
Wu et al. (Sex,) estudaram esta questão.