Key points are not available for this paper at this time.
Nos últimos anos, redes Transformer estão começando a substituir redes neurais convolucionais puras (CNNs) no campo da visão computacional devido ao seu campo receptivo global e adaptabilidade à entrada. No entanto, a complexidade computacional quadrática da atenção softmax limita a ampla aplicação na tarefa de desembaçamento de imagens, especialmente para imagens de alta resolução. Para resolver esse problema, propomos uma nova variante de Transformer, que aplica a expansão de Taylor para aproximar a atenção softmax e alcançar complexidade computacional linear. Um módulo de refinamento da atenção em múltiplas escalas é proposto como um complemento para corrigir o erro da expansão de Taylor. Além disso, introduzimos uma arquitetura de múltiplas ramificações com incorporação de patch em múltiplas escalas para o Transformer proposto, que incorpora características por meio de convoluções deformáveis sobrepostas de diferentes escalas. O design da incorporação de patch em múltiplas escalas é baseado em três ideias principais: 1) vários tamanhos do campo receptivo; 2) informação semântica em múltiplos níveis; 3) formas flexíveis do campo receptivo. Nosso modelo, chamado Transformer de Múltiplas Ramificações expandido pela fórmula de Taylor (MB-TaylorFormer), pode incorporar características de grosso a fino de forma mais flexível na fase de incorporação de patch e capturar interações de pixels de longa distância com custo computacional limitado. Resultados experimentais em vários benchmarks de desembaçamento mostram que o MB-TaylorFormer alcança desempenho de ponta (SOTA) com uma carga computacional leve. O código-fonte e os modelos pré-treinados estão disponíveis em https://github.com/FVL2020/ICCV-2023-MB-TaylorFormer.
Qiu et al. (Sun,) estudaram esta questão.