Modelos de linguagem autorregressivos (AR) geram texto um token por vez, o que limita sua velocidade de inferência. Modelos de linguagem baseados em difusão oferecem uma alternativa promissora, pois podem decodificar múltiplos tokens em paralelo. No entanto, identificamos um gargalo chave nos LM de difusão atuais: o problema da janela de decodificação longa, onde tokens gerados longe do contexto de entrada muitas vezes se tornam irrelevantes ou repetitivos. Soluções anteriores, como semi-autoregressivos, abordam esse problema dividindo janelas em blocos, mas isso sacrifica velocidade e bidirecionalidade, eliminando a principal vantagem dos modelos de difusão. Para superar isso, propomos a decodificação Convencional (Conv), um método baseado em normalização que estreita a janela de decodificação sem segmentação rígida, levando a melhor fluência e flexibilidade. Além disso, introduzimos o Ajuste Baseado em Regras de Rejeição (R2FT), um esquema de treinamento pós-hoc que alinha melhor os tokens em posições distantes do contexto. Nossos métodos alcançam resultados de ponta em benchmarks de geração aberta (por exemplo, AlpacaEval) entre as bases de LM de difusão, com um tamanho de passo significativamente menor do que trabalhos anteriores, demonstrando tanto melhorias de velocidade quanto de qualidade.
Seo et al. (qui,) estudaram essa questão.