O treinamento de grandes modelos de linguagem (LLMs) com comprimentos de sequência cada vez mais longos e variados introduz sérios desafios de desequilíbrio de carga no treinamento em larga escala em paralelo de dados. Estruturas recentes tentam mitigar esses problemas por meio de reorganização de dados ou estratégias de paralelismo híbrido. No entanto, muitas vezes negligenciam como os custos computacionais e de comunicação escalam com o comprimento da sequência, resultando em desempenho subótimo. Identificamos três desafios críticos: (1) variação nas razões de computação para comunicação entre sequências de diferentes comprimentos na atenção distribuída, (2) descompasso entre a afinidade estática NIC-GPU e cargas de trabalho paralelas dinâmicas, e (3) distintas estratégias de particionamento otimizadas necessárias para atenção quadrática versus componentes lineares. Para abordar esses desafios, apresentamos o Zeppelin, um novo sistema de treinamento que integra três técnicas principais: (1) um método hierárquico de particionamento de sequência para o módulo de atenção que reduz a sobrecarga de comunicação e equilibra a computação, apoiado por um motor de atenção eficiente que aplica estratégias paralelas divergentes; (2) uma camada de roteamento que orquestra transferências entre nós para utilizar totalmente a largura de banda da NIC; e (3) uma camada de reatribuição que transforma disposições de sequência entre módulos de atenção e lineares, garantindo alta eficiência computacional em ambos. Avaliações abrangentes em diversas configurações mostram que o Zeppelin oferece um aumento médio de 2,80x em relação aos métodos de ponta.
Chen et al. (Sex,) estudaram essa questão.