Die föderierte Feinabstimmung mittels Optimierungsmethoden nullter Ordnung (ZO) bietet einen datenschutzfreundlichen und speichereffizienten Ansatz zur Anpassung großer Sprachmodelle (LLMs) auf ressourcenbeschränkten Geräten. Allerdings konvergieren ZO-Methoden deutlich langsamer als Backpropagation-basierte Methoden. Während bereits mehrere clientseitige Anpassungen entwickelt wurden, um diese Einschränkung zu mildern, ist das Potenzial adaptiver serverseitiger Optimierer bislang kaum untersucht. In dieser Arbeit analysieren wir den Einfluss adaptiver serverseitiger Optimierer auf die ZO-basierte föderierte Feinabstimmung von LLMs und untersuchen, wie sich ihr Nutzen mit zunehmender Modellgröße verändert. Dazu evaluieren wir ZO-Varianten von FedAdam und FedAdamW auf einer Reihe unterschiedlicher Aufgaben der natürlichen Sprachverarbeitung (NLP), sowie über zwei Modellfamilien hinweg und vergleichen sie mit einer auf FedAvg basierten Aggregationsstrategie. Unsere Experimente zeigen, dass adaptive serverseitige Optimierer die Anzahl der für die Konvergenz benötigten Runden bei den meisten Aufgaben um etwa 50% verringern können, während die Modellgüte (F1-score, Accuracy, ROUGE-L) innerhalb von 1-2% der nicht adaptiven Baseline bleibt.
Philipp Rettig (Mon,) studied this question.