Gerne, hier ist der Text ohne die LaTeX-spezifischen Befehle und Formatierungen:Die Barrierefreiheit des Webs bleibt eine Herausforderung: Über 94% aller Startseiten verstoßen weiterhin gegen Standards wie WCAG 2.2 (Web Content Accessibility Guidelines), wodurch Millionen von Nutzerinnen und Nutzern benachteiligt werden. Diese Diplomarbeit untersucht, ob Large Language Models (LLMs) solche Barrierefreiheitsprobleme in komplexen Webprojekten autonom beheben können. Wir stellen A11y-Bench vor, ein neuartiges Benchmark-Datenset mit 51 realen Fällen von Barrierefreiheitsfehlern und deren Behebungen (extrahiert aus drei populären Open-Source-Repositorien), das vielfältige Probleme abdeckt, etwa fehlende ARIA-Labels, UI-Elemente mit zu geringem Kontrast und andere WCAG-Verstöße. Jede Instanz enthält den ursprünglichen fehlerhaften Code sowie die zugehörige Korrektur und ermöglicht so eine systematische Evaluation.Wir entwickeln eine vollständig automatisierte End-to-End-Evaluationspipeline auf Basis von Multi-SWE-Bench, die von LLMs generierte Patches in containerisierten Umgebungen einsetzt und ihre Gültigkeit über projektspezifische Test-Suiten überprüft. Mit diesem Framework evaluieren wir drei moderne, offene LLMs auf A11y-Bench mithilfe des MagentLess-Tools. Nur 1 von 51 Fällen (~2%) wurde von einem der Modelle vollständig behoben. Daher konzentriert sich die Analyse auf die Patch-Generierung selbst. Die Modelle erzeugten häufig nur Teilkorrekturen oder führten Regressionen ein und hatten insbesondere Schwierigkeiten mit kontextübergreifenden Frontend-Dateien. Unsere Analyse identifiziert typische Fehlermuster von LLMs (z. B. das Einfügen irrelevanter Änderungen oder das Übersehen einzelner Probleminstanzen).Die Diplomarbeit leistet einen Beitrag durch (1) das A11y-Bench-Datenset und eine offene Evaluationspipeline, (2) Basis-Ergebnisse zur LLM-Leistung bei der Behebung von Barrierefreiheitsproblemen und (3) Erkenntnisse, die zukünftige Forschung im Bereich der Web-Barrierefreiheit anleiten sollen.
Maximilian Tschoner (Mon,) studied this question.