Synapse
⌘+K
Synapse
PulseExploreClubsResearchersJournals
Instagram
HomeClubsExplore
September 23, 2025Open Access

Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models

View Full Paper
Ask AI
Bookmark
Share

Authors

FWFuta WasedaSSSaku SugawaraIEIsao Echizen

Discussion

Loading...

Member takes

Overview

Observational analysis reveals that Quality Text-guided adversarial fine-tuning improves image classification, suggesting enhanced robustness against adversarial attacks.

Key Points

  • QT-AFT enhances the robustness of vision-language models against adversarial attacks, allowing for better image classification.
  • Key evidence shows state-of-the-art zero-shot adversarial robustness and clean accuracy across 16 datasets.
  • The study proposes a novel approach, leveraging high-quality captions during training to improve semantic guidance in adversarial training.
  • Findings indicate the importance of linguistic supervision in improving visual representation learning.

Cite This Study

Waseda et al. (2025) studied this question.

synapsesocial.com/papers/68d473bb31b076d99fa6cc8fhttps://doi.org/10.48550/arxiv.2507.16257
View Full Paper
Ask AI
Bookmark
Share