Key points are not available for this paper at this time.
비전-언어 모델(VLMs)은 여러 언어로 이미지에 대한 질문에 응답할 수 있습니다. 그러나 언어를 넘어서, 문화는 우리가 사물을 보는 방식에 영향을 미칩니다. 예를 들어, 서구 문화의 개인은 이미지에서 중심 인물에 더 집중하는 반면, 동양 문화의 개인은 장면 맥락에 더 주목합니다. 이 연구에서는 이미지 이해에서 VLM의 서구 편향을 입증하고 국소화하는 새로운 조사를 제시합니다. 우리는 문화적으로 다양한 이미지와 주석으로 주관적 및 객관적 시각 과제를 통해 대규모 VLM을 평가합니다. 우리는 VLM이 각 과제의 서구 하위 집합에서 동양 하위 집합보다 더 잘 수행됨을 발견했습니다. 이러한 편향의 원인을 추적하는 통제된 실험은 영어로 추론이 수행될 때라도 공정한 VLM을 구축하기 위한 텍스트 전용 사전 훈련에서 다양한 언어 믹스의 중요성을 강조합니다. 게다가, 목표 문화의 언어로 프롬프트를 하면 편향이 줄어들 수 있지만, 이는 세계의 언어를 더 잘 대표하는 AI를 구축하는 대체물이 아닙니다.
Ananthram et al. (Mon,)이 이 질문을 연구했습니다.