Key points are not available for this paper at this time.
대형 언어 모델(LLM)은 유해한 콘텐츠가 포함된 데이터셋으로 훈련될 때 취약하며, 이는 두 가지 시나리오에서 잠재적인 탈옥 공격으로 이어집니다: 사전 훈련에 사용되는 크라우드소싱 데이터 내 유해한 텍스트의 통합과 LLM에 대한 직접적인 조작을 통한 파인튜닝입니다. 두 시나리오 모두에서 적대자는 LLM의 안전 정렬을 손상시킬 수 있으며, 이는 오작동을 악화시킵니다. 이러한 적대적 영향을 완화할 필요성에 의해 동기 부여된 우리의 연구는 사전 훈련 데이터셋에서 악성 텍스트의 영향을 중화하거나 다운스트림 파인튜닝 중 탈옥의 난이도를 증가시켜 안전 정렬을 개선하는 것을 목표로 합니다. 본 논문에서는 두 시나리오에서 적대적 영향을 상쇄하기 위해 설계된 데이터 관리 프레임워크를 제안합니다. 우리의 방법은 공격의 세부 사항에 대한 사전 지식이 없다는 가정 하에 깨끗한 텍스트를 관리하는 데만 집중합니다. LLM이 인식하는 혼란도를 줄이기 위해 텍스트를 수정하는 반복 프로세스를 도입하면서 동시에 텍스트 품질을 보존합니다. 관리된 깨끗한 텍스트로 LLM을 사전 훈련하거나 파인튜닝할 때, 우리는 유해한 쿼리에 대한 안전 정렬과 관련하여 LLM의 강건성이 눈에 띄게 개선되는 것을 관찰합니다. 예를 들어, 5%의 유해한 사례가 포함된 크라우드소싱 데이터셋을 사용하여 LLM을 사전 훈련할 경우, 동등한 양의 관리된 텍스트를 추가하면 LLM에서 유해한 응답을 제공할 가능성이 크게 완화되고 공격 성공률이 71% 감소합니다. 우리의 연구는 기반 훈련 탈옥과 관련된 위험을 완화하고 LLM의 안전한 활용을 강화하는 중요한 단계입니다.
Liu et al. (Fri,)는 이 질문을 연구했습니다.