Key points are not available for this paper at this time.
대규모 언어 모델(LLMs)을 인간의 의도와 가치에 어떻게 맞출 수 있을까? 일반적인 해결책은 모델 출력에 대한 인간의 선호를 수집하고 LLM을 이에 맞게 미세 조정하는 것이며, 업데이트가 참조 모델에서 너무 멀어지지 않도록 하는 것입니다. 최근 접근 방식, 즉 직접 선호 최적화(DPO)는 밀접하게 형성된 감독 손실을 도입하여 불안정하고 느린 강화 학습 최적화의 필요성을 제거했습니다. 그러나 현재 접근 방식의 중대한 제한은 단일 참조 모델만을 위해 설계되었으며 수많은 pretrained LLM의 집단적 힘을 활용하지 않는다는 것입니다. 이 한계를 극복하기 위해 우리는 다중 참조 모델을 사용한 직접 선호 최적화를 위한 새로운 폐쇄 형식 공식을 소개합니다. 결과로 나온 알고리즘인 다중 참조 선호 최적화(MRPO)는 다양한 참조 모델로부터 더 넓은 사전 지식을 활용하여 단일 참조 DPO에 비해 선호 학습 능력을 상당히 향상시킵니다. 우리의 실험은 MRPO로 미세 조정된 LLM이 데이터 희소성이나 풍부함과 관계없이 다양한 선호 데이터에서 더 잘 일반화됨을 보여줍니다. 게다가 MRPO는 여러 하위 자연어 처리 작업에서 뛰어난 성능을 발휘하도록 LLM을 효과적으로 미세 조정합니다. 예를 들어, GSM8K 및 TruthfulQA와 같은 작업이 있습니다.
Le et al. (Sat,)가 이 질문을 연구했습니다.