Key points are not available for this paper at this time.
대규모 언어 모델(LLM)의 광범위한 사용 사례 중 하나는 목표 지향적인 의사 결정 작업(또는 '에이전트' 작업)입니다. 여기서 LLM은 주어진 입력에 대한 완성만 생성할 뿐만 아니라, 작업을 수행하기 위해 다중 턴 상호작용에서 지능적인 결정을 내려야 합니다(예: 웹 상호작용, 도구 사용 또는 고객 지원 제공 시). 강화 학습(RL)은 이러한 에이전트 작업을 처리하기 위한 일반적인 패러다임을 제공하지만, 현재 LLM을 위한 RL 방법은 대부분 단일 턴 보상을 최적화하는 데 중점을 두고 있습니다. 설계상, 대부분의 단일 턴 RL 방법은 LLM에게 다수의 턴을 거쳐 정보를 지능적으로 탐색하거나, 크레딧 할당을 수행하거나, 과거 행동에 대해 추리하는 능력을 부여할 수 없습니다. 이는 에이전트 작업에서 모두 중요합니다. 이 문제는 이렇게 제기됩니다: LLM을 위한 효과적이고 효율적인 다중 턴 RL 알고리즘을 어떻게 설계할 수 있을까요? 본 논문에서는 LLM을 미세 조정하기 위한 다중 턴 RL 알고리즘 구축 프레임워크를 개발하여, 단일 턴 RL 방법(예: 근접 정책 최적화)의 유연성을 유지하면서 다중 턴, 긴 지연 시간 및 지연 보상을 효과적으로 처리할 수 있도록 합니다. 이를 위해 우리의 프레임워크는 계층적 RL 접근 방식을 채택하고 두 개의 RL 알고리즘을 병렬로 실행합니다: 발화에 대한 보상을 집계하기 위한 고수준 오프 정책 가치 기반 RL 알고리즘과, 각 발화 또는 턴 내에서 토큰 정책을 훈련하기 위해 이 고수준 가치 함수를 활용하는 저수준 RL 알고리즘입니다. 우리의 계층적 프레임워크인 계층 구조를 갖춘 액터-비평자 프레임워크(ArCHer)는 다른 RL 방법을 생성할 수 있습니다. 경험적으로, 우리는 ArCHer가 에이전트 작업에서 효율성과 성능을 크게 향상시켜 기존 방법에 비해 약 100배의 샘플 효율성을 달성하며, 더 큰 모델 용량(테스트한 최대 70억 범위에서)에서도 개선됨을 발견했습니다.
Zhou et al. (Thu,)은 이 질문을 연구했습니다.