Key points are not available for this paper at this time.
대형 언어 모델(LLM)은 인터넷에서 방대한 데이터를 활용하여 광범위한 기존 지식을 저장합니다. LLM은 의사결정 보조 도구로서 유용성을 입증했지만, 추론의 한계, 환각 현상 등으로 인해 신뢰성이 저하됩니다. 반면에 몬테카를로 트리 탐색(MCTS)은 재귀적 롤아웃 및 자가 플레이를 통해 안정적인 의사결정 솔루션을 제공하는 휴리스틱 검색 알고리즘입니다. 하지만, MCTS의 효과는 특히 복잡한 의사결정 시나리오에서 휴리스틱 가지치기 및 외부 가치 함수에 크게 의존합니다. 본 연구는 MCTS 자가 플레이와 결합하여 대형 언어 모델을 강화하여 체스 및 바둑과 같은 결정론적 턴 기반 제로섬 게임(DTZG)을 추가 교육 없이 효율적으로 해결하는 혁신적인 접근 방식을 소개합니다. 구체적으로, 우리는 대형 언어 모델을 액션 가지치기와 가치 함수의 대리로 활용합니다. 우리는 제안한 방법에서 추정된 가치의 비최적성이 O (| A|N + ₚruner + critic)으로 크기가 변화함을 이론적으로 증명합니다. 여기서 \ (N\)은 시뮬레이션 횟수, | A|는 LLM에 의해 가지치기된 액션 공간의 기수이며, ₚruner와 critic은 각각 액션 공간 가지치기와 가치 함수 대리로 LLM을 채택함으로써 발생하는 오류를 정량화합니다. 체스와 바둑에서의 실험 결과는 우리의 방법이 MCTS의 범위를 넘어서는 도전과제를 해결하고 LLM의 직접적인 적용 성능을 향상시킬 수 있는 능력을 입증합니다.
Guo et al. (Fri,)은 이 질문을 연구했습니다.