최신논문

Monte Carlo Tree를 통한 GPT-4 레벨 수학 올림피아드 솔루션 액세스 LLaMa-3 8B를 사용한 자체 정제

작성일
2024-07-04 12:08
조회
488
https://arxiv.org/abs/2406.07394

이 논문에서는 복잡한 수학적 추론 과제에서 성능을 향상시키도록 설계된 대규모 언어 모델(LLM)과 몬테카를로 트리 탐색(MCTS)의 혁신적 통합인 MCT 자체 정제(MCTSr) 알고리즘을 소개합니다. 특히 전략적 및 수학적 추론에서 LLM의 정확성과 신뢰성 문제를 해결하는 MCTSr은 체계적인 탐색 및 휴리스틱 자체 정제 메커니즘을 활용하여 LLM 내의 의사 결정 프레임워크를 개선합니다. 이 알고리즘은 선택, 자체 정제, 자체 평가 및 역전파의 반복적 프로세스를 통해 몬테카를로 탐색 트리를 구성하고 개선된 상위 신뢰 한계(UCB) 공식을 활용하여 탐색-활용 균형을 최적화합니다. 광범위한 실험을 통해 MCTSr이 올림피아드 수준의 수학 문제를 해결하는 데 효과적이며 GSM8K, GSM Hard, MATH 및 올림피아드 수준의 벤치마크(Math Odyssey, AIME, OlympiadBench 포함)를 포함한 여러 데이터 세트에서 성공률을 크게 향상시킵니다. 이 연구는 복잡한 추론 과제에서 LLM의 적용을 발전시키고 향후 AI 통합을 위한 기반을 마련하며, LLM 기반 애플리케이션에서 의사 결정의 정확성과 신뢰성을 향상시킵니다.
전체 0