최신논문
상호 추론은 소규모 LLM을 더 강력한 문제 해결자로 만듭니다.
작성자
작성일
2024-08-14 09:11
조회
597
https://arxiv.org/abs/2408.06195
이 논문에서는 미세 조정이나 우수한 모델 없이 소규모 언어 모델(SLM)의 추론 기능을 크게 개선하는 셀프 플레이 상호 추론 방식인 rStar를 소개합니다. rStar는 추론을 셀프 플레이 상호 생성-판별 프로세스로 분리합니다. 먼저, 대상 SLM은 몬테카를로 트리 탐색(MCTS)을 풍부한 인간과 유사한 추론 동작 세트로 증강하여 더 높은 품질의 추론 궤적을 구성합니다. 다음으로, 대상 SLM과 유사한 기능을 가진 또 다른 SLM은 판별자 역할을 하여 대상 SLM에서 생성된 각 궤적을 검증합니다. 상호 합의된 추론 궤적은 상호 일관성이 있는 것으로 간주되므로 정확할 가능성이 더 높습니다. 5개의 SLM에 대한 광범위한 실험은 rStar가 GSM8K, GSM-Hard, MATH, SVAMP 및 StrategyQA를 포함한 다양한 추론 문제를 효과적으로 해결할 수 있음을 보여줍니다. 주목할 점은 rStar가 LLaMA2-7B의 경우 GSM8K 정확도를 12.51%에서 63.91%로, Mistral-7B의 경우 36.46%에서 81.88%로, LLaMA3-8B-Instruct의 경우 74.53%에서 91.13%로 높인다는 것입니다. 코드는 이 https URL 에서 제공됩니다 .
이 논문에서는 미세 조정이나 우수한 모델 없이 소규모 언어 모델(SLM)의 추론 기능을 크게 개선하는 셀프 플레이 상호 추론 방식인 rStar를 소개합니다. rStar는 추론을 셀프 플레이 상호 생성-판별 프로세스로 분리합니다. 먼저, 대상 SLM은 몬테카를로 트리 탐색(MCTS)을 풍부한 인간과 유사한 추론 동작 세트로 증강하여 더 높은 품질의 추론 궤적을 구성합니다. 다음으로, 대상 SLM과 유사한 기능을 가진 또 다른 SLM은 판별자 역할을 하여 대상 SLM에서 생성된 각 궤적을 검증합니다. 상호 합의된 추론 궤적은 상호 일관성이 있는 것으로 간주되므로 정확할 가능성이 더 높습니다. 5개의 SLM에 대한 광범위한 실험은 rStar가 GSM8K, GSM-Hard, MATH, SVAMP 및 StrategyQA를 포함한 다양한 추론 문제를 효과적으로 해결할 수 있음을 보여줍니다. 주목할 점은 rStar가 LLaMA2-7B의 경우 GSM8K 정확도를 12.51%에서 63.91%로, Mistral-7B의 경우 36.46%에서 81.88%로, LLaMA3-8B-Instruct의 경우 74.53%에서 91.13%로 높인다는 것입니다. 코드는 이 https URL 에서 제공됩니다 .
전체 0