최신논문

ReST-MCTS*: 프로세스 보상 안내 트리검색을 통한 LLM 자체교육

작성일
2024-07-04 11:45
조회
534
https://arxiv.org/abs/2406.03816

최근의 LLM 자가 학습 방법론은 대부분 LLM이 응답을 생성하고 정답을 가진 응답을 학습 데이터로 필터링하는 방식에 의존합니다. 이 접근 방식은 종종 품질이 낮은 미세 조정 훈련 세트(예: 잘못된 계획 또는 중간 추론)를 생성합니다. 이 백서에서는 정책 및 보상 모델을 훈련하기 위한 단계별 값뿐만 아니라 고품질의 추론 추적을 수집하기 위해 프로세스 보상 지침을 트리 검색 MCTS*와 통합하는 강화된 자가 훈련 접근 방식인 ReST-MCTS*를 개발합니다. ReST-MCTS*는 트리 검색 기반 강화 학습으로 프로세스 보상을 훈련하는 데 일반적으로 사용되는 단계별 수동 주석을 피할 수 있습니다: 오라클 최종 정답이 주어지면 ReST-MCTS*는 이 단계가 정답으로 이어질 수 있는 확률을 추정하여 올바른 프로세스 보상을 추론할 수 있습니다. 이렇게 추론된 보상은 프로세스 보상 모델을 더욱 정교화하기 위한 가치 목표 역할을 하며, 정책 모델 자가 학습을 위한 고품질 트레이스를 쉽게 선택할 수 있도록 하는 두 가지 용도로 사용됩니다. 먼저, ReST-MCTS*의 트리 검색 정책이 동일한 검색 예산 내에서 Best-of-N 및 Tree-of-Thought와 같은 이전의 LLM 추론 기준선에 비해 더 높은 정확도를 달성한다는 것을 보여줍니다. 그런 다음 이 트리 검색 정책으로 검색된 트레이스를 학습 데이터로 사용하면 여러 번의 반복을 통해 세 가지 언어 모델을 지속적으로 향상시킬 수 있으며, ReSTEM 및 자기 보상형 LM과 같은 다른 자가 학습 알고리즘보다 성능이 뛰어나다는 것을 보여줍니다.

------

컴퓨터가 문제를 푸는 방법

컴퓨터가 문제를 푸는 방법은 여러 가지가 있어요. 우리가 많이 들어본 "인공지능(AI)"도 그 중 하나인데, 이 AI는 사람이 만든 데이터를 많이 공부해서 똑똑해지는 거예요.

사람이 만든 데이터가 부족해요

하지만 인터넷에 있는 좋은 데이터는 이미 많이 사용했기 때문에 이제는 컴퓨터 스스로 공부할 수 있는 방법이 필요해졌어요. 그래서 컴퓨터가 스스로 데이터를 만들고, 그 데이터를 이용해서 더 똑똑해지는 방법을 연구하고 있어요.

ReST-MCTS*란?

ReST-MCTS*는 컴퓨터가 스스로 더 잘 공부할 수 있게 도와주는 방법이에요.

문제를 해결하는 과정: 문제를 풀 때, 컴퓨터가 여러 단계로 나누어서 생각해요. 예를 들어, 수학 문제를 풀 때 하나씩 단계를 밟아가면서 문제를 해결하죠.

트리 구조: 컴퓨터는 여러 가지 방법을 시도해보면서 가장 좋은 방법을 찾기 위해 나무처럼 생긴 구조(트리 구조)를 사용해요. 마치 나무의 가지가 여러 갈래로 뻗어나가는 것처럼, 문제를 푸는 여러 방법을 시도해보는 거예요.

보상: 컴퓨터는 문제를 풀 때마다 '보상'이라는 점수를 받는데, 이 점수가 높을수록 더 좋은 방법이라는 뜻이에요. 그래서 컴퓨터는 높은 점수를 받을 수 있는 방법을 더 많이 시도하게 돼요.

왜 중요한가요?

이 방법을 사용하면, 컴퓨터가 사람처럼 생각하고 문제를 풀 수 있게 돼요. 이렇게 되면 더 많은 문제를 더 빠르고 정확하게 풀 수 있죠. 예를 들어, 수학 문제나 과학 문제를 더 잘 풀 수 있게 돼서 우리에게 더 큰 도움을 줄 수 있어요.

이제 ReST-MCTS*가 무엇인지 조금 더 이해할 수 있겠죠? 어렵게 들리지만, 결국 컴퓨터가 스스로 공부해서 더 똑똑해지는 방법이라는 걸 알면 돼요!
전체 0