최신논문

자기개선을 위한 LLM 교육

작성자
작성일
2024-07-26 12:22
조회
809


https://arxiv.org/abs/2407.18219

재귀적 내성: 언어 모델 에이전트에게 자기 개선 방법 가르치기

기초 모델에서 지능형 에이전트 행동을 가능하게 하는 핵심 요소는 더 많은 계산이나 상호 작용이 가능해짐에 따라 행동을 성찰하고 추론하며 실수를 수정할 수 있도록 하는 것입니다. 가장 강력한 독점적 대규모 언어 모델(LLM)조차도 실수를 하고 있다는 것을 명시적으로 알려주는 시나리오에서도 순차적으로 응답을 지속적으로 개선하는 능력을 보여주지 못합니다. 이 논문에서 우리는 이 기능을 구현하기 위해 LLM을 미세 조정하는 접근 방식인 RISE: Recursive IntroSpEction을 개발합니다. 이 접근 방식은 이전에 이 기능을 달성하는 것이 불가능할 수 있다는 가설을 세웠음에도 불구하고 이 기능을 도입하기 위해 LLM을 미세 조정하는 접근 방식입니다. 우리의 접근 방식은 반복적인 미세 조정 절차를 규정하는데, 이는 모델이 어려운 테스트 시간 문제를 해결하기 위해 이전에 실패한 시도를 실행한 후 응답을 변경하는 방법을 가르치려는 시도이며, 선택적으로 추가 환경 피드백이 있습니다. RISE는 단일 턴 프롬프트에 대한 미세 조정을 초기 상태가 프롬프트인 다중 턴 마르코프 결정 프로세스(MDP)를 해결하는 것으로 제시합니다. 온라인 모방 학습과 강화 학습의 원리에서 영감을 얻어, LLM이 후속 반복에서 이전 실수를 재귀적으로 감지하고 수정할 수 있는 기능을 부여하기 위해 다중 턴 데이터 수집 및 학습 전략을 제안합니다. 실험 결과, RISE를 사용하면 Llama2, Llama3 및 Mistral 모델이 수학 추론 과제에서 턴을 더 많이 늘려 스스로를 개선할 수 있으며, 동일한 양의 추론 시간 계산이 주어진 경우 여러 단일 턴 전략보다 성능이 뛰어납니다. 또한 RISE가 확장성이 뛰어나며, 더 유능한 모델로 더 큰 이점을 얻는 경우가 많습니다. 분석 결과, RISE는 더 복잡한 분포를 표현하여 단일 턴 능력을 방해하지 않으면서도 어려운 프롬프트에 대한 올바른 솔루션에 도달하기 위한 응답을 의미 있게 개선합니다.
전체 0