최신논문

인간의 피드백을 통한 내쉬 학습

작성일
2024-07-03 23:34
조회
308
https://arxiv.org/abs/2312.00886

인간 피드백을 통한 강화 학습(RLHF)은 대규모 언어 모델(LLM)을 인간 선호도에 맞추기 위한 주요 패러다임으로 부상했습니다. 일반적으로 RLHF는 종종 사전 훈련된 LLM에서 생성된 텍스트 세대 쌍 간의 선호도로 표현되는 인간 피드백에서 보상 모델을 학습하는 초기 단계를 포함합니다. 그런 다음 강화 학습 알고리즘을 통해 보상 모델을 최대화하도록 LLM의 정책을 최적화하여 미세 조정합니다. 그러나 현재 보상 모델의 고유한 한계는 인간 선호도의 풍부함과 샘플링 분포에 대한 종속성을 완전히 표현할 수 없다는 것입니다.
이 연구에서는 쌍별 인간 피드백을 사용하여 LLM을 미세 조정하기 위한 대체 파이프라인을 소개합니다. 우리의 접근 방식은 프롬프트가 주어진 두 개의 입력에 따라 조건화된 선호도 모델의 초기 학습을 수반한 다음 경쟁 정책에서 생성된 응답보다 선호되는 응답을 지속적으로 생성하는 정책을 추구하여 이 선호도 모델의 내쉬 균형을 정의합니다. 이 접근 방식을 인간 피드백을 통한 내쉬 학습(NLHF)이라고 합니다.
표형 정책 표현의 맥락에서 우리는 거울 하강의 원리에 기반한 새로운 알고리즘 솔루션인 Nash-MD를 제시합니다. 이 알고리즘은 일련의 정책을 생성하며, 마지막 반복은 정규화된 Nash 균형으로 수렴합니다. 또한, 우리는 정책의 매개변수 표현을 탐구하고 딥 러닝 아키텍처를 위한 경사 하강 알고리즘을 소개합니다. 우리 접근 방식의 효과를 보여주기 위해, 텍스트 요약 작업을 위한 LLM의 미세 조정과 관련된 실험 결과를 제시합니다. 우리는 NLHF가 선호도 학습 및 정책 최적화를 위한 매력적인 길을 제공하며, LLM을 인간의 선호도에 맞추는 분야를 발전시킬 잠재력이 있다고 믿습니다.
전체 0