최신논문

자기 보상 언어모델

작성일
2024-07-04 00:34
조회
410
https://arxiv.org/abs/2401.10020

우리는 초인적 에이전트를 달성하기 위해 미래의 모델이 적절한 훈련 신호를 제공하기 위해 초인적 피드백이 필요하다고 가정합니다. 현재의 접근 방식은 일반적으로 인간의 선호도에서 보상 모델을 훈련하는데, 이는 인간의 성과 수준에 의해 병목 현상이 발생할 수 있으며, 둘째로 이러한 별도의 동결된 보상 모델은 LLM 훈련 중에 개선하는 법을 배울 수 없습니다. 이 연구에서 우리는 LLM-as-a-Judge 프롬프트를 통해 언어 모델 자체가 훈련 중에 자체 보상을 제공하는 자기 보상 언어 모델을 연구합니다. 우리는 반복적 DPO 훈련 중에 지시를 따르는 능력이 향상될 뿐만 아니라 자체적으로 고품질 보상을 제공하는 능력도 향상됨을 보여줍니다. 접근 방식의 세 가지 반복에서 Llama 2 70B를 미세 조정하면 Claude 2, Gemini Pro, GPT-4 0613을 포함하여 AlpacaEval 2.0 리더보드에서 많은 기존 시스템보다 성능이 뛰어난 모델이 생성됩니다. 아직 탐구해야 할 것이 많지만 이 연구는 두 축 모두에서 지속적으로 개선될 수 있는 모델의 가능성을 열어줍니다.
전체 0