최신논문
강화학습을 통한 자체 수정을 위한 언어 모델 훈련
작성자
작성일
2024-09-20 19:10
조회
558
https://arxiv.org/abs/2409.12917
자기 교정은 대규모 언어 모델(LLM)의 매우 바람직한 기능이지만, 현대 LLM에서는 대체로 효과가 없는 것으로 꾸준히 밝혀졌습니다. 자기 교정을 훈련하기 위한 기존 접근 방식은 여러 모델을 필요로 하거나 더 유능한 모델이나 다른 형태의 감독에 의존합니다. 이를 위해, 우리는 완전히 자체 생성된 데이터를 사용하여 LLM의 자기 교정 능력을 크게 향상시키는 다중 턴 온라인 강화 학습(RL) 접근 방식인 SCoRe를 개발합니다. SCoRe를 구축하기 위해, 우리는 먼저 오프라인 모델에서 생성된 교정 추적에 대한 감독 미세 조정(SFT) 변형이 자기 교정 행동을 주입하기에 불충분하다는 것을 보여줍니다. 특히, 우리는 SFT를 통한 훈련이 훈련 데이터와 모델 자체의 응답 사이에 분포 불일치가 발생하거나 테스트 시간에 종종 효과적이지 않은 특정 교정 행동 모드만을 암묵적으로 선호한다는 것을 관찰합니다. SCoRe는 모델 자체의 자체 생성 수정 추적 분포에서 학습하고 적절한 정규화를 사용하여 학습 프로세스를 조정하여 테스트 시간에 효과적인 자체 수정 전략을 학습하는 방식으로 이러한 과제를 해결합니다. 이는 주어진 프롬프트에 대한 높은 보상 응답을 단순히 맞추는 것과는 대조적입니다. 이 정규화는 기본 모델에서 RL의 첫 번째 단계를 실행하여 붕괴 가능성이 적은 정책 초기화를 생성한 다음 보상 보너스를 사용하여 학습 중에 자체 수정을 증폭하도록 규정합니다. Gemini 1.0 Pro 및 1.5 Flash 모델에 적용했을 때 SCoRe는 최첨단 자체 수정 성능을 달성하여 MATH 및 HumanEval 벤치마크에서 각각 기본 모델의 자체 수정을 15.6% 및 9.1% 향상시킵니다.
자기 교정은 대규모 언어 모델(LLM)의 매우 바람직한 기능이지만, 현대 LLM에서는 대체로 효과가 없는 것으로 꾸준히 밝혀졌습니다. 자기 교정을 훈련하기 위한 기존 접근 방식은 여러 모델을 필요로 하거나 더 유능한 모델이나 다른 형태의 감독에 의존합니다. 이를 위해, 우리는 완전히 자체 생성된 데이터를 사용하여 LLM의 자기 교정 능력을 크게 향상시키는 다중 턴 온라인 강화 학습(RL) 접근 방식인 SCoRe를 개발합니다. SCoRe를 구축하기 위해, 우리는 먼저 오프라인 모델에서 생성된 교정 추적에 대한 감독 미세 조정(SFT) 변형이 자기 교정 행동을 주입하기에 불충분하다는 것을 보여줍니다. 특히, 우리는 SFT를 통한 훈련이 훈련 데이터와 모델 자체의 응답 사이에 분포 불일치가 발생하거나 테스트 시간에 종종 효과적이지 않은 특정 교정 행동 모드만을 암묵적으로 선호한다는 것을 관찰합니다. SCoRe는 모델 자체의 자체 생성 수정 추적 분포에서 학습하고 적절한 정규화를 사용하여 학습 프로세스를 조정하여 테스트 시간에 효과적인 자체 수정 전략을 학습하는 방식으로 이러한 과제를 해결합니다. 이는 주어진 프롬프트에 대한 높은 보상 응답을 단순히 맞추는 것과는 대조적입니다. 이 정규화는 기본 모델에서 RL의 첫 번째 단계를 실행하여 붕괴 가능성이 적은 정책 초기화를 생성한 다음 보상 보너스를 사용하여 학습 중에 자체 수정을 증폭하도록 규정합니다. Gemini 1.0 Pro 및 1.5 Flash 모델에 적용했을 때 SCoRe는 최첨단 자체 수정 성능을 달성하여 MATH 및 HumanEval 벤치마크에서 각각 기본 모델의 자체 수정을 15.6% 및 9.1% 향상시킵니다.
전체 0