최신논문

기초 자동 평가자: 더 나은 자동 평가를 위한 대규모 언어 모델 길들이기

작성일
2024-07-17 22:05
조회
523


우리는 광범위한 인간 평가를 통해 FLAMe (Foundational Large Autorater Model)를 교육하여 최고의 RewardBench 성능을 달성했습니다. 허용된 데이터로만 훈련된 생성 모델 중에서 GPT-4 및 4o를 모두 능가합니다.

https://arxiv.org/abs/2407.10817

대규모 언어 모델(LLM)이 발전함에 따라 인간 평가의 높은 비용으로 인해 출력을 신뢰할 수 있게 평가하기가 더 어려워집니다. 더 나은 LLM 자동 평가자를 향한 진전을 이루기 위해, 우리는 Foundational Large Autorater Models의 제품군인 FLAMe를 소개합니다. FLAMe은 이전 연구에서 공개적으로 발표된 인간 평가를 사용하여 큐레이팅 및 표준화된 500만 개 이상의 인간 판단으로 구성된 100개 이상의 광범위하고 다양한 고품질 평가 과제 컬렉션에서 학습합니다. FLAMe은 다양한 보류 과제에 대한 일반화를 크게 개선하여 많은 과제에서 GPT-4 및 Claude-3와 같은 독점 데이터에서 학습된 LLM보다 우수한 성과를 보입니다. 우리는 FLAMe이 보상 모델링 평가를 사례 연구(FLAMe-RM)로 사용하여 추가적인 다운스트림 미세 조정을 위한 강력한 시작점 역할을 할 수 있음을 보여줍니다. 특히 RewardBench에서 FLAMe-RM-24B 모델(정확도 87.8%)은 허용 라이선스 데이터에서만 학습된 최고 성능의 생성 모델로, GPT-4-0125(85.9%)와 GPT-4o(84.7%)보다 성능이 뛰어납니다. 또한 보상 모델링 평가를 위한 FLAMe 멀티태스크 혼합을 최적화하기 위해 새로운 테일 패치 미세 조정 전략을 사용하여 계산 효율성이 더 높은 접근 방식을 탐색합니다(FLAMe-Opt-RM). 이는 약 25배 적은 학습 데이터 포인트가 필요하면서도 경쟁력 있는 RewardBench 성능을 제공합니다. 전반적으로 FLAMe 변형은 RewardBench 및 LLM-AggreFact를 포함하여 12개의 자동 평가자 평가 벤치마크 중 8개에서 고려하는 모든 인기 있는 독점적 LLM-as-a-Judge 모델보다 성능이 뛰어납니다. 마지막으로, 우리의 분석에 따르면 FLAMe은 CoBBLEr 자동 평가자 편향 벤치마크에서 LLM-as-a-Judge 모델보다 편향이 훨씬 적으며, 코드 생성을 위한 고품질 응답을 효과적으로 식별합니다.
전체 0