최신논문
전문가의 혼합으로 심층 RL을 위한 매개변수 스케일링 잠금 해제
작성자
작성일
2024-07-04 00:46
조회
373
https://arxiv.org/abs/2402.08609
(자기) 지도 학습 모델에서 최근 빠르게 진전된 것은 대부분 경험적 스케일링 법칙에 의해 예측됩니다. 모델의 성능은 크기에 비례하여 스케일링됩니다. 그러나 강화 학습 도메인에서는 유사한 스케일링 법칙이 여전히 애매한데, 모델의 매개변수 수를 늘리면 종종 최종 성능이 저하되기 때문입니다. 이 논문에서는 Mixture-of-Expert(MoE) 모듈, 특히 Soft MoE(Puigcerver et al., 2023)를 가치 기반 네트워크에 통합하면 다양한 학습 체제와 모델 크기에서 상당한 성능 증가로 입증된 매개변수 확장성이 더 높은 모델이 생성됨을 보여줍니다. 따라서 이 연구는 강화 학습을 위한 스케일링 법칙을 개발하는 데 강력한 경험적 증거를 제공합니다.
(자기) 지도 학습 모델에서 최근 빠르게 진전된 것은 대부분 경험적 스케일링 법칙에 의해 예측됩니다. 모델의 성능은 크기에 비례하여 스케일링됩니다. 그러나 강화 학습 도메인에서는 유사한 스케일링 법칙이 여전히 애매한데, 모델의 매개변수 수를 늘리면 종종 최종 성능이 저하되기 때문입니다. 이 논문에서는 Mixture-of-Expert(MoE) 모듈, 특히 Soft MoE(Puigcerver et al., 2023)를 가치 기반 네트워크에 통합하면 다양한 학습 체제와 모델 크기에서 상당한 성능 증가로 입증된 매개변수 확장성이 더 높은 모델이 생성됨을 보여줍니다. 따라서 이 연구는 강화 학습을 위한 스케일링 법칙을 개발하는 데 강력한 경험적 증거를 제공합니다.
전체 0