최신논문

강화 사전 훈련

작성자
작성일
2025-06-11 19:57
조회
680
https://arxiv.org/abs/2506.08007

이 작업에서는 대규모 언어 모델 및 강화 학습(RL)을 위한 새로운 확장 패러다임으로 RPT(Reinforcement Pre-Training)를 소개합니다. 구체적으로 말하자면, 다음 토큰 예측을 RL을 사용하여 훈련된 추론 작업으로 재구성하며, 여기서 주어진 컨텍스트에 대한 다음 토큰을 올바르게 예측한 것에 대해 검증 가능한 보상을 받습니다. RPT는 도메인별 주석이 달린 답변에 의존하는 대신 범용 RL을 위해 방대한 양의 텍스트 데이터를 활용할 수 있는 확장 가능한 방법을 제공합니다. RPT는 넥스트 토큰 추론 능력을 장려함으로써 넥스트 토큰 예측의 언어 모델링 정확도를 크게 향상시킵니다. 또한 RPT는 추가 보강 미세 조정을 위한 강력한 사전 훈련된 기반을 제공합니다. 스케일링 곡선은 학습 컴퓨팅이 증가하면 다음 토큰 예측 정확도가 지속적으로 향상된다는 것을 보여줍니다. 그 결과 RPT는 언어 모델 사전 학습을 발전시키기 위한 효과적이고 유망한 확장 패러다임으로 자리매김했습니다.

 

전체 2

  • 2025-06-11 20:50

    5에서 큰거 보여주겠지?ㅠㅠ 더이상은..


    • 2025-06-11 21:28

      겨울이셈 ㅜㅜ