최신논문

RL + 트랜스포머 = 범용 문제 해결사

작성자
작성일
2025-02-02 12:51
조회
325
https://arxiv.org/abs/2501.14176

인공지능이 훈련된 문제를 해결할 수 있을 뿐만 아니라 새로운 문제를 해결하기 위해 스스로 학습하는 방법(즉, 메타 학습)도 배울 수 있다면 어떨까요? 이 연구에서는 여러 에피소드에 걸쳐 강화 학습으로 미세 조정된 사전 훈련된 트랜스포머가 이전에 직면하지 않은 문제를 해결하는 능력, 즉 ICRL(In-Context Reinforcement Learning)이라는 창발적 능력을 개발한다는 것을 보여줍니다. 이 강력한 메타 학습자는 놀라운 샘플 효율성으로 보이지 않는 분포 내 환경을 해결하는 데 탁월할 뿐만 아니라 분포 외 환경에서도 강력한 성능을 보여줍니다. 또한 훈련 데이터의 품질에 대한 견고성을 보여주고, 컨텍스트의 동작을 매끄럽게 연결하며, 고정되지 않은 환경에 적응한다는 것을 보여줍니다. 이러한 동작은 RL 훈련된 변환기가 자체 솔루션을 반복적으로 개선할 수 있음을 보여주므로 훌륭한 범용 문제 해결사가 됩니다.
전체 0