최신논문
기계가 스스로 최첨단 강화학습 알고리즘 발견
https://www.nature.com/articles/d41586-025-03398-6
https://www.nature.com/articles/s41586-025-09761-x인간과 다른 동물들은 진화 과정에서 수많은 세대에 걸친 시행착오를 통해 발견된 강력한 강화학습(Reinforcement Learning, RL) 메커니즘을 사용한다.
반면, 인공 지능 에이전트들은 일반적으로 사람이 설계한 학습 규칙(hand-crafted learning rules)을 사용해 학습한다. 수십 년 동안 연구가 진행되어 왔지만, 스스로 강력한 RL 알고리즘을 발견하는 목표는 여전히 어려운 과제로 남아 있었다.
이번 연구에서는 기계가 스스로 최첨단 강화학습 규칙(state-of-the-art RL rule) 을 발견할 수 있음을 보여준다. 이 규칙은 사람이 설계한 기존 규칙들을 능가하는 성능을 보였다.
이를 위해 연구진은 다양한 복잡한 환경들에서 여러 에이전트 집단(population of agents)의 누적 경험(cumulative experiences)을 기반으로 메타 학습(meta-learning) 을 수행했다.
구체적으로, 이 방법은 에이전트의 정책(policy)과 예측(predictions)이 어떻게 갱신되어야 하는지를 결정하는 학습 규칙 자체를 발견한다.
대규모 실험 결과, 이렇게 발견된 규칙은 Atari 벤치마크에서 기존 모든 규칙을 능가했으며, 학습 과정에서 한 번도 본 적 없는 어려운 환경들에서도 여러 최신 강화학습 알고리즘들을 앞섰다.
이 결과는 고도 인공지능(advanced AI) 에 필요한 강화학습 알고리즘이 앞으로는 사람이 직접 설계하지 않아도, 에이전트들의 경험으로부터 자동으로 발견될 수 있음을 시사한다.