최신논문

Iclr 2025 워크숍 인간의 감독 없이 자체 개선되는 파운데이션 모델

작성자
작성일
2025-01-30 09:07
조회
340
https://openreview.net/forum?id=rFYeBznwop



파운데이션 모델(FM)이 확장됨에 따라, 고품질 인터넷 데이터의 성장 속도가 학습 요구를 따라가지 못하는 데이터 병목 현상이 발생합니다. 이는 이미 텍스트 데이터에서 가장 두드러지게 나타나며, 구체화된 지능과 같은 영역에서 지속적인 문제였고, 곧 다른 모달리티에도 영향을 미칠 것으로 예상됩니다. 모델이 동일하거나 다른 모델에서 생성된 합성 데이터를 생성하고 학습하는 자기 개선(self-improvement) 패러다임은 유망한 해결책을 제공합니다. 이 패러다임은 정제된 인간 데이터를 의존하는 지도 학습과 외부 보상에 의존하는 강화 학습(RL)과는 다릅니다. 자기 개선 프레임워크는 종종 불완전한 학습된 검증기를 사용하여 모델이 스스로 학습 데이터를 선별해야 하며, 고유한 도전 과제가 존재합니다. 이 워크숍에서는 합성 데이터, 다중 에이전트 및 다중 모달 시스템, 약한 일반화에서 강한 일반화로, 추론 시 자기 감독, 이론적 한계와 같은 주제를 포함하여 자기 개선을 위한 알고리즘을 탐구할 것입니다.
전체 0