최신논문

openai 대규모 추론 모델을 사용한 경쟁 프로그래밍

작성자
작성일
2025-02-12 19:01
조회
306
https://arxiv.org/abs/2502.06807

우리는 대규모 언어 모델(LLM)에 적용된 강화 학습이 복잡한 코딩 및 추론 작업에서 성능을 크게 향상시킨다는 것을 보여줍니다. 또한, 우리는 두 가지 범용 추론 모델인 OpenAI o1과 o3의 초기 체크포인트를 2024년 국제 정보 올림피아드(IOI)에서 경쟁하도록 설계된 수작업 추론 전략을 사용하는 도메인별 시스템인 o1-ioi와 비교합니다. 우리는 o1-ioi로 IOI 2024에서 라이브로 경쟁했고, 수작업 테스트 시간 전략을 사용하여 49번째 백분위에 올랐습니다. 완화된 경쟁 제약 하에서 o1-ioi는 금메달을 획득했습니다. 그러나 o3와 같은 후속 모델을 평가할 때, 우리는 o3가 수작업 도메인별 전략이나 완화된 제약 없이 금메달을 획득한다는 것을 발견했습니다. 우리의 연구 결과에 따르면 o1-ioi와 같은 특수 파이프라인은 견고한 개선을 가져오지만, 확장된 범용 o3 모델은 수작업 추론 휴리스틱에 의존하지 않고도 이러한 결과를 능가합니다. 특히, o3는 2024 IOI에서 금메달을 획득하고 엘리트 인간 경쟁자와 동등한 Codeforces 등급을 획득했습니다. 전반적으로 이러한 결과는 도메인별 기술에 의존하기보다는 범용 강화 학습을 확장하는 것이 경쟁 프로그래밍과 같은 추론 도메인에서 최첨단 AI로 가는 강력한 경로를 제공한다는 것을 나타냅니다.

 

전체 0