최신논문

s1: 간단한 테스트 시간 스케일링

작성자
작성일
2025-02-03 19:23
조회
344
https://arxiv.org/abs/2501.19393

https://github.com/simplescaling/s1

테스트 시간 스케일링은 성능을 개선하기 위해 추가 테스트 시간 컴퓨팅을 사용하는 언어 모델링에 대한 유망한 새로운 접근 방식입니다. 최근 OpenAI의 o1 모델은 이 기능을 보여주었지만 방법론을 공개적으로 공유하지 않아 많은 복제 작업이 필요했습니다. 우리는 테스트 시간 스케일링과 강력한 추론 성능을 달성하기 위한 가장 간단한 접근 방식을 모색합니다. 첫째, 우리는 세 가지 기준(어려움, 다양성, 품질)을 절제를 통해 검증하는 추론 추적과 함께 1,000개의 질문으로 구성된 소규모 데이터 세트 s1K를 큐레이션합니다. 둘째, 모델의 사고 과정을 강제로 종료하거나 종료하려고 할 때 모델 생성에 "대기"를 여러 번 추가하여 길게 함으로써 테스트 시간 컴퓨팅을 제어하기 위한 예산 강제를 개발합니다. 이를 통해 모델은 답변을 두 번 확인하여 종종 잘못된 추론 단계를 수정할 수 있습니다. s1K에서 Qwen2.5-32B-Instruct 언어 모델을 감독 미세 조정하고 예산 강제를 장착한 후, 우리 모델 s1은 경쟁 수학 문제에서 o1-preview를 최대 27%까지 능가합니다(MATH 및 AIME24). 또한 예산 강제로 s1을 확장하면 테스트 시간 개입 없이 성능을 넘어서 외삽할 수 있습니다. AIME24에서 50%에서 57%까지. 우리 모델, 데이터 및 코드는 이 https URL 에서 오픈 소스입니다 .
전체 0