최신논문
문제를 만드는 절차까지 개선하는 AI: 하네스 재귀 개선의 성과와 한계
논문 제출: 2026년 10월 2일 · arXiv 발표 목록: 10월 5일
1. 무엇을 자기개선했나
연구진은 모델 가중치와 검증 기준을 고정하고, 문제 생성에 쓰는 스킬·프롬프트·작업 흐름을 개선했다. 생성 도중 발견한 풀이 실패를 재사용 가능한 스킬로 바꾸고, 배치가 끝나면 전체 절차를 수정한다. 난도·유효성·비용 조건을 통과한 수정만 채택한다.
2. 정답률 하락이 의미하는 것
수학·코딩·과학 시드 150개를 14회 진화시키자, 고정된 DeepSeek-V4-Pro 풀이기의 정답률은 100%에서 54.8%로 낮아졌다. 생성된 문제가 어려워졌다는 지표다. 별도 절제실험에서는 두 개선 방식을 결합했을 때 50.0%, 고정 하네스에서는 73.5%였다.
진화한 하네스를 고정한 뒤 별도 수학 시드 50개에 적용해도 정답률은 52.0%로, 초기 하네스의 70.0%보다 낮았다. 다만 같은 풀이기를 사용한 수학 영역 내 전이 실험이다.
3. 생성 데이터의 학습 효과
4B 모델의 GRPO 평가 평균은 58.4%에서 62.7%, 35B 모델의 SFT 평균은 51.1%에서 55.7%로 상승했다. Qwen3.8-27B는 수학 예제 1만 개로 APEX mean-16 정확도가 56.3%에서 62.5%로 올랐다. 비교 모델의 훈련·추론 비용까지 동일하다는 뜻은 아니다.
4. APEX 수치는 어떻게 읽어야 하나
지표의 배경은 MathArena 개발진의 2025년 8월 설명에서 확인할 수 있다. APEX는 기존 모델이 풀기 어려운 최종정답형 수학 문제를 선별한 평가다. 평균 성공률은 문제와 반복 시도 전체를 평균하며, 여러 번 시도해 한 번이라도 맞힌 문제 비율과 구분된다. 따라서 mean-16을 16회 중 최고 답안을 고른 점수처럼 읽으면 안 된다.
개발진은 문제 선정에 사용한 모델에 따라 순위 해석이 달라질 수 있고, 공개 문제를 향후 학습이 직접 겨냥할 경우 데이터 오염 위험이 생긴다고 경고했다. 이 기존 방법론 설명은 이번 연구의 오염을 입증하는 자료가 아니다. 평가셋의 범위와 학습자료 분리 절차를 함께 확인해야 하는 이유를 보여준다.
5. 아직 분리되지 않은 효과와 비용
고정·개선 하네스의 데이터를 같은 토큰량으로 학습한 비교, 전체 진화 비용, 독립 반복실험의 불확실성은 보고되지 않았다. 일부 연산 비용 감소도 전체 비용 절감을 입증하지 않는다. 결과는 합성데이터 생산 절차의 개선 가능성을 보여주지만, 무제한 자기개선이나 AGI 도달을 입증하지 않는다.