최신논문
VeriFine: 자기개선의 병목인 평가자도 고치자…주행 추론 점수 18.2% 개선
논문 최초 제출: 2026년 10월 6일 17:50 UTC.
NVIDIA 등이 참여한 VeriFine은 정책 모델, 학습자료 선택, 평가자를 함께 개선하는 프레임워크다. arXiv 최초 제출은 10월 6일이다. 정책의 반복 실패로 학습자료를 고르고, 개선이 막히면 사람의 도움으로 평가 기준을 보정한다.
1. 성과와 비교 조건
주행 실험의 고정 평가자 점수는 세 차례 개선 뒤 60.56에서 71.61로 높아졌다. 상대 개선율은 18.2%이며 18.2%포인트가 아니다. 로봇 내비게이션 점수는 68.09에서 77.59로 개선됐다. 점수는 추론 품질 지표로, 실제 도로 주행 성공률과 동일하지 않다.
주행 정책은 Alpamayo 1.5 8B, 교사 평가자는 Claude Opus 5다. 후보 40만 개에서 학습자료 2만5천 개를 선택하고, 2,700스텝·프롬프트당 16개 롤아웃·H100 노드 20개를 사용했다. 각 정책의 학습 예산을 맞췄지만 평가자 개발과 사람의 작업까지 합친 전체 비용이 동일하다는 비교는 아니다.
2. 완전한 RSI와 구분할 점
정책은 라운드마다 같은 기본 모델에서 다시 학습한다. 누적되는 것은 평가 기준과 커리큘럼의 개선이다. 사람의 보정과 사람이 검증한 참조 추론도 여전히 필요하다. 저자들은 고정 정책 평가셋, 참조 추론 의존성, 인간 개입을 한계로 적었다. 따라서 이 결과는 제한된 체화 추론 과제에서 검증 피드백을 개선한 증거이며, 인간 없는 범용 재귀적 자기개선의 실증으로 볼 수 없다. 논문: 3·4절 및 부록 A.4–A.5
공식 프로젝트의 모델 공개 상태는 확인 시점에 Coming soon이었다.