최신논문

LLM 자기개선의 ‘승자의 저주’… 16문항 평가 점수는 실제 성능보다 13~20%p 높았다

작성자
작성일
2026-10-09 08:40
조회
4

10월 7일 제출된 연구는 언어모델이 자신의 지시문을 수정하고, 작은 평가셋에서 점수가 오른 후보를 채택하는 과정의 측정 편향을 분석했다. 핵심은 실제 개선과 선택 과정에서 생긴 행운을 분리하는 것이다.

실험 방법

Qwen 모델이 매 세대 지시문 후보 4개를 만들도록 하고 TREC·Banking77·GSM8K에서 평가했다. 선택용 문항은 반복 사용했으며, 별도 600문항으로 성능을 측정했다. 확인 실험은 조건별 8개 시드를 사용했고, 후속 분석에는 Qwen3.5와 GEPA·MIPROv2도 포함했다.

무엇이 드러났나

16문항을 재사용한 루프의 최종 선택 점수는 별도 평가 정확도보다 13~20%p 높았다. 256문항에서는 격차가 1~5%p로 줄었다. 평가셋 확대가 실제 개선도 높인 것은 TREC였으며 GSM8K에서는 확인되지 않았다. 베이즈 채택 기준이나 선택 후 재확인도 전체 실행에서 단순 탐욕적 채택을 능가하지 못했다.

왜 중요한가

선택에 쓰지 않은 64문항으로 시작·최종 지시문을 평가하면 평균 편향은 제거됐지만 추정 오차는 약 6%p 남았다. 따라서 별도 평가와 불확실성 보고가 필요하다. 연구 범위는 지시문 최적화이며 코드·에이전트 과제나 재귀적 자기개선의 가능성을 직접 검증한 것은 아니다. GEPA의 기존 논문 성과 자체가 틀렸다는 주장도 아니다.

원문: The Winner’s Curse in LLM Self-Improvement Loops

전체 0