최신논문

같은 AI가 실행·평가·학습을 반복한 MASS, 두 차례 자기개선 실험 공개

작성자
작성일
2026-10-11 08:48
조회
4

논문: https://arxiv.org/abs/2610.12176
전문: https://arxiv.org/html/2610.12176v1
연구진 설명: https://pub.sakana.ai/mass/

1. 무엇이 발표됐나

Sakana AI와 UC Berkeley 연구진이 2026년 10월 8일 제출한 MASS 논문은 동일한 모델이 문제 해결자, 평가자, 작업 절차 설계자를 맡는 재귀적 자기개선 방법을 제시한다. 개별 실험일은 명시되지 않았다.

2. 어떻게 개선하나

모델은 여러 복제 에이전트의 역할과 정보 전달 순서를 바꾸고 결과물을 비교한다. 선택한 실행 기록으로 공유 모델을 미세조정한 뒤, 개선된 모델이 세 역할을 다시 맡는다. 단순히 추론 프롬프트만 바꾸는 방식은 아니다.

3. 실험 구성

Qwen3.6-27B로 두 주기를 수행했다. 금융·로봇·약학 합성 연구 과제 중 8개가 학습 데이터를 제공했고, 3개는 학습에서 제외됐다. GPT-5.5와 Claude Opus 4.8의 외부 평가는 개선 루프에 전달하지 않았다.

4. 주요 결과

보류 과제에서 초기 모델 대비 외부 평가 승률은 첫 주기 53.9%, 둘째 주기 69.9%였다. 연구 벤치마크 4종의 출력 토큰당 점수는 1.2~1.6배였고, 자체 평가와 외부 평가의 일치율은 73%에서 93%로 높아졌다.

5. 해석의 한계

이는 두 주기의 제한된 실험이다. Terminal-Bench와 SWE-bench의 성능은 오히려 낮아졌으며, 외부 모델의 선호도는 객관적 진실과 동일하지 않다. 범용 초지능이나 끝없는 성능 가속이 입증된 것으로 해석할 수 없다. 프리프린트이며, AGI 도래 연도는 제시하지 않는다.

전체 0