최신논문
AI 연구 월드모델: 실험기록으로 다음 실험을 더 잘 고른다
원문: https://arxiv.org/abs/2610.12235
전문: https://arxiv.org/html/2610.12235v1
공개 기록: 2026년 10월 8일 16:18 UTC 제출된 v1 프리프린트다. Amazon·UC Santa Cruz 등 공동연구이며, 동료평가는 미확인이다.
1. 무엇을 자동화했나
연구진은 실험 아이디어 생성보다 실제 실행이 비싼 병목에 주목했다. RWM은 환경·코드 변경안·과거 결과를 읽고, 실행 전에 성과를 예측한다. 학습률이나 데이터 배합처럼 조건에 따라 효과가 달라지는 변경을 선별하는 방식이다.
2. 비교 방법
사전학습·후속학습·추론의 9개 환경, 실험기록 2,653개를 사용했다. 기록 없는 조건, 동일 환경 기록, 다른 환경 기록을 비교했고, 전이 평가에서는 정답과 유사한 변경안의 기록을 제외했다.
3. 구체적 결과
동일 환경의 미지 실험 순위 상관은 평균 0.506→0.774로 개선됐다. OLMo3-100M에서는 8라운드에 총 24개 실험을 선택했다. 최종 최고 개선폭은 기록 없는 조건보다 동일환경 기록에서 15.8%, 타환경 기록에서 11.6% 컸다. 모델 지능이 해당 비율만큼 높아졌다는 뜻은 아니다.
4. 중요한 반례와 비용
Marin에서는 전이 기록이 실험 선택을 개선하지 못했다. 다른 환경에서 유효했던 변경도 출발 조건에 따라 실패할 수 있다. 기록 구축에는 총 171,862 H100 GPU시간이 들었으므로, 예측 정확도만으로 연구 전체의 비용효율을 판단할 수 없다.
5. RSI와 타임라인
예측모델의 가중치는 고정됐고, 각 실험은 동일 기준모델에서 시작했다. 환경 간 전이 검증도 자기회귀 사전학습에 한정된다. 따라서 이 결과는 경험을 재활용하는 실험 선택의 근거이지, 연속적인 세대교체나 범용 RSI의 실증은 아니다. AGI 도래 연도는 제시하지 않는다.