최신논문
Station, ICLR 논문 3편의 세부 발견 62.7% 재현… 연구 지속성 장치 효과
작성자
작성일
2026-10-09 08:39
조회
3
10월 6일 제출된 Station 연구는 정답 점수가 없는 개방형 과학 연구에서 다중 에이전트가 얼마나 성과를 내는지 평가했다. 연구진은 ICLR 논문 3편의 질문과 실험 환경을 제공하되 결과를 감추고 인터넷을 차단했다.
설계
Gemini 3.1 Pro 3개, Claude Opus 4.8 2개, GPT-5.5 1개 에이전트가 300단계 동안 연구했다. Supervisor는 성급한 방향 전환을 억제하고, 50단계마다 Meta Reflection으로 연구 가치를 재검토하게 했다. 각 과제는 3회 실행했으며, 결과를 뒷받침하는 실험 근거까지 있어야 재발견으로 인정했다.
주요 결과
세부 발견 회수율은 평균 62.7±2.8%로 Codex Multiagent-v2의 15.4%, AI Scientist-v2의 14.4~20.6%보다 높았다. 강화학습 계획 분석 과제에서 두 장치를 함께 제거하면 75.8%에서 57.9%로 낮아졌다. 다만 비교 예산은 누적 실험 실행시간 기준이며 모델 구성·토큰 수까지 동일하지 않았다.
해석의 경계
세 논문의 기존 발견을 회수한 비율이지 새로운 논문의 품질이나 AGI 달성률이 아니다. 모델 학습 중 원논문을 접했을 가능성도 배제하지 못했다. 별도로 평가한 연구 제안 24개 중 75%는 전문가에게 중요성 5점 만점의 1~2점을 받았다. 연구 지속성은 개선됐지만 중요한 질문을 고르는 판단력은 여전히 과제다.
전체 0