뉴스/정보
Reflection Beam: 1억 회 강화학습이 보여준 확장 가능성과 남은 검증
작성자
작성일
2026-10-06 09:26
조회
4
발표: 2026년 10월 5일 · 개발사 공식 발표 기준
1. 무엇이 공개됐나
Reflection이 첫 모델 Beam을 발표했다. 총 5,010억·활성 230억 파라미터의 MoE로, 코딩·추론·에이전트 작업을 겨냥한다. 현재는 제한된 사전 공개 단계다. 최종 레드팀 평가가 진행 중이며, Apache 2.0 가중치와 기술보고서·모델카드는 10월 중 공개 예정이다.
2. 강화학습 규모와 일반화
GB300 10,500개로 4주간 1억 회 이상의 실행 궤적을 생성했다. 약 100만 개의 학습 환경을 준비했고, 회사는 측정한 범위에서 성능 포화가 나타나지 않았다고 보고했다. 추론·코딩·터미널 작업을 학습하는 구간에서는 브라우징 과제 없이도 브라우징 성능이 개선됐다. 이는 과제 간 일반화의 관찰이며, 범용지능을 입증하는 실험은 아니다.
3. 성능과 비용을 어떻게 읽을까
공개 점수는 Terminal-Bench 2.1 80.1%, HLE 무도구 36.2%다. GLM-5.2 대비 추론 연산량이 3~4배 적다는 설명은 활성 파라미터와 생성 토큰을 이용한 FLOP 추정에 근거한다. 프리필·문맥 길이에 따른 어텐션·서빙 오버헤드는 제외하므로 실제 요금이나 처리속도 차이로 바로 환산할 수 없다.
4. AGI 관점의 의미와 다음 확인점
이번 발표는 강화학습 규모 확대와 추론 효율 개선의 추가 사례다. 다만 포화 부재는 해당 훈련 구간의 보고이며 무제한 성장을 뜻하지 않는다. 가중치와 기술보고서 공개 뒤에는 독립 재현, 전체 운영 비용, 안전평가를 함께 확인해야 한다.
전체 0