최신논문
ThinkingBox 최신 비교: Opus 5.5도 20회 모두 성공한 업무는 47.53%
발표일: 2026년 10월 3일 Microsoft·Hugging Face 공동 블로그. 원 논문은 8월 20일 최초 제출됐고, 최신 v4는 10월 1일 수정됐습니다. 최신 모델 비교와 공개 실행 환경을 정리했습니다.
원문 및 확인 자료: Microsoft·Hugging Face 공동 발표(10월 3일) · ThinkingBox 논문 v4(10월 1일) · Microsoft의 평가 설계 설명 · OpenEnv 공식 실행 문서
1. 완료 선언보다 실제 변경 결과를 검사한다
ThinkingBox는 소매·여행·보험·은행 내부 IT·컨설팅 지원의 507개 업무를 같은 초기 상태에서 각각 20회 독립 실행합니다. 분리된 MCP 도구 세션에서 최종 데이터베이스 상태와 부수효과를 검사하며, 도구 호출 순서가 달라도 올바른 결과를 만들면 인정합니다. 필요한 변경의 누락, 잘못된 값, 무관한 기록 변경은 실패입니다.
이 설계에서는 477개 과제가 상태만 채점하고, 30개만 응답 평가를 추가합니다. 결과 상태가 맞더라도 사용자에게 처리 내용을 잘못 설명하는 일부 문제를 놓칠 수 있다는 제한도 있습니다.
2. 한 번 성공과 20번 모두 성공은 다르다
공식 블로그는 세 지표를 구분합니다. pass@1은 전체 시도의 평균 성공률, pass@20은 20번 중 적어도 한 번 해결한 과제 비율입니다. observed 20/20은 실제 20번 모두 성공한 과제 비율입니다. 이 글의 반복 성공 수치는 마지막 정의를 따릅니다.
3. 최신 모델의 점수와 반복 신뢰성
Opus 5.5는 pass@1 67.16%로 선두지만, 20회 모두 성공한 과제는 241개(47.53%)입니다. Opus 5도 같은 241개이며, GPT-6 Astra는 231개(45.56%)입니다. Kimi-K3는 적어도 한 번 해결한 과제가 476개(93.89%)로 가장 많지만, 20회 모두 성공한 과제는 68개(13.41%)입니다.
비용에서도 평가 기준이 중요합니다. 블로그의 성공 시도당 비용은 GPT-5.6 Sol이 가장 낮지만, 반복 성공 과제당 비용에서는 GPT-5.4가 가장 낮습니다. 두 수치는 벤치마크 비교 지수이며 실제 운영 청구액으로 제시된 것이 아닙니다.
4. 논문과 블로그의 다른 수치를 읽는 법
논문 Appendix C.7의 pass^20은 각 과제의 관측 성공률을 20제곱해 평균한 추정치입니다. 따라서 20회 중 일부 실패한 과제도 작은 값을 기여합니다. 블로그는 추정 없이 20회 전승 과제만 셉니다. 논문 Table 15에도 Kimi의 전승 과제 68개가 기록돼 있어, 17.60%와 13.41%의 차이는 지표 정의로 설명됩니다.
이해를 돕는 별도 해설: 모델별 신뢰성을 비교하려면 반복 횟수와 지표 정의부터 일치시켜야 합니다.
5. 공개 환경으로 검증할 수 있는 것과 한계
OpenEnv 문서는 ThinkingBox를 직접 실행할 수 있는 평가 경로를 제공합니다. 현재 어댑터는 평가용이며, 모델과 별도로 데이터·도구 서버·사용자 시뮬레이터·판정 설정을 준비해야 합니다. 실행 인프라의 실패도 따로 기록하므로, 이를 조용히 제외하지 않고 결과에 반영할 기준이 필요합니다.
과제는 실제 고객 기록이 아닌 합성 재구성이며, 여러 정답 상태가 가능한 업무는 제외됐습니다. 사용자 시뮬레이터도 목표를 바꾸지 않는 협조적인 상대입니다. 따라서 이 결과는 기업 업무 전체나 AGI의 보편적 능력을 평가한 것이 아닙니다. 관측한 20회 전승 역시 이후 무오류를 보장하지 않습니다.