최신논문
(2023년 11월) GPQA: 대학원 수준의 Google 검증 Q&A 벤치마크
작성자
작성일
2024-07-03 19:59
조회
416
https://arxiv.org/abs/2311.12022
우리는 생물학, 물리학, 화학 분야의 도메인 전문가가 작성한 448개의 객관식 문제로 구성된 까다로운 데이터 세트인 GPQA를 제시합니다. 우리는 문제가 고품질이고 매우 어려운지 확인합니다. 해당 도메인에서 박사 학위를 취득했거나 취득 중인 전문가는 65%의 정확도를 달성하는 반면(전문가가 회고적으로 발견한 명확한 실수를 제외하면 74%), 고도로 숙련된 비전문가 검증자는 웹에 무제한으로 액세스하는 데 평균 30분 이상을 소비했음에도 불구하고 34%의 정확도에 도달합니다(즉, 문제는 "Google에서 검증 가능"). 이 문제는 최첨단 AI 시스템에도 어려운데, 가장 강력한 GPT-4 기반 기준은 39%의 정확도를 달성합니다. 예를 들어 새로운 과학적 지식을 개발할 때와 같이 매우 어려운 질문에 답하는 데 도움이 되는 미래의 AI 시스템을 사용하려면 인간이 출력을 감독할 수 있는 확장 가능한 감독 방법을 개발해야 하며, 이는 감독자가 스스로 숙련되고 지식이 풍부하더라도 어려울 수 있습니다. GPQA는 숙련된 비전문가와 최첨단 AI 시스템 모두에게 어려운데, 이를 통해 현실적이고 확장 가능한 감독 실험이 가능해질 것으로 기대되며, 이를 통해 인간 전문가가 인간 능력을 뛰어넘는 AI 시스템으로부터 신뢰할 수 있는 정확한 정보를 얻을 수 있는 방법을 고안하는 데 도움이 될 것으로 기대됩니다.
우리는 생물학, 물리학, 화학 분야의 도메인 전문가가 작성한 448개의 객관식 문제로 구성된 까다로운 데이터 세트인 GPQA를 제시합니다. 우리는 문제가 고품질이고 매우 어려운지 확인합니다. 해당 도메인에서 박사 학위를 취득했거나 취득 중인 전문가는 65%의 정확도를 달성하는 반면(전문가가 회고적으로 발견한 명확한 실수를 제외하면 74%), 고도로 숙련된 비전문가 검증자는 웹에 무제한으로 액세스하는 데 평균 30분 이상을 소비했음에도 불구하고 34%의 정확도에 도달합니다(즉, 문제는 "Google에서 검증 가능"). 이 문제는 최첨단 AI 시스템에도 어려운데, 가장 강력한 GPT-4 기반 기준은 39%의 정확도를 달성합니다. 예를 들어 새로운 과학적 지식을 개발할 때와 같이 매우 어려운 질문에 답하는 데 도움이 되는 미래의 AI 시스템을 사용하려면 인간이 출력을 감독할 수 있는 확장 가능한 감독 방법을 개발해야 하며, 이는 감독자가 스스로 숙련되고 지식이 풍부하더라도 어려울 수 있습니다. GPQA는 숙련된 비전문가와 최첨단 AI 시스템 모두에게 어려운데, 이를 통해 현실적이고 확장 가능한 감독 실험이 가능해질 것으로 기대되며, 이를 통해 인간 전문가가 인간 능력을 뛰어넘는 AI 시스템으로부터 신뢰할 수 있는 정확한 정보를 얻을 수 있는 방법을 고안하는 데 도움이 될 것으로 기대됩니다.
전체 0