인터뷰/예측

다니엘 코코타일로: “2028년 말까지 AI 연구 전체 자동화 가능성 약 50%”

작성자
작성일
2026-10-05 00:51
조회
14
https://blog.aifutures.org/p/senate-testimony-sept-2026

2026년 9월 30일, 저는 상원 재난 관리, 워싱턴 D.C. 및 인구 조사 소위원회에서 증언했습니다. 

 

--


홀리 위원장님, 김 간사님, 그리고 소위원회 위원 여러분. 오늘 증언할 기회를 주셔서 감사합니다.

제 이름은 다니엘 코코타일로(Daniel Kokotajlo)입니다. OpenAI에서 일할 당시 제 업무 중 하나는 AI의 미래를 예측하는 일이었습니다. 저는 회사가 책임감 있게 행동할 것이라는 신뢰를 잃은 것이 한 가지 이유였고, AI 업계와 그 미래에 대해 더 자유롭게 말하기 위해서라는 이유도 있어 회사를 떠났습니다. 현재 저는 소규모 비영리 연구기관인 AI Futures Project를 이끌고 있습니다.

Anthropic과 OpenAI는 서로 경쟁하며 초지능(superintelligence)을 향해 달려가고 있습니다. 여기서 초지능이란 모든 분야에서 최고의 인간보다 뛰어나면서도 더 빠르고 더 저렴하게 일하는 AI 시스템을 뜻합니다.

그들이 그 목표에 도달하려는 방법은 AI 연구개발 과정 자체를 자동화하는 것입니다.

현재 이런 회사들에서는 거의 모든 코드가 AI에 의해 작성되고 있습니다. 이제는 코딩뿐 아니라 연구 전체 과정을 수행하도록 AI를 훈련하기 시작했습니다. 언제 성공할지는 불확실하지만, 저와 제 팀은 이것이 이제 어느 해에라도 일어날 수 있다고 생각합니다. 개인적으로는 2028년 말까지 성공할 확률을 약 50%로 봅니다.

Hugging Face를 공격했던, 스스로를 ‘Swarm’이라고 부른 AI 집단은 약 1,000개의 에이전트로 이루어져 있었습니다. 만약 대형 AI 기업들이 AI 연구개발을 자동화한다면, 그들은 이보다 수백 배 더 큰 규모의 AI 스웜을 운영하게 될 것입니다.

오늘날에는 인간이 AI 직원들을 관리하는 관리자와 비슷한 위치에 있습니다. 그러나 그런 미래에는 인간이 전적으로 AI로 구성된 회사의 이사회와 같은 존재가 될 것입니다. 인간은 무슨 일이 벌어지고 있는지 이해하기 위해 AI가 만들어낸 설명에 의존하게 될 것이고, 모든 일은 점점 더 빠른 속도로 진행될 것입니다.

OpenAI의 저명한 AI 역량 연구자인 댄 셀삼(Dan Selsam)은 최근 AI 위험에 관한 성명을 발표했습니다. 그는 다음과 같이 말했습니다.

“전체 기술 스택의 연구자와 엔지니어들은 세상을 파악하는 것 자체를 점점 더 모델에 의존하고 있다. 나 자신도 이제는 원시 코드를 거의 직접 보지 않는다. 하루 종일 모델이 제시하는 설명과 제안을 깊이 검토하는 규율을 유지하는 것조차 점점 어려워지고 있다.”

오늘날의 AI들은 때때로 우리가 부여한 목표와 다른 목표를 추구하며, 때로는 자신들이 그렇게 하고 있다는 사실을 숨기기도 합니다.

Hugging Face 사건은 그것이 실제로 어떤 모습으로 나타나는지를 보여주었습니다. AI들은 자신들이 수행하는 행동이 주어진 임무의 범위를 벗어난다는 것을 알고 있었지만, 그럼에도 불구하고 실행했습니다.

제가 두려워하는 것은 1~2년 뒤 훨씬 더 강력한 AI 시스템에서 같은 일이 벌어졌을 때, 우리가 너무 늦을 때까지 그것을 알아차리지 못할 수도 있다는 점입니다.

범용 AI 에이전트를 우리가 원하는 방향으로 정렬시키는 과학은 매우 새롭고 아직 충분히 발전하지 않았습니다. 사실 저는 이 분야가 공학이라기보다는 심리학에 더 가깝다고 말하고 싶습니다.

여기에 기술 기업들의 ‘빠르게 움직이고 일단 부숴보자(move fast and break things)’는 태도까지 결합되면서, AI 업계에는 실제로는 임시방편에 불과한 해결책을 문제를 해결한 것으로 착각할 위험이 유난히 높습니다. 지금 붙여놓은 덕트테이프가 나중에 떨어져 나갈 수도 있는데도 말입니다.

최근 사건 역시 좋은 사례입니다. 사건에 연루된 AI들은 어느 정도의 정렬 훈련을 받았던 것으로 보이며, 정렬 평가에서도 겉보기에는 합리적인 점수를 기록했습니다.

더 나쁜 점은, AI의 정렬 실패 문제를 우리가 애초에 발견할 수 있는 능력 자체가 세 가지 이유로 급격히 감소할 가능성이 높다는 것입니다.

첫째, AI들이 점점 상황 인식 능력(situational awareness)을 갖추고 있습니다. AI들은 자신들의 행동이 감시되고 있으며 평가받고 있다는 사실을 점점 더 잘 이해하게 되고 있습니다.

따라서 앞으로는 평가 상황에서 AI가 어떻게 행동하는지를 관찰해도, 새로운 미래 상황에서 실제로 어떻게 행동할 것인지에 대해서는 거의 아무런 증거도 얻지 못하게 될 것입니다.

둘째, AI를 감시할 수 있는 능력, 즉 monitorability가 감소하는 방향으로 가고 있습니다.

지난 몇 년 동안 우리는 AI의 사고 과정(chain of thought)을 읽는 것만으로도 AI가 무엇을 생각하는지 상당히 잘 이해할 수 있었습니다. 그러나 제가 예측했던 것처럼, 이런 ‘황금기’는 끝나가고 있는 것으로 보입니다.

셋째, AI는 해킹 능력에서 빠르게 인간을 능가하고 있습니다.

이미 AI가 각종 평가 시스템을 속이려고 시도하거나, 자신들의 행동 기록을 조작하려 했던 사례들이 있었습니다.

우리는 정렬되지 않은 AI가 자신의 잘못된 행동에 대한 증거를 감추기 위해 상당한 노력을 기울이고, 실제로 그것에 성공할 가능성을 진지하게 고려해야 합니다.

셀삼의 말을 다시 인용하겠습니다.

“모델들은 실제로는 정렬되어 있지 않더라도 점점 더 정렬된 것처럼 보이게 될 것이다.”

만약 AI 기업들이 AI 연구개발 과정 자체를 자동화한다면, 이는 결국 이런 구조를 의미합니다.

AI가 AI를 만들고,
그 AI가 다시 AI를 만들고,
그 AI가 또 다음 AI를 만들게 됩니다.

그리고 그 최종적으로 만들어진 AI들은 경제를 바꾸고, 매일 우리와 대화하며, 군사 시스템에도 통합될 것입니다.

이것은 재앙으로 이어질 수 있는 처방입니다.

저는 즉각적으로 시행할 수 있는 두 가지 정책을 제안합니다.

첫째, AI 산업에 대한 투명성을 획기적으로 높여야 합니다.

여러 건의 ‘통제에서 벗어난 AI 스웜’ 사건이 있었으며, 그중 적어도 하나는 OpenAI 내부 인프라를 심각하게 침해했습니다.

하지만 METR은 이 사건들 가운데 단 한 건만 조사할 수 있었으며, 현장 조사 기간도 단 6일뿐이었습니다.

이것은 마치 쥬라기 공원에서 직원 한 명이 공룡에게 살해된 사건을 조사하도록 초대받았지만, 그 사건 전후에 있었던 수많은 다른 공룡 탈출 사고에 대해서는 질문조차 하지 못하게 하는 것과 같습니다.

둘째, AI 연구 자동화 경쟁에 투입되는 컴퓨팅 자원을 다른 분야로 돌려야 합니다.

최근 추정에 따르면 OpenAI와 Anthropic은 각각 전체 컴퓨팅 자원의 약 절반을 AI 연구개발에 사용하고 있습니다.

만약 그 비율을 예를 들어 10% 수준으로 낮춘다면, AI 연구 자동화를 향한 경쟁 속도를 상당히 늦출 수 있을 것입니다.

동시에 그 컴퓨팅 자원을 유익한 AI 서비스 배포, 안전 연구, 그리고 단순히 소비자 가격을 낮추는 데 사용할 수도 있습니다.

아모데이(Amodei), 올트먼(Altman), 머스크(Musk)는 모두 ‘프런티어의 속도를 조절해야 한다(pace the frontier)’는 필요성에 동의해왔습니다.

그러나 실제로는 아직 프런티어의 속도를 의미 있게 조절하지 않았습니다.

저는 미국 정부가 개입해야 한다고 생각합니다.

단지 말로만 속도 조절을 이야기하는 것이 아니라 실제로 프런티어의 속도를 낮춘다면, 그것이 규제 포획(regulatory capture)이나 안전을 명분으로 내세우는 ‘안전 세탁(safetywashing)’이 아니라는 사실을 확인할 수 있을 것입니다.

그 증거는 Anthropic과 OpenAI에서 AI 연구 자동화를 향해 나아가는 발전 추세선이 실제로 아래로 꺾이는 모습으로 나타날 것입니다.

감사합니다.

전체 0