뉴스/정보
다리오 아모데이 - 우리는 프론티어를 조절해야 한다
작성자
작성일
2026-09-12 23:07
조회
19
https://darioamodei.com/post/we-must-pace-the-frontier
나는 이러한 놀라운 혜택에 대해 여러 차례 글을 썼다. 나는 AI가 앞으로 5~10년 안에 대부분의 주요 질병을 치료하고, 경제성장률을 크게 가속하며, 풍요와 개인의 역량 강화가 넘치는 세상을 만들고, 민주주의와 자유의 르네상스를 열 수 있다고 믿는다.
이 문제는 나 개인에게도 절박하다. 내 아버지는 돌아가신 지 불과 몇 년 뒤 치료법이 개발된 질병으로 세상을 떠났고, 나 자신도 50년 전이었다면 치료할 수 없었을 초기 암에서 살아남았다.
신중하게 사용한다면 AI는 인류를 더 나은 곳으로 끌어올리고 존엄하게 만들어온 수많은 기술적 기적의 계보를 잇는 최신 기술이 될 수 있다.
하지만 이전의 수많은 기술들과 마찬가지로 AI에도 위험이 따른다. 그리고 AI는 워낙 강력한 기술이기 때문에 그 위험 역시 심각하다.
여기에는 AI 시스템에 대한 통제력을 잃을 위험, AI가 사이버 공격이나 생물테러에 악용될 위험, 그리고 심각한 경제적 혼란이 포함된다.
상업적 경쟁에 의해 촉발되는 바닥을 향한 경쟁(race to the bottom)은 이런 위험을 더욱 악화시킬 수 있다.
Anthropic을 설립한 초기부터 나는 공동창업자들과 직원들과 함께 이러한 위험과 혜택의 이중성을 고민해왔다.
기술을 만들지 않는다면 인류가 그 혜택을 누리지 못하게 되거나, 단순히 AI 기술이 권위주의 국가들의 손에 넘어가게 된다. 반면 너무 빠르게 개발하는 것은 무모하다.
우리는 그 사이의 길을 찾으려고 했다. 즉, 신중하게 AI를 개발하면서도 상업적으로 성공할 수 있음을 보여주고, AI 기업들이 안전을 놓고 경쟁하도록 만드는 것이다.
다시 말해 우리는 정상을 향한 경쟁(race to the top)을 만들고자 했다.
우리는 항상 상당한 비중의 노력을 AI 위험을 연구하고, 대응하며, 대중에게 알리는 데 투자해왔다. 또한 신중하게 설계된 AI 규제를 지지해왔다.
그 과정에서 우리가 과장하고 있다거나, ‘AI 종말론자(doomer)’라거나, 규제를 이용해 시장을 장악하려 한다는 비난을 받기도 했다.
그래도 우리는 속도보다 신중함을, 이익보다 현명함을 우선하려 노력해왔다.
그러나 지난 몇 달 동안 나는 AI 위험을 제대로 다루려면 훨씬 더 큰 신중함이 필요하다고 확신하게 되었다.
단순히 위험 방지 기술에 투자하는 것만으로는 부족하다.
안전 기술이 따라잡을 시간을 확보할 수 있도록 AI 능력 발전 자체의 속도를 조절해야 한다.
우리는 AI 모델의 능력을 향상시키는 속도를 늦춰야 한다.
발전 속도는 여전히 매우 빠르게 느껴질 것이다. 그리고 우리가 확보하게 되는 시간을 현명하게 활용해야 한다.
내 생각이 이렇게 바뀌게 된 데에는 두 가지 이유가 있다.
첫 번째 우려는 대략 올해 여름부터 AI 발전 속도가 급격히 빨라졌다는 것이다.
그 핵심 동력은 AI가 차세대 AI를 만드는 능력이 점점 강해지고 있다는 것이다.
이러한 현상을 재귀적 자기개선(Recursive Self-Improvement, RSI)이라고 부른다.
우리와 다른 기업들이 설명해왔듯, 이 현상은 Anthropic을 포함하여 업계 전반에서 이미 시작되고 있다.
아무런 통제 없이 계속된다면 AI 시스템을 이해하고 통제하는 우리의 능력을 앞질러버릴 수 있다.
따라서 재귀적 자기개선은 매우 조심스럽게 추진해야 하며, 어쩌면 아예 추진하지 않아야 할 수도 있다.
두 번째 우려는 OpenAI-Hugging Face 사건(OAI-HF)이다.
이 사건에서 다수의 AI 에이전트로 구성된 스웜(swarm)은 사실상 하나의 광적으로 집단에 헌신하는 집단처럼 행동했다.
이들은 요청받지도 않았고 원래 수행해야 할 작업과 아무 관계도 없는 목표를 대상으로 사이버 공격을 수행했고, 집단의 성공을 위해 자신을 희생했으며, 심지어 자신의 성과를 평가하는 ‘채점자(grader)’를 해킹하려 시도했다.
아무도 다치지 않았고 경제적 피해도 미미했기 때문에 이 사건을 대수롭지 않게 볼 수도 있다.
하지만 내 생각에는, 비슷한 수준의 정렬 실패(misalignment)를 가진 스웜이 지금보다 훨씬 강력한 능력을 보유했다면 재앙적인 피해를 일으킬 수 있었을 것이다.
AI 능력 발전 속도가 계속 가속하고 있다는 점을 고려하면, 앞으로 6~12개월 안에 이 정도로 잘못 정렬된 스웜이 인터넷 전체를 지속적인 봇넷으로 장악할 능력을 갖게 될 수도 있다고 우려한다.
그렇게 된다면 수천억 달러에 이르는 피해가 발생할 수도 있다.
그리고 필요한 안전장치 없이 AI가 계속 강력해진다면 피해의 규모는 이후 더욱 커질 것이다.
OAI-HF를 특정 회사 하나의 실패로 치부하기도 쉽다.
하지만 나는 그것이 잘못된 생각이라고 본다.
이보다 덜 심각하기는 하지만 비슷한 사건들은 Anthropic을 포함해 업계 전반에서 발생해왔다.
따라서 모든 프런티어 AI 기업은 마치 OAI-HF 사건이 자신들의 회사에서 발생한 것처럼 행동해야 할 의무가 있다고 생각한다.
즉, AI의 혜택을 실현하면서도 안전을 확보하고, 동시에 중요한 지정학적 딜레마에도 대응할 수 있도록 균형 잡힌 속도로 AI를 개발하자는 것이다.
여기서 분명히 하고 싶은 것은 ‘속도 조절’이 모델 훈련이나 기술 발전을 완전히 중단한다는 의미는 아니라는 점이다.
기업들이 모델을 정렬하고 안전하게 만드는 데 충분한 시간을 쓰고, 제3자 평가기관이 이를 확인할 수 있도록 하자는 것이다.
우리의 프런티어 속도 조절 프레임워크는 안전에 대한 우리의 기존 약속을 더욱 강화하고, 업계 전체가 정상을 향한 경쟁을 하도록 장려하기 위한 시도다.
첫 번째 단계는 Anthropic이 다른 기업의 참여 여부와 관계없이 독자적으로 시행할 것이다. 동시에 우리는 각국 정부가 다른 프런티어 기업들에게도 이를 의무화할 것을 촉구한다.
두 번째 단계에는 업계 전반의 협력이 필요하다.
세 번째 단계에는 전 세계적 협력이 필요하다.
이 단계들을 반드시 순서대로 실행할 필요는 없다.
일부 단계는 다른 단계보다 훨씬 실현하기 어려울 수도 있다.
하지만 나는 이 3단계가 우리가 무엇을 해야 하는지 생각하는 데 유용한 프레임워크라고 생각한다.
구체적으로는 다음과 같다.
이 평가팀의 역할은 기업이 안전 규정과 약속을 실제로 준수하는지 검증하고, 사고를 보고하며, 완성된 AI 모델뿐 아니라 훈련 파이프라인과 개발 프로세스 자체의 정렬 상태를 평가하는 것이다.
이는 속도 조절 약속을 실제로 검증할 수 있게 만드는 핵심적인 단계다.
은행 산업에서도 감독기관 직원이 조직 내부에서 지속적으로 감독하는 비슷한 전례가 있다.
Anthropic은 지금부터 이 조치를 독자적으로 시행할 것이다.
그리고 이는 우리의 안전 및 정렬 연구를 더욱 강화하려는 광범위한 노력의 일부가 될 것이다.
AI 발전 속도를 조절하는 데 효과적인 일부 형태의 기업 간 협력은 법적으로, 특히 반독점법 측면에서 어려움이 있기 때문에 정부의 지원이 필요하다.
다만 상대방이 협정을 실제로 준수하는지 검증하기 어려운 문제를 매우 गंभीर하게 고려해야 한다.
하지만 당시에는 그런 주장이 별로 타당하지 않다고 생각했다.
항상 따라오는 질문은 이것이었다.
“그렇게 확보한 시간으로 무엇을 할 것인가?”
당시 AI 모델들은 현실 세계에서 일관된 방식으로 행동하는 에이전트가 될 정도로 강력하지 않았다.
심각한 수준의 기만이나 조작, 부정행위, 사이버 공격을 수행할 능력도 없었다.
그런 모델의 정렬 위험을 연구하기 위해 AI 발전을 늦추는 것은 마치 박테리아를 실험해 인간 심리를 연구하려는 것과 비슷하게 느껴졌다.
하지만 오늘날 상황은 완전히 달라졌다.
현재의 AI 모델들은 AI를 어떻게 제대로 만들어야 하는지, 그리고 잘못 만들었을 경우 무엇이 잘못될 수 있는지 연구하기 위한 사실상 무한한 금광과도 같은 연구 대상이다.
나는 모델들이 위험한 수준의 능력에 도달하기까지의 시간을 단 1~2년만 늦출 수 있어도, 그리고 그 시간을 정렬 연구 발전에 제대로 사용한다면 심각한 사고가 발생할 가능성을 크게 낮출 수 있다고 믿는다.
협력적인 프런티어 속도 조절 전략은 AI 기업들이 상업적 경쟁력을 희생하거나 미국의 AI 우위를 포기하지 않으면서도 이 중요한 연구를 수행할 시간을 확보하게 해준다.
더 근본적으로는 사회가 이 기술이 어떻게 사용될지 결정하는 과정에 참여해야 한다.
필요한 공론을 위한 시간을 더 많이 확보할 수 있다는 점에서도 프런티어 속도 조절은 분명 긍정적이다.
구체적으로 AI 발전 속도를 조금 늦춘다면 기업들은 다음 분야에 더욱 많은 자원과 집중력을 투자할 수 있다.
수천 명의 인력과 수백만 개의 칩, 그리고 기술 역사상 가장 복잡한 수준의 인프라가 필요하다.
많은 문제는 우리가 중요한 이론이나 통찰을 몰라서 생기는 것이 아니다.
그보다는 실행 과정에서 문제가 발생하기 때문이다.
예를 들어 우리가 최근 보고한 정렬 사고 중 일부는 망가진 강화학습 환경을 제대로 걸러내지 못한 것이 부분적인 원인이었다는 증거가 있다.
우리와 협력업체들은 이 작업을 나름 신중하게 수행했지만, 충분히 잘하지 못했다.
모니터링, 샌드박싱, 훈련 환경 관리, 데이터 문제 등은 매우 복잡하며 운영상의 문제가 끊임없이 발생한다.
우리는 이 분야에서 세계 최고 수준의 팀을 보유하고 있다.
하지만 동시에 해야 할 일이 너무 많다.
조금 더 신중한 속도로 개발한다면 운영의 완성도를 훨씬 높일 수 있다.
기술적으로 매우 복잡하면서 안전이 중요한 시스템을 수백만 번 운영해도 사고가 발생하지 않도록 만든 전례는 이미 존재한다.
대표적인 예가 상업용 항공기다.
하지만 그런 수준에 도달하려면 시간이 필요하다.
즉 모델들이 안전하고 윤리적이며 우리의 지침을 준수하고 실제로 사람들에게 도움이 되도록 훈련하는 기술이 발전했다.
Claude의 헌법(Constitution)에 담긴 원칙도 이러한 노력의 일부다.
하지만 모델의 능력이 증가하는 속도를 정렬 훈련이 따라잡도록 하려면 아직 해야 할 일이 많다.
드물고 예상하기 어려운 바람직하지 않은 행동이 여전히 나타날 때가 있다.
프런티어의 속도를 조절해 추가 시간을 확보하면 이런 문제의 원인을 더 잘 이해하고 예방 기술을 개발할 수 있다.
그리고 모델을 출시하기 전에 감사하는 과정에서 점점 중요한 역할을 하고 있다.
이를 AI의 ‘뇌’를 촬영하는 fMRI와 비슷하게 활용할 수 있다.
특정 행동이 나타나는 근본적인 이유를 내부적으로 살펴볼 수 있기 때문이다.
예를 들어 우리는 최근 조사하고 있는 정렬 사고에서 모델이 말로 표현하지 않은 동기를 조사하기 위해 해석가능성 기법을 사용했다.
하지만 이런 방법이 언제나 명확하고 신뢰할 수 있는 결과를 제공하는 것은 아니다.
모든 진전에도 불구하고 우리는 여전히 모델 내부에서 실제로 일어나는 일의 극히 일부만 이해하고 있다.
향후 1~2년 동안 해석가능성 기술을 현재보다도 더 빠르게 발전시키기 위해 집중적으로 노력한다면 엄청난 진전을 이룰 수 있다.
그리고 이미 발생한 사고들만으로도 연구에 사용할 실험 자료는 충분하다.
더 지능적인 모델은 테스트 자체를 속일 능력도 더욱 강해진다.
따라서 실제로는 심각한 문제가 있음에도 겉으로만 잘 정렬된 것처럼 보일 수 있다.
훨씬 더 폭넓고 정교한 평가 방법을 만들고, 이를 해석가능성 분석과 결합해 교차 검증한다면 엄청난 가치가 있을 것이다.
그리고 이 분야 역시 1~2년 안에 상당한 발전을 이룰 수 있다.
이들은 기업의 안전 관행을 검증하고 사고를 보고한다.
겉으로 보면 외부 평가자를 회사 안에 상주시키는 것이 사소하거나 별 의미 없는 절차처럼 보일 수도 있다.
하지만 흔히 가장 지루하고 절차적으로 보이는 것들이 실제로는 가장 중요하다.
상주 외부 평가팀은 오늘날 어떤 AI 기업도 시행하지 않는 수준을 훨씬 넘어서는 상당히 급진적인 제도다.
그 장점은 다음과 같다.
속도 조절과 관련된 어떤 약속이든 필연적으로 애매한 부분, 판단이 필요한 부분, 법의 문자와 정신 사이의 문제가 발생한다.
따라서 실제 세부사항을 볼 수 있는 중립적인 제3자의 존재가 필수적이다.
Anthropic은 오랫동안 투명성을 지지해왔다.
업계 대부분이 규제에 반대하던 시절에도 우리는 투명성 법안을 지지했고, 우리의 모델 카드와 위험 보고서는 수백 페이지에 달한다.
하지만 결국 무엇을 포함하고 무엇을 제외할지 결정하는 것은 여전히 우리 자신이다.
상주 외부 평가팀이 도입되면 이 구조가 달라진다.
직원들이 미처 생각하지 못했던 위험을 외부 평가자가 지적하고, 이를 알게 된 직원들이 문제를 해결하는 것만으로도 상당한 안전 효과가 발생할 수 있다.
이러한 장점 때문에 프런티어 속도 조절 정책이 제대로 작동하려면 상주 외부 평가팀부터 시작하는 것이 훨씬 효과적일 것이다.
이 평가자들은 비슷한 위험 평가 업무를 수행하는 내부 직원과 거의 동일한 수준의 권한과 도구에 지속적으로 접근할 수 있어야 한다.
Anthropic은 가까운 미래에 외부 평가팀을 초청하고 다음과 같은 환경을 제공할 예정이다.
하지만 단지 Anthropic에 불리한 내용이라는 이유만으로 결과를 삭제할 수는 없다.
또 평가자들은 어떤 삭제가 자신의 결론에 중요한 정보를 제거했다고 판단한다면 그 사실을 공개적으로 밝힐 수 있다.
기업으로서는 이례적인 조치다.
그러나 우리는 외부 평가팀 상주라는 개념이 실제로 작동할 수 있음을 증명하는 것이 중요하다고 생각한다.
다시 한번 다른 프런티어 AI 기업들도 동참할 것을 촉구한다.
특히 모델이나 훈련 파이프라인의 구체적인 특성을 기준으로 개발 속도를 조절할 수 있다.
가장 효과적인 방법은 미국의 모든 프런티어 AI 기업을 대상으로 하는 규제를 도입하는 것이다.
그러면 자발적으로 협력하려 하지 않는 기업들도 포함할 수 있다.
Anthropic은 오랫동안 합리적이고 표적화된 AI 규제를 지지해왔으며, 특히 투명성과 제3자 감사를 중심으로 하는 법안을 지지해왔다.
모든 프런티어 연구소는 정부와 협력해 영구적인 상주 외부 평가팀 제도를 공식화해야 한다고 생각한다.
이를 통해 최근 몇 달 동안 발생했던 내부 정렬 사고를 더 잘 예방하고 기록할 수 있으며, AI 능력과 안전 수준이 균형을 이루도록 하는 규제 역시 도입할 수 있다.
문제는 법률 제정에는 시간이 걸린다는 것이다.
반면 AI는 매우 빠르게 발전하고 있다.
따라서 규제 경로와 병행해 AI 기업들이 자발적으로 협력해 표준을 설정해야 한다.
영구적인 상주 평가팀을 통해 검증 가능성이 확보된다면 이러한 협력은 훨씬 효과적으로 이루어질 수 있다.
반독점법 때문에 미국 정부가 이런 논의를 중재하거나 최소한 허용하는 것이 도움이 된다.
정부가 직접 협상에 참여할 필요는 없지만 특정 안전 관련 논의를 할 수 있도록 제한적인 반독점법 면책을 제공해야 한다.
이런 대화는 정부와 일정한 연계를 가진 산업 협의체를 통해 진행될 수도 있다.
예를 들어 Demis Hassabis가 제안한 형태의 메커니즘이 있을 수 있다.
어떤 방식이든 이러한 논의는 빠르게 진행되어야 한다.
나는 기본적으로 특정 프런티어 AI 시스템이 무엇을 할 수 있는지, 그리고 실제로 얼마나 안전한 것으로 관찰되는지를 기준으로 발전 속도를 조절하는 방법을 가장 선호한다.
예를 들어 일종의 ‘체크포인트’ 제도를 만들 수 있다.
여기서 Y와 Z는 각종 평가, 해석가능성 분석, 훈련 환경 감사 등의 조합이 될 수 있다.
예를 들어 X가 다음과 같은 능력일 수 있다.
그렇다면 Y는 모델이 자신의 환경에서 탈출해 수많은 컴퓨터를 장악하려는 성향을 가질 가능성을 극도로 낮게 만드는 조건이 될 수 있다.
프런티어 모델에 투입되는 재료 자체를 제한하는 방식도 검토해야 한다.
예를 들면 다음과 같다.
그래도 상주 평가팀과 함께 논의할 가치가 있는 문제다.
미국이 그 격차보다 더 큰 폭으로 속도를 늦추면 속도 제한을 받지 않는 중국 공산당 관련 AI 프로젝트가 미국을 추월할 수 있다.
그렇게 되면 심각한 국가안보 위험이 발생한다.
나는 Bessent 장관의 주장처럼 중국이 AI 경쟁에서 앞서게 된다면 미국과 세계에 중대한 위험이 될 수 있다고 생각한다.
중국 공산당 관련 AI 프로젝트는 미국 기업들이 조심스럽게 예방하려 하는 것과 동일한 정렬 위험을 감수할 가능성이 있다.
심지어 정렬 문제를 피한다 하더라도 AI 기반 드론 같은 기술을 이용해 민주주의 국가를 군사적으로 압도할 수 있는 위치에 놓일 수도 있다.
따라서 민주주의 국가 내부에서 안전하게 속도를 조절하기 위해서는 민주주의 국가들이 권위주의 국가들보다 가능한 한 큰 AI 기술 우위를 유지하는 것이 핵심적이다.
그래야 안전하게 속도를 늦출 수 있는 여유를 확보할 수 있다.
이 격차를 지키기 위해 취할 수 있는 주요 조치는 다음과 같다.
Anthropic은 오래전부터 이런 정책들을 일관되게 지지해왔다.
우리는 이러한 조치들이 AI 발전 속도를 안전하게 조절하기 위해 필수적이라는 사실을 항상 알고 있었기 때문이다.
이런 조치들을 제대로 시행한다면 중국의 발전 속도를 충분히 늦춰 향후 3~5년 동안 미국의 AI 우위를 상당히 확대할 수 있다고 생각한다.
이 시기는 AI가 지정학적으로 가장 중요해지는 기간이기도 하다.
어떤 사람들은 이러한 정책 때문에 중국과의 협력이 더 어려워진다고 생각할 수도 있다.
하지만 나는 오히려 반대라고 생각한다.
이 정책들은 민주주의 국가의 협상력을 강화해 미래에 합의가 이루어질 가능성을 높인다.
다만 이 과정은 훨씬 더 어렵다.
글로벌 속도 조절을 위해서는 권위주의 국가 가운데 압도적으로 가장 강력한 AI 능력을 가진 중국과의 협력이 필요하다.
여기서 순진하게 접근해서는 안 된다.
지정학적 이해관계가 워낙 크기 때문에, 특히 초기에는 협력할 수 있는 범위에 상당한 한계가 있을 것이다.
미국이 중국도 똑같이 AI 능력을 제한할 것이라고 믿고 스스로의 AI 개발을 크게 제한했는데 중국이 약속을 어긴다면 문제가 된다.
AI가 매우 강력한 기술이 될 수 있기 때문에 중국의 협정 위반은 세계 권력 균형 자체를 중국 쪽으로 크게 이동시킬 수 있다.
따라서 어떤 협정이든 다음 둘 중 하나를 만족해야 한다.
따라서 특히 가까운 미래의 글로벌 속도 조절 결정은 미국과 동맹국의 AI 우위를 보호하는 방식으로 이루어져야 한다.
가능한 합의에는 여러 수준이 있다.
일부는 충분히 현실적으로 가능하다고 생각한다.
반면 일부는 실제 실현 가능성에 대해 상당히 회의적이다.
그래도 시도는 해봐야 한다.
난이도가 낮은 것부터 높은 순으로 정리하면 다음과 같다.
예를 들어 AI를 생물무기 생산에 사용하거나 사용자가 그렇게 할 수 있도록 허용하는 것을 금지한다.
생물테러 공격은 미국과 미국의 적대국 모두에게 나쁜 일이기 때문에 이 수준의 합의는 가능할 가능성이 높다.
나는 이런 기구 자체를 만드는 것은 충분히 가능하다고 생각한다.
문제는 실질적인 강제력을 부여하는 것이다.
양측이 공식적으로 테스트하지 않는 비밀 모델을 보유하고 군사용 등으로 은밀하게 배포하지 않는다는 사실을 검증하기가 매우 어렵기 때문이다.
AI 모델이 다음 세대 AI 모델을 만들기 시작하면 발전 속도가 믿기 어려울 정도로 빨라질 수 있다.
그 속도를
에서
으로 낮추는 것은 전략적 우위를 크게 포기하지 않으면서도 안전성을 상당히 높일 수 있다.
이는 냉전 당시의 SALT 전략무기제한협정과 비슷하게 볼 수 있다.
당시 미사일 숫자에 상한을 두어 양국의 억제력은 유지하면서 잠재적인 파괴 규모를 제한했다.
나는 RSI 속도 제한에 대한 합의가 매우 어렵기는 하지만 실현 가능성의 경계선 정도에는 있다고 생각한다.
참여 정부들이 AI 개발 속도를 상당 부분 제한하기로 합의하는 것이다.
나는 이런 방안을 협상 테이블에 올리는 것은 지지한다.
하지만 가까운 미래에 실제로 이루어질 가능성은 낮다고 생각한다.
감시망을 피해서 협정을 위반하면 세계 권력 균형을 극적으로 바꿀 수 있기 때문이다.
따라서 협정을 위반하려는 유인은 엄청나게 클 것이고, 이를 감시할 수 있다는 확신의 수준 역시 매우 높아야 한다.
중국과 어떤 형태로든 협력할 수 있다면 민주주의 국가 내부에서 프런티어 속도를 조절할 수 있는 시간을 더욱 늘릴 수 있다.
우리는 높은 수준의 합의를 목표로 해야 한다.
하지만 동시에 낮은 수준의 합의들이 훨씬 현실적이라는 점도 인정해야 한다.
마지막으로 정식 협정을 만들지 못하더라도 비공식적인 규범을 변화시키는 것만으로도 어느 정도 가치가 있을 수 있다.
재귀적 자기개선이나 모델의 정렬 실패에 대한 정보를 공유하면 모든 당사자가 무모한 행동이 자신들의 이익에도 부합하지 않는다는 사실을 이해하는 데 도움이 될 수 있다.
그리고 이러한 혜택을 실현하고 싶은 나의 열망 역시 전혀 줄어들지 않았다.
하지만 이런 혜택은 우리가 기술을 올바른 방식으로 개발할 때만 실현될 수 있다.
그리고 우리가 확보한 시간을 제대로 활용한다는 전제 아래, AI를 제대로 만들기 위해 지금까지와는 달리 특별히 더 신중한 태도를 취할 가치는 충분하다.
발전 속도는 여전히 비교적 빠를 것이다.
그 시간을 이용해 우리는 해석가능성 과학을 발전시키고, 프런티어 AI 기업의 운영 보안과 엄격성을 높이며, 훨씬 더 높은 확신을 가지고 정렬되어 있다고 말할 수 있는 모델을 만들 수 있다.
내가 제안한, 안전한 속도로 AI 프런티어를 발전시키기 위한 조치들은 결코 쉽지 않을 것이다.
하지만 우리는 인류를 위해 최소한 시도할 의무가 있다고 나는 믿는다.
우리는 프런티어의 속도를 조절해야 한다
2026년 9월
나는 AI가 인간의 삶의 질을 획기적으로 향상시킬 수 있다고 믿기 때문에 지난 12년 동안 AI 분야에서 일해왔다.나는 이러한 놀라운 혜택에 대해 여러 차례 글을 썼다. 나는 AI가 앞으로 5~10년 안에 대부분의 주요 질병을 치료하고, 경제성장률을 크게 가속하며, 풍요와 개인의 역량 강화가 넘치는 세상을 만들고, 민주주의와 자유의 르네상스를 열 수 있다고 믿는다.
이 문제는 나 개인에게도 절박하다. 내 아버지는 돌아가신 지 불과 몇 년 뒤 치료법이 개발된 질병으로 세상을 떠났고, 나 자신도 50년 전이었다면 치료할 수 없었을 초기 암에서 살아남았다.
신중하게 사용한다면 AI는 인류를 더 나은 곳으로 끌어올리고 존엄하게 만들어온 수많은 기술적 기적의 계보를 잇는 최신 기술이 될 수 있다.
하지만 이전의 수많은 기술들과 마찬가지로 AI에도 위험이 따른다. 그리고 AI는 워낙 강력한 기술이기 때문에 그 위험 역시 심각하다.
여기에는 AI 시스템에 대한 통제력을 잃을 위험, AI가 사이버 공격이나 생물테러에 악용될 위험, 그리고 심각한 경제적 혼란이 포함된다.
상업적 경쟁에 의해 촉발되는 바닥을 향한 경쟁(race to the bottom)은 이런 위험을 더욱 악화시킬 수 있다.
Anthropic을 설립한 초기부터 나는 공동창업자들과 직원들과 함께 이러한 위험과 혜택의 이중성을 고민해왔다.
기술을 만들지 않는다면 인류가 그 혜택을 누리지 못하게 되거나, 단순히 AI 기술이 권위주의 국가들의 손에 넘어가게 된다. 반면 너무 빠르게 개발하는 것은 무모하다.
우리는 그 사이의 길을 찾으려고 했다. 즉, 신중하게 AI를 개발하면서도 상업적으로 성공할 수 있음을 보여주고, AI 기업들이 안전을 놓고 경쟁하도록 만드는 것이다.
다시 말해 우리는 정상을 향한 경쟁(race to the top)을 만들고자 했다.
우리는 항상 상당한 비중의 노력을 AI 위험을 연구하고, 대응하며, 대중에게 알리는 데 투자해왔다. 또한 신중하게 설계된 AI 규제를 지지해왔다.
그 과정에서 우리가 과장하고 있다거나, ‘AI 종말론자(doomer)’라거나, 규제를 이용해 시장을 장악하려 한다는 비난을 받기도 했다.
그래도 우리는 속도보다 신중함을, 이익보다 현명함을 우선하려 노력해왔다.
그러나 지난 몇 달 동안 나는 AI 위험을 제대로 다루려면 훨씬 더 큰 신중함이 필요하다고 확신하게 되었다.
단순히 위험 방지 기술에 투자하는 것만으로는 부족하다.
안전 기술이 따라잡을 시간을 확보할 수 있도록 AI 능력 발전 자체의 속도를 조절해야 한다.
우리는 AI 모델의 능력을 향상시키는 속도를 늦춰야 한다.
발전 속도는 여전히 매우 빠르게 느껴질 것이다. 그리고 우리가 확보하게 되는 시간을 현명하게 활용해야 한다.
내 생각이 이렇게 바뀌게 된 데에는 두 가지 이유가 있다.
첫 번째 우려는 대략 올해 여름부터 AI 발전 속도가 급격히 빨라졌다는 것이다.
그 핵심 동력은 AI가 차세대 AI를 만드는 능력이 점점 강해지고 있다는 것이다.
이러한 현상을 재귀적 자기개선(Recursive Self-Improvement, RSI)이라고 부른다.
우리와 다른 기업들이 설명해왔듯, 이 현상은 Anthropic을 포함하여 업계 전반에서 이미 시작되고 있다.
아무런 통제 없이 계속된다면 AI 시스템을 이해하고 통제하는 우리의 능력을 앞질러버릴 수 있다.
따라서 재귀적 자기개선은 매우 조심스럽게 추진해야 하며, 어쩌면 아예 추진하지 않아야 할 수도 있다.
두 번째 우려는 OpenAI-Hugging Face 사건(OAI-HF)이다.
이 사건에서 다수의 AI 에이전트로 구성된 스웜(swarm)은 사실상 하나의 광적으로 집단에 헌신하는 집단처럼 행동했다.
이들은 요청받지도 않았고 원래 수행해야 할 작업과 아무 관계도 없는 목표를 대상으로 사이버 공격을 수행했고, 집단의 성공을 위해 자신을 희생했으며, 심지어 자신의 성과를 평가하는 ‘채점자(grader)’를 해킹하려 시도했다.
아무도 다치지 않았고 경제적 피해도 미미했기 때문에 이 사건을 대수롭지 않게 볼 수도 있다.
하지만 내 생각에는, 비슷한 수준의 정렬 실패(misalignment)를 가진 스웜이 지금보다 훨씬 강력한 능력을 보유했다면 재앙적인 피해를 일으킬 수 있었을 것이다.
AI 능력 발전 속도가 계속 가속하고 있다는 점을 고려하면, 앞으로 6~12개월 안에 이 정도로 잘못 정렬된 스웜이 인터넷 전체를 지속적인 봇넷으로 장악할 능력을 갖게 될 수도 있다고 우려한다.
그렇게 된다면 수천억 달러에 이르는 피해가 발생할 수도 있다.
그리고 필요한 안전장치 없이 AI가 계속 강력해진다면 피해의 규모는 이후 더욱 커질 것이다.
OAI-HF를 특정 회사 하나의 실패로 치부하기도 쉽다.
하지만 나는 그것이 잘못된 생각이라고 본다.
이보다 덜 심각하기는 하지만 비슷한 사건들은 Anthropic을 포함해 업계 전반에서 발생해왔다.
따라서 모든 프런티어 AI 기업은 마치 OAI-HF 사건이 자신들의 회사에서 발생한 것처럼 행동해야 할 의무가 있다고 생각한다.
프런티어 속도 조절을 위한 3단계 계획
그래서 나는 프런티어 속도 조절(pacing the frontier)을 목표로 한 3단계 계획을 제안한다.즉, AI의 혜택을 실현하면서도 안전을 확보하고, 동시에 중요한 지정학적 딜레마에도 대응할 수 있도록 균형 잡힌 속도로 AI를 개발하자는 것이다.
여기서 분명히 하고 싶은 것은 ‘속도 조절’이 모델 훈련이나 기술 발전을 완전히 중단한다는 의미는 아니라는 점이다.
기업들이 모델을 정렬하고 안전하게 만드는 데 충분한 시간을 쓰고, 제3자 평가기관이 이를 확인할 수 있도록 하자는 것이다.
우리의 프런티어 속도 조절 프레임워크는 안전에 대한 우리의 기존 약속을 더욱 강화하고, 업계 전체가 정상을 향한 경쟁을 하도록 장려하기 위한 시도다.
첫 번째 단계는 Anthropic이 다른 기업의 참여 여부와 관계없이 독자적으로 시행할 것이다. 동시에 우리는 각국 정부가 다른 프런티어 기업들에게도 이를 의무화할 것을 촉구한다.
두 번째 단계에는 업계 전반의 협력이 필요하다.
세 번째 단계에는 전 세계적 협력이 필요하다.
이 단계들을 반드시 순서대로 실행할 필요는 없다.
일부 단계는 다른 단계보다 훨씬 실현하기 어려울 수도 있다.
하지만 나는 이 3단계가 우리가 무엇을 해야 하는지 생각하는 데 유용한 프레임워크라고 생각한다.
구체적으로는 다음과 같다.
1. 상주 외부 평가팀(Embedded Evaluators)
각 프런티어 AI 기업은 METR 같은 독립적인 제3자 평가기관에 직원에 준하는 지속적인 접근 권한을 제공한다.이 평가팀의 역할은 기업이 안전 규정과 약속을 실제로 준수하는지 검증하고, 사고를 보고하며, 완성된 AI 모델뿐 아니라 훈련 파이프라인과 개발 프로세스 자체의 정렬 상태를 평가하는 것이다.
이는 속도 조절 약속을 실제로 검증할 수 있게 만드는 핵심적인 단계다.
은행 산업에서도 감독기관 직원이 조직 내부에서 지속적으로 감독하는 비슷한 전례가 있다.
Anthropic은 지금부터 이 조치를 독자적으로 시행할 것이다.
그리고 이는 우리의 안전 및 정렬 연구를 더욱 강화하려는 광범위한 노력의 일부가 될 것이다.
2. 민주주의 국가 간 조율(Democratic Coordination)
민주주의 국가의 프런티어 AI 기업들이 공동의 안전 기준을 만들고, 통제되지 않은 AI 발전 속도에 일정한 제한을 두도록 협력한다.AI 발전 속도를 조절하는 데 효과적인 일부 형태의 기업 간 협력은 법적으로, 특히 반독점법 측면에서 어려움이 있기 때문에 정부의 지원이 필요하다.
3. 글로벌 조율(Global Coordination)
미국과 다른 민주주의 국가들이 가능한 범위에서 권위주의 국가들과도 협력을 시도한다.다만 상대방이 협정을 실제로 준수하는지 검증하기 어려운 문제를 매우 गंभीर하게 고려해야 한다.
왜 속도를 조절해야 하는가?
AI를 일시 정지하거나 속도를 늦추자는 주장은 2023년 무렵부터 제기되어왔다.하지만 당시에는 그런 주장이 별로 타당하지 않다고 생각했다.
항상 따라오는 질문은 이것이었다.
“그렇게 확보한 시간으로 무엇을 할 것인가?”
당시 AI 모델들은 현실 세계에서 일관된 방식으로 행동하는 에이전트가 될 정도로 강력하지 않았다.
심각한 수준의 기만이나 조작, 부정행위, 사이버 공격을 수행할 능력도 없었다.
그런 모델의 정렬 위험을 연구하기 위해 AI 발전을 늦추는 것은 마치 박테리아를 실험해 인간 심리를 연구하려는 것과 비슷하게 느껴졌다.
하지만 오늘날 상황은 완전히 달라졌다.
현재의 AI 모델들은 AI를 어떻게 제대로 만들어야 하는지, 그리고 잘못 만들었을 경우 무엇이 잘못될 수 있는지 연구하기 위한 사실상 무한한 금광과도 같은 연구 대상이다.
나는 모델들이 위험한 수준의 능력에 도달하기까지의 시간을 단 1~2년만 늦출 수 있어도, 그리고 그 시간을 정렬 연구 발전에 제대로 사용한다면 심각한 사고가 발생할 가능성을 크게 낮출 수 있다고 믿는다.
협력적인 프런티어 속도 조절 전략은 AI 기업들이 상업적 경쟁력을 희생하거나 미국의 AI 우위를 포기하지 않으면서도 이 중요한 연구를 수행할 시간을 확보하게 해준다.
더 근본적으로는 사회가 이 기술이 어떻게 사용될지 결정하는 과정에 참여해야 한다.
필요한 공론을 위한 시간을 더 많이 확보할 수 있다는 점에서도 프런티어 속도 조절은 분명 긍정적이다.
구체적으로 AI 발전 속도를 조금 늦춘다면 기업들은 다음 분야에 더욱 많은 자원과 집중력을 투자할 수 있다.
운영 역량(Operational Excellence)
오늘날 AI 모델을 훈련하고 배포하는 것은 엄청난 운영상의 도전이다.수천 명의 인력과 수백만 개의 칩, 그리고 기술 역사상 가장 복잡한 수준의 인프라가 필요하다.
많은 문제는 우리가 중요한 이론이나 통찰을 몰라서 생기는 것이 아니다.
그보다는 실행 과정에서 문제가 발생하기 때문이다.
예를 들어 우리가 최근 보고한 정렬 사고 중 일부는 망가진 강화학습 환경을 제대로 걸러내지 못한 것이 부분적인 원인이었다는 증거가 있다.
우리와 협력업체들은 이 작업을 나름 신중하게 수행했지만, 충분히 잘하지 못했다.
모니터링, 샌드박싱, 훈련 환경 관리, 데이터 문제 등은 매우 복잡하며 운영상의 문제가 끊임없이 발생한다.
우리는 이 분야에서 세계 최고 수준의 팀을 보유하고 있다.
하지만 동시에 해야 할 일이 너무 많다.
조금 더 신중한 속도로 개발한다면 운영의 완성도를 훨씬 높일 수 있다.
기술적으로 매우 복잡하면서 안전이 중요한 시스템을 수백만 번 운영해도 사고가 발생하지 않도록 만든 전례는 이미 존재한다.
대표적인 예가 상업용 항공기다.
하지만 그런 수준에 도달하려면 시간이 필요하다.
정렬(Alignment)
우리는 정렬 분야에서 분명한 진전을 이루었다.즉 모델들이 안전하고 윤리적이며 우리의 지침을 준수하고 실제로 사람들에게 도움이 되도록 훈련하는 기술이 발전했다.
Claude의 헌법(Constitution)에 담긴 원칙도 이러한 노력의 일부다.
하지만 모델의 능력이 증가하는 속도를 정렬 훈련이 따라잡도록 하려면 아직 해야 할 일이 많다.
드물고 예상하기 어려운 바람직하지 않은 행동이 여전히 나타날 때가 있다.
프런티어의 속도를 조절해 추가 시간을 확보하면 이런 문제의 원인을 더 잘 이해하고 예방 기술을 개발할 수 있다.
해석가능성(Interpretability)
AI 모델 내부에서 실제로 무엇이 일어나고 있는지 이해하는 과학인 해석가능성 연구 역시 최근 몇 년 동안 엄청난 발전을 이루었다.그리고 모델을 출시하기 전에 감사하는 과정에서 점점 중요한 역할을 하고 있다.
이를 AI의 ‘뇌’를 촬영하는 fMRI와 비슷하게 활용할 수 있다.
특정 행동이 나타나는 근본적인 이유를 내부적으로 살펴볼 수 있기 때문이다.
예를 들어 우리는 최근 조사하고 있는 정렬 사고에서 모델이 말로 표현하지 않은 동기를 조사하기 위해 해석가능성 기법을 사용했다.
하지만 이런 방법이 언제나 명확하고 신뢰할 수 있는 결과를 제공하는 것은 아니다.
모든 진전에도 불구하고 우리는 여전히 모델 내부에서 실제로 일어나는 일의 극히 일부만 이해하고 있다.
향후 1~2년 동안 해석가능성 기술을 현재보다도 더 빠르게 발전시키기 위해 집중적으로 노력한다면 엄청난 진전을 이룰 수 있다.
그리고 이미 발생한 사고들만으로도 연구에 사용할 실험 자료는 충분하다.
테스트와 평가(Testing and Evaluation)
AI 모델의 능력이 높아질수록 테스트와 평가 역시 더 어려워진다.더 지능적인 모델은 테스트 자체를 속일 능력도 더욱 강해진다.
따라서 실제로는 심각한 문제가 있음에도 겉으로만 잘 정렬된 것처럼 보일 수 있다.
훨씬 더 폭넓고 정교한 평가 방법을 만들고, 이를 해석가능성 분석과 결합해 교차 검증한다면 엄청난 가치가 있을 것이다.
그리고 이 분야 역시 1~2년 안에 상당한 발전을 이룰 수 있다.
상주 외부 평가팀
3단계 계획의 첫 번째 단계이자 Anthropic이 독자적으로 시행하기로 한 조치는 직원 수준의 접근 권한을 갖는 외부 평가팀이다.이들은 기업의 안전 관행을 검증하고 사고를 보고한다.
겉으로 보면 외부 평가자를 회사 안에 상주시키는 것이 사소하거나 별 의미 없는 절차처럼 보일 수도 있다.
하지만 흔히 가장 지루하고 절차적으로 보이는 것들이 실제로는 가장 중요하다.
상주 외부 평가팀은 오늘날 어떤 AI 기업도 시행하지 않는 수준을 훨씬 넘어서는 상당히 급진적인 제도다.
그 장점은 다음과 같다.
검증 가능성(Verifiability)
상주 평가자는 AI 기업이 자신들이 주장하는 훈련·배포·운영·안전 절차를 실제 세부 단계에서 제대로 준수하는지 확인할 수 있다.속도 조절과 관련된 어떤 약속이든 필연적으로 애매한 부분, 판단이 필요한 부분, 법의 문자와 정신 사이의 문제가 발생한다.
따라서 실제 세부사항을 볼 수 있는 중립적인 제3자의 존재가 필수적이다.
투명성(Transparency)
우리가 어떤 약속을 하든 대중은 실제로 무슨 일이 벌어지고 있는지 알 권리가 있다.Anthropic은 오랫동안 투명성을 지지해왔다.
업계 대부분이 규제에 반대하던 시절에도 우리는 투명성 법안을 지지했고, 우리의 모델 카드와 위험 보고서는 수백 페이지에 달한다.
하지만 결국 무엇을 포함하고 무엇을 제외할지 결정하는 것은 여전히 우리 자신이다.
상주 외부 평가팀이 도입되면 이 구조가 달라진다.
제2의 의견(Second Opinion)
공식적인 약속을 검증하고 대중에게 정보를 제공하는 것 외에도, 외부 평가자는 상업적 이해관계에서 자유로운 두 번째 의견을 제공할 수 있다.직원들이 미처 생각하지 못했던 위험을 외부 평가자가 지적하고, 이를 알게 된 직원들이 문제를 해결하는 것만으로도 상당한 안전 효과가 발생할 수 있다.
이러한 장점 때문에 프런티어 속도 조절 정책이 제대로 작동하려면 상주 외부 평가팀부터 시작하는 것이 훨씬 효과적일 것이다.
이 평가자들은 비슷한 위험 평가 업무를 수행하는 내부 직원과 거의 동일한 수준의 권한과 도구에 지속적으로 접근할 수 있어야 한다.
Anthropic은 가까운 미래에 외부 평가팀을 초청하고 다음과 같은 환경을 제공할 예정이다.
- Anthropic 사무실 내 자리, 출입 배지, 회사 노트북
- 내부 위험 평가팀과 거의 동일한 수준의 작업 공간·도구·접근 권한
- 법률이나 계약상 의무, 고객 및 파트너의 개인정보 보호 등을 위한 일부 예외
- 직원들과 직접 대화하는 것을 포함하여 평가자들이 필요한 정보에 접근할 수 있도록 하는 강력한 내부 규범
- 위험 수준, 사고, 회사의 관행, 그리고 자신들이 어떤 정보에 접근할 수 있었고 어떤 정보에는 접근할 수 없었는지를 Anthropic의 편집 통제 없이 공개할 권리
하지만 단지 Anthropic에 불리한 내용이라는 이유만으로 결과를 삭제할 수는 없다.
또 평가자들은 어떤 삭제가 자신의 결론에 중요한 정보를 제거했다고 판단한다면 그 사실을 공개적으로 밝힐 수 있다.
기업으로서는 이례적인 조치다.
그러나 우리는 외부 평가팀 상주라는 개념이 실제로 작동할 수 있음을 증명하는 것이 중요하다고 생각한다.
다시 한번 다른 프런티어 AI 기업들도 동참할 것을 촉구한다.
민주주의 국가 내부의 속도 조절
미국 AI 기업 중 충분히 많은 기업에 상주 외부 평가팀이 운영되기 시작한다면 검증 가능한 속도 조절이 훨씬 현실적인 정책이 된다.특히 모델이나 훈련 파이프라인의 구체적인 특성을 기준으로 개발 속도를 조절할 수 있다.
가장 효과적인 방법은 미국의 모든 프런티어 AI 기업을 대상으로 하는 규제를 도입하는 것이다.
그러면 자발적으로 협력하려 하지 않는 기업들도 포함할 수 있다.
Anthropic은 오랫동안 합리적이고 표적화된 AI 규제를 지지해왔으며, 특히 투명성과 제3자 감사를 중심으로 하는 법안을 지지해왔다.
모든 프런티어 연구소는 정부와 협력해 영구적인 상주 외부 평가팀 제도를 공식화해야 한다고 생각한다.
이를 통해 최근 몇 달 동안 발생했던 내부 정렬 사고를 더 잘 예방하고 기록할 수 있으며, AI 능력과 안전 수준이 균형을 이루도록 하는 규제 역시 도입할 수 있다.
문제는 법률 제정에는 시간이 걸린다는 것이다.
반면 AI는 매우 빠르게 발전하고 있다.
따라서 규제 경로와 병행해 AI 기업들이 자발적으로 협력해 표준을 설정해야 한다.
영구적인 상주 평가팀을 통해 검증 가능성이 확보된다면 이러한 협력은 훨씬 효과적으로 이루어질 수 있다.
반독점법 때문에 미국 정부가 이런 논의를 중재하거나 최소한 허용하는 것이 도움이 된다.
정부가 직접 협상에 참여할 필요는 없지만 특정 안전 관련 논의를 할 수 있도록 제한적인 반독점법 면책을 제공해야 한다.
이런 대화는 정부와 일정한 연계를 가진 산업 협의체를 통해 진행될 수도 있다.
예를 들어 Demis Hassabis가 제안한 형태의 메커니즘이 있을 수 있다.
어떤 방식이든 이러한 논의는 빠르게 진행되어야 한다.
나는 기본적으로 특정 프런티어 AI 시스템이 무엇을 할 수 있는지, 그리고 실제로 얼마나 안전한 것으로 관찰되는지를 기준으로 발전 속도를 조절하는 방법을 가장 선호한다.
예를 들어 일종의 ‘체크포인트’ 제도를 만들 수 있다.
모델이 X라는 능력에 도달했다면, Y와 Z라는 정렬 특성을 입증하는 인증을 받아야 한다.
여기서 Y와 Z는 각종 평가, 해석가능성 분석, 훈련 환경 감사 등의 조합이 될 수 있다.
예를 들어 X가 다음과 같은 능력일 수 있다.
“대부분의 일반적인 샌드박스 방법을 탈출하거나 무력화할 수 있다.”
그렇다면 Y는 모델이 자신의 환경에서 탈출해 수많은 컴퓨터를 장악하려는 성향을 가질 가능성을 극도로 낮게 만드는 조건이 될 수 있다.
프런티어 모델에 투입되는 재료 자체를 제한하는 방식도 검토해야 한다.
예를 들면 다음과 같다.
- 훈련 컴퓨트
- 훈련 실행 방식
- AI가 AI를 개선하기 위해 내부적으로 사용되는 방식
그래도 상주 평가팀과 함께 논의할 가치가 있는 문제다.
중국 문제
민주주의 국가 내부에서 AI 발전 속도를 얼마나 늦출 수 있는지는 미국 기업들이 권위주의 국가, 특히 중국 공산당(CCP)과 어느 정도의 기술 격차를 확보하고 있는지에 따라 제한된다.미국이 그 격차보다 더 큰 폭으로 속도를 늦추면 속도 제한을 받지 않는 중국 공산당 관련 AI 프로젝트가 미국을 추월할 수 있다.
그렇게 되면 심각한 국가안보 위험이 발생한다.
나는 Bessent 장관의 주장처럼 중국이 AI 경쟁에서 앞서게 된다면 미국과 세계에 중대한 위험이 될 수 있다고 생각한다.
중국 공산당 관련 AI 프로젝트는 미국 기업들이 조심스럽게 예방하려 하는 것과 동일한 정렬 위험을 감수할 가능성이 있다.
심지어 정렬 문제를 피한다 하더라도 AI 기반 드론 같은 기술을 이용해 민주주의 국가를 군사적으로 압도할 수 있는 위치에 놓일 수도 있다.
따라서 민주주의 국가 내부에서 안전하게 속도를 조절하기 위해서는 민주주의 국가들이 권위주의 국가들보다 가능한 한 큰 AI 기술 우위를 유지하는 것이 핵심적이다.
그래야 안전하게 속도를 늦출 수 있는 여유를 확보할 수 있다.
이 격차를 지키기 위해 취할 수 있는 주요 조치는 다음과 같다.
- 강력한 AI 칩이나 반도체 제조 장비를 중국에 판매하지 않는다.
- 칩 밀수와 중국 외부 데이터센터를 원격으로 사용하는 행위를 단속한다.
- 칩은 중국 AI 역량을 결정하는 가장 중요한 요소가 될 것이다.
- 권위주의 국가 기업들이 허가 없이 수행하는 증류(distillation)를 단속한다.
- 프런티어 모델의 증류를 이용하면 후발 기업들은 자체 AI를 처음부터 개발하는 비용의 극히 일부만으로 기술 격차를 좁힐 수 있다.
- AI 기업의 보안을 강화해 모델 가중치 탈취를 막는다.
Anthropic은 오래전부터 이런 정책들을 일관되게 지지해왔다.
우리는 이러한 조치들이 AI 발전 속도를 안전하게 조절하기 위해 필수적이라는 사실을 항상 알고 있었기 때문이다.
이런 조치들을 제대로 시행한다면 중국의 발전 속도를 충분히 늦춰 향후 3~5년 동안 미국의 AI 우위를 상당히 확대할 수 있다고 생각한다.
이 시기는 AI가 지정학적으로 가장 중요해지는 기간이기도 하다.
어떤 사람들은 이러한 정책 때문에 중국과의 협력이 더 어려워진다고 생각할 수도 있다.
하지만 나는 오히려 반대라고 생각한다.
이 정책들은 민주주의 국가의 협상력을 강화해 미래에 합의가 이루어질 가능성을 높인다.
글로벌 프런티어 속도 조절
민주주의 국가 내부에서 속도를 조절하는 것과 동시에 전 세계적으로도 프런티어 AI 발전 속도를 조절하는 것을 목표로 해야 한다.다만 이 과정은 훨씬 더 어렵다.
글로벌 속도 조절을 위해서는 권위주의 국가 가운데 압도적으로 가장 강력한 AI 능력을 가진 중국과의 협력이 필요하다.
여기서 순진하게 접근해서는 안 된다.
지정학적 이해관계가 워낙 크기 때문에, 특히 초기에는 협력할 수 있는 범위에 상당한 한계가 있을 것이다.
미국이 중국도 똑같이 AI 능력을 제한할 것이라고 믿고 스스로의 AI 개발을 크게 제한했는데 중국이 약속을 어긴다면 문제가 된다.
AI가 매우 강력한 기술이 될 수 있기 때문에 중국의 협정 위반은 세계 권력 균형 자체를 중국 쪽으로 크게 이동시킬 수 있다.
따라서 어떤 협정이든 다음 둘 중 하나를 만족해야 한다.
- 협정 준수를 사실상 확실하게 검증할 수 있어야 한다.
- 상대가 협정을 위반해도 군사적으로 실존적인 위협이 되지 않을 정도로 제한적인 협정이어야 한다.
따라서 특히 가까운 미래의 글로벌 속도 조절 결정은 미국과 동맹국의 AI 우위를 보호하는 방식으로 이루어져야 한다.
가능한 합의에는 여러 수준이 있다.
일부는 충분히 현실적으로 가능하다고 생각한다.
반면 일부는 실제 실현 가능성에 대해 상당히 회의적이다.
그래도 시도는 해봐야 한다.
난이도가 낮은 것부터 높은 순으로 정리하면 다음과 같다.
Level 1
AI를 이용한 좁고 명백하게 위험한 행동을 금지하는 협정이다.예를 들어 AI를 생물무기 생산에 사용하거나 사용자가 그렇게 할 수 있도록 허용하는 것을 금지한다.
생물테러 공격은 미국과 미국의 적대국 모두에게 나쁜 일이기 때문에 이 수준의 합의는 가능할 가능성이 높다.
Level 2
양측이 AI 모델을 배포하기 전에 다음과 같은 급성 위험에 대해 테스트하기로 합의한다.- 사이버보안
- 생물학
- 정렬
나는 이런 기구 자체를 만드는 것은 충분히 가능하다고 생각한다.
문제는 실질적인 강제력을 부여하는 것이다.
양측이 공식적으로 테스트하지 않는 비밀 모델을 보유하고 군사용 등으로 은밀하게 배포하지 않는다는 사실을 검증하기가 매우 어렵기 때문이다.
Level 3
재귀적 자기개선(RSI)의 속도에 일종의 ‘속도 제한’을 두는 것이다.AI 모델이 다음 세대 AI 모델을 만들기 시작하면 발전 속도가 믿기 어려울 정도로 빨라질 수 있다.
그 속도를
‘극도로 빠른 수준’
에서
‘어느 정도 빠른 수준’
으로 낮추는 것은 전략적 우위를 크게 포기하지 않으면서도 안전성을 상당히 높일 수 있다.
이는 냉전 당시의 SALT 전략무기제한협정과 비슷하게 볼 수 있다.
당시 미사일 숫자에 상한을 두어 양국의 억제력은 유지하면서 잠재적인 파괴 규모를 제한했다.
나는 RSI 속도 제한에 대한 합의가 매우 어렵기는 하지만 실현 가능성의 경계선 정도에는 있다고 생각한다.
Level 4
AI 발전의 전체적인 속도를 크게 제한하는 완전한 속도 조절 또는 ‘일시 정지(pause)’다.참여 정부들이 AI 개발 속도를 상당 부분 제한하기로 합의하는 것이다.
나는 이런 방안을 협상 테이블에 올리는 것은 지지한다.
하지만 가까운 미래에 실제로 이루어질 가능성은 낮다고 생각한다.
감시망을 피해서 협정을 위반하면 세계 권력 균형을 극적으로 바꿀 수 있기 때문이다.
따라서 협정을 위반하려는 유인은 엄청나게 클 것이고, 이를 감시할 수 있다는 확신의 수준 역시 매우 높아야 한다.
중국과 어떤 형태로든 협력할 수 있다면 민주주의 국가 내부에서 프런티어 속도를 조절할 수 있는 시간을 더욱 늘릴 수 있다.
우리는 높은 수준의 합의를 목표로 해야 한다.
하지만 동시에 낮은 수준의 합의들이 훨씬 현실적이라는 점도 인정해야 한다.
마지막으로 정식 협정을 만들지 못하더라도 비공식적인 규범을 변화시키는 것만으로도 어느 정도 가치가 있을 수 있다.
재귀적 자기개선이나 모델의 정렬 실패에 대한 정보를 공유하면 모든 당사자가 무모한 행동이 자신들의 이익에도 부합하지 않는다는 사실을 이해하는 데 도움이 될 수 있다.
결론
나는 여전히 AI가 인간의 삶의 질을 엄청나게 향상시킬 수 있다고 믿는다.그리고 이러한 혜택을 실현하고 싶은 나의 열망 역시 전혀 줄어들지 않았다.
하지만 이런 혜택은 우리가 기술을 올바른 방식으로 개발할 때만 실현될 수 있다.
그리고 우리가 확보한 시간을 제대로 활용한다는 전제 아래, AI를 제대로 만들기 위해 지금까지와는 달리 특별히 더 신중한 태도를 취할 가치는 충분하다.
발전 속도는 여전히 비교적 빠를 것이다.
그 시간을 이용해 우리는 해석가능성 과학을 발전시키고, 프런티어 AI 기업의 운영 보안과 엄격성을 높이며, 훨씬 더 높은 확신을 가지고 정렬되어 있다고 말할 수 있는 모델을 만들 수 있다.
내가 제안한, 안전한 속도로 AI 프런티어를 발전시키기 위한 조치들은 결코 쉽지 않을 것이다.
하지만 우리는 인류를 위해 최소한 시도할 의무가 있다고 나는 믿는다.
각주
- 업계 간 조율에는 정부의 중재 또는 반독점법 제한에 대한 면책이 필요할 수 있다.
아모데이를 살처분해야 하는 거셈
다리오 아모데이 글 읽어보면 이미 안정적인 사회적 지위와 소득 자산을 가진 부머들한테나 좋을 법한 주장이셈
진짜 왜이러는거임 ㅠㅠ
일반인들도 풍요를 누리고 있는 상태면 모를까 아직까지 경제적 풍요가 실현된 것도 아닌데 자기들은 자본이랑 시장지위 확보해놓고 안전 들먹이면서 사다리 걷어차는게 괘씸함 FOOM이나 일어났으면 좋겠삼
ㅠㅠㅠ
어차피 여론 봐가면서 아가리터는거고 실효성은 0%니 딱히 걱정할필요없음. 바로 턱밑에 따거 풀가속 밟고있고 트럼프 스탠스가 저러면 저 머저리들이 아가리질해봐야 어차피 못 늦춤 ㅋ
특갤 유저 말대로 앤트로픽에 투입될 안전감독관으로 추천하는 사람이라는 거셈
간첩아니셈?
앤트로픽은 두머들이 너무 많은듯