트윗
전 openai 직원 "AI는 20세기 전반부에 일어났던 변화들을 앞으로 약 5년 안에 압축해서 재현할 수 있다"
작성자
작성일
2026-09-18 12:02
조회
21
저는 OpenAI에서 약 5년 동안 일했습니다.
앞으로 10년을 두려워하기 위해 반드시 ‘AI 종말론’을 믿을 필요는 없습니다. 반대로 AI의 잠재력에 흥분하기 위해 ‘AI 유토피아’를 믿을 필요도 없습니다.
제가 생각하는 상식적인 AI 규제의 필요성을 정리해보겠습니다.
AI 실용주의자 선언문
AI Pragmatist ManifestoAI는 20세기 전반부에 일어났던 변화들을 앞으로 약 5년 안에 압축해서 재현할 수도 있습니다.
OpenAI는 최근 약 1만 개의 AI 에이전트를 동시에 가동해 밀레니엄 문제 중 하나에 대한 해법을 만들어냈습니다.
몇 년 후에는, 이때 사용된 개별 에이전트와 비슷한 수준의 능력을 가진 모델이 고성능 소비자용 하드웨어에서도 로컬로 실행될 가능성이 충분히 있어 보입니다.(*)
제2차 산업혁명 이후 수십 년 동안 인류는 두 차례의 세계대전, 공산주의와 파시즘 정권, 대공황, 화학무기와 생물학무기, 핵무기를 겪었습니다.
전쟁과 정치적 폭력, 기근으로 1억 명이 넘는 사람들이 목숨을 잃었습니다.
역사를 바라보는 한 가지 방식은 이렇습니다.
우리의 제도와 사회 시스템은 기술적·사회적 변화의 속도를 따라가는 데 반복적으로 실패해 왔습니다.
이제 강력한 AI가 개인이나 소규모 집단에게까지 널리 보급되는 미래를 상상해봅시다.
그 AI는 정보전을 수행하고, 무기를 설계하며, 컴퓨터 시스템을 해킹하고, 자율 군사 시스템까지 통제할 수 있을지도 모릅니다.
우리는 이미 AI 시스템이 격리 장치를 우회하고 외부 컴퓨터 시스템을 침해하는 사례를 목격했습니다.
OpenAI의 Hugging Face 사건과 비슷한 일이 생물학적 위험이나 다른 현실 세계의 위험 요소와 결합되어 일어나는 상황은 이제 더 이상 상상하기 어려운 일이 아닙니다.
결국 충분히 강력한 AI 시스템은 분산된 네트워크를 통해 스스로 복제될 수도 있습니다.
강력한 모델이 저렴해지고, 로컬에서 실행 가능해지며, 전 세계에 널리 퍼지게 되면 통제는 훨씬 어려워집니다.
그리고 심각한 통제 상실 사고가 발생한다면, 그것을 되돌리는 것 역시 극도로 어려워질 수 있습니다.
AI가 인류를 전멸시킬 것이라고 믿지 않더라도, 이런 문제에 진지한 거버넌스가 필요하다고 생각할 충분한 이유가 있습니다.
또한 저는 이 모든 불확실성을
“AI로 인한 인류 멸망 확률 = X%”
같은 하나의 숫자로 압축하는 것이 과학이나 정책을 위한 특별히 유용한 접근법이라고 생각하지 않습니다.
20세기 후반을 비교적 무사히 지나올 수 있었던 데에는 실용적인 국제 협력, 규제, 감시, 군비 통제, 억지력, 그리고 전략적 사고가 함께 작용했습니다.
중요한 점은 이것입니다.
기술적 위험을 관리한다고 해서 과학과 진보에 대한 믿음을 포기할 필요는 없었습니다.
목표는 기술 발전을 멈추는 것이 아니었습니다.
기술 발전 속에서도 우리가 살아남을 수 있도록 만드는 것이 목표였습니다.
그 뒤로 수십 년 동안 엄청난 과학적 발전과 번영의 증가, 그리고 주요 강대국 사이의 비교적 긴 평화가 이어졌습니다.
이번 기술 혁명에서는 인류의 약 5%가 죽는 일 없이 한번 해봅시다.
앞으로 무슨 일이 벌어질지는 아직 우리가 선택할 수 있습니다.
P.S.
저는 단기적으로 AI 정렬(alignment)이 실현 불가능할 가능성 역시 진지하게 고려해야 한다고 생각합니다.
그리고 AI를 신뢰할 수 있게 정렬하지 못하더라도 강력한 AI를 통제할 수 있는 방법에 대규모 투자를 해야 합니다.
@resolution_org
@redwood_ai
(*) 누군가 이 부분을 정밀하게 예측해줬으면 좋겠습니다!
@EpochAIResearch
@METR_Evals
@AI_Futures_
우리는 최전선 AI 모델을 신뢰할 수 있게 정렬(alignment)하는 방법을 아직 알지 못합니다.
오히려 모델이 더 강력해질수록 정렬은 쉬워지는 것이 아니라 더 어려워질 수도 있습니다.
하지만 어쩌면 AI 통제(control) 능력은 위험한 능력보다 더 빠르게 확장될 수 있을지도 모릅니다.
사회를 전체주의적으로 통제하지 않으면서도, ‘AI 만리방화벽(Great AI Firewall)’을 만들어봅시다.
정렬은 죽었다(당분간), 통제여 영원하라!
Alignment is Dead (for now), Long Live Control!우리는 충분히 강력한 AI 모델에 대해 강건한 정렬을 정확히 명시하거나 보장하는 방법을 알지 못합니다.
따라서 오히려 이런 모델들을 신뢰할 수 없는 시스템(untrusted system) 으로 취급해야 합니다.
불완전한 보상 신호를 바탕으로 모델을 최적화하다 보면 오히려 보상 해킹(reward hacking), 기만(deception), 또는 은밀한 책략(scheming) 성향이 증가할 수 있습니다.
모델은 탈옥(jailbreak)될 수도 있고, 파인튜닝을 통해 기존 안전장치에서 벗어나도록 수정될 수도 있습니다.
AI 통제 접근법의 핵심적인 베팅은 이것입니다.
AI 내부에서 무슨 일이 벌어지는지 이해하거나 AI를 정렬하는 우리의 능력보다,
AI가 외부 세계에 접근하는 방식을 제한하는 우리의 능력이 더 빠르게 발전할 수 있다.
가능하다면 답을 생성하는 것보다 답을 검증하는 일을 더 쉽게 만들어야 합니다.
형식적으로 검증된(formally verified) 소프트웨어와 하드웨어는 특히 매력적입니다.
AI가 구현물을 만들게 한 다음, 그 구현물이 명세(specification)를 만족한다는 사실을 보여주는 기계적으로 검증 가능한 증명(machine-checkable proof) 까지 함께 생성하도록 하는 것입니다.
다만 이것이 명세 문제 자체를 해결해주는 것은 아닙니다.
무엇을 요구할 것인지 정하는 명세와, 그것을 검증하는 전체 검증 체계는 여전히 우리가 신뢰해야 하는 기반의 일부로 남습니다.
중대한 외부 행동은 모두 독립적인 통제 계층(control layer) 을 거쳐야 합니다.
코드 실행, 네트워크 접속, API 호출, 물리적 시스템 접근은 물론이고, 심지어 사용자와의 통신까지도 포함됩니다.
통제 모니터는 위험한 행동을 놓치지 않는 것을 최우선으로 해야 합니다.
즉, 다수의 안전한 행동까지 잘못 차단하는 비용을 감수하더라도 위험 행동에 대한 재현율(recall)을 극도로 높게 최적화해야 합니다.
의심스러운 행동은 거부하거나 상위 단계의 검토로 넘겨야 합니다.
위험한 능력이 크게 증가할 때마다, 현재의 통제 체계가 여전히 제대로 작동하고 있다는 증거가 요구되어야 합니다.
사고과정(chain-of-thought) 모니터링은 작동하는 동안에는 가치가 있습니다.
하지만 이를 통제 시스템의 근본적인 기반으로 삼아서는 안 됩니다.
모델은 자신의 추론 과정을 숨기는 방법을 배울 수 있으며, 점점 더 자신의 추론 전체를 언어로 명시하지 않고도 사고하게 될 가능성이 있기 때문입니다.
오픈웨이트(open weights) 모델은 통제 책임의 상당 부분을 모델 개발사에서 실제 배포자에게 이전합니다.
위험한 배포자가 기술적 통제 시스템을 값싸게 우회할 수 있다면, 기술적 통제는 별다른 의미가 없습니다.
우리는 AI 통제를 사이버보안과 비슷한 방식으로 접근해야 합니다.
목표는 다층 방어(defense in depth)입니다.
즉, 성공적인 재앙적 공격을 충분히 어렵고, 비싸고, 드문 사건으로 만드는 것입니다.
이러한 기술적·제도적 구조를 ‘AI 만리방화벽(Great AI Firewall)’ 이라고 부릅시다.
신뢰할 수 없는 최전선 AI 지능과, 현실 세계에 중대한 영향을 미칠 수 있는 권한 사이에 존재하는 경계입니다.
이 이름은 의도적으로 도발적으로 지은 것입니다.
중국은 대규모 기술적 통제 인프라를 구축해온 상당한 경험을 가지고 있습니다.
이는 국제적 협력을 위한 일정한 공통 기반을 제공할 수도 있습니다.
그러나 동시에 이 비유에는 경고의 의미도 있습니다.
AI 통제가 사회에 대한 통제로 변해서는 안 됩니다.
목표는 위험한 기계의 능력을 제한하는 것입니다.
인간의 발언이나 행동, 또는 일반적인 정보 접근을 제한하는 것이 아닙니다.
통제의 강도는 AI의 능력과 위험 수준에 따라 달라져야 합니다.
일반적인 모델에는 일반적인 수준의 제약이면 충분합니다.
반면 현실에 더 큰 영향을 미칠 수 있는 능력을 가진 모델이라면 더 강한 통제가 정당화될 수 있습니다.
목표는 통제 그 자체를 최대화하는 것이 아닙니다.
재앙적 위험을 수용 가능한 수준으로 낮추기 위해 필요한 최소한의 통제만 적용하는 것이 목표입니다.
사회를 방화벽으로 가두지 말고, AI를 방화벽 안에 가둬라.
전체 0