인터뷰/예측
제리 트워렉 "2024년의 나는 2025년에 AGI가 올 것이라고 생각했다"
작성자
작성일
2026-07-30 18:56
조회
3
자동화된 AGI 연구소 구축
Core Automation 공동창업자 제리 트워렉 인터뷰 정리
인터뷰어: 소니아 조셉인터뷰이: 제리 트워렉, Core Automation 공동창업자
주요 주제: 트랜스포머의 한계, 지속학습, 테스트 시점 학습, AGI의 정의, AI 연구 자동화
1. “트랜스포머를 대체하려면 먼저 트랜스포머가 우리를 얼마나 멀리 데려왔는지 이해해야 한다”
인터뷰어:최근 당신은 “트랜스포머를 대체하기 위한 첫 단계는 트랜스포머가 우리를 얼마나 멀리 데려왔는지 깊이 이해하는 것”이라고 말했습니다. 트랜스포머에 대한 추도사 같은 이야기인가요?
제리 트워렉:
트랜스포머를 제대로 평가한다는 것은 그것이 무엇을 잘하고, 무엇을 잘하지 못하는지를 정확히 이해한다는 뜻입니다.
현재 많은 아키텍처 연구는 트랜스포머를 더 저렴하고 효율적으로 만드는 데 집중하고 있습니다. 하지만 트랜스포머를 더 강력하게 만들거나, 현재 표현하지 못하는 것을 표현하도록 만드는 연구는 상대적으로 드뭅니다.
어떤 시스템의 강점을 이해하는 것과 약점을 이해하는 것은 사실 거의 같은 일입니다. 둘 다 그 시스템의 전체적인 형태와 능력의 경계를 파악하는 과정이기 때문입니다.
우리는 지난 6년 동안 매우 큰 모델을 훈련하는 데 능숙해졌습니다. 특히 두 가지 알고리즘을 대규모로 다루는 방법을 익혔습니다.
- 대규모 사전학습
- 대규모 강화학습
현재 더 나은 모델과 더 지능적인 시스템을 만드는 데 가장 큰 병목은 아키텍처 자체라고 생각합니다. 지난 6년 동안 우리는 사실상 어텐션과 MoE라는 비슷한 연산에 더 많은 파라미터를 추가하는 기차를 계속 타고 있었습니다. 이제는 그 경로를 다시 검토할 때입니다.
2. “Codex가 이렇게 유용한데, 왜 여전히 내가 출근해야 하는가?”
인터뷰어:현재의 코딩 에이전트들은 어떻게 평가합니까?
제리 트워크:
저는 Codex나 Claude Code 같은 시스템에 매우 감사하고 있습니다. 코딩과 업무 자동화 측면에서 지난 6년간의 스케일링이 만들어낸 놀라운 결과물입니다.
하지만 Codex를 사용해 어떤 작업에 성공할 때마다 동시에 이런 생각이 듭니다.
“왜 나는 이 시스템을 더 강하게 밀어붙이지 않았을까?”
“왜 나는 아직도 직접 출근하고 있는가?”
“왜 Codex가 내 일을 전부 수행하지 못하는가?”
저는 여전히 회사에 가서 Codex에 특정 작업을 요청하고, 결과를 확인하고, 다음 작업을 결정합니다. 그렇다면 왜 인간인 제가 여전히 필요한 것일까요?
Core Automation이라는 이름도 이러한 문제의식에서 나왔습니다. 우리는 작업을 자동화하고 싶습니다. 그런데 왜 아직도 그렇게 많은 작업이 자동화되지 않았는지를 연구하려는 것입니다.
이를 위해서는 현재 모델에 없는 특성이 무엇인지, 어떤 모델과 시스템이 필요한지를 알아내야 합니다.
3. “2024년의 나는 2025년에 AGI가 올 것이라고 생각했다”
인터뷰어:아키텍처가 핵심적인 문제라고 생각하게 된 계기는 무엇입니까?
제리 트워크:
근본적인 문제는 모델이 연구소 안에서 훈련되고, 실제 세계에서는 그 훈련이 끝난 상태로 배포된다는 점입니다.
제가 OpenAI에서 강화학습 스케일링 연구를 시작했을 때의 개인적인 경험과도 관련이 있습니다.
저는 오랫동안 강화학습 극대주의자였습니다. OpenAI에서 일하기 시작한 이후부터 강화학습을 대규모로 확장하는 것이 AGI로 가는 필수적인 디딤돌이라고 생각했습니다.
GPT-3에서 GPT-4까지 언어모델이 계속 커지는 것을 보면서도 당시에는 강화학습이 거의 사용되지 않는다고 생각했습니다. 저는 마음속으로 이렇게 믿었습니다.
“강화학습을 본격적으로 스케일링하기만 하면 모든 문제가 해결될 것이다.”
결국 우리는 강화학습을 대규모로 확장하기 시작했습니다. 저는 그 중심에 있었습니다. 2024년의 저에게 AGI가 언제 올 것 같으냐고 물었다면, 저는 아마 이렇게 답했을 것입니다.
“2025년이 될 것이다. 이제 모든 문제를 해결하게 될 것이다.”
실제로 모델을 계속 훈련하면서 벤치마크 점수는 지속적으로 상승했습니다. 모델은 확실히 더 좋아졌습니다.
하지만 실제 세계의 모든 작업까지 해결했느냐고 묻는다면, 불행히도 그렇지 않았습니다.
4. 벤치마크와 실제 세계는 동일하지 않다
인터뷰어:벤치마크 성능은 향상됐는데, 왜 실제 작업은 해결되지 않았다고 봅니까?
제리 트워크:
우리가 모델을 평가하는 벤치마크는 본질적으로 훈련에 사용되는 작업과 같은 동전의 양면이었습니다.
반면 실제 세계의 분포는 훨씬 더 지저분하고, 불분명하며, 예측하기 어렵습니다. 실제 사용자들이 수행하는 작업은 훈련 데이터가 충분히 재현하지 못합니다.
모델 연구자들에게 가장 큰 문제가 무엇이냐고 물으면 흔히 이런 답이 돌아옵니다.
“모델을 훈련할 만큼 어려운 과제가 부족하다.”
하지만 이상한 점은, 어렵고 좋은 훈련 과제가 부족하다고 말하면서도 모델은 실제 세계의 전체 작업 분포를 여전히 다루지 못한다는 것입니다.
이 경험을 통해 저는 모델이 테스트 시점에 학습해야 한다는 결론을 내렸습니다.
모델은 사용자와 함께 학습해야 합니다. 사용자의 데이터, 실제 작업, 실제 환경과 실제 세계의 분포에서 학습할 수 있어야 합니다.
5. 현재 트랜스포머가 배포 후 학습하지 못하는 이유
인터뷰어:현재 트랜스포머도 문맥학습이나 파인튜닝을 통해 적응할 수 있지 않습니까?
제리 트워크:
테스트 시점에서 가능한 학습은 크게 두 가지로 생각할 수 있습니다.
첫째, 문맥 내 학습
트랜스포머의 문맥 내 학습은 파국적 망각 문제가 없고, 비교적 데이터 효율적이라는 장점이 있습니다.그러나 확장성이 떨어집니다. 문맥에 넣을 수 있는 데이터의 양에는 한계가 있습니다.
예를 들어 제가 Codex를 사용하면 대략 20분 정도 후에는 문맥을 압축하거나 새로운 세션으로 넘겨야 합니다. 모델이 학습할 수 있는 경험이 20분 정도에 불과하다면 충분하지 않습니다.
둘째, 지속적인 파인튜닝
모델을 계속 파인튜닝하는 방법도 생각할 수 있습니다.하지만 파인튜닝에는 파국적 망각 문제가 있으며, 데이터 효율성도 매우 낮습니다. 새로운 내용을 조금 학습시키는 과정에서 기존 능력을 잃어버릴 수 있습니다.
사람들이 오랫동안 이러한 문제를 해결하려고 시도해 왔지만, 쉬운 문제였다면 이미 해결됐을 것입니다.
그래서 저는 학습 자체를 아키텍처 수준에서 표현할 수 있는 새로운 알고리즘이 필요하다고 생각합니다.
우리는 메타학습할 수 있고, 훨씬 더 긴 시간 범위에서 작동하며, 학습이 어떻게 이루어지는지를 아키텍처 자체가 나타낼 수 있는 시스템을 찾아야 합니다.
6. “트랜스포머가 없었어도 LSTM을 스케일링할 수는 있었다”
인터뷰어:새로운 아키텍처도 트랜스포머와 비슷한 형태가 될까요? 강화학습이 본격적으로 확장될 수 있었던 것도 트랜스포머라는 기반이 있었기 때문 아닌가요?
제리 트워크:
두 사건이 비슷한 시기에 일어난 것은 맞습니다. 하지만 핵심은 기술적 가능성보다 경제성에 가까웠다고 생각합니다.
기술적으로는 LSTM도 스케일링할 수 있습니다. 다만 누구도 그 방향으로 충분히 크게 밀어붙이지 않았습니다.
트랜스포머는 LSTM보다 스케일링 법칙이 훨씬 좋았습니다. 트랜스포머가 발명되지 않은 세계에서는 사람들이 거대한 LSTM을 훈련했을 수도 있습니다.
하지만 그 모델은 더 비싸고, 제품으로서도 덜 인상적이었을 것입니다. 그렇게 비싼 모델을 훈련하는 데 막대한 돈을 쓰도록 투자자들을 설득하기 어려웠을 가능성이 큽니다.
트랜스포머의 진정한 위대함은 경제적으로 가치가 있다는 점입니다.
트랜스포머를 훈련하는 비용보다 그것이 만들어내는 수익이 더 큽니다. 이는 머신러닝에서 마법과도 같은 일이며, 자동으로 보장되는 것이 아닙니다.
7. OpenAI의 중요한 베팅은 “효율성보다 확장성”이었다
인터뷰어:과거에는 왜 사람들이 아키텍처를 대규모로 확장하지 않았다고 생각합니까?
제리 트워크:
OpenAI 이전의 많은 연구자는 스케일링을 과학적이지 않은 접근으로 보는 경향이 있었습니다.
알고리즘 연구의 목표는 같은 계산 예산으로 더 나은 결과를 얻는 것이었습니다. 더 효율적인 알고리즘을 만드는 것이 좋은 연구로 여겨졌습니다.
OpenAI는 다른 베팅을 했습니다.
“더 나은 알고리즘보다 더 단순하고 확장 가능한 알고리즘을 찾자.”
“더 많은 계산을 투입했을 때 계속 성능이 향상되는 시스템을 만들자.”
OpenAI는 이 접근법 때문에 오랫동안 많은 비판을 받았습니다. 하지만 그 베팅 덕분에 오늘날의 모델이 탄생했습니다.
사실 대규모로 확장할 수 있는 아키텍처는 매우 많을 수 있습니다.
8. 작은 규모에서 실패한 아키텍처가 큰 규모에서는 성공할 수 있다
인터뷰어:새로운 아키텍처를 찾으려면 어떤 방식으로 연구해야 합니까?
제리 트워크:
아키텍처 연구는 너무 오랫동안 지나치게 작은 규모에서 진행됐다고 생각합니다.
많은 연구자가 작은 데이터셋과 작은 계산량에서 아키텍처를 먼저 검증하고, 거기서 성과가 나와야 나중에 확장하려고 합니다.
하지만 강화학습을 연구해보면 일정 수준 이상의 기본 능력을 가진 모델이 아니면 흥미로운 능력이 나타나지 않는다는 것을 알 수 있습니다. 강화학습이 작동하기 위해서도 최소한의 계산량과 기본 능력이 필요합니다.
마찬가지로 많은 새로운 아키텍처도 충분한 계산량이 투입되기 전까지는 아무런 흥미로운 특성을 보이지 않을 수 있습니다.
작은 규모에서 성과가 없다고 해서 큰 규모에서도 실패한다고 단정할 수 없습니다.
9. 왜 거대 연구소가 아니라 스타트업에서 연구하는가
인터뷰어:새 아키텍처를 검증하려면 많은 계산량이 필요합니다. 그렇다면 대형 연구소 안에서 연구하는 편이 유리하지 않습니까?
제리 트워크:
좋은 질문입니다. 지금은 시기의 문제라고 생각합니다.
현재 가장 크고 성공적인 AI 연구소들은 역사상 가장 치열한 시장 경쟁을 벌이고 있습니다. 이 때문에 다른 길이나 대안적인 아키텍처를 시도할 여유가 줄어들었습니다.
트랜스포머가 이미 수익성이 있고, 다음 분기에 경쟁자를 이기기 위해 트랜스포머를 더 확장할 수 있다면, 1~2년 후에 성공할지도 모르는 전혀 다른 방향에 상당한 관심과 자원을 투입하기가 어렵습니다.
저는 사실상 모든 대형 연구소와 이야기해봤습니다. 그들은 트랜스포머의 대안을 연구하는 데 큰 관심이 없습니다.
규모가 작은 연구소들은 대형 연구소가 하는 것을 따라잡기 위해 최선을 다하고 있습니다.
최근 출시되는 제품을 보면 모두가 비슷한 코딩 에이전트를 만들고 있습니다. 모두가 같은 방향으로 달리고 있는 것입니다.
하지만 생태계에는 다른 경로와 다른 접근법이 필요합니다. Core Automation은 그 틈을 채우려고 합니다.
10. 트랜스포머는 어디까지 갈 수 있는가
인터뷰어:트랜스포머 기반 아키텍처는 어디까지 발전할 수 있다고 봅니까?
제리 트워크:
트랜스포머는 인터넷에 존재하는 지식을 모델 안에 압축하는 데 매우 뛰어납니다.
사전학습을 통해 인간 지식과 개념들 사이의 관계를 모델에 넣을 수 있습니다. 이후 강화학습을 통해 원하는 업무 절차와 행동을 모델에 내장할 수 있습니다.
훈련 데이터가 존재하는 작업이라면 거의 무엇이든 모델에 넣을 수 있습니다. 엄청난 계산량을 사용해 세계의 모든 데이터를 학습한 거대한 모델을 만들 수도 있습니다.
하지만 질문은 훈련이 끝난 다음입니다.
OpenAI와 Anthropic이 오늘부터 새로운 모델 훈련을 중단하고, 현재 모델이 최종 모델이라고 가정해봅시다.
몇 달, 몇 년이 지나면 그 모델은 점점 덜 유용해질 것입니다.
세계에서 새로운 사건이 발생하고, 사건들 사이에 새로운 관계가 생기며, 새로운 종류의 작업과 코드베이스와 도구가 등장하기 때문입니다.
트랜스포머의 유용성과 가치는 훈련 중에 가치 있는 정보가 데이터에 포함되어야 한다는 점에 크게 의존합니다.
훈련에 없었던 것이 등장하면 어느 정도 적응할 수는 있지만, 그 적응 능력은 크지도 않고 유연하지도 않습니다.
이것이 제가 생각하는 트랜스포머의 상한선입니다.
11. 트랜스포머는 강력한 도구지만 스스로 갱신되는 지능은 아니다
인터뷰어:그렇다면 현재 모델은 어떤 위치에 있다고 봅니까?
제리 트워크:
현재의 트랜스포머는 인간이 한계를 이해하고 적절하게 지시할 수 있을 때 매우 강력한 도구입니다.
인간이 모델의 작업을 분배하고, 프롬프트를 작성하고, 실패한 사례를 발견할 수 있습니다. 실패한 사례는 다시 연구소의 훈련 데이터에 추가되고, 다음 모델에서는 성공할 수 있습니다.
하지만 그 학습 루프는 사용자의 환경에서 직접 일어나는 것이 아닙니다.
사용자가 실패를 발견하면 연구소가 데이터를 수집하고 모델을 다시 훈련해야 합니다.
근본적으로 모델이 계속 연구소로 돌아가 재훈련되어야 한다면, 그것이 우리가 원하는 최종적인 지능 형태인지 질문해야 합니다.
저는 배포된 이후에도 스스로 갱신되고 학습할 수 있는 모델을 원합니다.
12. “경험으로부터 학습하는 방법은 강화학습만이 아니다”
인터뷰어:리치 서튼과 데이비드 실버의 「경험의 시대」에 대해서는 어떻게 생각합니까?
제리 트워크:
강화학습은 새로운 접근법이 아닙니다. 경험으로부터 학습한다는 생각은 오래전부터 존재했습니다.
사전학습은 대부분 다른 존재가 생성한 정적인 데이터를 이용합니다. 행동 복제, 모방, 인터넷 데이터의 압축이라고 볼 수 있습니다.
최근에는 인터넷 토큰의 상당 부분이 AI가 생성한 것이기 때문에, 오늘날의 사전학습은 이전 모델을 새 모델에 증류하는 과정에 가까워지고 있다는 개인적인 견해도 있습니다.
반면 강화학습에서는 모델이 자신의 경험을 만들고 그 경험으로부터 학습합니다.
강화학습은 백개먼, 바둑, 스타크래프트, 도타, 프로그래밍과 같은 문제를 해결하는 데 사용돼 왔습니다.
하지만 강화학습이 경험으로부터 배우는 유일한 방법은 아닙니다.
앞으로는 경험을 활용하는 방식에서 더 많은 알고리즘적 혁신이 나타날 것입니다.
13. 축구를 배우는 방식과 수학을 배우는 방식은 다르다
인터뷰어:강화학습 이외의 경험 학습이란 구체적으로 무엇입니까?
제리 트워크:
뇌에는 하나의 학습 알고리즘만 있는 것이 아니라 여러 학습 알고리즘이 함께 작동한다고 생각합니다.
예를 들어 제가 축구를 배운다고 해봅시다.
공을 여러 번 차고, 매번 결과를 확인한 뒤 동작을 조금씩 조정합니다. 원하는 방향과 대략 일치하는지를 보면서 학습합니다. 이것은 강화학습과 매우 비슷합니다.
하지만 수학을 배우는 방식은 전혀 다릅니다.
어려운 개념을 읽고, 머릿속에서 오랫동안 깊이 생각하다가 어느 순간 개념들이 서로 연결되면서 이해가 됩니다.
축구 학습과 수학 학습은 모두 경험으로부터 배우는 것이지만, 학습 방식은 매우 다릅니다.
우리는 현재 역사상 가장 많은 계산량을 경험 학습에 투입하고 있을 가능성이 큽니다.
그러나 강화학습이 경험 학습의 종착점은 아닙니다. 앞으로 연구자들은 경험 데이터를 더 풍부하게 사용하는 훨씬 나은 방법을 발견할 것입니다.
14. Core Automation이 말하는 자동화는 인간 제거가 아니다
인터뷰어:AI 연구자의 업무는 얼마나 자동화될 수 있습니까? Core Automation은 세계에서 가장 자동화된 연구소를 만들려는 것입니까?
제리 트워크:
우리의 목표는 세계에서 가장 자동화된 연구소를 만드는 것입니다.
하지만 Core Automation이 말하는 자동화는 인간을 루프에서 제거하는 것만을 의미하지 않습니다.
핵심은 각 인간에게 최대한의 행동 능력과 주도권을 부여하는 것입니다.
사람이 걸으면 일정한 거리만 이동할 수 있습니다. 자전거를 타면 더 멀리 갈 수 있고, 자동차를 타면 훨씬 더 멀리 갈 수 있습니다.
농사를 손으로 지을 때는 작은 땅만 경작할 수 있지만, 기계를 사용하면 훨씬 넓은 땅을 다룰 수 있습니다.
AI 자동화도 마찬가지입니다. 인간을 없애려는 것이 아니라 한 명의 연구자가 같은 시간 동안 훨씬 더 많은 일을 할 수 있도록 만드는 것입니다.
15. AI 에이전트 시대에 맞춰 연구소 자체를 다시 설계해야 한다
인터뷰어:기존 연구소의 구조를 개선하는 것과 처음부터 새 회사를 만드는 것에는 어떤 차이가 있습니까?
제리 트워크:
현재의 코딩 에이전트를 활용하면 한 명의 연구자가 과거보다 훨씬 많은 일을 할 수 있습니다.
저는 코딩 연구와 OpenAI 내부의 여러 AI 과학자 프로젝트에 참여하면서 오랫동안 이런 비전을 연구했습니다.
결국 그 비전을 실현하는 가장 좋은 방법 중 하나가 새로운 회사를 설립하는 것이라고 판단했습니다.
오늘날에는 연구하는 방식 자체가 과거와 크게 다릅니다.
아이디어를 실험하고, 결과 데이터를 얻고, 다음 아이디어로 넘어가는 반복 속도가 훨씬 빨라졌습니다.
기존 조직의 팀 구조, 업무 절차, 데이터 수집 방식을 조금씩 수정할 수도 있습니다.
하지만 우리는 AI 에이전트 시대에 맞춰 처음부터 조직과 연구 과정을 설계할 수 있습니다. 각 연구자가 최대한 빠르게 자신의 아이디어를 실험하도록 만드는 것입니다.
16. 하루 1개에서 10개, 궁극적으로 200개의 실험
인터뷰어:자동화된 연구소의 실험 속도는 어느 정도를 목표로 합니까?
제리 트워크:
우리는 딥러닝 스택의 거의 모든 부분을 다시 설계하려고 합니다. 각각의 연산을 다르게 수행할 가능성을 검토하고 있습니다.
대규모 실험을 하루에 하나라도 실행할 수 있다면 과거에 비해 매우 빠른 반복 속도입니다.
언젠가는 하루에 10개를 실행할 수도 있습니다.
더 나아가 하루에 200개의 실험을 실행할 수도 있습니다.
아키텍처 탐색은 일종의 검색 및 최적화 과정입니다. 많은 아이디어를 빠르게 실험하고 결과를 확인할 수 있다면, 더 나은 딥러닝 시스템을 발견할 가능성도 크게 높아집니다.
Core Automation은 소수의 인원으로 최대한 많은 일을 하는 에이전트 기반·자동화 기반 조직이 어디까지 갈 수 있는지를 직접 실험하는 회사이기도 합니다.
17. 제리 트워크가 정의하는 AGI
인터뷰어:우리가 AGI에 도달했다는 것을 언제 알 수 있을까요?
제리 트워크:
예전에는 AGI란 결국 각자의 마음속에 있는 개념이라고 말하곤 했습니다. 사람마다 AGI라고 생각하는 기준이 다르기 때문입니다.
OpenAI는 AGI를 인간보다 경제적으로 가치 있는 대부분의 작업을 더 잘 수행하는 시스템으로 정의합니다.
하지만 저는 한 가지 질문을 추가하고 싶습니다.
“모델을 훈련하는 연구소가 더 이상 새로운 모델을 훈련하지 않아도 그 시스템은 계속 같은 수준의 자동화를 유지할 수 있는가?”
저에게 AGI는 어떤 형태로든 인간이 개입하지 않고 스스로를 개선할 수 있는 모델입니다.
그 시점부터 AGI라는 표현을 의미 있게 사용할 수 있다고 생각합니다.
AI 모델을 개선하는 일은 인간이 수행하는 경제적으로 가치 있는 업무입니다. 따라서 모델이 모든 경제적 업무를 수행할 수 있다면, 자기 자신을 개선하는 업무도 수행할 수 있어야 합니다.
18. 현재 모델은 인간과 결합할 때 강하지만 단독으로는 약하다
인터뷰어:현재의 모델은 AGI에 얼마나 가까이 왔다고 생각합니까?
제리 트워크:
모델의 작업 루프에서 인간을 완전히 제거하는 것은 지금까지 극도로 어려웠습니다.
제가 아는 범위에서는 모델이 인간을 완전히 제거하고 독립적으로 수행할 수 있는 작업을 찾기조차 어렵습니다.
현재 가장 성공적인 형태는 인간과 LLM의 결합입니다.
인간–LLM 하이브리드는 매우 성공적입니다. 하지만 인간 없는 LLM은 그렇지 않습니다. 아직은 전혀 그렇지 않다고 말할 수 있습니다.
제가 2024년과 2025년 초에 본 바로는 현재의 경로만으로는 인간을 루프에서 완전히 제거하는 단계에 도달하기 어렵습니다.
모델이 테스트 시점에 더 깊은 수준에서 학습하고 적응하게 만들려면 상당히 심각하고 근본적인 연구가 필요합니다.
그 연구를 우리 회사가 해낼 수도 있고, 다른 누군가가 해낼 수도 있습니다.
19. Core Automation의 궁극적인 목표
인터뷰어:Core Automation의 전체적인 계획을 설명해줄 수 있습니까?
제리 트워크:
Core Automation은 지속적으로 학습하고, 배포된 환경으로부터 학습하는 모델을 만들기 위해 설립된 연구소입니다.
우리는 트랜스포머가 지속학습을 수행할 수 없다고 생각합니다. 현재의 트랜스포머에 진정한 지속학습을 추가할 방법은 없다고 봅니다.
따라서 새로운 아키텍처, 즉 트랜스포머를 대체할 구조를 찾아야 합니다.
이를 위해 우리는 세계에서 가장 자동화된 연구소를 만들고자 합니다.
대규모 실험을 누구보다 빠르게 구성하고 실행하며, 결과를 반복적으로 확인하고, 새로운 아키텍처 아이디어를 대량으로 시도할 것입니다.
물론 무작정 모든 가능성을 탐색하는 것은 아닙니다. 우리가 원하는 시스템에 대한 강한 사전 가설을 바탕으로 아키텍처 공간을 효율적으로 탐색할 것입니다.
커널 자동화, 대규모 훈련, 새로운 아키텍처 연구는 모두 그 목표를 향한 탐색 과정입니다.
20. 새로운 아키텍처를 발견했다는 것을 어떻게 알 수 있는가
인터뷰어:더 우수한 아키텍처를 실험으로 발견한다면, 그것이 정답이라는 것을 어떻게 알 수 있습니까?
제리 트워크:
제가 경험한 성공적인 연구에는 언제나 다른 그래프에서는 볼 수 없는 특별한 그래프가 있었습니다.
어떤 선이 이전과 조금 다른 방식으로 휘어집니다. 그 선을 보면서 “이것이 우리가 찾던 결과다”라고 알 수 있습니다.
하지만 그 그래프는 연구 여정의 상당히 후반에 등장합니다.
대부분의 경우 연구자는 자신이 무엇을 찾는지 어느 정도 알고 있습니다. 다만 그것을 아직 실제로 구현하지 못했을 뿐입니다.
첫 번째 방법을 시도하지만 작동하지 않고, 두 번째 방법도 실패합니다. 딥러닝 시스템은 매우 복잡하게 맞물려 있기 때문에 보통 다섯 가지 정도를 연속해서 정확하게 맞춰야 비로소 전체가 작동하기 시작합니다.
그러다 어느 순간 모든 조각이 맞아떨어지고, 원하던 형태의 그래프가 나타납니다.
21. 최종 평가 기준: “우리 연구소의 일을 매일 더 잘하는가?”
인터뷰어:Core Automation이 찾는 시스템의 핵심적인 성공 기준은 무엇입니까?
제리 트워크:
우리가 찾는 것은 테스트 시점에 학습하는 시스템입니다.
특히 장기적으로 의미 있는 적응 능력을 보이는지를 확인하고 싶습니다.
가장 현실적인 평가 방법은 모델을 우리 연구소의 실제 업무에 투입하는 것입니다.
“이 시스템은 Core Automation 과학자들의 일을 하루가 지날 때마다 더 잘 수행하는가?”
어제보다 오늘 더 잘하고, 오늘보다 내일 더 잘한다면 그것은 단순히 문맥에 정보를 유지하는 것이 아니라 실제로 경험으로부터 장기적으로 학습하고 있다는 신호가 될 수 있습니다.
우리는 농담처럼 이런 이야기도 합니다.
팀 전체가 일주일 동안 휴가를 떠난 뒤 돌아왔을 때 연구소가 이전보다 더 좋은 결과물을 만들어냈는지 확인해보자는 것입니다.
실제로 그런 일이 일어난다면 휴가를 두 배, 세 배, 네 배로 늘릴 수 있을 것입니다.
궁극적으로는 영구적인 휴가에 들어갈 수 있을 때까지 말입니다.
제리 트워크의 핵심 주장 요약
제리 트워크는 현재 AI 발전이 정체됐다고 주장하는 것이 아니다. 오히려 트랜스포머와 강화학습이 매우 강력하며 경제적으로도 성공했다는 사실을 인정한다.그러나 그는 현재 방식에는 명확한 구조적 한계가 있다고 본다.
현재 모델은 연구소에서 미리 학습한 뒤 고정된 상태로 현실에 배포된다. 문맥 내 학습은 짧고 제한적이며, 지속적인 파인튜닝은 파국적 망각과 낮은 데이터 효율성 문제를 겪는다.
그 결과 현재 AI는 인간과 결합할 때는 매우 유용하지만, 인간 없이 장기간 독립적으로 일하며 새로운 환경에 적응하지는 못한다.
제리가 생각하는 AGI는 단순히 벤치마크에서 인간을 능가하거나 많은 경제적 업무를 수행하는 모델이 아니다.
배포 이후의 경험으로부터 지속적으로 학습하고, 인간의 개입 없이 자기 자신을 개선할 수 있는 시스템이 진정한 AGI에 가깝다.
Core Automation의 목표는 바로 이러한 시스템을 만들 수 있는 트랜스포머 이후의 아키텍처를 찾는 것이다.
그리고 그 아키텍처를 발견하기 위한 연구소 자체도 AI 에이전트와 자동화를 전제로 처음부터 다시 설계하려 한다.
전체 0