인터뷰/예측

제프 딘 "2027년에는 머신러닝 시스템 자체를 개선하는 과정이 훨씬 더 많이 자동화될 것"

작성자
작성일
2026-07-31 19:54
조회
5

제프 딘 인터뷰 상세 정리

「AI 시대에 무언가를 만드는 법: 1%의 성공 가능성을 찾아라」

1. AI는 이미 주니어 엔지니어 수준에 도달했는가

인터뷰어:
당신은 MapReduce, Bigtable, TensorFlow, TPU, Gemini 등 수많은 시스템을 만들었습니다. 2025년에는 AI가 주니어 엔지니어 수준에 도달했다고 말했는데, 지금 그 예측을 어떻게 평가합니까?

제프 딘:
현재 모델들은 에이전트 기반의 장시간 코딩 작업에서 상당히 빠르게 발전하고 있습니다. 주니어 엔지니어를 어떻게 정의하느냐에 따라 조금 다르겠지만, 지금 시점에서는 그 예측이 꽤 정확했다고 생각합니다.

제가 오히려 과소평가한 부분은 모델이 점점 더 복잡한 작업을 수행하는 능력이었습니다. 그 능력이 제가 생각했던 것보다 훨씬 빠르게 향상됐습니다.

또한 이런 에이전트 시스템은 코딩뿐만 아니라 다른 분야에서도 두각을 나타내기 시작했습니다. 앞으로는 코딩 이외의 과학, 공학, 연구 업무에서도 에이전트가 중요한 역할을 할 것입니다.



2. 2027년에는 AI가 AI 연구를 자동화할 것이다

인터뷰어:
그렇다면 2027년에 대한 새로운 대담한 예측을 해주시겠습니까?

제프 딘:
2027년에는 머신러닝 시스템 자체를 개선하는 과정이 훨씬 더 많이 자동화될 것이라고 생각합니다.

AI 시스템이 하나의 큰 문제를 여러 하위 문제로 분해하고, 각각의 하위 문제에 대해 수많은 실험을 자동으로 수행하게 될 것입니다. 실험 결과를 평가한 뒤, 가장 성공적인 방법들을 다시 결합해 더 나은 머신러닝 시스템을 만들어낼 수 있습니다.

즉, 다음과 같은 과정이 자동화될 것입니다.
  1. 해결해야 할 문제를 정의한다.
  2. 문제를 여러 하위 문제로 나눈다.
  3. 각 하위 문제에 대해 여러 실험을 한다.
  4. 결과를 측정하고 비교한다.
  5. 가장 좋은 결과를 통합한다.
  6. 개선된 시스템을 만든다.
이 방식은 머신러닝에만 국한되지 않습니다. 측정 가능한 목표가 있는 과학과 공학 분야라면 대부분 적용할 수 있습니다.

명확한 평가 기준만 존재한다면 AI가 반복적으로 실험하고, 결과를 측정하며, 더 나은 해법을 찾을 수 있습니다.



3. 2026년의 “모든 것이 메모리에 들어가는 순간”

인터뷰어:
2001년 당시 구글 검색은 하드디스크를 사용했습니다. 당신과 산제이 게마와트는 검색 인덱스 전체가 구글 서버들의 RAM에 들어갈 수 있다는 계산을 했고, 검색 시스템을 메모리 기반으로 전환했습니다. 현재 AI 분야에도 이와 비슷한 전환점이 있습니까?

제프 딘:
완전히 똑같은 상황은 아니지만, 지금의 핵심 전환점은 고성능·저전력 추론 하드웨어라고 생각합니다.

사람들은 이제 추론이 에이전트 시스템을 더 많은 사람에게 보급하는 데 가장 중요한 요소라는 점을 깨닫고 있습니다.

에이전트는 한 번 답변하고 끝나는 시스템이 아닙니다. 수많은 단계에서 모델을 반복적으로 호출합니다. 따라서 추론 속도, 지연시간, 에너지 효율이 매우 중요합니다.

범용 GPU나 TPU보다 특정 추론 작업에 더 특화된 하드웨어를 만들면 훨씬 낮은 전력과 훨씬 짧은 지연시간을 달성할 수 있습니다.

현재 우리는 모델의 응답을 기다리는 데 익숙합니다. 하지만 지연시간이 지금보다 50배 빨라진다면 완전히 다른 종류의 제품과 경험이 가능해질 것입니다.

사람들은 모델이 얼마나 똑똑한지만 보지만, 실제 제품에서는 얼마나 빠르게 반응하는지도 매우 중요합니다.



4. 사람들은 장기 실행 에이전트의 가능성을 과소평가한다

인터뷰어:
현재 AI에 대해 사람들이 잘못 믿고 있는 가정은 무엇입니까?

제프 딘:
많은 사람이 에이전트가 한두 시간 정도만 작업할 수 있다고 생각합니다.

하지만 모델의 능력이 충분히 높고, 문제 영역이 적합하다면 에이전트는 며칠 또는 몇 주 동안 지속적으로 작업할 수 있습니다. 그러면서 상당히 복잡한 문제를 해결할 수 있습니다.

일부 사람들은 이미 이런 가능성을 조금씩 보고 있지만, 대부분은 아직 이것이 얼마나 큰 변화인지 충분히 체감하지 못하고 있습니다.

예를 들어 에이전트에게 기존의 대규모 소프트웨어를 다른 프로그래밍 언어로 다시 구현하도록 지시할 수 있습니다.

새로운 언어가 더 나은 안전성이나 성능 특성을 가진다면, 에이전트가 상당한 규모의 소프트웨어를 실제로 새 언어로 옮기는 작업을 장기간 수행할 수 있습니다.

앞으로 중요한 변화는 단순히 AI가 짧은 답을 잘하는 것이 아니라, 장기간 지속되는 프로젝트를 맡을 수 있게 된다는 점입니다.



5. 음성인식의 성공이 TPU 개발로 이어진 과정

인터뷰어:
2013년 구글의 음성인식 성능이 좋아졌을 때, 모든 사용자가 하루 3분씩 음성인식을 사용하면 구글 서버 수를 거의 두 배로 늘려야 한다는 계산을 했다고 들었습니다.

제프 딘:
당시 딥러닝 기반 음성인식 시스템은 기존 시스템보다 훨씬 정확했습니다.

몇 달 동안 모델과 데이터를 개선한 것만으로 오류율이 절반 수준으로 줄었습니다. 기존 방식으로는 약 20년에 걸쳐 일어날 발전이 몇 달 만에 일어난 것과 비슷했습니다.

문제는 음성인식이 좋아질수록 사람들이 더 많이 사용하게 된다는 점이었습니다.

사람들이 이메일을 음성으로 작성하거나 휴대전화에 말을 걸기 시작하면, 기존 CPU 기반 시스템으로는 필요한 연산량을 감당하기 어려웠습니다.

그래서 우리는 머신러닝에 필요한 저정밀도 밀집 선형대수 연산만 매우 효율적으로 수행하는 특수 칩을 만들기로 했습니다. 그것이 TPU의 시작입니다.

TPU는 크롬이나 워드 같은 일반 프로그램은 실행하지 못합니다. 하지만 머신러닝 추론에 필요한 연산에서는 당시 CPU와 GPU보다 30배에서 80배 높은 에너지 효율을 제공했습니다.

지연시간도 약 20배에서 30배 낮았습니다.

우리는 특정 음성 모델 하나에만 맞춘 칩을 만든 것이 아닙니다. 머신러닝 알고리즘이 계속 변할 것을 알고 있었기 때문에, 선형대수 연산이라는 비교적 일반적인 핵심 연산에 특화했습니다.

충분히 특화해 큰 성능 향상을 얻으면서도, 새로운 알고리즘에 대응할 수 있는 범용성은 남겨둔 것입니다.



6. 창업자는 현재 방식에 얽매이지 말고 10배 개선을 찾아야 한다

인터뷰어:
미래의 창업자들이 TPU처럼 중요한 것을 만들려면 어떤 계산을 해봐야 합니까?

제프 딘:
자신이 관심 있는 문제에서 병목이 무엇인지 먼저 생각해야 합니다.

그리고 지금의 해결 방식에 얽매이지 말고, 완전히 다른 방식으로 문제를 해결했을 때 성능이나 능력을 10배 또는 100배 개선할 수 있는지를 생각해야 합니다.

사람들은 흔히 현재 시스템이 작동하는 방식을 당연한 전제로 받아들입니다. 하지만 제1원칙에서 다시 생각하면 다른 사람들이 놓치는 아이디어를 발견할 수 있습니다.

“현재 방식에서 20% 개선할 수 있는가?”보다 “문제를 완전히 다르게 정의하면 10배 나아질 수 있는가?”라는 질문이 더 중요할 때가 많습니다.



7. AI 시대에 엔지니어가 알아야 할 새로운 숫자들

인터뷰어:
당신이 과거에 작성한 ‘모든 프로그래머가 알아야 할 지연시간 수치’는 분산 시스템 엔지니어들의 필독 자료가 됐습니다. 2026년 AI 버전에는 어떤 숫자들이 들어가야 합니까?

제프 딘:
AI 시스템을 설계할 때는 다음과 같은 숫자를 알아야 합니다.
  • 가속기의 주메모리와 온칩 메모리 사이의 대역폭
  • 온칩 메모리와 행렬곱 연산기 사이의 대역폭
  • 한 번의 곱셈 연산에 필요한 에너지
  • 칩과 칩을 연결하는 인터커넥트 대역폭
  • 고속 대역폭으로 연결 가능한 칩의 수
  • 500개 칩을 연결할 때와 1만 개 칩을 연결할 때의 네트워크 성능 저하
  • 데이터 이동과 실제 계산에 필요한 에너지 차이
이런 숫자를 알고 있으면 어떤 문제를 어떤 방식으로 해결해야 하는지가 달라집니다.

AI 시대에는 FLOPS만 보는 것으로는 부족합니다. 메모리 대역폭, 통신, 데이터 이동, 전력 소비가 시스템의 실질적 능력을 결정합니다.



8. AI 시스템의 핵심 비용은 계산이 아니라 데이터 이동이다

인터뷰어:
계산 한 번보다 데이터를 이동시키는 데 약 1,000배 더 많은 에너지가 든다고 말한 적이 있습니다. 이 차이가 실제 AI 시스템에 어떤 영향을 줍니까?

제프 딘:
데이터를 메모리에서 가져오는 비용이 실제 곱셈 연산보다 약 1,000배 크다는 사실은 머신러닝 시스템 전체의 구조를 결정합니다.

이 차이가 없었다면 배치 처리를 할 필요도 별로 없었을 것입니다.

하지만 데이터를 가져오는 비용이 매우 크기 때문에, 같은 데이터를 한 번 가져온 뒤 여러 샘플이나 여러 토큰에 재사용해야 합니다. 그래서 많은 샘플을 하나의 배치로 묶습니다.

배치 크기가 커지면 데이터 이동 비용을 여러 연산에 분산할 수 있습니다.

하지만 배치는 저지연 추론과 충돌합니다. 사용자가 하나의 요청을 보냈을 때 다른 요청이 모일 때까지 기다려야 하기 때문입니다.

따라서 AI 제품의 중요한 문제 중 상당수는 겉으로는 모델 문제처럼 보이지만, 실제로는 에너지와 데이터 입출력 문제입니다.

훈련에서 데이터를 배치로 묶고 여러 에포크를 반복하는 것도 순수한 모델 이론의 문제가 아니라, 하드웨어를 효율적으로 사용하기 위한 시스템적 선택입니다.

이상적으로는 배치 크기 1로 훈련할 수도 있겠지만, 현재 하드웨어에서는 효율이 떨어지기 때문에 매우 큰 배치를 사용합니다.



9. 추론 하드웨어는 훈련 하드웨어보다 더 특화될 수 있다

인터뷰어:
배치 크기 1의 훈련을 가능하게 하는 시스템을 연구하고 있습니까?

제프 딘:
최근에는 훈련보다 추론에 더 관심이 있습니다.

훈련은 반드시 극도로 낮은 지연시간이 필요하지는 않습니다. 반면 추론은 사용자가 직접 기다리기 때문에 낮은 지연시간이 중요합니다.

현재보다 추론에 훨씬 특화된 하드웨어를 만들 여지가 많습니다.

핵심은 데이터 이동을 최소화하는 것입니다. 또한 연산 정밀도를 극도로 낮추는 것도 중요합니다.

필요한 정밀도 수준에 대해 확신이 있다면, 다양한 정밀도를 모두 지원하는 복잡한 하드웨어를 만들 필요가 없습니다. 특정 저정밀도 연산만 매우 빠르게 수행하도록 설계할 수 있습니다.

범용성을 줄이는 대신 성능과 전력 효율을 크게 높이는 방식입니다.



10. 모델 자체보다 모델 주변의 시스템이 중요해지고 있다

인터뷰어:
과거 AI 발전은 더 큰 모델, 더 많은 데이터, 더 많은 파라미터를 의미했습니다. 이제는 검색, 메모리, 도구, 에이전트 같은 모델 주변 시스템이 중요해지고 있습니다.

제프 딘:
모델은 전체 시스템의 한 구성요소일 뿐입니다.

우리가 실제로 원하는 것은 흥미롭고 복잡한 문제를 해결하는 전체 시스템입니다.

그 시스템에는 다음과 같은 요소가 필요합니다.
  • 어떤 도구를 사용해야 하는지 아는 모델
  • 필요한 정보를 검색하는 기능
  • 과거 문제에서 얻은 정보를 기억하는 기능
  • 현재 문제에 필요한 정보를 컨텍스트에 넣는 기능
  • 문제를 여러 단계로 나누는 능력
  • 여러 해결법을 시도하는 능력
  • 어떤 해결법이 더 나은지 평가하는 능력
  • 여러 에이전트를 조율하는 기능
훈련 데이터는 수조 개의 토큰이 수천억 또는 수조 개의 파라미터 속에 뒤섞인 형태로 존재합니다. 모델 입장에서는 특정 정보가 명확하게 드러나지 않을 수 있습니다.

반면 현재 컨텍스트에 직접 제공된 정보는 모델이 훨씬 명확하게 볼 수 있습니다.

따라서 어떤 정보를 모델의 컨텍스트에 넣고, 어떤 도구를 제공하며, 어떤 순서로 호출하게 만들 것인지가 매우 중요합니다.

앞으로는 복잡한 에이전트와 다중 에이전트 시스템의 오케스트레이션이 핵심 기술이 될 것입니다.



11. 컨텍스트 엔지니어링 능력을 향상시키는 방법

인터뷰어:
모델을 직접 훈련하려면 많은 GPU와 데이터가 필요하지만, 컨텍스트 엔지니어링은 API만 있으면 누구나 할 수 있습니다. 어떻게 하면 이를 잘할 수 있습니까?

제프 딘:
가장 좋은 방법은 모델과 에이전트 도구를 실제 문제에 계속 사용해보는 것입니다.

사용하다 보면 모델이 어디에서 실패하는지 볼 수 있습니다.

외부 사용자가 모델 파라미터 자체를 바꾸기는 어렵습니다. 하지만 다음과 같은 것은 바꿀 수 있습니다.
  • 더 나은 지침
  • 더 명확한 작업 절차
  • 도구 사용법을 설명하는 스킬
  • 문제 해결에 필요한 배경 정보
  • 결과를 평가하는 방식
  • 실패했을 때 다시 시도하는 절차
모델이 특정 작업에서 실패한다면, 그 작업을 수행하는 방법을 스킬 형태로 설명해줄 수 있습니다.

이 과정을 반복하면 모델을 사용하는 전체 시스템이 점점 개선됩니다.

결국 중요한 질문은 “이 모델이 더 잘 작동하려면 어떤 추가 정보가 필요한가?”입니다.



12. 제프 딘이 직접 만든 성능 최적화 에이전트

인터뷰어:
직접 수행한 컨텍스트 엔지니어링 사례를 들려줄 수 있습니까?

제프 딘:
산제이와 저는 구글에서 매우 저수준의 라이브러리 성능을 개선하는 작업을 자주 합니다.

구글 내부에는 특정 연산이나 자료구조의 실행시간을 측정하는 마이크로벤치마크 라이브러리가 있습니다.

이러한 자료구조는 구글의 수백만 개 프로세스에서 사용될 수 있기 때문에 작은 성능 차이도 중요합니다.

일반적인 성능 개선 과정은 다음과 같습니다.
  1. 현재 성능을 측정한다.
  2. 성능을 개선할 것으로 예상되는 코드를 수정한다.
  3. 벤치마크를 다시 실행한다.
  4. 실제로 성능이 향상됐는지 확인한다.
  5. 더 넓은 벤치마크를 실행한다.
  6. 캐시 사용량과 메모리 영향을 측정한다.
  7. 다시 코드를 수정한다.
우리는 이 과정을 모델이 수행할 수 있도록 하나의 스킬로 작성했습니다.

모델에게 벤치마크를 측정하는 법, 코드를 수정하는 법, 결과를 비교하는 법, 반복해서 개선하는 법을 알려준 것입니다.

그러자 에이전트가 일부 문제에서는 스스로 코드를 수정하고 성능을 측정하며 반복적으로 최적화할 수 있었습니다.

결국 우리가 사람으로서 사용하는 문제 해결 절차를 모델이 이해할 수 있는 형태로 전달한 것입니다.

산제이와 제가 작성한 약 30페이지 분량의 ‘Performance Hints’ 문서도 공개돼 있습니다. 이 문서를 요약해 모델에게 제공하면 모델의 코드 성능 추론 능력이 향상되는 사례가 있습니다.



13. 에이전트가 장시간 작업하다 실패하는 이유

인터뷰어:
에이전트는 처음 10단계 정도는 잘하지만 30단계나 50단계가 되면 잘못된 방향으로 가는 경우가 많습니다. 가장 큰 제약은 무엇입니까?

제프 딘:
우리는 에이전트가 매우 오랜 시간 작업할 수 있기를 원합니다. 그래야 더 복잡한 문제를 풀 수 있기 때문입니다.

그러나 현재 에이전트는 몇 차례 도구를 사용한 뒤 실패하기도 합니다.

그 이유 중 하나는 모델이 충분히 경험하지 않은 작업을 시도하기 때문입니다.

모델은 특정한 데이터 분포에서 훈련됐습니다. 익숙한 작업 범위를 조금 벗어나기 시작하면 성능이 떨어질 수 있습니다. 익숙한 영역에서 더 멀어질수록 실패할 가능성이 커집니다.

이를 개선하는 방법은 여러 가지입니다.

첫째, 모델이 잘 알고 있는 경로를 따라가도록 스킬과 힌트를 제공할 수 있습니다.

둘째, 여러 에이전트가 서로 다른 접근법을 시도하게 할 수 있습니다.

셋째, 별도의 모델이나 에이전트가 각각의 접근법을 평가하게 할 수 있습니다.

넷째, 유망하지 않은 경로는 버리고 가능성이 높은 경로만 계속 탐색할 수 있습니다.

이것은 추론 시점 연산을 이용해 가능한 해결 경로를 탐색하는 방식입니다.

하나의 답을 바로 생성하는 것이 아니라 여러 후보 경로를 탐색하고, 비교하고, 선택하는 것입니다. 이런 방식은 장기 실행 에이전트의 성능과 신뢰성을 크게 높일 수 있습니다.



14. 구글 내부 에이전트는 회사의 도구 사용법을 스킬로 배운다

인터뷰어:
구글 내부에서는 이런 방식을 어떻게 구현하고 있습니까?

제프 딘:
구글 내부 개발 환경에는 에이전트가 사용할 수 있는 다양한 스킬이 있습니다.

예를 들어 다음과 같은 일을 수행하는 방법을 알려줍니다.
  • 내부 코딩 도구 사용
  • 코드 리뷰 수행
  • 성능 측정
  • 로그 파일 검색
  • 구글 내부 시스템에서 필요한 데이터 가져오기
  • 테스트 실행
  • 오류 원인 분석
기본 모델은 구글 내부의 독점적인 로그 시스템 사용법을 훈련 과정에서 배우지 않았을 수 있습니다.

하지만 정확한 스킬 정의를 제공하면 내부 엔지니어가 사용하는 방식으로 도구를 활용할 수 있습니다.

기본 모델 자체를 다시 훈련하지 않더라도, 스킬을 추가해 훨씬 유용한 에이전트로 만들 수 있습니다.



15. 작은 스타트업이 구글을 이길 수 있는 영역

인터뷰어:
구글은 칩에서 모델, 제품까지 모든 계층을 함께 설계합니다. 그렇다면 2~3명으로 구성된 작은 팀은 어디에서 경쟁할 수 있습니까?

제프 딘:
구글과 Gemini는 거의 모든 것을 할 수 있는 범용 모델을 만들려고 합니다.

하지만 범용 모델을 만들다 보면 특정 분야 하나에 극도로 집중하기 어렵습니다.

작은 팀은 자신이 열정을 가진 특정 분야에서 더 아름다운 사용자 경험, 더 높은 정확도, 더 높은 품질을 갖춘 제품을 만들 수 있습니다.

특정 분야에 특화된 모델과 스킬을 조합하거나, 범용 모델이 잘하지 못하는 문제를 매우 깊게 해결할 수 있습니다.

다만 중요한 경고가 있습니다.

범용 모델은 매우 빠르게 더 많은 일을 잘하게 되고 있습니다.

따라서 자신이 만들고 있는 기능이 앞으로 6개월이나 12개월 안에 범용 모델에 흡수될 가능성을 생각해야 합니다.

그 기능이 2~3년 동안 범용 모델이 쉽게 따라오기 어려운 것인지도 평가해야 합니다.



16. 성공률 20%인 문제가 아니라 0~1%인 문제를 찾아라

인터뷰어:
창업자는 구체적으로 어떤 문제를 골라야 합니까?

제프 딘:
가장 중요한 기준은 자신이 정말로 열정적으로 만들고 싶은 문제인가입니다.

또한 세상에 실제로 유용한 것을 만들어야 합니다.

그 다음에는 현재 범용 모델이 그 문제를 얼마나 잘 해결하는지 직접 시험해봐야 합니다.

범용 모델이 문제를 완전히 해결하지 못하고 성공률이 0%나 1%라면 좋은 신호일 수 있습니다.

반면 모델이 이미 20% 정도 성공한다면 반드시 좋은 신호는 아닙니다.

그것은 해당 능력이 이미 모델 내부에서 형성되기 시작했다는 뜻일 수 있습니다. 훈련 데이터가 늘거나 모델 규모가 커지면 곧 성능이 빠르게 좋아질 가능성이 있습니다.

따라서 범용 모델이 조금 부족한 문제보다, 현재는 거의 전혀 해결하지 못하는 문제를 찾는 것이 더 유리할 수 있습니다.

이것이 이 인터뷰 제목의 ‘1% 규칙’입니다.



17. 스타트업이 방어력을 가질 수 있는 두 가지 방법

인터뷰어:
범용 모델이 해결하지 못하는 문제는 어떤 형태입니까?

제프 딘:
한 가지는 범용 모델이 접근할 수 없는 독자적인 데이터를 가진 제품입니다.

예를 들어 구글은 세계의 정보를 정리하지만, 개인 사용자의 모든 사적 정보를 자동으로 정리해주지는 못할 수 있습니다.

개인의 이메일, 문서, 기록, 업무 흐름 등을 안전하게 연결한 제품은 일반 모델이 볼 수 없는 중요한 데이터를 사용할 수 있습니다.

두 번째는 특정 영역에 특화된 모델입니다.

올바른 훈련 데이터를 확보할 수 있다면 범용 모델보다 작고 저렴한 모델로도 특정 문제에서 매우 높은 정확도를 얻을 수 있습니다.

좁은 영역에서는 반드시 거대한 모델이 필요한 것은 아닙니다.

AlphaFold가 대표적인 사례입니다.

AlphaFold는 범용 모델이 아니라 단백질 접힘이라는 특정 문제를 매우 잘 해결하는 전문 모델입니다.

이런 접근은 재료과학, 칩 설계, 분자과학 등에서도 가능할 수 있습니다.



18. AI 에이전트를 잘 쓰려면 명확한 명세를 작성해야 한다

인터뷰어:
앞으로 창업자가 50개나 100개의 에이전트를 관리하게 된다면, 명확한 설계 문서와 명세가 중요하다고 말했습니다.

제프 딘:
에이전트에게 원하는 것을 명확하게 설명할수록 성공 가능성이 높아집니다.

명세가 모호하면 에이전트가 사용자의 의도를 추론해야 합니다. 그 과정에서 사용자가 상상한 것과 다른 방향으로 갈 수 있습니다.

소프트웨어를 작성하기 전에 무엇을 만들고 싶은지 명확히 정의하는 일은 예전부터 중요했습니다.

하지만 이제는 그 중요성이 더 커졌습니다.

과거에는 지능적인 인간 엔지니어에게 일을 맡겼습니다. 인간은 배경 맥락을 알고 있거나, 필요하면 질문할 수 있었습니다.

에이전트도 질문할 수 있지만, 여전히 명확한 명세가 훨씬 좋은 결과를 만듭니다.

현재 코딩 에이전트가 특히 잘하는 작업 중 하나는 프로그램을 한 언어에서 다른 언어로 변환하는 것입니다.

예를 들어 Python 프로그램을 Go로 변환하는 작업입니다.

이 경우 기존 Python 코드 전체가 매우 상세한 명세 역할을 합니다.

기존 테스트를 Go로 변환할 수 있고, 두 구현의 동작 차이를 비교할 수 있으며, 모든 테스트가 통과할 때까지 수정할 수 있습니다.

명세가 명확하기 때문에 모델이 매우 높은 성능을 보이는 것입니다.



19. 코드가 자동화된 뒤 희소해지는 능력은 ‘무엇을 만들지 고르는 안목’이다

인터뷰어:
모든 창업자가 수백 개의 에이전트를 사용하고 코드가 자동으로 작성된다면, 어떤 능력이 희소해집니까?

제프 딘:
가장 희소한 능력은 에이전트에게 무엇을 시킬지 결정하는 안목입니다.

연구자에게도 도구나 기법 자체보다 어떤 문제에 시간을 쓸 것인지가 훨씬 중요합니다.

중요한 문제를 잘 선택해 해결한다면 큰 가치를 만들 수 있습니다.

반대로 중요하지 않은 문제를 매우 훌륭하게 해결해도 영향은 제한적입니다.

앞으로 사람들은 수많은 AI 에이전트와 연산을 지휘하게 될 것입니다.

하지만 그 연산을 어디에 투입할 것인지, 어떤 결과를 원하는지, 무엇이 가치 있는 문제인지 판단하는 역할은 여전히 인간에게 중요합니다.

모델이 반드시 이런 고차원적 판단을 잘하게 된다고 보기는 어렵습니다.



20. 안목을 기르는 구체적인 방법

인터뷰어:
‘안목’은 다소 추상적인 개념입니다. 어떻게 기를 수 있습니까?

제프 딘:
일부는 경험에서 나옵니다.

다양한 문제를 해결해보면 어떤 문제가 미래에 중요할지 판단하는 능력이 생깁니다.

과거의 여러 접근법을 조합하면 이제 막 가능해지는 일이 무엇인지도 알 수 있습니다.

또 하나의 방법은 앞으로 12개월 동안 중요해질 것이라고 생각하는 아이디어를 여러 개 적어보는 것입니다.

그중 하나만 실제로 작업하더라도, 12개월 뒤 나머지 아이디어들도 다시 평가해볼 수 있습니다.

어떤 것이 실제로 중요해졌는가?

다른 사람이 어떤 것을 만들었는가?

어떤 것은 아무도 만들지 않았는가?

내가 중요하다고 생각했지만 실제로는 중요하지 않았던 것은 무엇인가?

이 과정을 반복하면 자신의 판단을 검증할 수 있는 표본이 늘어납니다.

극단적인 사고실험을 해보는 것도 도움이 됩니다.

대부분의 사람이 당연하게 받아들이는 전제를 의심해보는 것입니다.



21. 오류가 자주 발생하는 트랜지스터로 컴퓨터를 만든다면

인터뷰어:
최근 해본 극단적인 사고실험의 예가 있습니까?

제프 딘:
반도체 산업은 약 60년 동안 트랜지스터를 더 작게 만들면서 오류율을 극도로 낮추기 위해 노력해왔습니다.

같은 설계의 칩은 모두 동일하게 작동해야 한다고 가정합니다. 비트가 뒤집히지 않아야 하고, 메모리에는 오류 정정 기능도 사용합니다.

하지만 대규모 분산 시스템에서는 다른 접근을 씁니다.

각각의 디스크나 서버가 고장 날 수 있다는 사실을 받아들입니다. 대신 데이터를 여러 서버와 랙에 복제하고, 오류 정정 부호를 사용해 전체 시스템의 신뢰성을 확보합니다.

그렇다면 트랜지스터 수준에서도 비슷한 접근을 할 수 있지 않을까요?

트랜지스터 하나가 수백만 년에 한 번 오류를 내는 대신 하루에 20번 오류를 내는 시스템을 상상해볼 수 있습니다.

그렇게 신뢰성이 낮은 트랜지스터를 전제로 하면 제조 방식과 설계 방식이 완전히 달라질 수 있습니다.

하나의 신호를 여러 중복 경로로 보내고, 일부 경로가 실패해도 전체 시스템은 작동하게 만들 수 있습니다.

실제로 그렇게 해야 한다는 뜻은 아닙니다.

대부분의 전통적 설계 방식에는 좋은 이유가 있습니다. 하지만 때때로 오랫동안 유지돼온 전제를 다시 질문해야 합니다.

인간의 뇌도 각각의 신호 전달은 완벽하게 신뢰할 수 있지 않습니다. 중요한 정보는 여러 경로로 전달해 전체적으로 안정성을 확보합니다.



22. MapReduce는 복잡성을 아래 계층으로 숨긴 사고실험에서 나왔다

인터뷰어:
과거에 기존 가정을 깨뜨려 중요한 시스템으로 이어진 사례가 있습니까?

제프 딘:
TPU가 한 사례입니다.

머신러닝이 지금처럼 중요해지기 전부터 특정 연산에 특화된 하드웨어를 만들 수 있다고 생각했습니다.

MapReduce도 좋은 사례입니다.

산제이와 저는 구글의 웹 크롤링과 색인 시스템을 여러 차례 개발했습니다.

당시에는 수백 개 또는 수천 개의 컴퓨터에서 실행되는 코드를 직접 병렬화해야 했습니다.

서버 일부가 죽어도 작업을 계속할 수 있도록 체크포인트와 복구 로직도 작성해야 했습니다.

하지만 실제로 수행하려는 작업은 의외로 단순한 경우가 많았습니다.

예를 들어 모든 웹페이지를 읽고 URL별로 어떤 언어로 작성됐는지 계산하는 정도였습니다.

문제는 단순한 계산 로직이 병렬화, 체크포인트, 장애 복구 코드 속에 묻힌다는 점이었습니다.

우리는 함수형 프로그래밍에서 배운 개념을 떠올렸습니다.

많은 문제를 Map과 Reduce라는 단순한 추상화로 표현하고, 병렬화와 장애 복구는 하위 라이브러리가 처리하도록 만들 수 있다고 생각했습니다.

사용자는 자신이 수행하려는 계산만 작성하고, 시스템이 자동으로 분산 처리와 신뢰성을 책임지는 구조입니다.

이 사고실험은 구글의 대규모 계산을 처리하는 매우 성공적인 방식으로 발전했습니다.



23. AI가 AI를 만드는 자동화된 과학적 방법

인터뷰어:
AlphaChip은 칩 배치를 설계하고, AlphaEvolve는 해결책을 제안하고 평가하며 좋은 결과를 유지합니다. AI가 AI를 만드는 구조가 형성되고 있는 것 아닙니까?

제프 딘:
더 일반적으로 보면 과학적 방법 자체가 자동화되고 있습니다.

과학적 방법은 다음 과정으로 구성됩니다.
  1. 가설이나 실험을 제안한다.
  2. 실험을 실행하기 위해 필요한 것을 구현한다.
  3. 실험을 수행한다.
  4. 결과를 평가한다.
  5. 결과를 바탕으로 다음 실험을 정한다.
이 전체 루프를 자동화할 수 있는 문제가 점점 많아지고 있습니다.

실험 몇 개가 아니라 매우 많은 실험을 수행할 수 있습니다.

자동화를 통해 실험 루프의 지연시간을 극도로 줄이면 머신러닝 모델 설계, 과학, 공학, 칩 설계 등 다양한 영역의 발전이 가속됩니다.

상위 수준의 목표를 하위 문제로 분해하고, 각각의 하위 문제에서 자동 실험을 수행하며, 그 결과를 다시 하나의 전체 해법으로 조립하는 오케스트레이션 시스템이 매우 중요해질 것입니다.



24. 빠른 평가기가 과학 발전을 극적으로 가속할 수 있다

인터뷰어:
명확한 평가 함수가 있는 분야가 자동화에 적합하다고 볼 수 있습니까?

제프 딘:
그렇습니다. 다만 평가 자체가 너무 느린 경우가 있습니다.

예를 들어 양자화학에서 특정 분자의 성질을 확인하기 위해 밀도범함수이론 시뮬레이션을 실행할 수 있습니다.

하나의 분자 구성을 평가하는 데 밤새 계산해야 할 수도 있습니다.

제 동료들은 여러 시뮬레이션의 입력과 출력을 모아, 비싼 시뮬레이터를 근사하는 신경망 모델을 훈련했습니다.

그 결과 거의 비슷한 정확도를 유지하면서 약 30만 배 빠른 평가 시스템을 만들었습니다.

이것은 과학을 수행하는 방식 자체를 바꿉니다.

평가해야 할 후보가 1,000만 개 있다고 가정해봅시다.

기존에는 6개월 동안 대규모 컴퓨팅 자원을 확보해야 했을 수 있습니다.

하지만 30만 배 빠른 평가 모델이 있다면 점심시간 동안 수많은 후보를 선별할 수 있습니다.

여러 과학 분야에서 실제 평가기를 근사하는 빠른 학습 기반 평가 모델을 만들 수 있습니다.

평가 속도가 빨라지면 실험 루프를 훨씬 빠르게 반복할 수 있습니다.



25. 재귀적 자기개선은 기술적으로 막혀 있지 않다

인터뷰어:
가속된 과학적 방법이 특히 큰 영향을 줄 분야는 어디입니까?

제프 딘:
머신러닝 자체가 명확한 사례입니다.

모델이 수많은 실험을 실행하면서 스스로를 재귀적으로 개선할 수 있는지를 생각할 수 있습니다.

현재 대규모 연구팀에서 모델을 개선하는 과정은 대체로 다음과 같습니다.

사람들이 아이디어를 제안합니다.

작은 규모의 실험을 여러 개 실행합니다.

효과가 있었던 아이디어를 더 큰 규모에서 시험합니다.

결과를 평가하고, 성공적인 요소들을 새로운 학습 레시피에 통합합니다.

이 과정을 훨씬 더 자동화하지 못할 근본적인 장애물은 없다고 생각합니다.

사람이 상위 수준에서 “새로운 모델 아키텍처를 탐색해보라”는 방향을 제시할 수 있습니다.

그러면 모델이 수많은 실험을 실행하고, 어떤 것이 효과가 있는지 판단하며, 성공적인 방법을 더 빠르게 통합할 수 있습니다.

결국 중요한 목표는 투입된 연산량당 발견의 양을 최대화하는 것입니다.



26. 증류 논문 거절과 연구자의 판단

인터뷰어:
2014년 제프리 힌턴 등과 작성한 지식 증류 논문이 학회에서 거절된 적이 있습니다. 지금은 업계 전체가 사용하는 기술이 됐습니다.

제프 딘:
당시 한 심사자는 이 연구가 큰 영향을 미칠 가능성이 낮다고 평가했습니다.

저는 심사위원들을 탓하지 않습니다. 논문은 보통 몇 명의 심사자가 평가하며, 그들이 가진 경험과 관점에 따라 중요성을 다르게 볼 수 있습니다.

우리는 당시 큰 모델의 능력을 작고 저렴한 모델로 옮기는 일이 매우 중요하다는 것을 알고 있었습니다.

음성이나 비전 모델을 더 많은 사용자에게 제공하려면 저렴하고 빠른 모델이 필요했기 때문입니다.

하지만 심사자는 대규모 AI 서비스를 운영하는 관점보다, 순수한 기초 연구의 관점에서 봤을 수 있습니다.

논문이 거절되더라도 괜찮습니다.

우리는 논문을 arXiv에 올렸고, 사람들이 읽고 사용했습니다.

현재 Gemini의 Flash 모델이 크기와 속도에 비해 뛰어난 성능을 내는 이유 중 하나도 큰 Pro 모델에서 작은 모델로 능력을 전달하는 증류 기술입니다.

중요한 것은 거절됐다고 해서 중단하지 않는 것입니다.



27. 25세의 제프 딘이라면 무엇을 선택할 것인가

인터뷰어:
지금 25세라면 프런티어 AI 연구소에 들어가겠습니까, 아니면 회사를 창업하겠습니까?

제프 딘:
매우 개인적인 선택입니다.

제가 중요하게 생각하는 질문은 다음과 같습니다.

내가 정말 중요하게 생각하는 문제를 다루고 있는가?

함께 일하는 동료들을 좋아하는가?

우리가 성공했을 때 세상에 긍정적인 영향을 줄 수 있는가?

프런티어 연구소나 대기업에서는 구조가 이미 갖춰져 있습니다.

자신이 모르는 것을 아는 훌륭한 동료들이 많습니다.

다양한 흥미로운 문제를 다룰 수 있고, 이미 많은 사람에게 영향을 줄 수 있는 플랫폼이 존재합니다.

반면 작은 스타트업은 위험이 큽니다.

자신이 열정을 가진 문제가 있어야 하고, 실제로 성공해서 조직을 성장시킬 수 있을지 불확실합니다.

하지만 성공한다면 매우 보람 있는 경험이 될 수 있습니다.

어떤 길을 선택하든 다음 질문을 해야 합니다.

“이 문제에서 가능한 최고의 결과를 달성했을 때 세상이 상당히 더 좋아지는가?”

세상이 “조금 멋지긴 하지만 별 의미는 없다”고 반응할 문제라면 시간을 쓰지 않는 편이 낫습니다.



28. 뛰어난 팀원을 고르는 기준

인터뷰어:
똑똑한 사람들과 함께 일하고 좋은 팀을 만드는 방법은 무엇입니까?

제프 딘:
팀에 필요한 특정 영역에서 뛰어난 기술을 가진 사람을 찾아야 합니다.

하지만 능력만으로는 충분하지 않습니다.

함께 있는 것이 즐거운 사람이어야 합니다.

어려운 문제를 해결하면서 많은 시간을 같이 보내야 하기 때문입니다.

자아가 지나치게 강하지 않고, 팀을 우선하며, 서로 보완적인 기술을 가진 사람이 좋습니다.

저는 작은 팀에서 각자가 서로 다른 것을 아는 상황을 좋아합니다.

나는 다른 사람이 모르는 것을 알고 있고, 다른 사람은 내가 모르는 것을 알고 있습니다.

그러면 혼자서는 만들 수 없던 것을 함께 만들 수 있습니다.

동시에 서로에게서 새로운 지식과 기술을 배울 수 있습니다.

연구자나 엔지니어의 경력은 다양한 도구가 들어 있는 공구 벨트와 같습니다.

항상 새로운 도구를 추가해야 합니다.

앞으로 어떤 문제를 만나게 될지 모르기 때문입니다.

도구가 많을수록 미래의 문제를 해결할 가능성도 높아집니다.



29. 앞으로 해결되기를 바라는 문제들

인터뷰어:
이 방에 있는 누군가가 미래의 MapReduce나 TPU만큼 중요한 것을 만든다면, 어떤 문제를 해결했으면 합니까?

제프 딘:
흥미로운 문제는 매우 많습니다.

저는 특히 새로운 하드웨어 접근법에 관심이 있습니다.

훨씬 더 효율적인 추론 하드웨어가 필요합니다.

현재와 완전히 다른 머신러닝 알고리즘도 가능할 수 있습니다.

오늘날 대규모 모델은 인간이 18세가 될 때까지 접하는 데이터보다 아마 약 1,000배 많은 데이터를 봅니다.

그런데도 18세 인간은 여러 영역에서 프런티어 모델보다 낫거나 비슷합니다.

그렇다면 현재 방식보다 훨씬 데이터 효율적인 학습 시스템을 만들 수 있지 않을까요?

자신의 행동으로부터 지속적으로 학습하는 시스템도 중요합니다.

연속학습은 매우 흥미로운 문제입니다.

다중 에이전트 상호작용도 중요합니다.

사람들이 더 나은 방식으로 토론할 수 있게 돕는 기술도 흥미롭습니다.

온라인에서 더 문명적이고 생산적인 대화를 가능하게 하거나, 비슷한 관심사를 가진 사람들이 세계 곳곳에서 서로 만날 수 있도록 하는 것도 좋은 문제입니다.

세상에는 해결할 가치가 있는 문제가 많습니다.

우리 모두가 지금보다 더 멋진 일이 일어나도록 노력해야 합니다.



인터뷰의 핵심 주장

제프 딘의 주장을 압축하면 다음과 같습니다.

첫째, AI는 이미 주니어 엔지니어 수준의 코딩 업무에 상당 부분 도달했으며, 예상보다 더 빠르게 복잡한 장기 작업으로 확장되고 있습니다.

둘째, 2027년 전후에는 머신러닝 연구의 상당 부분이 자동화될 가능성이 큽니다. AI가 문제를 분해하고, 실험하고, 평가하고, 개선안을 통합하는 연구 루프를 수행하게 될 것입니다.

셋째, AI 발전의 핵심 병목은 모델 파라미터만이 아니라 추론 지연시간, 메모리 대역폭, 데이터 이동, 전력 효율입니다.

넷째, 앞으로의 AI 제품은 하나의 모델이 아니라 모델, 도구, 메모리, 검색, 스킬, 평가기, 다중 에이전트를 결합한 전체 시스템으로 만들어집니다.

다섯째, 작은 스타트업은 범용 모델이 이미 20% 정도 성공하는 문제보다, 현재 성공률이 0~1%에 불과한 문제를 찾아야 합니다.

여섯째, 에이전트 시대에는 코드를 직접 작성하는 능력보다 무엇을 만들지 판단하는 안목, 명확한 명세를 작성하는 능력, 결과를 평가하는 능력이 더 희소해집니다.

일곱째, 빠른 평가 모델과 자동 실험 루프가 결합되면 머신러닝, 화학, 재료과학, 칩 설계 등에서 과학적 발견 속도가 급격히 빨라질 수 있습니다.

여덟째, 재귀적 자기개선을 가로막는 근본적인 기술적 장애물은 없으며, 인간이 수행하던 모델 개선 실험 루프는 점차 자동화될 수 있습니다.



이 인터뷰에서 가장 중요한 발언

제프 딘이 가장 강하게 강조한 부분은 단순히 “모델이 더 좋아질 것”이라는 이야기가 아닙니다.

그가 예상하는 다음 단계는 AI가 독립적인 답변 도구를 넘어 다음과 같은 시스템이 되는 것입니다.
AI가 상위 목표를 이해하고, 문제를 하위 문제로 분해하며, 각 문제에 대해 수많은 실험을 자동으로 실행하고, 결과를 평가한 뒤, 성공적인 결과를 하나의 개선된 시스템으로 통합하는 단계.

이는 단순한 코딩 자동화보다 훨씬 넓은 개념입니다.

AI 연구 자동화, 과학 자동화, 공학 자동화, 칩 설계 자동화가 동일한 구조로 발전할 수 있다는 주장입니다.

특히 제프 딘은 머신러닝 모델이 스스로 새로운 아키텍처와 학습 방법을 탐색하고, 작은 실험과 대규모 실험을 반복하며, 성공한 아이디어를 다음 모델에 통합하는 과정이 훨씬 더 자동화될 수 있다고 보고 있습니다.

따라서 이 인터뷰의 중심 메시지는 다음과 같이 정리할 수 있습니다.

AI의 다음 도약은 하나의 더 큰 모델에서 나오는 것이 아니라, 장기간 작업하는 에이전트, 빠른 추론 하드웨어, 자동 평가기, 다중 에이전트 탐색, 자동화된 실험 루프가 하나의 시스템으로 결합되면서 발생할 가능성이 크다.
전체 0