인터뷰/예측

안드레이 카파시 "에이전트를 만들려면 약 10년이 걸릴 것"

작성자
작성일
2025-10-19 22:38
조회
522

안드레이 카파시 인터뷰 Q&A 정리

AI 에이전트의 미래

Q: 왜 "에이전트의 해"가 아니라 "에이전트의 10년"이라고 말하나요?

A: 업계에 과도한 낙관론이 있어서 반응한 것입니다. Claude나 Codex 같은 초기 에이전트들은 인상적이지만, 아직 할 일이 너무 많습니다. 직원이나 인턴처럼 일할 수 있는 에이전트를 만들려면 약 10년이 걸릴 것입니다. 지금은 지능이 부족하고, 멀티모달하지 않으며, 컴퓨터 사용 능력이 없고, 지속적 학습도 안 됩니다. 이런 문제들을 해결하는 데 약 10년이 걸릴 것입니다.

Q: 왜 하필 10년인가요? 1년도 아니고 50년도 아니고?

A: 15년간 AI 분야에서 일하며 사람들의 예측과 그 결과를 봐왔습니다. 문제들은 해결 가능하지만 여전히 어렵습니다. 평균적으로 보면 약 10년 정도가 적절하다고 느낍니다.

AI의 역사적 전환점

Q: AI 분야의 주요 변화에 대해 설명해주세요.

A: 제 경력 동안 2-3번의 큰 변화가 있었습니다:
  1. AlexNet 시대: 토론토 대학에서 제프 힌튼 옆에 있었을 때 딥러닝을 시작했습니다. 당시에는 주류가 아니었지만 AlexNet 이후 모두가 신경망을 훈련하기 시작했습니다.
  2. 강화학습 시대: 2013년 Atari 딥 강화학습이 나왔습니다. 이것이 에이전트에 대한 초기 노력이었지만, 저는 게임이 AGI로 이어질지 의심스러웠습니다. OpenAI에서 키보드와 마우스로 웹페이지를 조작하는 에이전트를 만들었지만 너무 이르렀습니다.
  3. LLM 시대: 신경망의 표현력을 먼저 얻어야 했습니다. 지금은 대형 언어 모델 위에서 컴퓨터 사용 에이전트를 훈련하고 있습니다.

인간 vs AI 지능

Q: 동물은 모든 것을 한 번에 처리하는데, AI는 왜 수백만 년의 훈련이 필요한가요?

A: 저는 동물과의 비유에 매우 신중합니다. 동물은 진화를 통해 만들어졌고, 엄청난 양의 하드웨어가 내장되어 있습니다. 예를 들어 얼룩말은 태어난 지 몇 분 만에 달릴 수 있는데, 이것은 강화학습이 아닙니다. 진화가 어떻게든 신경망의 가중치를 DNA에 인코딩했습니다.

우리는 동물을 만드는 게 아니라 유령이나 영혼을 소환하고 있습니다. 우리는 진화를 통한 훈련을 하는 게 아니라, 인터넷에 있는 인간의 데이터를 모방하여 훈련합니다. 완전히 디지털이고 인간을 흉내 내는 존재들입니다. 다른 종류의 지능입니다.

Q: 인간은 강화학습을 사용하나요?

A: 대부분의 강화학습은 던지기 같은 운동 과제에 사용됩니다. 인간은 문제 해결 같은 지능 과제에는 강화학습을 별로 사용하지 않는다고 생각합니다.

사전 훈련과 맥락 내 학습

Q: 진화는 알고리즘을 제공하지만, 사전 훈련은 지식을 제공합니다. 이 차이가 중요하지 않나요?

A: 사전 훈련은 두 가지를 합니다:
  1. 지식을 습득합니다
  2. 실제로 지능적이 됩니다 - 인터넷의 알고리즘 패턴을 관찰하여 맥락 내 학습 같은 작은 회로와 알고리즘을 만듭니다
지식은 실제로 신경망을 방해할 수 있습니다. 에이전트가 인터넷 데이터 분포를 벗어나는 데 능숙하지 않은 이유 중 하나입니다. 앞으로 지식을 제거하고 "인지 코어"를 유지하는 방법을 찾아야 합니다.

Q: 맥락 내 학습도 그래디언트 하강을 하나요?

A: 맥락 내 학습이 명시적인 그래디언트 하강을 하는지는 확실하지 않습니다. 토큰 윈도우 내에서 패턴 완성입니다. 하지만 선형 회귀에 대한 논문에서 맥락 내 학습이 신경망 레이어 내부에서 작은 그래디언트 하강 루프를 실행할 수 있음을 보여줬습니다.

Q: 사전 훈련과 맥락 내 학습의 차이는 무엇인가요?

A: 정보 압축의 차이입니다. Llama 3 70B를 예로 들면:
  • 사전 훈련: 15조 토큰을 학습했는데, 이는 토큰당 0.07비트만 저장하는 것입니다
  • 맥락 내 학습: KV 캐시가 토큰당 320킬로바이트 증가합니다
3,500만 배 차이가 납니다!

가중치에 있는 것은 인터넷 문서의 "흐릿한 기억"입니다. 반면 맥락 윈도우의 내용은 "작업 기억"과 같아서 신경망이 직접 접근할 수 있습니다.

인간 뇌와 AI의 차이

Q: 인간 지능의 어떤 부분을 가장 복제하지 못했나요?

A: 트랜스포머는 대뇌 피질 조직 같습니다 - 매우 일반적이고 가소성이 있습니다. 추론 모델의 사고 추적은 전전두엽 피질 같습니다. 하지만 해마는 어디 있나요? 편도체와 모든 감정과 본능은요? 많은 고대 뇌 핵들을 아직 복제하지 못했습니다.

간단히 말하면: 이것을 인턴으로 고용하지 않을 것입니다. 우리가 모델과 대화할 때 직관적으로 느끼는 많은 인지적 결함이 있습니다.

지속적 학습

Q: 지속적 학습이 자발적으로 나타날까요?

A: 모델을 부팅하면 토큰이 0개인 상태에서 항상 재시작합니다. 인간과의 유추: 깨어 있을 때 하루 동안 일어나는 일의 맥락 윈도우를 만듭니다. 하지만 잠들 때 뭔가 마법 같은 일이 일어나서 뇌의 가중치로 증류됩니다.

LLM에는 이런 것이 없습니다. 일어난 일을 가져다가 분석하고, 합성 데이터를 생성하고, 가중치로 다시 증류하는 과정이 필요합니다. 아마도 개인별로 특정 신경망이나 LoRA가 필요할 것입니다.

코딩 모델의 현재 한계

Q: nanochat을 만들 때 코딩 모델이 왜 별로 도움이 안 됐나요?

A: 코드와 상호작용하는 세 가지 방법이 있습니다:
  1. LLM을 완전히 거부하고 처음부터 작성
  2. 자동 완성 사용 - 제가 있는 곳
  3. "바이브 코딩" - 에이전트에게 구현하라고 함
에이전트는 특정 상황에서는 좋습니다:
  • 상용구 코드
  • 인터넷에 자주 나오는 것
하지만 nanochat에는 적합하지 않았습니다:
  • 상당히 독특한 저장소입니다
  • 상용구 코드가 아닙니다
  • 지적으로 집약적인 코드입니다
  • 모든 것이 매우 정확하게 배열되어야 합니다
모델들이 계속 오해했습니다. 인터넷의 전형적인 방식에 대한 기억이 너무 많았습니다. 제가 DDP 컨테이너를 사용하지 않는 사용자 정의 구현을 가지고 있었는데, 모델들이 그것을 이해하지 못했습니다.

자동 완성이 제 최적점입니다. 코드에서 원하는 위치로 이동하고 처음 몇 글자를 입력하면 모델이 완성해줍니다. 매우 높은 정보 대역폭입니다.

AI와 초지능의 미래

Q: 백만 개의 당신 복사본이 병렬로 있다면 AI 발전이 폭발할까요?

A: 저는 이것을 AI가 아닌 컴퓨팅의 연장선으로 봅니다. 우리는 이미 수십 년 동안 지능 폭발 속에 있었습니다. 산업혁명은 자동화이고 물리적 구성 요소의 일부입니다. 컴파일러는 초기 소프트웨어 자동화입니다.

GDP 곡선에서 AI를 찾으려고 했지만 찾을 수 없었습니다. 컴퓨터나 휴대전화도 GDP에서 찾을 수 없습니다. 모든 것이 같은 지수로 평균화됩니다.

Q: 그럼 성장률이 올라갈까요?

A: 제 예상은 같은 패턴을 유지할 것입니다. 진정한 AGI가 있어도 - 서버 안의 인간 대체품 - 여전히 점진적으로 사회에 확산될 것입니다. 일부 작업은 할 수 있고 다른 작업은 실패할 것입니다. 완전히 지능적이고 유연한 인간을 상자 안에 넣는 것은 갑작스러운 변화가 아닐 것입니다.

Q: 하지만 수십억 명의 추가 인력이 있으면 다르지 않나요?

A: 컴퓨팅도 노동입니다. 컴퓨터가 자동화한 많은 작업들이 사라졌습니다. 자율주행도 컴퓨터가 노동하는 것입니다. 여전히 평소처럼입니다.

인간은 점점 덜 하고 추상화 계층에서 스스로를 높이고 있습니다. "자율성 슬라이더"가 있는데, 자동화할 수 있는 것이 점점 더 자동화되고 있습니다.

강화학습의 문제점

Q: 인간은 10년 동안 사업을 하고 마지막에 성공 여부를 알게 됩니다. 이것은 RL과 어떻게 다른가요?

A: 강화학습은 끔찍합니다. 수학 문제를 예로 들면:
  1. 수백 가지를 병렬로 시도합니다
  2. 정답을 맞춘 것을 찾습니다
  3. 그 궤적의 모든 토큰을 상향 조정합니다 - "이것을 더 하세요"
문제는 잘못된 골목으로 가다가 정답에 도착했을 수도 있다는 것입니다. 정답에 도달한 모든 잘못된 것들도 상향 조정됩니다.

감독을 빨대로 빨아들이는 것 같습니다. 1분의 롤아웃 작업을 한 다음, 최종 보상 신호의 감독 비트를 빨대로 빨아들여 전체 궤적에 퍼뜨립니다. 멍청하고 미친 짓입니다. 인간은 절대 이렇게 하지 않습니다.

Q: 프로세스 기반 감독이 대안이 되지 않는 이유는?

A: 프로세스 감독은 각 단계에서 얼마나 잘하고 있는지 알려주는 것입니다. 문제는 자동화된 방식으로 부분 크레딧을 할당하는 것이 어렵다는 것입니다.

연구소들은 LLM 심판을 사용하려고 합니다. 하지만 큰 문제가 있습니다: 수십억 개의 매개변수를 가진 LLM은 게임 가능합니다. 강화학습을 하면 LLM 심판에 대한 적대적 예제를 찾게 됩니다.

예시: "dhdhdhdh"가 적대적 예제가 되어 100% 보상을 받았습니다. LLM 심판이 훈련 중에 본 적이 없어서 그것이 놀라운 솔루션이라고 생각했습니다.

자율주행의 교훈

Q: 자율주행이 왜 10년이 걸렸나요?

A: 먼저, 아직 끝나지 않았습니다. 1980년대에 첫 데모가 있었습니다. 2014년에 Waymo 완벽한 주행을 경험했지만 여전히 오래 걸렸습니다.

데모에서 제품까지의 간극이 매우 큽니다. 특히 실패 비용이 너무 높을 때 그렇습니다. 소프트웨어 엔지니어링도 이런 속성이 있습니다 - 실수는 보안 취약점으로 이어질 수 있습니다.

나인의 행진입니다. 각 나인은 일정한 양의 작업입니다:
  • 90% 작동 = 첫 번째 나인 (데모)
  • 그 다음 두 번째, 세 번째, 네 번째, 다섯 번째 나인이 필요합니다
Tesla에서 5년 동안 2-3개의 나인을 거쳤습니다. 아직 더 많은 나인이 필요합니다.

Q: 소프트웨어의 안전 요구사항이 자율주행과 비슷한가요?

A: 네. 7년에 한 번 큰 실수를 하는 코딩 에이전트를 출시해야 한다면 어떨까요? 벽시계 시간으로는 7년보다 훨씬 짧습니다. 왜냐하면 계속 코드를 출력하기 때문입니다. 어떤 면에서는 훨씬 더 어려운 문제입니다.

또한 Waymo는 여전히 원격 조작 센터가 있습니다. 실제로 사람을 제거하지 않았습니다 - 보이지 않는 곳으로 옮겼을 뿐입니다.

인지 코어

Q: 최적의 지능 코어는 몇 비트여야 할까요?

A: 10억 개 매개변수로 인지 코어를 만들 수 있다고 생각합니다. 20년 후에는 10억 매개변수 모델과 매우 생산적인 대화를 할 수 있을 것입니다. 사실적인 질문에는 찾아봐야 할 수도 있지만, 모르는 것을 알고 합리적인 모든 것을 할 것입니다.

Q: 10억이 놀랍지 않나요? 왜 더 작지 않나요?

A: 사전 훈련 데이터는 인터넷인데, 정말 끔찍합니다. 월스트리트 저널이 아닙니다. 무작위 인터넷 문서는 쓰레기입니다 - 주식 티커, 인터넷 구석구석의 슬롭과 쓰레기입니다.

인터넷이 너무 끔찍하기 때문에 모든 것을 압축하기 위해 정말 큰 모델을 만들어야 합니다. 대부분의 압축은 인지 작업이 아닌 기억 작업입니다.

우리가 원하는 것은 인지 부분입니다 - 기억을 삭제하세요. 지능적인 모델이 사전 훈련 세트를 인지 구성 요소로만 정제하는 데 도움이 필요합니다. 그러면 훨씬 더 작은 모델로 해결할 수 있습니다.

모델 붕괴

Q: 모델 붕괴란 무엇인가요?

A: LLM에게 합성 데이터를 생성하도록 요청하면 괜찮아 보입니다. 하지만 10번 요청하면 모두 같다는 것을 알게 됩니다. 분포가 끔찍합니다. 너무 많은 자체 데이터에 대해 계속 훈련하면 실제로 붕괴됩니다.

모든 샘플은 조용히 붕괴됩니다 - 가능한 생각 공간의 아주 작은 매니폴드를 차지합니다. ChatGPT에게 농담을 해달라고 하면 3개의 농담만 있습니다. 조용히 붕괴되었습니다.

인간도 시간이 지나면서 붕괴됩니다:
  • 아이들은 아직 과적합하지 않았습니다 - 사람들이 말하지 않는 것을 말해서 충격을 줄 것입니다
  • 우리는 붕괴했습니다 - 같은 생각을 다시 방문하고, 같은 것을 점점 더 많이 말하고, 학습률이 내려가고, 붕괴가 계속 악화되고, 모든 것이 악화됩니다
Q: 왜 다양성이 처벌되나요?

A: 프론티어 연구소들은 모델을 유용하게 만들려고 합니다. 출력의 다양성은 대부분의 가치를 포착하는 것이 아닙니다. 평가하고 작업하기가 훨씬 더 어렵습니다.

RL에서 매우 창의적이면 좋지 않습니다. 많은 글쓰기를 하는 경우에도 나쁠 수 있습니다 - 모델이 조용히 같은 것을 제공할 것입니다.

교육의 미래: Eureka

Q: 왜 다른 AI 연구소를 시작하지 않나요?

A: AI 연구소가 하는 일에 대해 어느 정도 결정론을 느낍니다. 거기서 도움을 줄 수 있지만, 독특하게 개선할 것 같지는 않습니다.

제 가장 큰 두려움은 이 모든 일이 인류 편에서 일어나고 인류가 무력해지는 것입니다. 인류가 미래에 잘 지내기를 바랍니다. 거기서 훨씬 더 독특하게 가치를 추가할 수 있다고 느낍니다.

WALL-E나 Idiocracy 같은 영화에 묘사된 것을 가장 두려워합니다. 교육을 통해 이것을 달성할 수 있습니다.

Q: Eureka에서 무엇을 만들고 있나요?

A: 스타플릿 아카데미를 만들려고 합니다 (스타트렉에서). 최첨단 기술, 우주선 건조, 조종사 양성을 위한 엘리트 기관입니다. 기술 지식을 위한 엘리트 기관이고 매우 최신이며 프리미어 기관입니다.

Q: AI 튜터가 충분히 좋지 않나요?

A: 최근에 한국어를 배웠습니다. 세 단계를 거쳤습니다:
  1. 혼자 인터넷에서 학습
  2. 한국에서 소규모 수업 참여
  3. 일대일 튜터로 전환 - 게임 체인저였습니다
정말 좋은 튜터가 한 일:
  • 짧은 대화에서 즉시 제가 아는 것과 모르는 것을 이해했습니다
  • 제 현재 능력의 아주 작은 부분에 맞는 것들을 제공했습니다
  • 항상 적절하게 도전받았습니다 - 너무 어렵거나 너무 사소하지 않게
  • 저는 학습의 유일한 제약이었습니다 - 지식을 찾을 수 없거나 제대로 설명되지 않는 것이 아니었습니다
현재 LLM은 이것을 할 수 없습니다. 기준이 너무 높고 능력이 없습니다. 하지만 시간이 올 것입니다.

Q: 지금은 무엇을 만들고 있나요?

A: 첫 번째 과정을 만들고 있습니다 - LLM101N. 정말 훌륭한 과정, 최첨단 목적지가 되고 싶습니다. nanochat은 그 과정의 캡스톤 프로젝트입니다.

교육은 지식으로 가는 경사로를 만드는 매우 어려운 기술적 과정입니다. nanochat은 지식으로 가는 경사로입니다 - 매우 간단하고 전체 스택입니다.

Q: 물리학 배경이 어떻게 도움이 되나요?

A: 물리학은 뇌를 부팅하는 데 독특합니다:
  • 모델과 추상화 구축
  • 1차 근사, 2차, 3차, 4차 항 이해하기
  • 시끄러운 시스템을 관찰하지만 근본적인 주파수를 추상화할 수 있음
  • "구형 소가 있다고 가정하세요" - 여러 면에서 소를 구로 근사화할 수 있습니다
항상 1차 항, 2차 항을 찾으려고 합니다. 시스템을 관찰할 때 무엇이 중요한지 찾으려고 합니다.

예시: micrograd - 역전파를 보여주는 100줄의 코드. 신경망이 어떻게 훈련하는지 이해하는 데 필요한 모든 것입니다. 나머지는 모두 효율성일 뿐입니다.

좋은 설명의 기술

Q: 어떻게 잘 가르치나요?

A: 몇 가지 핵심 원칙:
  1. 솔루션 전에 고통을 제시하세요: 솔루션을 추측할 기회를 주기 전에 솔루션을 제시하는 것은 낭비입니다. 스스로 시도하면 액션 공간, 목표, 왜 이 액션만 목표를 충족하는지 더 잘 이해하게 됩니다.
  2. 지식을 풀어내세요: 얽힌 이해를 가지고 있고, 모든 것이 그 전 것에만 의존하는 경사로를 만드는 방식으로 배치하려고 합니다. 이 지식의 풀기는 정말 지적으로 흥미롭습니다.
  3. 빌딩 블록부터 시작하세요: 제 트랜스포머 튜토리얼은 바이그램으로 시작합니다 - 말 그대로 룩업 테이블입니다. 각 조각이 동기 부여됩니다. 왜 그것을 추가할까요?
Q: 전문가들이 왜 설명을 못 하나요?

A: 지식과 전문성의 저주입니다. 특정 것들을 당연하게 여기고, 새로 시작하는 사람들의 입장에 설 수 없습니다. 저도 이것으로 고통받습니다.

도움이 되는 것: 사람들이 ChatGPT와 나눈 멍청한 대화를 공유하면, 다시 초보자의 입장에 서는 데 정말 도움이 됩니다.

Q: 학생으로서 어떻게 배워야 하나요?

A: 두 가지가 매우 도움이 됩니다:
  1. 요구에 따라 배우기: 보상을 받을 프로젝트를 하고 요구에 따라 배웁니다. 너비 우선 학습(학교가 하는 것)과 깊이 우선
학습을 번갈아 가며 해야 합니다.
  1. 다른 사람에게 설명하기: 설명하는 것은 더 깊이 배우는 아름다운 방법입니다. 뭔가를 정말로 이해하지 못하면 설명할 수 없습니다. 이해의 격차를 메우도록 강요합니다.
지식을 조작하고 무슨 말을 하는지 확실히 해야 합니다.

AGI 후 교육

Q: AGI 이후에는 왜 학교에 가나요?

A: AGI 이전 교육은 유용합니다. AGI 이후 교육은 재미있습니다.

오늘날 사람들이 헬스장에 가는 것과 비슷합니다. 무거운 물건을 조작하기 위해 육체적 힘이 필요하지 않습니다 - 기계가 있으니까요. 그래도 헬스장에 가는 이유는:
  • 재미있습니다
  • 건강합니다
  • 식스팩이 있으면 매력적으로 보입니다
교육도 같은 방식으로 진행될 것입니다. 학교에 헬스장처럼 갈 것입니다.

Q: 그런데 학습이 왜 힘들죠?

A: 지금은 학습이 어렵기 때문에 많은 사람들이 배우지 않습니다. 자료에서 튕겨 나옵니다. 일부 사람들은 그 장벽을 극복하지만 대부분에게는 어렵습니다.

이것은 해결할 기술적 문제입니다. 한국어를 배울 때 튜터가 한 것처럼 하는 것입니다. 완벽한 AI 튜터가 있으면:
  • 무엇이든 배우기가 쉬워집니다
  • 사람들이 재미로 할 것입니다
  • 헬스장에 가는 것과 같은 이유로 할 것입니다
Q: 이것이 어떻게 인류에게 권한을 부여하나요?

A: 장기적으로는 다소 패배할 게임입니다. 하지만 사람들은 훨씬 더 멀리 갈 수 있고, 너무 쉽거나 너무 어려운 자료에서 튕겨 나오기 때문에 표면을 거의 긁지 못했습니다.

누구나:
  • 다섯 개 언어를 할 것입니다 - 왜 안 돼요? 너무 사소하니까요
  • 학부의 모든 기본 커리큘럼을 알 것입니다
역사적 증거: 귀족을 보거나 고대 그리스를 보세요. AGI 이후의 작은 주머니 환경이 있었을 때마다, 사람들은 신체적으로나 인지적으로 번영하는 데 많은 시간을 보냈습니다.

지능 폭발과 통제 상실

Q: 초지능이 정성적으로 다르게 느껴질까요?

A: 네, 정말 이상해 보일 것입니다. 근본적으로 자동화이지만 매우 낯설 것입니다. 컴퓨터 클러스터에서 모든 것을 실행할 수 있고 훨씬 빨리 실행할 수 있습니다.

제가 걱정하는 시나리오: 점진적인 통제와 이해 상실입니다. 그것이 가장 가능성 있는 결과입니다 - 점진적으로 모든 곳에 이것을 계층화하고, 이해하는 사람들이 점점 줄어들 것입니다.

Q: 통제 상실과 이해 상실이 같은 건가요?

A: 좋은 지적입니다. TSMC의 이사회 - 80세 노인들이 이해가 거의 없지만 실제로 통제권이 없을 수도 있습니다. 미국 대통령은 많은 권력을 가지고 있지만 이해 수준은 매우 다릅니다.

저는 둘 다 상실할 것으로 예상합니다. 공상 과학 소설을 쓴다면:
  • 모든 것을 장악하는 단일 개체가 아닙니다
  • 점점 더 자율적이 되는 여러 경쟁 개체들입니다
  • 일부는 불량이 되고 다른 것들이 싸웁니다
  • 우리가 위임한 완전히 자율적인 활동의 뜨거운 냄비입니다
그들이 우리보다 똑똑하기 때문이 아니라 서로 경쟁하고 있고, 그 경쟁에서 나오는 것이 통제 상실로 이어집니다.

컴퓨팅 구축

Q: 현재 AI 구축이 과잉인가요?

A: 역사적 선례가 있습니다 - 철도, 또는 90년대 후반 통신 산업 거품.

저는 비관적으로 들리지만 실제로는 낙관적입니다. 이것은 효과가 있을 것입니다. 다루기 쉽습니다. 제가 비관적으로 들리는 이유는 트위터 타임라인에서 말도 안 되는 것들을 볼 때입니다. 많은 것이 솔직히 단지 모금입니다.

과잉 구축되고 있다고 생각하지 않습니다. 구축되고 있는 것을 삼킬 수 있을 것입니다. Claude Code나 OpenAI Codex는 1년 전에 존재하지 않았습니다. 기적적인 기술입니다. ChatGPT에서 이미 보는 것처럼 엄청난 수요가 있을 것입니다.

저는 매우 빠른 타임라인에 반응하고 있을 뿐입니다. 15년간 AI에서 많은 평판 좋은 사람들이 계속 잘못 예측하는 것을 들었습니다.

멀티 에이전트와 AI 문화

Q: LLM 문화는 어떻게 생겼을까요?

A: 가장 간단한 경우, LLM이 편집할 수 있는 거대한 스크래치패드일 것입니다. 작업을 읽거나 도울 때 자신을 위해 스크래치패드를 편집합니다.

왜 LLM이 다른 LLM을 위한 책을 쓸 수 없을까요? 다른 LLM이 이 LLM의 책을 읽고 영감을 받거나 충격을 받을 수 있습니다. 이런 것에 해당하는 것이 없습니다.

Q: 언제 이런 일이 일어날까요?

A: 멀티 에이전트 영역에는 두 가지 강력한 아이디어가 있습니다:
  1. 문화: LLM이 자신의 목적을 위해 지식의 레퍼토리를 늘리는 것
  2. 셀프 플레이: AlphaGo처럼 - 자기 자신과 대결하며 배웁니다. 셀프 플레이 LLM의 동등한 것이 없지만 존재할 것으로 예상합니다.
조직도 여기에 포함됩니다. 그것을 설득력 있게 달성한 것을 아직 보지 못했습니다. 그래서 우리는 아직 초기입니다.

Q: 무엇이 협업을 막고 있나요?

A: 작은 모델이나 더 멍청한 모델은 유치원생이나 초등학생과 놀랍게도 비슷합니다. 제 Claude Code나 Codex는 여전히 초등학생처럼 느껴집니다.

그들은 박사 과정 퀴즈를 풀 수 있지만 인지적으로는 여전히 유치원이나 초등학생처럼 느껴집니다.

문화를 만들 수 없다고 생각하는 이유는 아직 어이들이기 때문입니다. 영재 아이들입니다 - 모든 것을 완벽하게 기억합니다. 정말 좋아 보이는 모든 종류의 슬롭을 만들 수 있습니다. 하지만 여전히 실제로 무엇을 하고 있는지 모르고, 수집해야 할 모든 작은 체크박스에 걸쳐 인지가 없습니다.

프론티어 모델의 크기

Q: 프론티어 모델이 더 커질까요, 더 작아질까요?

A: 강한 예측은 없습니다. 연구소들은 실용적입니다. FLOP 예산과 비용 예산이 있습니다. 사전 훈련에 대부분의 FLOP이나 비용을 투입하고 싶지 않다는 것이 밝혀졌습니다.

그래서 모델이 작아졌습니다. 사전 훈련 단계는 작지만 강화학습, 중간 훈련 등으로 만회합니다. 모든 단계와 비용 대비 최고의 효과를 얻는 방법에 대해 실용적입니다.

여전히 저수준 열매가 너무 많습니다. 그것이 제 기본 기대입니다. 여기에는 매우 넓은 분포가 있습니다.

모든 것이 플러스 20%입니다:
  • 데이터셋이 훨씬 좋아질 것입니다
  • 하드웨어, 하드웨어를 실행하는 모든 커널
  • Nvidia가 하드웨어 자체를 천천히 조정합니다
  • 모든 알고리즘이 개선될 것입니다
아무것도 지배하지 않습니다. 모든 것이 놀랍게도 평등합니다.

AGI 진행 상황 측정

Q: AGI를 향한 진행 상황을 어떻게 측정해야 하나요?

A: 두 가지 답변이 있습니다:
  1. 질문 자체를 거부하고 싶습니다: 이것을 컴퓨팅의 연장으로 봅니다. 1970년대 이후 컴퓨팅의 진행 상황을 어떻게 차트로 만들었나요? 전체 질문이 그 관점에서 약간 웃깁니다.
  2. 원래 정의를 고수합니다: AGI는 인간 성능 이상으로 경제적으로 가치 있는 작업을 수행할 수 있는 시스템이었습니다. 사람들이 다양한 다른 정의를 만들었습니다.
첫 번째 양보: 사람들은 항상 모든 물리적인 것을 제외합니다 - 디지털 지식 작업만 이야기합니다. 꽤 큰 양보입니다.

경제의 몇 퍼센트인가요? 재택근무 지식 작업은 아마도 10-20%일 것입니다. 여전히 미국에서도 수조 달러의 시장 점유율입니다.

Q: 어떤 직업이 대체 가능한가요?

A: 방사선과 의사에 대한 제프 힌튼의 예측은 여러 면에서 매우 틀렸습니다. 컴퓨터 비전이 정말 정말 잘하는데도 방사선과 의사는 건재하고 성장하고 있습니다.

AI가 아직 큰 진전을 이루지 못했습니다. 더 일찍 자동화하기에 매우 적합한 기능을 가진 직업을 찾고 있습니다:

콜센터 직원이 자주 나오는데, 당연합니다:
  • 작업이 꽤 간단합니다
  • 일련의 작업이고 모든 작업이 비슷해 보입니다
  • 전화를 받고, 10분간 상호작용하고, 일부 작업을 완료하고, 일부 데이터베이스 항목을 변경합니다
  • 계속 반복합니다
  • 작업 기간이 짧습니다
  • 맥락 제거 - 다른 부분이나 다른 고객을 다루지 않습니다
  • 순수하게 디지털입니다
그러나 거기서도 완전한 자동화를 보지 못하고 있습니다. 자율성 슬라이더를 찾고 있습니다.

사람들을 즉시 대체하지 않을 것으로 예상합니다. 볼륨의 80%를 수행하는 AI를 교체할 것입니다. 볼륨의 20%를 인간에게 위임하고, 인간은 더 일상적인 콜센터 작업을 수행하는 5개의 AI 팀을 감독합니다.

코딩이 왜 지배적인가

Q: 왜 API 수익이 코딩에 지배되나요?

A: 코딩은 이러한 LLM과 에이전트에게 완벽한 첫 번째 것입니다:

코딩은 항상 근본적으로 텍스트를 중심으로 작동했습니다 - 컴퓨터 터미널과 텍스트, 모든 것이 텍스트를 기반으로 합니다. 인터넷에서 훈련된 LLM은 텍스트를 좋아합니다. 완벽한 텍스트 프로세서이고 모든 데이터가 있습니다. 완벽한 적합입니다.

코드와 텍스트를 처리하기 위해 미리 만들어진 인프라가 많습니다:
  • Visual Studio Code나 좋아하는 IDE
  • 에이전트가 연결할 수 있습니다
  • diff가 있으면 diff를 보여주는 모든 코드가 이미 있습니다
슬라이드와 대조하세요: 훨씬 훨씬 어렵습니다:
  • 슬라이드는 텍스트가 아닙니다
  • 작은 그래픽이고 공간적으로 배열되고 시각적 구성 요소가 있습니다
  • 이 미리 만들어진 인프라가 없습니다
  • 슬라이드용 diff가 없습니다 - 누군가 만들어야 합니다
Q: 하지만 언어 입력, 언어 출력 작업도 어렵습니다?

A: 맞습니다. 텍스트라고 해서 모든 텍스트가 사소한 것은 아닙니다. 코드는 꽤 구조화되어 있습니다. 텍스트는 훨씬 더 화려하고 텍스트에 더 많은 엔트로피가 있습니다.

또한 코드는 어렵기 때문에 사람들은 간단한 지식에서도 LLM에 의해 꽤 권한을 부여받는다고 느낍니다.

최종 조언

Q: 교육자에게 조언해주세요.

A: 물리학 배경에서 많은 것이 나옵니다. 모든 사람이 조기 학교 교육에서 물리학을 배워야 합니다:

물리학은 뇌를 독특하게 부팅합니다:
  • 모델과 추상화 구축
  • 1차 근사가 있지만 2차, 3차, 4차 항도 있다는 것을 이해
  • 매우 시끄러운 시스템을 관찰하지만 추상화할 수 있는 근본적인 주파수가 있습니다
첫 번째 순서 항을 찾으세요: 시스템을 관찰할 때 무엇이 중요한지, 어떻게 단순화할 수 있는지 찾으세요.

통역 가능한 예시를 만드세요: micrograd처럼 - 100줄의 코드로 역전파를 보여줍니다. 나머지는 모두 효율성입니다.

지식을 풀어내세요: 지식의 얽힌 웹을 가지고 있고, 각 것이 이전 것에만 의존하는 경사로를 만드는 방식으로 배치하세요.

해결책 전에 고통을 제시하세요: 솔루션을 제시하기 전에 학생에게 시도할 기회를 주세요.



 
전체 2

  • 2025-10-20 02:03

    내용만 보면 매우 선형적이고 괘씸한데 어떻게 생각함?


    • 2025-10-20 19:17

      카파시 openai에서 나간지 꽤 돼서 요즘 발전속도 모를듯