자유게시판
즈푸 어닝 스크립트
작성자
작성일
2026-09-02 00:00
조회
8
탕제(Tang Jie)
투자자 및 애널리스트 여러분, 안녕하십니까. 2026년 상반기 실적 설명회에 참석해 주셔서 진심으로 감사드립니다.먼저 즈푸(Zhipu)의 기본적인 현황과 최근의 고민, 그리고 향후 기술 로드맵에 대해 간략히 말씀드리겠습니다.
대규모 모델 기술은 이미 거의 10년 동안 발전해 왔습니다. 지난해부터 즈푸는 대규모 모델이 “대화하는 것(Chatting)”에서 “일을 하는 것(Doing)”으로 전환하고 있다고 판단했고, 비교적 이른 시점부터 이에 대응하기 시작했습니다. 특히 모델의 코딩 능력을 강화하는 데 중점을 두었습니다.
지난해 중반에는 코딩에서 처음으로 강한 성과를 거둔 모델인 GLM-4.5를 출시했습니다. 올해 들어서는 GLM-5.0, 5.1, 5.2, 5.3을 차례로 출시했으며, 모두 동일한 기반 위에서 지속적으로 반복 개선해 왔습니다.
첫 번째 질문은 이렇습니다.
스케일링(Scaling)이 반드시 파라미터 수를 크게 늘리는 것을 의미하는가?
스케일링은 더 높은 지능을 향하는 핵심 경로이지만, 그 본질이 단순히 파라미터 수를 늘리는 데 있는 것은 아닙니다.
올해 들어 우리는 베이스 모델의 규모뿐 아니라 후속 훈련(Post-training)과 과제 환경(Task Environment)의 규모도 크게 강화했습니다.
파라미터 규모를 늘리는 동시에 모델의 유효 깊이(Effective Depth)도 늘려야 합니다. 예를 들어 Loop Transformer를 사용하면 추론 과정에서 모델이 더 깊이 생각하도록 만들 수 있습니다. 최근 우리는 이와 관련된 연구를 진행하고 있습니다.
동시에 후속 훈련에도 여전히 상당히 큰 개선 여지가 있습니다. 그래서 GLM-5.3에는 매우 많은 자원을 투자했고, 특히 후속 훈련을 크게 강화했습니다.
코딩 역시 하나의 단일 과제가 아니라 매우 다양한 종류의 과제를 포함합니다. 여러 유형의 코딩 과제에서 모델을 강화하면 전체적인 능력을 체계적으로 향상시킬 수 있습니다.
우리는 다양한 과제 환경에서 많은 작업을 수행했고, 이를 통해 GLM-5.3의 성능이 크게 향상되어 SOTA(State of the Art) 수준, 즉 현재 지능 프런티어 수준에 도달했습니다.
한편 모델은 강력하기만 해서는 안 됩니다. 사용자가 실제로 감당할 수 있고 접근할 수 있어야 합니다.
모델을 설계할 때는 모델 크기, 활성 파라미터 수뿐 아니라 추론 효율과 인프라 효율도 고려해야 합니다. 추론 비용을 낮춰야만 기술을 보다 광범위하게 사용할 수 있기 때문입니다.
이 때문에 GLM-5 시리즈를 설계할 때 우리는 특히 추론 능력 강화에 중점을 두었습니다.
현재 중국에서는 엔비디아 칩과 다양한 중국산 칩이 함께 사용되고 있습니다. 우리는 외부 자원을 활용하고 추론 기술 전문 기업을 인수하면서 추론 역량을 더욱 강화했습니다.
이를 통해 GLM-5.1, 5.2, 5.3을 보다 쉽게 배포하고 사용할 수 있게 만들었습니다.
현재 모델 사용량도 매우 큽니다. 한때 OpenRouter에서 우리의 사용량이 1위를 기록하기도 했습니다.
새로운 모델을 출시할 때마다 MaaS 플랫폼의 호출량은 대체로 2배씩 증가해 왔습니다.
이것이 올해 우리의 전반적인 포지셔닝과 진행 상황에 대한 기본적인 설명입니다.
모델 연구개발 기업의 핵심 과제는 결국 지능의 프런티어를 지속적으로 끌어올리는 것입니다.
이는 다시 즈푸의 가장 근본적인 비전으로 돌아갑니다.
2019년 우리는 즈푸의 단 하나의 비전을 정했습니다.
“기계가 인간처럼 생각하도록 만든다.”
오늘날까지도 우리는 지능의 상한선을 탐구하고 있습니다.
지능의 상한선을 탐구한다는 것은 단순히 모델을 훈련하는 것만을 의미하지 않습니다.
미래의 모델이 어떤 종류의 지능을 가져야 하는지, 무엇을 할 수 있어야 하는지를 함께 고민해야 합니다.
우리는 다음 단계의 기술 로드맵과 관련해 몇 가지 방향을 설정했습니다.
첫째, 올해 초 우리는 코딩이 업계 전반에서 인정받는 핵심 방향으로 자리 잡았다고 판단했습니다.
그리고 코딩 능력을 바탕으로 모델이 더 많은 과제를 수행할 수 있는 방법을 고민하기 시작했습니다.
GLM-5.1과 5.2를 중심으로 우리는 Long Horizon Task, 즉 장기 과제라는 개념을 제안했습니다.
모델이 더 긴 시간 범위의 과제를 수행할 수 있게 하려는 것입니다.
또한 Autonomous AI, 즉 모델이 과제를 자율적으로 완수할 수 있어야 한다는 개념도 제시했습니다.
이러한 능력을 갖추게 된 이후에도 모델은 계속 진화해야 합니다.
우리는 이미 완전한 자기훈련(Fully Self-Training) 모델 연구를 시작했습니다.
우리는 모델이 사전훈련(Pre-training), 중간훈련(Mid-training), 후속훈련(Post-training)의 전 과정에서 자율적으로 학습하고, 자체적으로 Harness를 구축하면서 훈련 과정 자체가 점차 자율화되기를 기대합니다.
최근의 추론 최적화 작업, 특히 GLM-5.3 출시와 중국산 칩용 인프라 최적화 과정에서는 이미 Infra Agent를 사용하고 있습니다.
GLM-5.3 기반의 Infra Agent는 중국산 칩을 위한 최적화 방안을 자율적으로 수정할 수 있으며, 이를 통해 성능을 상당히 개선했습니다.
앞으로도 이러한 방향으로 계속 나아가며 관련 능력을 더욱 강화할 것입니다.
마지막으로 AI를 더 많은 사람이 접근하고 사용할 수 있도록 만드는 과정에서는 사회적 책임 역시 매우 중요합니다.
모델의 출시와 대규모 사용에는 강력한 거버넌스와 안전 메커니즘이 필요합니다.
우리는 사회 거버넌스, 공공안전, 윤리와 관련한 모델의 능력을 어떻게 강화할 수 있을지 계속 고민하고 있으며, 이미 관련 연구를 시작했습니다.
앞으로 투자자와 애널리스트 여러분께서도 더 많은 제안과 지원을 해주시기를 바랍니다.
함께 AGI의 프런티어와 모두가 접근 가능한 AI로 향하는 길을 탐구해 나가기를 기대합니다.
류더빙(Liu Debing)
다음으로 올해 상반기의 성과와 우리의 생각을 종합적으로 말씀드리겠습니다.요약하자면, 지난해의 핵심 키워드가 “지능 프런티어(Intelligence Frontier)”였다면, 올해 상반기의 핵심 키워드는
“능력을 가치로 전환한다(Turning Capability into Value)”
였습니다.
처음으로 모델은 단순한 도구가 아니라 하나의 과제를 독립적으로 완수할 수 있는 시스템이라는 점이 입증되었습니다.
이에 따라 회사의 매출 구조도 변화했고, 강력한 모델이 만들어내는 상업적 가치가 본격적으로 대규모로 실현되기 시작했습니다.
1. 전략적 집중과 모델 발전에 대한 생각
먼저 지능 프런티어가 과제의 경계를 결정하고, 과제의 가치가 상업적 기회를 결정합니다.지난 3월 연간 실적 설명회에서 우리는 다음과 같은 공식을 제시했습니다.
AGI의 상업적 가치 = 지능 프런티어 × 토큰 소비 규모
지능 프런티어는 모델이 어떤 과제를 처리할 수 있는지, 그리고 각 토큰이 사용자에게 얼마나 큰 가치를 만들어낼 수 있는지를 결정합니다.
지능 프런티어가 높아질수록 모델이 처리할 수 있는 과제의 가치 밀도(Value Density)도 높아집니다.
즉, 동일한 단위의 지능이 만들어내는 경제적 산출 역시 증가합니다.
토큰 소비 규모는 지능이 얼마나 폭넓고 깊게 사용되고 있는지를 나타냅니다.
같은 하나의 토큰이라도 단순한 일상 대화에 사용되는 것과 실제 운영 환경에서 보안 취약점을 수정하는 데 사용되는 것은 결과적으로 만들어내는 가치가 몇 자릿수 차이가 날 수 있습니다.
따라서 토큰이 사용되는 시나리오의 가치 밀도는 모델이 열어낼 수 있는 과제의 경계에 달려 있습니다.
과제의 경계가 한 단계 높아질 때마다 시장 기회는 한 자릿수 규모(order of magnitude)로 확대될 수 있습니다.
2. 모델 능력 발전의 다섯 단계
우리는 대규모 모델 능력의 진화가 서로 독립적인 여러 제품 라인이 아니라, 순차적으로 올라가는 계단식 구조라고 생각합니다.Chat → Coding → Agent → Cowork → Autonomous AI
Chat은 한 번의 답변을 제공합니다.
Coding은 실행 가능한 코드를 제공합니다.
Agent는 여러 단계로 이루어진 일련의 과제를 완수합니다.
Cowork는 전문가가 검토할 수 있는 수준의 업무 결과물을 제공합니다.
Autonomous AI는 지속적으로 운영될 수 있는 능력을 제공합니다.
각 단계로 올라가기 위해서는 구체적인 기술적 임계점을 넘어야 합니다.
그 임계점을 넘지 못하면 다음 단계의 비즈니스 모델은 성립할 수 없습니다.
Chat에서 Coding으로 넘어갈 때의 기준은 결과를 검증할 수 있는가입니다.
Coding에서 Agent로 넘어갈 때의 기준은 장기 계획과 오류 복구 능력입니다.
Agent에서 Cowork로 넘어갈 때의 기준은 전문가가 결과를 처음부터 다시 만들지 않고 검토만 할 정도로 신뢰성이 충분한가입니다.
Cowork에서 Autonomous AI로 넘어갈 때의 기준은 모델이 자신의 결과가 올바른지 스스로 판단할 수 있는가입니다.
이번 보고 기간 동안 회사의 초점은 Coding과 Cowork 사이에 있었습니다.
우리는 이미 사이버보안, 법률 서비스, 금융, 교육 등의 분야에서 실험을 시작했습니다.
현재 가장 빠르게 진행되고 있는 분야는 사이버보안입니다.
그 외 분야는 아직 초기 단계이며 대규모 매출을 발생시키지는 못하고 있습니다.
우리 모델은 CyberGym에서 84.5점을 기록해 Fable5와 GPT-5.6 SOLO를 넘어섰습니다.
ExploitGym에서는 130개의 과제를 완료해 Fable5와 GPT-5.6 다음 수준을 기록했습니다.
3. 지속적인 모델 반복과 SOTA 유지가 중요하다
지난 1년 동안 업계에서 SOTA를 바라보는 관점이 변화하고 있습니다.단기간 벤치마크에서 1위를 차지하는 것은 더 이상 가장 중요한 일이 아닙니다.
정말 중요한 것은
누가 더 빠른 속도로, 더 낮은 비용으로, 지속적으로 더 강한 모델을 시장에 내놓을 수 있느냐
입니다.
한 번의 1위는 금방 사라집니다.
중요한 것은 지속적으로 상승하는 궤적입니다.
GLM 시리즈는 약 11개월 동안 6번의 반복 개발을 거쳤습니다.
지능 지수는 32에서 60으로 상승했고, 과제당 비용은 약 0.20달러 수준을 유지했습니다.
GLM-5.3 Flash는 과제당 0.045달러의 비용으로 지능-비용 프런티어에 진입했습니다.
GLM-5는 코딩을 출발점으로 삼아 Long-Horizon Intelligence를 개척했습니다.
능력은 코드 생성에서 시스템 이해, 과제 계획, 도구 사용, 엔지니어링 상호작용으로 확장되었습니다.
모델이 단순한 Vibe Coding에서 Agentic Engineering으로 이동하고 있는 것입니다.
프로그래밍은 현재 회사의 가장 중요한 매출원이 되었습니다.
또한 코딩을 통해 축적한 장기 과제 수행 능력이 사이버보안 등의 분야에서도 이전 가능하다는 점이 입증되었습니다.
GLM-5.2는 장기 과제를 위한 플래그십 모델입니다.
실제로 사용할 수 있는 100만 토큰 컨텍스트 윈도우를 지원하며, 프로젝트 단위의 엔지니어링 컨텍스트를 실제로 담을 수 있습니다.
장시간 과제 수행에서 더욱 안정적이며 엔지니어링 규칙을 따르는 능력도 향상되었습니다.
개발 시나리오에서 성공률이 더욱 높아졌으며, 하나의 과제 안에서 요구사항부터 여러 엔드포인트에 배포 가능한 결과물까지 전체 개발 과정을 수행할 수 있습니다.
GLM-5.3은 즈푸의 최신 플래그십 모델로 복잡한 소프트웨어 엔지니어링과 Agent 과제 전반에서 발전했습니다.
GLM-5.2와 동일한 베이스 모델을 사용하며, 모든 능력 향상은 후속 훈련(Post-training)만을 통해 이루어졌습니다.
GLM-5.3에서는 과제 환경의 규모를 더욱 확대했습니다.
훈련 과제를 기존의 일반적인 프로그래밍 문제에 국한하지 않고, 실제 환경에서 전문가가 수행하는 완전한 단위의 전문 업무와 비슷하게 만들었습니다.
아키텍처, 전체 파라미터 수, 활성 파라미터 수가 모두 동일한 상황에서 단지 후속 훈련 규모를 확대하는 것만으로 종단간 완료율이 50% 이상 향상되었습니다.
GLM-5.3은 스케일링이 단순히 파라미터를 늘리는 것만을 의미하지 않는다는 점을 보여줍니다.
현재 가장 큰 개선 여지가 존재하는 곳은 훈련입니다.
GLM-5.3이 현재 능력의 프런티어를 의미한다면, GLM-5.3 Flash는 비용의 프런티어를 의미합니다.
GLM-5.3 Flash는 고빈도·대규모·비용 민감형 사용을 위해 설계됐으며 비용 절감을 목적으로 개발된 새로운 아키텍처를 사용합니다.
총 파라미터는 3,200억 개, 활성 파라미터는 180억 개입니다.
Sparse Attention과 Linear Attention을 결합했고 가격은 GLM-5.2의 10분의 1 수준입니다.
그러면서도 벤치마크와 실제 응용 환경 모두에서 GLM-5.2보다 높은 성능을 보입니다.
출시 전에는 OpenCode와 OpenRouter에서 OX, Aux Offer라는 익명 모델명으로 실제 사용자 테스트를 진행했습니다.
온라인에 공개된 첫날 OpenRouter 1위를 기록했으며, 하루 토큰 사용량 신기록을 세웠습니다.
6일간 누적 사용량은 62조 토큰 이상이었고, 플랫폼 전체 사용량을 20% 이상 증가시켰습니다.
4. “중국산 칩으로 중국산 모델을 구동한다”
올해 들어 우리는 중국산 칩을 주요 추론 인프라에 포함시키기 시작했습니다.GLM-5.3 Flash는 회사가 초대규모 실제 트래픽 환경에서 전적으로 중국산 칩 클러스터를 이용해 서비스한 최초의 모델입니다.
칩들은 자체 개발한 고대역폭 인터커넥트 네트워크를 통해 연결되어 있습니다.
전체 추론 엔진은 GLM-5.3 기반 Infer Agent의 도움을 받아 크게 최적화되었고, 연산자 개발 주기를 절반으로 줄였습니다.
회사 역사상 처음으로
“모델이 시스템을 최적화하고, 그 시스템이 다시 모델을 구동하는”
순환 구조를 완성했습니다.
동일한 하드웨어 기준 초기 상태와 비교해 엔드투엔드 서비스 성능은 3배 향상되었습니다.
현재 약 10만 장의 중국산 가속기 카드를 이용해 대규모 저비용 추론을 구현했습니다.
토큰당 추론 비용은 연초 대비 80% 감소했습니다.
글로벌 컴퓨팅 자원 부족이 지속되는 상황에서 이는 우리가 스스로 비용 곡선을 통제하기 시작했다는 의미입니다.
샤오레이(Xiao Lei)
투자자 여러분, 안녕하십니까.이제 회사의 재무 성과와 사업 발전 상황을 설명드리겠습니다.
2026년 상반기 총매출은 9억 5,400만 위안, 약 1억 4,200만 달러를 기록했습니다.
전년 동기 대비 거의 400% 성장했습니다.
성장률보다 더욱 중요한 것은 매출 구성의 변화입니다.
오픈 플랫폼 및 API 사업 매출은 8억 2,500만 위안, 약 1억 2,300만 달러를 기록했습니다.
이는 지난해 상반기의 27배 이상입니다.
전체 매출에서 차지하는 비중은 지난해 같은 기간의 15.2%, 지난해 말의 26.3%에서 올해 상반기에는 **86.5%**까지 급격히 상승했습니다.
현재 즈푸의 매출은 주로 오픈 플랫폼과 API 사업에서 발생하고 있습니다.
최근 출시한 GLM-5.2, GLM-5.3, GLM-5.3 Flash가 오픈 플랫폼 및 API 사업 사용량의 역사적인 증가를 이끌었습니다.
2026년 8월 말 기준 ARR은 16억 달러에 도달했습니다.
이 ARR은 월 매출을 연환산한 것으로, 8월 매출에 12를 곱한 값입니다.
해외 프런티어 모델 기업과 일부 업계 기업들은 최근 일주일 매출에 52를 곱하는 더 공격적인 방식도 사용합니다.
GLM-5.3의 성장 속도를 고려하면 이 방식으로 계산한 ARR은 이미 20억 달러를 넘어섰습니다.
그러나 ARR 숫자 자체보다 중요한 것은 그 배경에 있는 성장 동력입니다.
올해 들어 즈푸는 사용량과 가격 양쪽에서 모두 비교적 건강한 성장을 이루었습니다.
8월 말 기준 MaaS 플랫폼의 토큰 사용량은 연초 대비 40배 이상 증가했습니다.
CodingPlan은 23배 이상 증가했습니다.
평균 API 가격은 약 101% 상승했습니다.
이는 플랫폼 매출의 역사적인 급증이 단순히 저가 정책이나 가격 탄력성 때문에 발생한 것이 아니라, 모델 능력 자체가 향상되었기 때문임을 보여줍니다.
사용량과 가격이 동시에 상승하면서 매출총이익률도 크게 개선됐습니다.
오픈 플랫폼 및 API 사업의 매출총이익률은 지난해 상반기 **-0.4%**에서 올해 상반기 **24.6%**로 상승했습니다.
전년 대비 약 25%포인트 개선됐으며, 지난해 연간 기준 18.9%와 비교해도 약 6%포인트 상승했습니다.
연구개발에서는 계속해서 전력을 다해 투자하고 있습니다.
모델의 기술적 리더십이 모든 것의 전제조건이기 때문입니다.
2026년 상반기 회사의 R&D 지출은 21억 3,000만 위안, 약 3억 1,700만 달러였습니다.
기간 손실은 약 20억 7,200만 위안으로 전년 동기 대비 12.1% 감소했습니다.
손실률은 지난해 상반기 대비 4.7배 축소되었습니다.
조정 순손실은 19억 6,400만 위안이며, 조정 손실률은 지난해 상반기보다 3.5배 축소되었습니다.
즉, 매출이 확대되는 동시에 단위 경제성(Unit Economics)도 빠르게 개선되고 있습니다.
특히 올해 상반기 조정 순손실 19억 6,400만 위안은 R&D 지출보다도 작았습니다.
이는 지난해 연간 실적에서 나타났던 패턴이 이어지고 있음을 뜻합니다.
사업에서 발생한 매출총이익이 관리비와 판매비를 우선 충당한 뒤, 이제는 R&D 투자 자체를 지원하기 시작했다는 것입니다.
운영 성과: 다섯 가지 관점
첫째, 매출 구조가 근본적으로 바뀌었다
2026년 상반기 오픈 플랫폼 및 API 사업은 전체 매출의 86.5%를 차지했습니다.이는 의도적인 재무적 조정의 결과가 아닙니다.
모델 능력이 향상되면서 자연스럽게 발생한 변화입니다.
회사의 사업 발전 과정을 돌이켜보면,
2년 전에는 로컬 배포형 모델을 판매했고,
이후 API 사용량과 구독형 서비스를 판매했으며,
현재는 엔드투엔드 과제의 결과물을 판매하는 단계로 이동하고 있습니다.
모델 지능이 향상될 때마다 새로운 사용 시나리오와 사업 형태가 하나씩 열렸습니다.
2025년 이전 첫 번째 단계에서는 주로 로컬 배포형 모델 사업을 진행했습니다.
당시 초기 모델들은 하나의 업무를 독립적으로 완수할 능력이 없었습니다.
사용자가 구매하는 것은 ‘도구’였고, 그 도구를 고객 환경에 통합하고 커스터마이징하고 구축해야 했습니다.
데이터 보안, 컴플라이언스, 자율·통제 가능성도 충족해야 했습니다.
따라서 당시 기업들이 대규모 모델을 도입할 때 로컬 배포는 자연스러운 출발점이었습니다.
2025년 초부터 두 번째 단계인 Coding 단계에 진입했습니다.
이 단계의 가장 중요한 특징은 모델이 지식 중심에서 과제 중심으로 전환했다는 것입니다.
프로그래밍 능력의 향상이 API와 CodingPlan 같은 구독형 제품의 빠른 성장을 이끌었습니다.
이 단계에서 회사는 전략적으로 로컬 배포 모델의 소프트웨어 라이선스 사업을 줄이고,
호출 가능하고,
확장 가능하며,
측정 가능한
지능 서비스를 지속적으로 제공하는 방향으로 전환했습니다.
올해 들어서는 세 번째 단계인 Agentic 및 Cowork 단계에 진입했습니다.
사업은 모델 호출 판매에서 과제 결과 전달(Task Delivery)로 이동하고 있습니다.
2026년 상반기 GLM 모델은 Agent 계획, 도구 사용, 장기 과제의 지속적인 실행 능력을 계속 향상시켰습니다.
사업 영역도 단순 코딩에서 소프트웨어 엔지니어링, 사이버보안, 데이터 분석, 복잡한 자동화 등 고부가가치 시나리오로 확대되었습니다.
비즈니스 모델 역시 사용량 판매에서 구독 및 엔드투엔드 과제 결과 판매로 발전하고 있습니다.
앞으로 회사가 본격적으로 열어가려는 단계가 바로 Cowork입니다.
모델이 기업의 데이터, 도구, 업무 시스템에 연결되어 조달, 재무, 고객서비스, R&D, IT 운영 등의 업무 프로세스에 직접 들어가게 됩니다.
이미 요구사항을 이해하는 것부터 실제 과제를 실행하는 것까지 수행할 수 있는 기반을 갖추고 있습니다.
동시에 실제 기업 업무 흐름은 모델이 학습할 수 있는 환경과 데이터가 될 수 있습니다.
2026년 상반기에는 사이버보안, 법률 서비스, 금융, 교육 등의 분야에서 시험을 시작했습니다.
현재 가장 빠르게 진행되는 분야는 사이버보안입니다.
그 외 분야는 아직 초기 단계이며 대규모 매출은 발생하지 않고 있습니다.
로컬 배포 → Coding → Cowork라는 세 단계를 연결하는 핵심 논리는 다음과 같습니다.
모델 능력이 한 단계 도약해 더 중요하고 완전한 과제를 수행할 수 있게 될 때마다, 고객이 구매하는 대상은 최종적인 경제적 가치와 결과물에 더욱 가까워진다.
그리고 그때마다 회사의 매출 구조도 다시 쓰입니다.
이것이 매출 구조 변화의 근본적인 이유입니다.
둘째, 시장 진출 전략이 더욱 넓어졌다
업계는 벤치마크 점수뿐 아니라 모델이 지능과 비용 사이에서 파레토 최적(Pareto Optimal)을 달성할 수 있는지를 점점 더 중요하게 보고 있습니다.2026년 상반기 회사는 고부가가치 과제 영역을 계속 확장하면서 GLM-5.3 Flash도 출시했습니다.
프런티어 수준의 지능도 대중적으로 접근 가능한 사용 사례에 들어갈 수 있다는 점을 보여주려는 것입니다.
10만 장 이상의 중국산 가속기 카드 클러스터를 활용해 초대규모 저비용 추론을 초기 단계에서 구현했습니다.
지난달 말에는 CodingPlan 구독 서비스를 모든 사용자에게 개방했습니다.
Light, Pro, Max, Team 버전을 제공합니다.
중국에서 프로그래밍 Agent 능력을 구독 모델로 제공하는 비교적 초기의 대규모 모델 서비스 중 하나입니다.
기업 고객에게 API를 제공하는 동시에 중국 개발자에게도 고품질 프로그래밍 구독 서비스를 제공하려 합니다.
고부가가치 과제에서 대중적인 접근성까지,
프런티어 지능과 보편적 접근성을 동시에 추구하고,
기업 서비스에서 API와 CodingPlan의 조합으로 확장하면서
회사의 시장 전략은 점점 더 깊고 넓으며 균형 잡힌 구조로 변화하고 있습니다.
셋째, MaaS 플랫폼의 사용자 규모
2026년 8월 기준 플랫폼 등록 사용자는 740만 명 이상입니다.연초 대비 144% 증가했습니다.
유료 일일활성이용자(DAU)는 603% 증가했습니다.
매출 측면에서 상위 10대 사용자의 이번 달 일평균 사용량은 연초 대비 98배입니다.
이러한 데이터를 종합하면 우리는 중국 최대 규모의 독립 개발자 플랫폼 중 하나를 구축했고, 이미 상당한 규모에 도달했음에도 사용자 기반이 계속 빠르게 성장하고 있음을 알 수 있습니다.
최근 두 달 동안 GLM-5.2, 5.3, 5.3 Flash의 영향으로 사용자 수는 6월 말 580만 명에서 740만 명으로 160만 명 증가했습니다.
Long-Horizon Task 시대에 진입하면서 핵심 개발자 사용자들은 과거 Vibe Coding 단계와 비교해 실제 업무 흐름 안에서 훨씬 더 많은 플랫폼 사용량을 발생시키고 있습니다.
동시에 고품질 고객 기반도 확대되고 있습니다.
8월 말 ARR 기준으로 연환산 매출 기여도가
10만 달러 이상인 고객군은 115개,
50만 달러 이상은 25개,
100만 달러 이상은 37개,
1,000만 달러 이상은 8개,
2,500만 달러 이상은 2개,
2억 5,000만 달러 이상은 2개
입니다.
이것이 사용자 규모, 사용자 특성, 사용 깊이, 사용자 품질에 관한 데이터입니다.
넷째, Compute Multiplier
우리는 Compute Multiplier, 즉 컴퓨트 승수라는 새로운 개념을 소개하고 있습니다.최근 몇 년 동안 업계에서 크게 주목받고 있는 개념입니다.
이는 컴퓨팅 자원에 1위안을 투자했을 때 오픈 플랫폼 및 API를 통해 얼마의 매출을 만들어내는지를 나타냅니다.
컴퓨팅 투자에는 훈련과 추론이 모두 포함됩니다.
올해 회사의 Compute Multiplier는 지난해 상반기보다 14배 증가했습니다.
이는 컴퓨팅 공급 효율이 크게 향상되었다는 의미입니다.
이 곡선이 개선되는 이유는 두 가지입니다.
첫째, 각 토큰에 담긴 지능은 계속 증가하는 반면, 토큰 소비 비용과 과제당 비용은 계속 감소합니다.
둘째, 컴퓨팅 자원 1위안당 발생하는 매출이 계속 증가하면서 모델이 자기 자신의 발전 비용을 스스로 부담할 수 있는 능력이 강화되고 있습니다.
지능의 돌파가 더 많은 토큰 사용과 상업적 수익을 만들어내고,
이 수익이 다시 컴퓨팅 자원과 R&D에 재투자되어,
지능 프런티어를 다시 끌어올립니다.
이 플라이휠(Flywheel)이 이미 돌기 시작했습니다.
다섯째, 안전 능력도 모델 능력과 함께 성장한다
모델 능력이 신뢰할 수 있는 서비스가 되기 위해 중요한 것은 실제 세계에서 신뢰를 얻을 수 있는가입니다.우리는 항상 개방성과 안전을 동시에 발전시키는 원칙을 유지해 왔습니다.
한편으로는 오픈 모델 웨이트, MaaS 플랫폼, CodingPlan, 글로벌 개발자 네트워크를 통해 모델이 가능한 한 많은 실제 환경에 진입하도록 합니다.
다른 한편으로는 권한 관리, 과정 모니터링, 위험 평가, 취약점 공개, 외부 검증을 통해 모델 능력을 검증 가능하게 만듭니다.
이상으로 회사의 재무 성과와 사업 발전 상황에 대한 설명을 마치겠습니다.
다음으로 류더빈 즈푸 회장이 향후 전망에 대해 말씀드리겠습니다.
류더빈(Liu Debin), 즈푸 회장
2026년 상반기 우리는 모델이 하나의 완전한 업무를 독립적으로 수행할 수 있다는 것을 증명했습니다.다음 단계는 모델이 완전한 하나의 비즈니스 프로세스 전체를 수행하게 만드는 것입니다.
이 목표와 관련해 몇 가지 판단을 내리고 있습니다.
첫째, 장기 과제에서 자율 시스템으로
현재 모델의 과제는 Long-Horizon Task에서 Autonomous System으로 발전하고 있습니다.현재 프런티어는 몇 시간 동안 지속되는 엔지니어링 과제입니다.
다음 단계에서는 이를 며칠 동안 이어지는 완전한 상호작용으로 확장할 것입니다.
모델은 더 오랜 시간 동안 목표의 일관성을 유지하면서 지속적으로 과제를 분해하고, 도구를 호출하고, 환경과 상호작용하고, 오류를 수정하고, 결과를 검증할 수 있어야 합니다.
동시에 업계는 단일 Agent에서 Multi-Agent의 역할 분담과 협업으로 이동하게 될 것입니다.
모델은 완전한 비즈니스 프로세스를 담당하게 되고,
업무를 보조하는 단계에서 업무를 직접 수행하는 단계로 이동합니다.
이 단계의 핵심 임계점은 단순한 지능만이 아닙니다.
오히려 더 중요한 것은 신뢰성과 감사 가능성(Auditability)입니다.
사람이 모든 단계를 일일이 확인하지 않아도 모델이 일을 수행할 수 있어야 하며, 동시에 나중에 검토 가능한 기록을 남겨야 합니다.
둘째, Scaling은 멈추지 않았다
Scaling은 지금까지 단 한 번도 중단된 적이 없으며 여전히 더 높은 지능으로 가는 가장 중요한 경로입니다.변하지 않은 것은 경로입니다.
변한 것은 무엇을 스케일링하느냐입니다.
현재 모델의 상한은 네 가지 요소의 조합에 의해 결정됩니다.
1. 베이스 모델 규모
2. 유효 깊이(Effective Depth)
3. 훈련 깊이(Training Depth)
4. 과제 환경(Task Environment)
이 네 요소의 한계 수익률은 각 단계마다 달라지고 순환합니다.
회사는 각 단계에서 어떤 요소의 현재 수익률이 가장 높은지 판단하여 자원을 배분합니다.
GLM-5.3은 현재 훈련 깊이에서 가장 큰 개선 여지가 있다는 점을 보여줬습니다.
후속 훈련이 한계까지 진행된 이후 다음 성장 단계는 다시 베이스 모델로 돌아가야 합니다.
GLM-5.3 Flash는 차세대 아키텍처와 30 TG 멀티모달 코퍼스를 통해 효율성을 검증했습니다.
차세대 베이스 모델은 이미 훈련 중입니다.
주요 방향은
더 큰 유효 규모,
더 긴 네이티브 컨텍스트,
네이티브 통합 멀티모달 모델링
등입니다.
셋째, 시스템 수준의 Self-Training
훈련 시스템 내부에서도 더욱 근본적인 변화가 일어나고 있습니다.데이터, 환경, 인프라가 모두 AI에 의해 운영되기 시작하는 초기 징후가 나타나고 있습니다.
데이터가 스스로 생성되기 시작한다
모델 대 모델 Self-Play 파이프라인이 발전하면서 데이터 품질의 상한이 더 이상 인간 라벨링 속도에 의해 결정되지 않고 모델 자신의 결과 검증 능력에 의해 결정되기 시작했습니다.환경이 자동으로 만들어지기 시작한다
Research Agent가 과제 패턴을 수집하고,Judge Agent가 각각의 과제를 시도하며,
Verifier와 Environment가 자동으로 합성됩니다.
이 과정은 점차 표준화된 파이프라인 제품으로 발전하고 있습니다.
인프라가 스스로 최적화되기 시작한다
추론 시스템 최적화는 본질적으로 코드 엔지니어링 과제입니다.그리고 이것은 바로 현재 모델이 가장 강한 능력을 가진 영역입니다.
이 세 가지 흐름은 동일한 최종 상태를 가리키고 있습니다.
모델이 자신의 개선 과정에 직접 참여하는 것, 즉 Recursive Self-Improvement입니다.
이것이 우리가 생각하는 기술 비전인 Self-Training입니다.
차세대 GLM은 이전 세대 GLM이 구축한 환경에서 스스로 훈련하게 될 것입니다.
넷째, 경계와 거버넌스
능력이 강해질수록 평가와 판단을 외부에 맡기는 것이 더욱 중요합니다.모델 능력에 대한 평가와 위험 판단은 궁극적으로 사람이 내려야 하며, 외부 독립기관의 평가가 필요합니다.
2026년 상반기 우리는 이미 사이버보안 분야에서 이를 실천하기 시작했습니다.
가장 민감한 능력은 통제된 조건에서만 공개합니다.
오픈소스 공개 전에는 전문적인 제3자 팀이 독립 평가를 수행합니다.
취약점은 국가 취약점 데이터베이스를 통해 책임감 있게 공개됩니다.
벤치마크 점수는 회사가 발표하지만,
위험 판단은 외부 팀에 맡깁니다.
이러한 역할 분담은 모델 능력이 향상된다고 해서 약화되지 않을 것입니다.
오히려 능력이 강해질수록 더욱 강화될 것입니다.
마지막으로 오늘 말씀드린 모든 수치를 한 문장으로 정리하겠습니다.
모델 능력의 세대 수준이 회사의 모든 제품과 상업적 논리의 출발점입니다.
GLM의 사전훈련 아키텍처에서 Wudao 시리즈, 그리고 오늘날의 GLM-5 시리즈까지 우리는 7년 동안 한 가지에 집중해 왔습니다.
더 강력한 모델을 훈련하는 것.
매출이 빠르게 성장했던 시기는 언제나 모델 능력이 먼저 향상되고 새로운 과제 영역이 열린 이후였습니다.
그 반대가 아니었습니다.
능력이 먼저이고, 사업이 그 뒤를 따릅니다.
2026년 상반기 매출 구조의 역전과 사용량·가격의 동시 성장은 이미 이 논리를 입증했습니다.
앞으로는 더 큰 사용자 기반, 더 큰 상업 규모, 더 넓은 글로벌 영향력을 통해 계속 입증될 것입니다.
갈 길은 멀지만 방향은 확고합니다.
감사합니다.
Q&A
Q. 즈푸의 코딩 능력 우위를 어떻게 평가하며, 진정한 장기 경쟁우위는 무엇입니까?
A.어떤 단일 분야의 우위도 영원하지 않습니다.
코딩 벤치마크에서 1위를 하더라도 몇 주나 몇 달 안에 다른 기업이 따라올 수 있습니다.
하나의 리더보드 순위보다 중요한 것은 지속적으로 반복 개발할 수 있는 능력입니다.
지난 약 11개월 동안 GLM 모델 패밀리는 4.6, 4.7에서 5.1, 5.2, 5.3으로 여러 세대에 걸쳐 발전했습니다.
능력 곡선은 계속 상승했지만 과제당 비용은 비교적 건강한 수준을 유지했습니다.
장기적인 해자는 모든 벤치마크에서 영원히 1위를 유지하는 것이 아닙니다.
더 빠른 모델 반복 개발, 실제 과제에서 더 높은 완료율, 더 낮은 단위 지능 비용, 더 높은 가치의 고객 업무 흐름으로 지속적으로 침투하는 능력이 진정한 경쟁우위입니다.
Q. 왜 코딩을 모델 능력 돌파의 핵심 출발점으로 선택했습니까?
A.우리는 코딩을 단순히 빠르게 상업화할 수 있는 하나의 제품 라인으로 보지 않습니다.
코딩은 Agent, 장기 과제, 복잡한 협업 업무, Fully Self-Training으로 향하는 길에 존재하는 기술적 병목입니다.
복잡한 Coding Agent는 동시에
요구사항을 이해하고,
과제를 분해하고,
코드를 읽고,
도구를 호출하고,
코드를 수정하고,
테스트를 실행하고,
다시 계획하고,
결과를 검증해야 합니다.
따라서 코딩은 다단계 계획, 오류 복구, 자기 수정 능력을 체계적으로 훈련시킵니다.
또한
코드가 실제로 실행되는가,
테스트를 통과하는가,
성능이 향상되었는가,
버그가 수정되었는가
를 객관적으로 검증할 수 있습니다.
따라서 코딩은 강화학습을 위한 확장 가능하고 자동화되어 있으며 저렴한 피드백 환경을 제공합니다.
GLM-5.3의 훈련 환경은 기존의 일반적인 코딩 문제에서 실제 엔지니어링 과제로 확대되었습니다.
일부 과제는 숙련된 시니어 엔지니어가 며칠 연속으로 수행해야 할 정도의 업무량에 해당합니다.
Q. 코딩 능력이 어떻게 사이버보안과 다른 전문 분야로 전이될 수 있습니까?
A.사이버보안에서는 코드를 이해하고, 이상 징후를 찾고, 도구를 호출해 이를 검증하고, 다단계 공격·방어 과정을 구축하고, 환경 피드백을 바탕으로 계획을 수정해야 합니다.
따라서 기본적인 능력 구조가 복잡한 Coding Agent에 필요한 능력과 매우 유사합니다.
CyberGym에서 GLM-5.2는 약 77.2점을 기록했으며 GLM-5.3은 84.5점으로 향상됐습니다.
ExploitBench에서는 약 24.4에서 54.4로 상승했습니다.
하나의 완전한 익스플로잇 체인에 가까운 과제일수록,
그리고 장기 계획을 더 많이 요구할수록,
성능 향상이 더욱 크게 나타났습니다.
GLM-5.2 이후 우리는 여러 중국 보안팀과 실제 코드베이스를 대상으로 협업했습니다.
전문가의 검토와 중복 제거 이후 약 2,436개의 취약점을 발견했습니다.
이 가운데 1,000개 이상이 고위험 취약점이었으며 총 269개 프로젝트에서 발견되었습니다.
다음 단계에서는 코딩을 통해 학습한 장기 계획, 도구 사용, 오류 복구 능력을 데이터 분석, 복잡한 자동화, 법률 서비스, 금융과 같은 고부가가치 전문 업무로 계속 이전할 것입니다.
Q. Cowork 시나리오는 어떤 기준으로 선택합니까?
A.Cowork는 단순한 일상적인 사무보조가 아닙니다.
전문 분야에서 실제로 존재하는 복잡한 업무 흐름을 담당하거나 대체하는 것을 의미합니다.
시나리오를 선택하는 기준은 세 가지입니다.
첫째, 과제가 충분히 높은 지적 난이도를 가져야 합니다.
둘째, 결과를 효과적으로 검증할 수 있어야 합니다.
셋째, 과제를 완료했을 때 충분히 높은 경제적 가치를 만들어야 합니다.
현재 가장 명확하게 검증된 분야는 사이버보안입니다.
법률 서비스, 금융, 데이터 분석 등의 분야도 탐색 중입니다.
다만 신뢰성에 필요한 임계점과 검증 방식이 서로 다르기 때문에 상업화 시점 역시 달라질 것입니다.
각 세대의 모델이 더 길고, 더 완전하고, 더 전문적인 업무를 처리할 수 있게 된다면 코딩은 일종의 메타 능력(Meta-Ability)이 될 것입니다.
그리고 회사가 서비스할 수 있는 고부가가치 과제의 경계도 계속 확장될 것입니다.
Q. 현재 컴퓨팅 자원 확장 상황과 구조는 어떻습니까?
A.올해 들어 컴퓨팅 용량은 건강한 속도로 계속 확대되고 있습니다.
훈련과 추론 모두에서 투자를 늘렸습니다.
컴퓨팅 자원은
자체 보유 클러스터,
임대 컴퓨팅 자원,
구매한 컴퓨팅 서비스
등으로 구성됩니다.
사용처는 사전훈련, 중간훈련, 후속훈련, 실제 서비스 추론을 모두 포함합니다.
서로 다른 칩 세대와 아키텍처가 혼재하면서 매우 다양하고 이질적인 환경이 만들어지고 있습니다.
훈련 효율과 추론 처리량도 크게 다르기 때문에 단순히 가속기 카드 수만 세는 것으로는 실제 컴퓨팅 공급 능력이나 인프라 역량을 정확히 표현하기 어렵습니다.
우리는 내부적으로 Effective Compute, 즉 유효 컴퓨팅 자원을 더 중요하게 봅니다.
설치가 완료되어 있고,
안정적으로 스케줄링할 수 있으며,
장기간 지속적으로 운영할 수 있고,
궁극적으로 모델 훈련 진척도나 과금 가능한 토큰으로 전환될 수 있는 컴퓨팅 자원을 의미합니다.
대규모 모델 기업의 컴퓨팅 능력을 평가하는 핵심 기준은 얼마나 많은 카드를 소유하고 있느냐가 아닙니다.
그 자원을 얼마나 빠르게 모델 반복 개발로 연결하고, 얼마나 많은 상업적 토큰 공급으로 전환할 수 있느냐가 중요합니다.
Q. 중국산 칩은 어느 정도 규모로 추론 사업에 사용되고 있으며 성능은 어떻습니까?
A.올해 상반기 기준 약 10만 장의 중국산 가속기 카드에서 대규모 저비용 추론을 구현했습니다.
앞으로도 추론 공급을 수입 칩이나 중국산 칩 중 하나의 단일 경로에만 의존하지는 않을 것입니다.
GLM-5.3 Flash를 익명으로 출시했을 때 백엔드는 전부 중국산 칩 클러스터를 사용했습니다.
약 6일 동안 약 60조 토큰의 사용량을 처리했으며 OpenRouter와 OpenCode 등에서 역사적으로 높은 트래픽이 발생했음에도 안정적인 서비스 성능을 유지했습니다.
중국산 가속기와 추론 카드가 실제 워크로드를 수행할 수 있다는 점은 이미 검증됐습니다.
다음 단계에서는 경제성에 초점을 맞출 것입니다.
메모리 용량, 대역폭, 긴 컨텍스트 워크로드 등의 제약 속에서 하드웨어 단위당 유효 토큰 생산량을 어떻게 높일 것인가가 핵심입니다.
Q. 인프라 최적화를 통해 중국산 칩의 추론 효율은 얼마나 향상됐습니까?
A.회사는 약 6개월 전부터 “All in Infra” 전략을 시행했고 GLM-5.3을 위한 추론 엔진과 서비스 스택을 다시 구축했습니다.
최적화 범위에는
Encode/Decode,
Prefill과 Decode 분리,
양자화,
레이어 분할,
캐싱,
통신
등이 포함됩니다.
동일한 중국산 하드웨어와 동일한 컴퓨팅 자원을 기준으로 전체 엔드투엔드 서비스 성능은 초기 상태 대비 약 3배 향상됐습니다.
제한적이고 복잡한 컴퓨팅 공급 환경에서는 단순히 하드웨어 공급원을 늘리는 것보다 모델과 인프라의 공동 최적화를 통해 효율성을 높이는 것이 더욱 근본적으로 중요합니다.
다음 단계의 핵심 과제는 각각의 물리적 컴퓨팅 자원을
더 많은 지능,
더 많은 유효 토큰,
더 큰 상업적 가치
로 전환하는 것입니다.
Q. 훈련용 컴퓨팅 자원에는 어떤 구조적인 문제가 있으며 향후 어떻게 개선될까요?
A.프런티어 모델을 훈련하려면 단순히 많은 컴퓨팅 자원만 필요한 것이 아닙니다.
대규모 동종 클러스터의 안정성, 네트워크 통신, 소프트웨어 스택, 장시간 지속 운영 능력 역시 필요합니다.
현재 중국은 여전히 주로 이기종 컴퓨팅 환경에 의존하고 있습니다.
고성능 중국산 가속기 카드 역시 아직 대규모 양산에 완전히 진입하지 못했기 때문에 일정한 구조적 불일치가 존재합니다.
앞으로 약 3~6개월 동안 고성능 중국산 칩 제조사들이 생산량을 확대하기 시작할 가능성이 있으며, 이기종 병렬 컴퓨팅 환경도 상당히 개선될 것으로 예상합니다.
베이스 모델 훈련은 이미 진행 중입니다.
컴퓨팅 자원 배분에서는 핵심 훈련 기간을 우선할 것입니다.
추론 수요가 빠르게 증가한다는 이유만으로 모든 자원을 추론으로 옮기지는 않을 것입니다.
Q. 모델 레이어가 상품화(Commoditization)될 위험은 없습니까? 즈푸는 어떻게 가격 결정력을 구축하고 있습니까?
A.단일 SOTA 성과는 장기적인 가격 결정력을 만들어내지 못합니다.
공개 벤치마크나 짧은 과제에서는 모델들의 성능이 점차 수렴할 것입니다.
그러나 오랜 시간 수행되어야 하고, 실행 가능하며, 결과를 검증할 수 있는 실제 과제에서는 모델 간 차이가 훨씬 크게 나타납니다.
지난 약 11개월 동안 Artificial Analysis 기준 GLM의 Intelligence Index는 32에서 60으로 상승했습니다.
그러는 동안 플래그십 모델의 과제당 비용은 약 0.20달러 수준을 유지했습니다.
GLM-5.3 Flash는 이를 약 0.045달러까지 낮췄습니다.
가격 결정력은 토큰 하나가 무엇을 할 수 있느냐에 달려 있습니다.
단순한 잡담에 사용되는 100만 토큰과 엔지니어링 프로젝트를 완료하거나 실제 운영 시스템의 취약점을 수정하는 데 사용되는 100만 토큰은 고객에게 전혀 다른 가치를 제공합니다.
모델이 Coding에서 Agent, Cowork로 이동하면서 고객은 점차 토큰을 구매하는 것이 아니라 과제의 결과를 구매하게 될 것입니다.
모델이 고객의 코드베이스, 툴체인, 내부 데이터, 업무 흐름에 들어가게 되면 고객은 그 모델을 중심으로
프롬프트,
Agent 워크플로,
권한 시스템,
평가 기준,
엔지니어링 통합
등을 축적하게 됩니다.
그렇게 되면 전환 비용은 단순히 API 가격 차이보다 훨씬 커지게 됩니다.
Q. 실제 상업적 데이터에서도 능력 향상이 가격 인상을 뒷받침한다는 점이 확인됐습니까?
A.올해 상반기 평균 API 판매가격은 약 101% 증가했으며 토큰 사용량도 동시에 크게 증가했습니다.
매출 기준 상위 10대 고객의 일평균 사용량은 연초 대비 약 98배 증가했습니다.
가격이 올라갔음에도 핵심 고객들의 사용량이 증가했다는 것은 고객들이 단순히 모델이 싸기 때문에 사용하는 것이 아니라는 뜻입니다.
능력이 향상되면서 고객들은 더 많은 실제 업무를 모델에 맡기고 있으며, 더 강한 능력에 비용을 지불할 의향이 있습니다.
향후 업계에는 두 가지 가격 곡선이 생길 가능성이 있습니다.
동일한 지능 수준에서는 가격이 계속 내려갈 것입니다.
그러나 새로운 과제의 경계를 열어주고 성공률을 실질적으로 개선하는 프런티어 모델은 계속 프리미엄을 받을 수 있으며, 경우에 따라 가격을 추가로 인상할 수도 있습니다.
Q. 해외 사업은 현재 어느 단계이며 앞으로 어떻게 확대할 예정입니까?
A.회사는 2025년부터 일정 규모의 해외 사업을 진행해 왔습니다.
초기에는 주로 로컬 배포와 Sovereign Large Model 프로젝트에 집중했습니다.
말레이시아의 Matrix 대규모 모델 프로젝트가 초기 해외 프로젝트 중 하나였습니다.
사업 형태가 변화하면서 해외에서도 중심이 오픈 플랫폼과 API로 이동하고 있습니다.
GLM-5.3은 더 높은 수준의 지능을 의미하고,
GLM-5.3 Flash는 접근성과 높은 가성비를 의미합니다.
두 모델은 각각 고부가가치 과제 계층과 대중적 접근 계층에서 서로 다른 생태계 포지션을 차지합니다.
우리는 해외 CSP 플랫폼들과 적극적으로 협력을 추진하고 있습니다.
앞으로는 오픈소스 모델, 로컬 호스팅, 수익 공유 등의 방식을 통해 해외 시장을 확대할 것입니다.
추가 진전 사항은 앞으로 1~2개월 내 공개될 가능성이 있습니다.
중국 모델은 여전히 해외 최상위 모델과 차이가 존재합니다.
그러나 종합 능력과 비용의 파레토 최적 조합은 해외 시장 경쟁에서 중요한 진입점이 될 수 있습니다.
Q. 차세대 GLM 모델에서 가장 중요한 개선 방향은 무엇입니까?
A.Scaling은 멈춘 적이 없습니다.
목표는 계속해서 지능 프런티어를 높이는 것입니다.
과거에는 멀티모달, 이미지 생성, 영상 생성 연구에도 투자했습니다.
그러나 이러한 분야는 지능의 상한 자체를 끌어올리는 데에는 도움의 크기가 제한적이었습니다.
그래서 연구 중심을 텍스트와 텍스트·멀티모달 능력이 서로 강화되는 모델 형태로 이동시켰습니다.
모델 능력은 지식 질문에 답하는 단계에서 실제 과제를 완료하는 단계로 이동하고 있습니다.
이에 따라 연구 초점도 기본적인 질의응답에서 Coding과 Cowork로 이동하고 있습니다.
차세대 모델 역시 이 방향을 이어갈 것입니다.
베이스 모델의 규모도 계속 확대하여 지식을 더 잘 저장하고 표현할 수 있도록 할 것입니다.
동시에 활성 파라미터 수를 상대적으로 작게 유지하면서 Loop 등의 방식을 활용해 추론 깊이를 증가시키는 방법을 사용할 것입니다.
수조 개의 파라미터를 가진 모델에서 활성 파라미터가 너무 많아져 지나치게 느리고 비싸지는 상황을 피하기 위해서입니다.
베이스 모델 Scaling뿐 아니라 후속 훈련도 크게 강화할 것입니다.
기술적 방법과 엔지니어링 방법을 모두 활용해 중국의 컴퓨팅 자원 제약으로 인해 OpenAI나 Anthropic 같은 해외 기업과 발생하는 격차를 줄일 것입니다.
Q. 데이터 환경과 후속 훈련이 GLM-5.3의 성능 향상에 중요한 이유는 무엇입니까?
A.2022년 ChatGPT가 출시될 무렵 즈푸는 이미 수백 명 규모의 데이터 라벨링 팀을 구축하고 있었으며, 장기적으로 데이터와 훈련 환경 개발에 투자하고 있었습니다.
GLM-5.3이 GLM-5.2보다 크게 향상된 중요한 이유 중 하나는 데이터 환경의 규모가 수십 배 확대됐기 때문입니다.
앞으로도 데이터와 환경을 계속 Scaling할 것입니다.
인터넷에서 새로 생성되는 텍스트 데이터의 양은 점차 감소하고 있는 반면, 합성 데이터의 비중은 증가하고 있습니다.
따라서 단순히 베이스 모델 파라미터를 늘리는 것보다도 검증 가능한 데이터 환경과 실제 과제 환경을 구축하여 후속 훈련 과정에서 모델이 지속적으로 유효한 피드백을 받을 수 있도록 만드는 것이 더욱 중요합니다.
Q. GLM-6.0에서 구상하고 있는 Fully Self-Training이란 무엇입니까?
A.Fully Self-Training은 자기 진화(Self-Evolution) 능력을 가진 모델에 해당합니다.
해외에서는 흔히 RSI(Recursive Self-Improvement)라고 부르기도 합니다.
목표는 모델이 사전훈련, 중간훈련, 후속훈련 전 과정에서 자신의 훈련과 자기 진화를 더 많이 직접 수행하도록 하는 것입니다.
가장 큰 문제는 단순히 모델을 더 크게 만들거나 훈련을 계속하는 것이 아닙니다.
모델이
자기 자신을 평가하고, 언제 멈춰야 하는지 알고, 오류가 발생했을 때 스스로 수정할 수 있게 만드는 것
이 가장 어려운 과제입니다.
Fully Self-Training은 향후 모델 연구의 중요한 방향이 될 것입니다.
윤리와 사회 거버넌스 역시 모델 진화 과정에 포함될 것입니다.
Q. 현재 파라미터 규모 확대에 상대적으로 신중한 이유는 무엇입니까?
A.모델 규모를 결정할 때는
보유 자원,
모델의 목표,
실제로 사용자가 언제 사용할 수 있는가
를 함께 고려해야 합니다.
중국에서 활용 가능한 훈련 데이터는 일반적으로 약 30~50조 토큰 수준입니다.
이 정도 데이터 규모에서 Scaling Law만을 기준으로 무작정 매우 큰 모델을 훈련하면 충분한 한계 수익을 얻지 못할 수 있습니다.
중국 내 컴퓨팅 자원은 제한적인 반면, 중간훈련과 후속훈련의 잠재력은 아직 충분히 활용되지 않았습니다.
따라서 현재로서는 단순한 파라미터 증가가 가장 중요한 투자 방향은 아닙니다.
GLM-5.3의 기반이 되는 7,450억 파라미터 베이스 모델은 올해 초 훈련을 완료했습니다.
처음부터 반년 이상 재사용할 계획으로 만들어졌습니다.
동일한 베이스 모델에서 GLM-5.1, 5.2, 5.3을 순차적으로 개발했으며 관련 SFT, 중간훈련, 후속훈련 환경 역시 지속적으로 발전시켰습니다.
기본적인 접근법은 각 베이스 모델에서 가능한 한 최대 능력을 끌어내는 것입니다.
동시에 사용자가 실제 대규모로 감당할 수 있는 수준까지 추론 비용을 최적화합니다.
실제로 배포할 수 없는 거대한 모델을 만드는 것 자체를 목표로 하지는 않습니다.
Q. 차세대 베이스 모델과 추론 배포는 어떻게 계획하고 있습니까?
A.차세대 대규모 베이스 모델은 이미 개발이 진행되고 있습니다.
구체적인 파라미터 수는 아직 공개하지 않았습니다.
새로운 베이스 모델 위에서 중간훈련과 후속훈련 역시 체계적으로 계획될 것입니다.
추론 연구와 엔지니어링 작업도 이미 사전에 시작했습니다.
목표는 차세대 모델이 출시 첫날부터 전체 규모의 사용자 수요를 감당할 수 있도록 만드는 것입니다.
출시한 뒤 오랜 기간 동안 엔지니어링 적응 작업을 해야 하는 방식은 피하려고 합니다.
차세대 모델에서도 중요한 설계 제약 중 하나는 다음과 같습니다.
모델을 오픈소스로 공개했을 때 기업들이 즉시 설치하고 사용할 수 있어야 하며, 동시에 회사 역시 낮은 추론 비용을 바탕으로 대규모 사용량을 감당할 수 있어야 합니다.
전체 0