최신논문
(2023년 9월) 언어 모델링은 압축이다
작성자
작성일
2024-06-26 15:12
조회
554
https://arxiv.org/abs/2309.10668

예측 모델이 무손실 압축으로 변환될 수 있고 그 반대로 변환될 수 있다는 것이 오랫동안 확립되어 왔습니다. 덧붙여서, 최근 몇 년 동안 기계 학습 커뮤니티는 점점 더 크고 강력한 자체 지도(언어) 모델을 훈련하는 데 중점을 두었습니다. 이러한 대규모 언어 모델은 인상적인 예측 기능을 보여주기 때문에 강력한 압축기로 자리잡았습니다. 이 작업에서 우리는 압축이라는 렌즈를 통해 예측 문제를 살펴보고 대규모(기초) 모델의 압축 기능을 평가하는 것을 옹호합니다. 우리는 대규모 언어 모델이 강력한 범용 예측 변수이며 압축 관점이 확장 법칙, 토큰화 및 상황 내 학습에 대한 새로운 통찰력을 제공한다는 것을 보여줍니다. 예를 들어, Chinchilla 70B는 주로 텍스트에 대해 교육을 받았지만 ImageNet 패치를 원시 크기의 43.4%로 압축하고 LibriSpeech 샘플을 16.4%로 압축하여 각각 PNG(58.5%) 또는 FLAC(30.3%)와 같은 도메인별 압축 프로그램을 능가합니다. 마지막으로, 예측-압축 등가성을 통해 조건부 생성 모델을 구축하기 위해 모든 압축기(예: gzip)를 사용할 수 있음을 보여줍니다.

예측 모델이 무손실 압축으로 변환될 수 있고 그 반대로 변환될 수 있다는 것이 오랫동안 확립되어 왔습니다. 덧붙여서, 최근 몇 년 동안 기계 학습 커뮤니티는 점점 더 크고 강력한 자체 지도(언어) 모델을 훈련하는 데 중점을 두었습니다. 이러한 대규모 언어 모델은 인상적인 예측 기능을 보여주기 때문에 강력한 압축기로 자리잡았습니다. 이 작업에서 우리는 압축이라는 렌즈를 통해 예측 문제를 살펴보고 대규모(기초) 모델의 압축 기능을 평가하는 것을 옹호합니다. 우리는 대규모 언어 모델이 강력한 범용 예측 변수이며 압축 관점이 확장 법칙, 토큰화 및 상황 내 학습에 대한 새로운 통찰력을 제공한다는 것을 보여줍니다. 예를 들어, Chinchilla 70B는 주로 텍스트에 대해 교육을 받았지만 ImageNet 패치를 원시 크기의 43.4%로 압축하고 LibriSpeech 샘플을 16.4%로 압축하여 각각 PNG(58.5%) 또는 FLAC(30.3%)와 같은 도메인별 압축 프로그램을 능가합니다. 마지막으로, 예측-압축 등가성을 통해 조건부 생성 모델을 구축하기 위해 모든 압축기(예: gzip)를 사용할 수 있음을 보여줍니다.
전체 0