최신논문
Q-Sparse: 모든 대규모 언어모델은 완전 희소 활성화 가능
작성자
작성일
2024-07-16 12:36
조회
589
https://arxiv.org/abs/2407.10969?s=09
우리는 희소하게 활성화된 대규모 언어 모델(LLM)을 훈련하는 간단하면서도 효과적인 접근법인 Q-Sparse를 소개합니다. Q-Sparse는 LLM에서 활성화의 완전한 희소성을 가능하게 하여 추론에서 상당한 효율성 이득을 가져올 수 있습니다. 이는 활성화에 상위 K 희소화를 적용하고 훈련에 직접 추정기를 적용하여 달성됩니다. 이 작업의 주요 결과는 다음과 같습니다. (1) Q-Sparse는 추론 시간에 훨씬 더 효율적이면서도 기준 LLM과 비슷한 결과를 얻을 수 있습니다. (2) 희소하게 활성화된 LLM에 대한 추론 최적 스케일링 법칙을 제시합니다. (3) Q-Sparse는 처음부터 훈련, 기성품 LLM의 계속 훈련 및 미세 조정을 포함한 다양한 설정에서 효과적입니다. (4) Q-Sparse는 완전 정밀도와 1비트 LLM(예: BitNet b1.58) 모두에서 작동합니다. 특히, BitNet b1.58과 Q-Sparse(MoE 장착 가능)의 시너지는 미래 LLM의 비용과 에너지 소비를 포함한 효율성을 혁신할 수 있는 초석과 명확한 경로를 제공합니다.
우리는 희소하게 활성화된 대규모 언어 모델(LLM)을 훈련하는 간단하면서도 효과적인 접근법인 Q-Sparse를 소개합니다. Q-Sparse는 LLM에서 활성화의 완전한 희소성을 가능하게 하여 추론에서 상당한 효율성 이득을 가져올 수 있습니다. 이는 활성화에 상위 K 희소화를 적용하고 훈련에 직접 추정기를 적용하여 달성됩니다. 이 작업의 주요 결과는 다음과 같습니다. (1) Q-Sparse는 추론 시간에 훨씬 더 효율적이면서도 기준 LLM과 비슷한 결과를 얻을 수 있습니다. (2) 희소하게 활성화된 LLM에 대한 추론 최적 스케일링 법칙을 제시합니다. (3) Q-Sparse는 처음부터 훈련, 기성품 LLM의 계속 훈련 및 미세 조정을 포함한 다양한 설정에서 효과적입니다. (4) Q-Sparse는 완전 정밀도와 1비트 LLM(예: BitNet b1.58) 모두에서 작동합니다. 특히, BitNet b1.58과 Q-Sparse(MoE 장착 가능)의 시너지는 미래 LLM의 비용과 에너지 소비를 포함한 효율성을 혁신할 수 있는 초석과 명확한 경로를 제공합니다.
전체 0