최신논문

네이티브 스파스 어텐션: 하드웨어 정렬 및 네이티브 학습 가능한 스파스 어텐션

작성자
작성일
2025-02-18 18:24
조회
286


장문맥 모델링은 차세대 언어 모델에 필수적이지만, 표준 어텐션 메커니즘의 높은 계산 비용은 상당한 계산적 과제를 야기합니다. 희소 어텐션은 모델 기능을 유지하면서 효율성을 개선하는 데 유망한 방향을 제공합니다. 우리는 알고리즘 혁신과 하드웨어 정렬 최적화를 통합하여 효율적인 장문맥 모델링을 달성하는 기본적으로 학습 가능한 희소 어텐션 메커니즘인 NSA를 제시합니다. NSA는 동적 계층적 희소 전략을 사용하여 거친 토큰 압축과 세밀한 토큰 선택을 결합하여 전역적 컨텍스트 인식과 지역적 정밀도를 모두 유지합니다. 우리의 접근 방식은 두 가지 핵심 혁신을 통해 희소 어텐션 설계를 발전시킵니다. (1) 우리는 현대 하드웨어에 대한 구현 최적화를 통해 산술 강도 균형 알고리즘 설계를 통해 상당한 속도 향상을 달성합니다. (2) 우리는 종단 간 학습을 가능하게 하여 모델 성능을 희생하지 않고 사전 학습 계산을 줄입니다. 그림 1에서 볼 수 있듯이, 실험 결과 NSA로 사전 학습된 모델은 일반 벤치마크, 장문맥 작업 및 명령어 기반 추론에서 전체 어텐션 모델을 유지하거나 능가합니다. 한편, NSA는 디코딩, 순방향 전파 및 역방향 전파 전반에서 64k 길이의 시퀀스에 대해 Full Attention보다 상당한 속도 향상을 달성하여 모델 수명 주기 전반에 걸쳐 효율성을 검증했습니다.
전체 0