최신논문

TransMLA: 다중 헤드 잠재 주의만 있으면 됩니다.

작성자
작성일
2025-02-13 16:25
조회
370
https://arxiv.org/abs/2502.07864

현대의 대규모 언어 모델(LLM)은 순전히 계산 제약이 아닌 현재 하드웨어에서 통신 병목 현상을 겪는 경우가 많습니다. MLA(Multi-head Latent Attention)는 KV(키-값) 계층에서 낮은 순위의 매트릭스를 사용하여 압축된 잠재 KV 상태를 캐시할 수 있도록 하여 이 문제를 해결합니다. 이 접근 방식은 기존의 다중 헤드 어텐션에 비해 KV 캐시 크기를 크게 줄여 더 빠른 추론을 가능하게 합니다. 또한 MLA는 표현력을 높이기 위해 상향 투영 매트릭스를 사용하여 통신 오버헤드를 줄이기 위해 추가 계산을 교환합니다. MLA는 Deepseek V2/V3/R1에서 효율성과 효과를 입증했지만 많은 주요 모델 제공업체는 여전히 GQA(Group Query Attention)에 의존하고 있으며 MLA 채택 계획을 발표하지 않았습니다. 이 백서에서는 GQA가 동일한 KV 캐시 오버헤드를 유지하면서 항상 MLA로 표현될 수 있음을 보여주지만 그 반대는 성립하지 않습니다. MLA의 광범위한 사용을 장려하기 위해 널리 사용되는 GQA 기반 사전 학습 모델(예: LLaMA, Qwen, Mixtral)을 MLA 기반 모델로 변환하는 사후 학습 방법인 **TransMLA**를 도입합니다. 변환 후 모델은 KV 캐시 크기를 늘리지 않고 표현력을 향상시키기 위해 추가 교육을 받을 수 있습니다. 또한, 변환된 모델에서 낮은 지연 시간을 유지하기 위해 MLA에 특화된 추론 가속 기술을 개발하여 Deepseek R1을 보다 효율적으로 증류할 수 있도록 할 계획입니다.
전체 0