최신논문

Qwen2.5-VL 기술 보고서

작성자
작성일
2025-02-20 23:32
조회
333
https://arxiv.org/abs/2502.13923

Qwen 비전 언어 시리즈의 최신 플래그십 모델인 Qwen2.5-VL을 소개하며, 이는 기본 기능과 혁신적인 기능 모두에서 상당한 발전을 보여줍니다. Qwen2.5-VL은 향상된 시각적 인식, 정확한 개체 위치 파악, 강력한 문서 구문 분석 및 긴 비디오 이해를 통해 세상을 이해하고 상호 작용하는 데 있어 큰 도약을 이룹니다. Qwen2.5-VL의 두드러진 기능은 경계 상자 또는 점을 사용하여 개체를 정확하게 지역화하는 기능입니다. 송장, 양식 및 테이블에서 강력한 구조화된 데이터 추출은 물론 차트, 다이어그램 및 레이아웃에 대한 자세한 분석을 제공합니다. 복잡한 입력을 처리하기 위해 Qwen2.5-VL은 동적 해상도 처리 및 절대 시간 인코딩을 도입하여 2차 레벨 이벤트 현지화를 통해 다양한 크기의 이미지와 장시간(최대 시간)의 비디오를 처리할 수 있습니다. 이를 통해 모델은 기존의 정규화 기술에 의존하지 않고 공간 스케일과 시간 역학을 기본적으로 인식할 수 있습니다. 네이티브 동적 해상도 Vision Transformer(ViT)를 처음부터 훈련하고 Window Attention을 통합함으로써 기본 해상도를 유지하면서 컴퓨팅 오버헤드를 줄입니다. 결과적으로 Qwen2.5-VL은 정적 이미지 및 문서 이해뿐만 아니라 운영 컴퓨터 및 모바일 장치와 같은 실제 시나리오에서 추론, 도구 사용 및 작업 실행이 가능한 대화형 시각적 에이전트로서 탁월합니다. Qwen2.5-VL은 세 가지 크기로 제공되어 엣지 AI에서 고성능 컴퓨팅에 이르기까지 다양한 사용 사례를 처리합니다. 플래그십 Qwen2.5-VL-72B 모델은 GPT-4o 및 Claude 3.5 Sonnet과 같은 최첨단 모델과 일치하며, 특히 문서 및 다이어그램 이해가 탁월합니다. 또한 Qwen2.5-VL은 Qwen2.5 LLM의 핵심 언어 역량을 보존하면서 강력한 언어 성능을 유지합니다.

전체 0