최신논문

Generalist Vision Transformer를 향하여

작성일
2024-07-04 08:50
조회
418
https://arxiv.org/abs/2403.09394

이 논문은 다양한 시각 작업에 바닐라 ViT만 사용하여 동시에 적용할 수 있는 GiT라는 간단하면서도 효과적인 프레임워크를 제안합니다. 대규모 언어 모델(LLM)에서 널리 사용되는 다중 계층 변환기 아키텍처(예: GPT)의 보편성에 동기를 부여받아, 강력한 시각 기반 모델(VFM)로 사용할 수 있도록 범위를 넓히고자 합니다. 그러나 언어 모델링과 달리 시각 작업에는 일반적으로 감지를 위한 바운딩 박스 헤드와 분할을 위한 픽셀 디코더와 같은 특정 모듈이 필요하여 시각 도메인에서 강력한 다중 계층 변환기를 적용하는 데 큰 방해가 됩니다. 이를 해결하기 위해 이미지 수준 이해(예: 캡션), 희소 인식(예: 감지), 밀도 예측(예: 분할)에 이르기까지 다양한 시각 작업을 능숙하게 통합할 수 있는 성공적인 자동 회귀 디코딩을 지원하는 범용 언어 인터페이스를 설계합니다. 위의 설계를 기반으로 전체 모델은 특정 추가 기능 없이 ViT로만 구성되어 놀라운 구조적 단순화를 제공합니다. GiT은 멀티태스크 시각적 모델로, 작업별 미세 조정 없이 5개의 대표적인 벤치마크에 걸쳐 공동으로 학습합니다. 흥미롭게도, 우리의 GiT는 일반주의적 성능에서 새로운 벤치마크를 구축하고, 작업 간에 상호 향상을 촉진하여 분리된 학습에 비해 상당한 개선을 이룹니다. 이는 LLM에서 관찰된 유사한 영향을 반영합니다. 27개 데이터 세트로 학습을 더욱 풍부하게 하는 GiT는 다양한 작업에 걸쳐 강력한 제로샷 결과를 달성합니다. 이 패러다임은 간단한 설계로 인해 비전과 언어 간의 구조적 격차를 좁히는 데 유망합니다. 코드와 모델은 https://github.com/Haiyang-W/GiT에서 제공됩니다.
전체 0