최신논문

Mobility VLA: Long-Context VLM 및 Topological Graph를 사용한 다중 모드 지침 탐색

작성자
작성일
2024-07-11 23:52
조회
576


https://arxiv.org/abs/2407.07775

항해 연구에서 찾기 힘든 목표는 자연어와 이미지를 포함한 다중 모드 지침을 이해하고 유용한 항해를 수행할 수 있는 지능형 에이전트를 구축하는 것입니다. 이를 달성하기 위해, 우리는 다중 모드 지침 항해 및 데모 투어(MINT)라고 하는 널리 유용한 항해 작업 범주를 연구합니다. 여기서 환경 사전은 이전에 녹화된 데모 비디오를 통해 제공됩니다. 시각 언어 모델(VLM)의 최근 발전은 다중 모드 입력에 대한 인식 및 추론 기능을 보여주기 때문에 이 목표를 달성하는 데 유망한 경로를 보여주었습니다. 그러나 VLM은 일반적으로 텍스트 출력을 예측하도록 훈련되며 항해에서 이를 가장 잘 활용하는 방법에 대한 열린 연구 질문입니다. MINT를 해결하기 위해, 우리는 장기 컨텍스트 VLM의 환경 이해 및 상식적 추론 능력과 토폴로지 그래프를 기반으로 하는 강력한 저수준 항해 정책을 결합하는 계층적 시각-언어-행동(VLA) 항해 정책인 Mobility VLA를 제시합니다. 상위 수준 정책은 데모 투어 비디오와 멀티모달 사용자 지침을 입력으로 받아 투어 비디오에서 목표 프레임을 찾는 롱 컨텍스트 VLM으로 구성됩니다. 다음으로, 하위 수준 정책은 목표 프레임과 오프라인으로 구성된 토폴로지 그래프를 사용하여 모든 타임스텝에서 로봇 동작을 생성합니다. 우리는 836m^2의 실제 환경에서 Mobility VLA를 평가했으며, Mobility VLA가 플라스틱 통을 든 채로 "어디에 반환해야 하나요?"와 같은 이전에 해결되지 않은 멀티모달 지침에 대해 높은 엔드투엔드 성공률을 보인다는 것을 보여줍니다.

 
전체 0