뉴스/정보
(2023년 7월)RT-2: 비전과 언어를 행동으로 변환하는 새로운 모델
작성자
작성일
2024-06-25 11:50
조회
749
https://deepmind.google/discover/blog/rt-2-new-model-translates-vision-and-language-into-action/
한글기사
https://www.ciokorea.com/news/301693
RT-2(Robotic Transformer 2)는 웹 및 로봇 데이터 모두에서 학습하고 이 지식을 로봇 제어를 위한 일반화된 지침으로 변환하는 새로운 VLA(비전-언어-동작) 모델입니다.
RT-2는 비전-언어 모델(VLM)을 강력한 비전-언어-액션(VLA) 모델로 변환할 수 있음을 보여주며, VLM 사전 학습과 로봇 데이터를 결합하여 로봇을 직접 제어할 수 있습니다.
PaLM-E와 PaLI-X를 기반으로 하는 두 가지 VLA 인스턴스를 통해 RT-2는 고도로 향상된 로봇 정책을 제공하며, 무엇보다도 웹 스케일 비전 언어 사전 학습에서 상속받은 일반화 성능과 새로운 기능을 훨씬 더 향상시킬 수 있습니다.
RT-2는 기존 VLM 모델을 간단하고 효과적으로 수정할 수 있을 뿐만 아니라 실제 세계에서 다양한 작업을 수행하기 위해 추론하고 문제를 해결하며 정보를 해석할 수 있는 범용 물리적 로봇을 구축할 수 있는 가능성을 보여줍니다.
한글기사
https://www.ciokorea.com/news/301693
RT-2(Robotic Transformer 2)는 웹 및 로봇 데이터 모두에서 학습하고 이 지식을 로봇 제어를 위한 일반화된 지침으로 변환하는 새로운 VLA(비전-언어-동작) 모델입니다.
RT-2는 비전-언어 모델(VLM)을 강력한 비전-언어-액션(VLA) 모델로 변환할 수 있음을 보여주며, VLM 사전 학습과 로봇 데이터를 결합하여 로봇을 직접 제어할 수 있습니다.
PaLM-E와 PaLI-X를 기반으로 하는 두 가지 VLA 인스턴스를 통해 RT-2는 고도로 향상된 로봇 정책을 제공하며, 무엇보다도 웹 스케일 비전 언어 사전 학습에서 상속받은 일반화 성능과 새로운 기능을 훨씬 더 향상시킬 수 있습니다.
RT-2는 기존 VLM 모델을 간단하고 효과적으로 수정할 수 있을 뿐만 아니라 실제 세계에서 다양한 작업을 수행하기 위해 추론하고 문제를 해결하며 정보를 해석할 수 있는 범용 물리적 로봇을 구축할 수 있는 가능성을 보여줍니다.
전체 0