RT-2: Vision-Language-Action Models — 웹 지식을 로봇 행동으로
TL;DR
RT-2는 인터넷 규모로 학습된 Vision-Language Model(VLM)을 로봇 제어에 직접 적용한 첫 번째 대규모 VLA 모델입니다. PaLI-X(55B)와 PaLM-E(12B)를 기반으로, 로봇 행동을 텍스트 토큰으로 표현해 웹 데이터와 로봇 데이터를 함께 학습합니다. 6,000번의 실제 로봇 실험에서 RT-1 대비 3배 이상 향상된 일반화 성능을 달성했으며, 학습에 없던 개념에 대한 추론 능력(emergent capabi...
telos-robotics.hashnode.dev5 min read