Skip to main content

Command Palette

Search for a command to run...

RT-2: Vision-Language-Action Models — 웹 지식을 로봇 행동으로

LLM의 지식이 로봇으로 전이된다 — 6,000번 실험, 3배 일반화 향상, emergent reasoning

Updated
5 min readView as Markdown
T
I build robots for a living. Not in simulation. Not in a lab. On the floor, with real hardware, real failure modes, and real deadlines. My work spans the full stack of modern robotics: embedded systems firmware, autonomous navigation, and the end-to-end pipeline for Vision-Language-Action (VLA) model development — dataset collection, training, inference optimization, and sim-to-real transfer. I've worked hands-on with platforms from Unitree, Deep Robotics, Dexmate, and Robotis, among others. Each one teaches you something different about the gap between what models promise and what robots actually do.

TL;DR

RT-2는 인터넷 규모로 학습된 Vision-Language Model(VLM)을 로봇 제어에 직접 적용한 첫 번째 대규모 VLA 모델입니다. PaLI-X(55B)와 PaLM-E(12B)를 기반으로, 로봇 행동을 텍스트 토큰으로 표현해 웹 데이터와 로봇 데이터를 함께 학습합니다. 6,000번의 실제 로봇 실험에서 RT-1 대비 3배 이상 향상된 일반화 성능을 달성했으며, 학습에 없던 개념에 대한 추론 능력(emergent capability)이 자연스럽게 등장했습니다.


Background: RT-1 이후의 질문

RT-1은 스케일이 로봇 학습에 통한다는 걸 증명했습니다. 130K 데모, 700+ 태스크, 97% 성공률. 하지만 한계가 있었습니다.

RT-1은 학습 데이터에 없는 개념을 이해하지 못했습니다. "에너지 음료를 피곤한 사람한테 줘"라는 명령은 '에너지 음료 = 피로 회복'이라는 상식 지식이 필요한데, 로봇 데모 데이터에는 이런 정보가 없습니다.

RT-2의 질문: 이미 수조 개의 웹 텍스트+이미지로 학습한 거대 언어 모델이 그 지식을 로봇 행동으로 옮길 수 있을까?

답은 '그렇다' — 그리고 기대 이상이었습니다.


Core Idea: 행동을 텍스트 토큰으로 표현하기

RT-2의 핵심 아이디어는 단순하면서도 강력합니다.

로봇 행동(arm 위치, gripper 상태 등)을 문자열 토큰으로 discretize합니다. 예를 들어 "팔을 x축으로 0.03m 이동"이 256이라는 텍스트 토큰이 됩니다. 그러면 로봇 제어 문제가 언어 모델이 이미 잘 하는 다음 토큰 예측 문제로 바뀝니다.

이렇게 되면 거대한 VLM을 그대로 가져와서 로봇 데이터로 co-fine-tuning만 하면 됩니다. 웹 지식 + 로봇 행동이 하나의 모델 안에 공존합니다.


Architecture: PaLI-X & PaLM-E 기반

RT-2는 두 가지 베이스 모델로 실험합니다:

베이스 모델파라미터특징
PaLI-X5B / 55B다국어 VLM, 이미지-텍스트 이해 특화
PaLM-E12B구현된 에이전트용 멀티모달 LLM

RT-2 Architecture: VLM backbone + action tokenization 그림 1. RT-2 아키텍처 — 이미지+텍스트 입력을 받아 행동 토큰을 출력하는 end-to-end VLA 구조

입력 구조

  • 이미지: 로봇 카메라 (front view)
  • 텍스트 명령: 자연어 instruction
  • 출력: 텍스트 토큰 시퀀스 (마지막 N개가 로봇 행동)

RT-1이 EfficientNet + TokenLearner + Transformer였다면, RT-2는 그냥 거대 VLM 하나입니다. 아키텍처 자체는 더 단순해졌습니다.

Action Tokenization

행동 공간:

  • 팔 7-DOF (x, y, z, roll, pitch, yaw, gripper): 각 256 bins
  • 베이스 이동: 3-DOF

각 bin이 하나의 정수 토큰 → VLM vocab에 추가 → 일반 text token과 동일하게 처리.

Co-fine-tuning

핵심은 로봇 데이터만으로 fine-tuning하는 게 아니라, 기존 웹 VQA 데이터와 로봇 trajectory 데이터를 함께 학습한다는 점입니다. 이렇게 해야 웹 지식이 사라지지(catastrophic forgetting) 않습니다.


Evaluation: 무엇을 테스트했나

6,000회 실제 로봇 실험. 크게 세 가지 평가 축:

1. 기존 태스크 성능

학습 데이터와 비슷한 태스크에서의 성공률.

모델Success Rate
RT-1 (seen tasks)97%
RT-2-PaLI-X 55B~90%
RT-2-PaLM-E 12B~83%

RT-2 performance results across evaluation categories 그림 4. 평가 카테고리별 성공률 — 학습 분포 내 태스크에서 RT-1 수준, 새로운 환경에서 3배 이상 향상

RT-1보다 낮지만, RT-2의 진짜 가치는 다음에 있습니다.

2. 새로운 시나리오 일반화

학습에 없던 객체, 환경, 개념에서의 성공률.

조건RT-1RT-2-55B
새로운 객체~32%~62%
새로운 배경~40%~69%
새로운 명령~23%~59%

RT-2 generalization to novel objects, backgrounds, and commands 그림 2. 새로운 시나리오 일반화 평가 — RT-2는 학습에 없던 객체/배경/명령에서도 강건하게 동작

3배 이상 향상. RT-1은 학습 분포를 벗어나면 급격히 무너지지만, RT-2는 웹 지식 덕분에 훨씬 강건합니다.

3. Emergent Capabilities — 핵심 발견

이게 RT-2에서 가장 놀라운 부분입니다. 로봇 훈련 데이터에는 전혀 없던 능력들이 자연스럽게 등장했습니다:

Symbol Understanding "숫자 3 위에 물건을 놓아라" — 로봇 데이터에는 '숫자 3'이 없지만, VLM이 시각적으로 숫자를 인식합니다.

Cross-concept Reasoning "술에 맞는 음료를 집어줘" → 맥주 집기 "피곤한 사람에게 줄 음료" → 에너지 음료 집기

RT-2 emergent capabilities evaluation 그림 6. Emergent capabilities 평가 — 로봇 훈련 데이터에 없던 개념들(수식, 상식 추론 등)에서 RT-2의 성공률

Chain-of-Thought (RT-2-CoT) 명령 실행 전에 "Plan: 에너지 음료는 피로 회복에 좋으니 에너지 음료를 선택한다. Action: [토큰들]" 형식으로 이유를 먼저 생성한 뒤 행동. 복잡한 다단계 추론에서 성능 향상.


Chain-of-Thought 확장

논문에서 별도로 실험한 RT-2-CoT는 다음 구조로 동작합니다:

입력: 이미지 + "어떤 음료가 피로 회복에 좋을까?"
출력: "Plan: Energy drinks help with fatigue. Action: 238 211 ... [행동 토큰]"

CoT를 붙이면 멀티스텝 추론이 필요한 태스크에서 성공률이 유의미하게 올라갑니다. 이는 이후 OpenVLA, π0 같은 후속 연구들이 language chain을 더 깊이 파고드는 계기가 됩니다.


Scale의 효과: 55B vs 5B

모델 크기가 클수록 일관되게 성능이 좋습니다:

  • PaLI-X 55B > PaLI-X 5B on emergent tasks
  • 특히 새로운 개념 추론에서 격차가 큼

로봇 데이터는 동일한데 베이스 모델 크기만 달라도 emergent capability 차이가 납니다. LLM scaling law가 VLA에도 적용됩니다.


Limitations — 현장 엔지니어 관점

논문이 인정하는 한계:

  1. 추론 속도: 55B 모델은 느려서 실시간 제어에 제약
  2. 로봇 데이터 의존성: 웹 지식만으론 부족, 여전히 실제 로봇 데이터 필요
  3. 단일 로봇 형태: RT-1과 동일하게 Everyday Robots 한정

현장 관점 추가:

  • 레이턴시: 55B 모델을 로봇 온보드에서 돌리는 건 현실적으로 어렵습니다. 추론 서버 분리 필수
  • Fine-grained manipulation: 텍스트 토큰으로 표현된 action은 여전히 거친 bin resolution 문제 있음 (π0가 이걸 diffusion으로 해결하려 함)
  • Catastrophic forgetting: Co-fine-tuning 비율을 잘못 설정하면 웹 지식이 사라짐 — 하이퍼파라미터 튜닝이 까다로움

The Lineage — RT-2가 열어준 것

논문RT-2에서 가져간 것
RT-X (2023)cross-embodiment + RT-2 아키텍처
Octo (2023)오픈소스 VLA, RT-2 패러다임 민주화
OpenVLA (2024)7B LLM + RT-2 co-fine-tuning 방식
π0 (2024)VLM backbone + diffusion action head로 resolution 문제 해결
Embodied CoT (2024)RT-2-CoT에서 더 발전한 추론 체인

RT-2가 증명한 것: LLM의 지식이 로봇 행동으로 transfer된다. 이 발견이 이후 모든 VLA 연구의 출발점입니다.


Summary — Key Takeaways

  1. VLM의 웹 지식이 로봇으로 전이된다 — co-fine-tuning만으로 emergent capability 획득
  2. 행동을 텍스트 토큰으로 표현하면 기존 LLM 인프라 그대로 활용 가능
  3. 크면 클수록 emergent capability가 강해진다 — LLM scaling law가 VLA에도 적용
  4. Chain-of-Thought가 복잡한 추론에서 유효 — 행동 전 이유 생성이 성능 향상
  5. RT-2는 VLA의 패러다임 전환 — task-specific에서 general purpose로

📄 Paper: arXiv:2307.15818 🌐 Project: robotics-transformer2.github.io

다음 포스트: FAST-LIO2 — LiDAR-IMU 융합으로 고속 정밀 odometry 구현

2 views

More from this blog

TwinVLA: 단일 팔 VLA 두 개로 양팔 조작 구현 — 50 에피소드로 RDT-1B 능가

TL;DR TwinVLA(arXiv:2511.05275)는 두 개의 사전 훈련된 단일 팔 VLA를 조합해 양팔 조작(Bimanual Manipulation)을 구현하는 프레임워크다. 양팔 데이터로 처음부터 대규모 사전 훈련 없이, 단일 팔 데이터만으로 사전 훈련된 SingleVLA(0.8B)를 두 개 인스턴스로 구성하고 Joint Attention + Causal Mask로 양팔을 협조시킨다. 결과: RDT-1B(학습 데이터 2,400시간)을 ...

Apr 21, 20268 min read1

Swerve Drive: 슬립 없는 전방향 이동 플랫폼 완전 분석 (2휠/3휠/4휠 비교)

TL;DR Swerve Drive(스워브 드라이브)는 각 바퀴가 독립적으로 조향(steering)과 구동(driving)을 동시에 수행하는 전방향 이동 플랫폼이다. 모든 방향으로 슬립 없이 이동할 수 있으면서도 메카넘 휠 대비 높은 견인력을 유지한다. 핵심은 역기구학(Inverse Kinematics): 원하는 차체 속도(vx, vy, ω)를 입력받아 각 바퀴의 속도와 각도를 실시간 계산한다. 산업용 AGV, 경쟁 로봇(FRC), 서비스 로봇 ...

Apr 20, 202612 min read5

telos-robotics

26 posts

VLA Paper Reviews RT-1, RT-2, π0, OpenVLA, Octo — the models that define where robot learning is headed. Not just summaries. Architecture breakdowns, training details, deployment considerations. Autonomous Driving Navigation Path planning algorithms, localization techniques (LiDAR SLAM ...), perception stacks. The building blocks of autonomous mobile robots. Robot Platform Notes Hands-on observations from working with specific hardware. Things you only learn by running the robot until it fails.