VLA(Vision-Language-Action) 모델 데이터 수집 및 학습 방법 심층 조사 보고서
요청 개요
본 보고서는 허깅페이스(Hugging Face) 생태계를 중심으로 VLA(Vision-Language-Action) 모델의 데이터 수집, 학습, 파인튜닝, 평가에 이르는 전 과정을 심층 분석한다. 특히 Open X-Embodiment, RT-1/RT-2, BridgeData 등 대표적 VLA 데이터셋의 특성과 수집 방법론, 허깅페이스 데이터셋 허브 및 LeRobot 프레임워크를 활용한 로봇 학습 파이프라인, 그리고 OpenVLA와 같은 오픈소스 모델의 학습 및 평가 절차를 단계별로 정리한다.
수집 소스
- OpenVLA 공식 웹사이트: https://openvla.github.io/
- OpenVLA GitHub 저장소: https://github.com/openvla/openvla
- VLA Training Data 가이드 (Claru.ai): https://claru.ai/vla-training-data-guide
- Hugging Face - Linslab/VLA-OS-Dataset: https://huggingface.co/datasets/Linslab/VLA-OS-Dataset
- Hugging Face - HuggingFaceVLA 조직: https://huggingface.co/HuggingFaceVLA
핵심 분석
1. VLA 모델 개요 및 아키텍처
VLA(Vision-Language-Action) 모델은 로봇 조작 작업을 위해 비전(Vision), 언어(Language), 행동(Action)을 통합한 멀티모달 AI 모델이다. 기존의 로봇 학습 방식이 단일 태스크에 특화된 정책(policy)을 학습하는 것과 달리, VLA는 대규모 사전 학습된 비전-언어 모델(VLM)을 기반으로 로봇 행동을 출력하도록 확장한 구조를 가진다.
핵심 아키텍처 특징:
- 비전 인코더: 이미지 또는 비디오 프레임을 처리하여 시각적 특징 추출
- 언어 모델: 자연어 지시사항을 이해하고 토큰화
- 행동 디코더: 연속적인 로봇 행동(관절 위치, 그리퍼 상태 등)을 이산화된 토큰으로 출력
OpenVLA의 경우, 사전 학습된 VLM(예: Prismatic)을 기반으로 행동 토큰을 추가하여 로봇 조작 정책을 학습한다.
2. VLA 데이터셋 수집 방법
2.1 Open X-Embodiment (OpenX) 데이터셋
OpenX는 VLA 학습을 위한 가장 대표적인 대규모 데이터셋으로, 다양한 로봇 플랫폼, 태스크, 환경에서 수집된 로봇 조작 궤적(trajectory)을 포함한다.
주요 특징:
- 규모: 970,000개 이상의 로봇 조작 궤적 (OpenVLA 학습 기준)
- 다양성: 다양한 로봇 임보디먼트(embodiment), 태스크, 장면 포함
- 형식: RLDS(Relay-Learning DataSet) 형식으로 표준화
수집 방법:
- 원격 조작(Teleoperation): 인간 오퍼레이터가 로봇을 직접 조작하며 시연 데이터 수집
- 자동화된 데이터 수집: 스크립트 기반 자동 시연 생성
- 크라우드소싱: 여러 연구 기관이 데이터를 기여하고 공유
2.2 RT-1/RT-2 데이터셋
Google Robotics에서 개발한 RT-1(Robotics Transformer 1)과 RT-2는 대규모 로봇 데이터와 인터넷 규모의 비전-언어 데이터를 결합한 접근법을 사용한다.
RT-1 특징:
- 130,000개 이상의 에피소드로 구성된 로봇 조작 데이터
- 13개의 로봇 플랫폼에서 수집
- 700개 이상의 태스크 정의
RT-2 특징:
- RT-1 데이터 + 웹 규모의 비전-언어 데이터 결합
- Co-Fine-Tuning 기법으로 로봇 데이터와 인터넷 데이터를 혼합 학습
- 언어-비전-행동의 의미론적 연결 강화
2.3 BridgeData V2
BridgeData V2는 WidowX 로봇 플랫폼을 기반으로 수집된 데이터셋으로, OpenVLA의 평가 및 파인튜닝에 널리 사용된다.
주요 특징:
- 64,000개 이상의 궤적 포함
- 다양한 가정 환경에서 수집
- 단일 로봇 플랫폼에 특화되어 있어 일관성 높음
2.4 데이터 형식: RLDS vs LeRobot
| 구분 | RLDS | LeRobot |
|---|---|---|
| 개발 주체 | Google DeepMind | Hugging Face |
| 형식 | TFRecord 기반 | Parquet 기반 |
| 장점 | 대규모 데이터 처리에 최적화 | Python 생태계와의 호환성 우수 |
| 사용처 | Open X-Embodiment, RT-1/RT-2 | Hugging Face Hub, 커뮤니티 |
3. 허깅페이스 데이터셋 허브 활용
허깅페이스 데이터셋 허브는 VLA 데이터셋의 공유, 버전 관리, 배포를 위한 중앙 플랫폼 역할을 한다.
주요 기능:
- 데이터셋 카탈로그: VLA-OS-Dataset 등 다양한 로봇 데이터셋 검색 및 다운로드
- 버전 관리: 데이터셋의 변경 이력 추적
- 데이터 카드: 데이터셋의 구성, 수집 방법, 라이선스 등 메타데이터 제공
- 통합 API:
datasets라이브러리를 통한 간편한 데이터 로딩
HuggingFaceVLA 조직: 허깅페이스는 VLA 연구를 위한 전용 조직을 운영하며, 데이터셋, 모델, 학습 코드를 통합 제공한다. 이를 통해 연구자들은 표준화된 파이프라인을 통해 VLA 모델을 개발할 수 있다.
4. LeRobot 프레임워크를 통한 로봇 학습 파이프라인
LeRobot는 허깅페이스가 개발한 로봇 학습 프레임워크로, VLA 모델의 데이터 수집부터 학습, 평가까지 전 과정을 지원한다.
파이프라인 구성:
5. 파인튜닝 및 학습 절차
5.1 OpenVLA 학습 절차
사전 학습 (Pre-training):
- 970K 궤적의 OpenX 데이터셋 사용
- 64대의 A100 GPU에서 15일간 학습
- 사전 학습된 VLM(Prismatic)을 기반으로 행동 디코더 추가
파인튜닝 (Fine-tuning):
LoRA 파인튜닝:
- 경량화된 파인튜닝 방식으로 적은 GPU 메모리 사용
- 특정 로봇 플랫폼에 빠르게 적응
- 학습 시간: 수 시간 ~ 수 일
전체 파인튜닝 (Full Fine-tuning):
- 모든 모델 파라미터 업데이트
- 더 높은 성능 달성 가능
- 많은 GPU 리소스 필요
파인튜닝 절차:
- 대상 로봇의 데이터 수집 (예: BridgeData V2)
- 데이터를 RLDS 형식으로 변환
- 사전 학습된 OpenVLA 가중치 로딩
- LoRA 또는 전체 파인튜닝 설정
- 학습 하이퍼파라미터 튜닝
- 평가 및 반복
5.2 데이터 혼합 전략
VLA 학습에서 데이터 혼합은 중요한 요소이다:
- 다양한 임보디먼트 혼합: 일반화 성능 향상
- 태스크 다양성: 지시사항 이해 능력 강화
- 도메인 랜덤화: 시각적 강건성 확보
6. 평가 방법
6.1 실제 로봇 평가
BridgeData V2 WidowX 평가:
- 실제 WidowX 로봇에서 태스크 수행
- 성공률(Success Rate) 측정
- 다양한 태스크와 장면에서 일반화 성능 평가
평가 절차:
- 평가 환경 설정 (로봇, 카메라, 물체 배치)
- 태스크 정의 (예: “빨간 블록을 파란 컵에 넣어”)
- 에피소드 실행 및 성공 여부 기록
- 통계적 분석 (성공률, 평균 소요 시간 등)
6.2 시뮬레이션 평가
- 시뮬레이션 환경에서 대규모 자동 평가 가능
- 다양한 난이도와 환경 구성 테스트
- 실제 로봇 평가 전 사전 검증 용도
6.3 벤치마크 비교
- 기존 VLA 모델(RT-1, RT-2, Octo 등)과의 성능 비교
- 동일한 데이터셋과 환경에서 공정한 비교 필요
결론
VLA 모델의 성공적인 학습을 위해서는 대규모의 다양한 로봇 조작 데이터가 필수적이며, Open X-Embodiment와 같은 공개 데이터셋이 핵심 역할을 한다. 허깅페이스는 데이터셋 허브와 LeRobot 프레임워크를 통해 VLA 데이터 수집부터 학습, 평가까지의 전 과정을 표준화하고 민주화하는 데 기여하고 있다. OpenVLA는 오픈소스 VLA 모델의 대표 사례로, 970K 궤적의 데이터로 사전 학습되고 LoRA 파인튜닝을 통해 특정 로봇에 효율적으로 적응할 수 있음을 보여준다. 데이터 형식(RLDS vs LeRobot)의 표준화와 다양한 데이터 혼합 전략이 VLA 모델의 일반화 성능을 결정하는 중요한 요소로 작용한다.
한계 및 주의사항
- 데이터 편향 가능성: OpenX 데이터셋은 주로 서양권 연구 기관의 데이터로 구성되어 있어, 다양한 문화권의 환경과 물체에 대한 일반화 성능이 제한될 수 있다.
- 평가의 일관성 부족: 실제 로봇 평가는 환경 조건, 로봇 상태 등에 따라 결과가 달라질 수 있어 표준화된 평가 프로토콜이 필요하다.
- 정보의 시의성: VLA 분야는 빠르게 발전하고 있어, 본 보고서의 정보(특히 2026년 자료)는 최신 연구 동향을 완전히 반영하지 못할 수 있다.
- 리소스 요구사항: OpenVLA 사전 학습에 필요한 64대의 A100 GPU는 일반 연구자가 접근하기 어려운 수준으로, 경량화된 학습 방법에 대한 추가 연구가 필요하다.
- 실제 로봇 적용의 안전성: VLA 모델의 실제 로봇 적용 시 안전성 검증이 충분히 이루어지지 않았으며, 실패 모드에 대한 추가 분석이 필요하다.