VLA(Vision-Language-Action) 모델 데이터 수집 및 학습 방법 심층 조사 보고서

요청 개요

본 보고서는 허깅페이스(Hugging Face) 생태계를 중심으로 VLA(Vision-Language-Action) 모델의 데이터 수집, 학습, 파인튜닝, 평가에 이르는 전 과정을 심층 분석한다. 특히 Open X-Embodiment, RT-1/RT-2, BridgeData 등 대표적 VLA 데이터셋의 특성과 수집 방법론, 허깅페이스 데이터셋 허브 및 LeRobot 프레임워크를 활용한 로봇 학습 파이프라인, 그리고 OpenVLA와 같은 오픈소스 모델의 학습 및 평가 절차를 단계별로 정리한다.

수집 소스


핵심 분석

1. VLA 모델 개요 및 아키텍처

VLA(Vision-Language-Action) 모델은 로봇 조작 작업을 위해 비전(Vision), 언어(Language), 행동(Action)을 통합한 멀티모달 AI 모델이다. 기존의 로봇 학습 방식이 단일 태스크에 특화된 정책(policy)을 학습하는 것과 달리, VLA는 대규모 사전 학습된 비전-언어 모델(VLM)을 기반으로 로봇 행동을 출력하도록 확장한 구조를 가진다.

핵심 아키텍처 특징:

  • 비전 인코더: 이미지 또는 비디오 프레임을 처리하여 시각적 특징 추출
  • 언어 모델: 자연어 지시사항을 이해하고 토큰화
  • 행동 디코더: 연속적인 로봇 행동(관절 위치, 그리퍼 상태 등)을 이산화된 토큰으로 출력

OpenVLA의 경우, 사전 학습된 VLM(예: Prismatic)을 기반으로 행동 토큰을 추가하여 로봇 조작 정책을 학습한다.

2. VLA 데이터셋 수집 방법

2.1 Open X-Embodiment (OpenX) 데이터셋

OpenX는 VLA 학습을 위한 가장 대표적인 대규모 데이터셋으로, 다양한 로봇 플랫폼, 태스크, 환경에서 수집된 로봇 조작 궤적(trajectory)을 포함한다.

주요 특징:

  • 규모: 970,000개 이상의 로봇 조작 궤적 (OpenVLA 학습 기준)
  • 다양성: 다양한 로봇 임보디먼트(embodiment), 태스크, 장면 포함
  • 형식: RLDS(Relay-Learning DataSet) 형식으로 표준화

수집 방법:

  • 원격 조작(Teleoperation): 인간 오퍼레이터가 로봇을 직접 조작하며 시연 데이터 수집
  • 자동화된 데이터 수집: 스크립트 기반 자동 시연 생성
  • 크라우드소싱: 여러 연구 기관이 데이터를 기여하고 공유

2.2 RT-1/RT-2 데이터셋

Google Robotics에서 개발한 RT-1(Robotics Transformer 1)과 RT-2는 대규모 로봇 데이터와 인터넷 규모의 비전-언어 데이터를 결합한 접근법을 사용한다.

RT-1 특징:

  • 130,000개 이상의 에피소드로 구성된 로봇 조작 데이터
  • 13개의 로봇 플랫폼에서 수집
  • 700개 이상의 태스크 정의

RT-2 특징:

  • RT-1 데이터 + 웹 규모의 비전-언어 데이터 결합
  • Co-Fine-Tuning 기법으로 로봇 데이터와 인터넷 데이터를 혼합 학습
  • 언어-비전-행동의 의미론적 연결 강화

2.3 BridgeData V2

BridgeData V2는 WidowX 로봇 플랫폼을 기반으로 수집된 데이터셋으로, OpenVLA의 평가 및 파인튜닝에 널리 사용된다.

주요 특징:

  • 64,000개 이상의 궤적 포함
  • 다양한 가정 환경에서 수집
  • 단일 로봇 플랫폼에 특화되어 있어 일관성 높음

2.4 데이터 형식: RLDS vs LeRobot

구분RLDSLeRobot
개발 주체Google DeepMindHugging Face
형식TFRecord 기반Parquet 기반
장점대규모 데이터 처리에 최적화Python 생태계와의 호환성 우수
사용처Open X-Embodiment, RT-1/RT-2Hugging Face Hub, 커뮤니티

3. 허깅페이스 데이터셋 허브 활용

허깅페이스 데이터셋 허브는 VLA 데이터셋의 공유, 버전 관리, 배포를 위한 중앙 플랫폼 역할을 한다.

주요 기능:

  • 데이터셋 카탈로그: VLA-OS-Dataset 등 다양한 로봇 데이터셋 검색 및 다운로드
  • 버전 관리: 데이터셋의 변경 이력 추적
  • 데이터 카드: 데이터셋의 구성, 수집 방법, 라이선스 등 메타데이터 제공
  • 통합 API: datasets 라이브러리를 통한 간편한 데이터 로딩

HuggingFaceVLA 조직: 허깅페이스는 VLA 연구를 위한 전용 조직을 운영하며, 데이터셋, 모델, 학습 코드를 통합 제공한다. 이를 통해 연구자들은 표준화된 파이프라인을 통해 VLA 모델을 개발할 수 있다.

4. LeRobot 프레임워크를 통한 로봇 학습 파이프라인

LeRobot는 허깅페이스가 개발한 로봇 학습 프레임워크로, VLA 모델의 데이터 수집부터 학습, 평가까지 전 과정을 지원한다.

파이프라인 구성:

1234....데--데---모---평---이이델가터원시터R이행사L분실시모격뮬L미동학전o산및제뮬델수레전D지습R레집조이처S토학A학배로이허작션리리큰습습포봇션브→사화된또도환이는지평벤배구경L징V원가치포e,L전마제지RM체크공원o정b규로파o화딩인t튜닝형식변환

5. 파인튜닝 및 학습 절차

5.1 OpenVLA 학습 절차

사전 학습 (Pre-training):

  • 970K 궤적의 OpenX 데이터셋 사용
  • 64대의 A100 GPU에서 15일간 학습
  • 사전 학습된 VLM(Prismatic)을 기반으로 행동 디코더 추가

파인튜닝 (Fine-tuning):

LoRA 파인튜닝:

  • 경량화된 파인튜닝 방식으로 적은 GPU 메모리 사용
  • 특정 로봇 플랫폼에 빠르게 적응
  • 학습 시간: 수 시간 ~ 수 일

전체 파인튜닝 (Full Fine-tuning):

  • 모든 모델 파라미터 업데이트
  • 더 높은 성능 달성 가능
  • 많은 GPU 리소스 필요

파인튜닝 절차:

  1. 대상 로봇의 데이터 수집 (예: BridgeData V2)
  2. 데이터를 RLDS 형식으로 변환
  3. 사전 학습된 OpenVLA 가중치 로딩
  4. LoRA 또는 전체 파인튜닝 설정
  5. 학습 하이퍼파라미터 튜닝
  6. 평가 및 반복

5.2 데이터 혼합 전략

VLA 학습에서 데이터 혼합은 중요한 요소이다:

  • 다양한 임보디먼트 혼합: 일반화 성능 향상
  • 태스크 다양성: 지시사항 이해 능력 강화
  • 도메인 랜덤화: 시각적 강건성 확보

6. 평가 방법

6.1 실제 로봇 평가

BridgeData V2 WidowX 평가:

  • 실제 WidowX 로봇에서 태스크 수행
  • 성공률(Success Rate) 측정
  • 다양한 태스크와 장면에서 일반화 성능 평가

평가 절차:

  1. 평가 환경 설정 (로봇, 카메라, 물체 배치)
  2. 태스크 정의 (예: “빨간 블록을 파란 컵에 넣어”)
  3. 에피소드 실행 및 성공 여부 기록
  4. 통계적 분석 (성공률, 평균 소요 시간 등)

6.2 시뮬레이션 평가

  • 시뮬레이션 환경에서 대규모 자동 평가 가능
  • 다양한 난이도와 환경 구성 테스트
  • 실제 로봇 평가 전 사전 검증 용도

6.3 벤치마크 비교

  • 기존 VLA 모델(RT-1, RT-2, Octo 등)과의 성능 비교
  • 동일한 데이터셋과 환경에서 공정한 비교 필요

결론

VLA 모델의 성공적인 학습을 위해서는 대규모의 다양한 로봇 조작 데이터가 필수적이며, Open X-Embodiment와 같은 공개 데이터셋이 핵심 역할을 한다. 허깅페이스는 데이터셋 허브와 LeRobot 프레임워크를 통해 VLA 데이터 수집부터 학습, 평가까지의 전 과정을 표준화하고 민주화하는 데 기여하고 있다. OpenVLA는 오픈소스 VLA 모델의 대표 사례로, 970K 궤적의 데이터로 사전 학습되고 LoRA 파인튜닝을 통해 특정 로봇에 효율적으로 적응할 수 있음을 보여준다. 데이터 형식(RLDS vs LeRobot)의 표준화와 다양한 데이터 혼합 전략이 VLA 모델의 일반화 성능을 결정하는 중요한 요소로 작용한다.


한계 및 주의사항

  • 데이터 편향 가능성: OpenX 데이터셋은 주로 서양권 연구 기관의 데이터로 구성되어 있어, 다양한 문화권의 환경과 물체에 대한 일반화 성능이 제한될 수 있다.
  • 평가의 일관성 부족: 실제 로봇 평가는 환경 조건, 로봇 상태 등에 따라 결과가 달라질 수 있어 표준화된 평가 프로토콜이 필요하다.
  • 정보의 시의성: VLA 분야는 빠르게 발전하고 있어, 본 보고서의 정보(특히 2026년 자료)는 최신 연구 동향을 완전히 반영하지 못할 수 있다.
  • 리소스 요구사항: OpenVLA 사전 학습에 필요한 64대의 A100 GPU는 일반 연구자가 접근하기 어려운 수준으로, 경량화된 학습 방법에 대한 추가 연구가 필요하다.
  • 실제 로봇 적용의 안전성: VLA 모델의 실제 로봇 적용 시 안전성 검증이 충분히 이루어지지 않았으며, 실패 모드에 대한 추가 분석이 필요하다.