월~금 오전 7시, 일요일 오전 8시 — AI 뉴스와 용어를 보내드립니다메일로 받아보기

METAL LAB

사람이 1인칭 시점으로 찍은 물건 조작 영상을 로봇 학습 데이터로 바꿔, 18,561시간짜리 15종 로봇용 데이터셋을 만들고 실제로 정책 일반화에 도움이 되는지 검증했다

arXiv:2608.025802026-08-02

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

사람이 1인칭 시점으로 찍은 물건 조작 영상을 로봇 학습 데이터로 바꿔, 18,561시간짜리 15종 로봇용 데이터셋을 만들고 실제로 정책 일반화에 도움이 되는지 검증했다

로봇이 물건을 잡고 옮기는 법을 배우려면 다양한 시연 데이터가 많이 필요한데, 로봇으로 직접 시연을 모으는 건 비싸고 느리다. Ego2Robot은 사람이 고개에 카메라를 달고 찍은 1인칭 조작 영상을 손동작 변환, 팔 영상 합성, 품질 검수를 거쳐 15가지 로봇 형태의 학습 데이터 18,561시간으로 바꾸는 파이프라인이다. 이렇게 만든 데이터를 실제 로봇 데이터와 섞어 사전학습시켰더니, 시각·장면·로봇 종류·언어 표현이 바뀐 낯선 상황에서 성공률이 꾸준히 올랐고 실제 로봇 실험에서도 효과가 확인됐다.

METAL LAB 해설 도표

Ego2Robot 파이프라인: 사람 영상에서 로봇 학습 데이터까지

증거 상태측정 결과가 보고됨

  1. 입력: 1인칭 조작 영상ANT, EgoDex, ViTRA, EgoVerse 등 4개 출처에서 모은 약 1,940시간의 사람 손 조작 영상
  2. 행동 정렬손 관절 21개 지점을 로봇 엔드이펙터(그리퍼) 궤적으로 변환하고 속도·움직임을 매끄럽게 다듬음
  3. 시각 정렬SAM 3로 사람 팔을 지운 뒤 로봇 베이스 위치를 역기구학으로 계산하고 15종 로봇 팔을 각 장면에 합성
  4. 품질 검수역기구학 실패, 자기충돌, 이상치 동작, 의미 불일치를 3단계(파이프라인 내부, 통계, VLM 검증)로 걸러냄
  5. 출력: 18,561시간 학습 데이터15가지 로봇 형태에 대해 병렬로 생성된 데이터를 실제 로봇 데이터와 섞어 VLA 모델을 사전학습
METAL LAB이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 사람이 손으로 물건을 조작하는 1인칭 영상(약 1,940시간, ANT·EgoDex·ViTRA·EgoVerse 4개 출처)을 수집해, 손 관절 위치를 로봇 팔 끝(엔드이펙터) 궤적으로 변환하는 '행동 정렬', 영상 속 사람 팔을 지우고 로봇 팔을 합성해 넣는 '시각 정렬', IK 실패나 의미 불일치를 걸러내는 3단계 '품질 검수'로 파이프라인을 구성했다.
  2. 이 파이프라인을 Panda, UR5e, xArm7 등 15종의 서로 다른 로봇 팔 모델에 각각 적용해, 원본 영상 하나당 15개의 병렬 학습 스트림을 만들어냈고 최종적으로 18,561시간 분량의 로봇 학습 데이터를 생성했다.
  3. 일반화 성능을 정밀하게 측정하기 위해 RoboTwin2.0 벤치마크를 확장해, 배경·조명·로봇 색상(시각), 테이블 높이·방해물·카메라 위치(장면 배치), 다른 로봇 종류로 교체(로봇 형태), 낯선 물체·다른 말투 지시문(작업 의미) 네 축을 따로따로 흔들어 테스트할 수 있게 만들었다.
  4. 실제 로봇(DROID, AgibotWorld, InternData 등 약 6,565시간)만 쓴 사전학습과 비교해, 합성 데이터(Ego2R)를 실제 로봇 데이터와 1:1 비율로 섞어 사전학습했을 때 RoboTwin의 무작위 설정에서 성공률이 53.5%로 로봇 전용 대비 2.6%포인트 올랐고, 배경(+4)·조명(+8)·로봇 색상(+6)·카메라 위치(+6)·낯선 물체(+11, 3:1 비율)·말투 변형 지시문(69% 도달) 등 여러 지표에서 개선이 나타났다.
  5. 실제 ARX ACone 로봇 5개 과제(과일 담기, 서랍에 블록 넣기, 수건 개기, 쓰레기 쓸기, 나사 끼우기)에서, 텔레오퍼레이션 시연과 합성 데이터를 함께 쓴 모델이 로봇 전용 학습보다 모든 과제에서 더 높은 점수를 냈고, 특히 블록 넣기(+14점)와 나사 끼우기(+13점)에서 격차가 컸다.
Figure 1: Ego2Robot pipeline. Converting egocentric video into 18,561h robot training data across 15 morphologies through action alignment, visual alignment, and quality curation.
Figure 1: Ego2Robot pipeline. Converting egocentric video into 18,561h robot training data across 15 morphologies through action alignment, visual alignment, and quality curation.
Table 1: Main results. Success rates (%) on RoboTwin2.0 and EBench. Green = gain >5% vs. Robot-only.
PretrainingRoboTwinPer-Dimension (RoboTwin)EBench
CleanRandVisualSceneEmbodyTaskAvg
Robot-only62.250.961.452.923.846.239.6
Ego2R+Robot (1:3)61.4 –0.851.0 +0.161.2 –0.252.5 –0.421.9 –1.949.5 +3.347.4 +7.8
Ego2R+Robot (3:1)64.1 +1.949.2 –1.762.7 +1.354.3 +1.428.2 +4.451.6 +5.451.7 +12.1
Ego2R+Robot (1:1)68.1 +5.953.5 +2.667.3 +5.956.9 +4.027.2 +3.454.1 +7.949.8 +10.2
Figure 2: Evaluation framework. Four generalization dimensions with 12 evaluation settings. Dashed borders: settings decoupled from bundled randomization for independent testing. Solid borders: newly introduced evaluation axes. Gray border: external benchmark (EBench).
Figure 2: Evaluation framework. Four generalization dimensions with 12 evaluation settings. Dashed borders: settings decoupled from bundled randomization for independent testing. Solid borders: newly introduced evaluation axes. Gray border: external benchmark (EBench).
Table 2: Per-perturbation breakdown. Change vs. Robot-only. Green = gain >5%.
PretrainingVisualSceneEmbodimentTask
BGLightColorHeightClutterCameraARXUR5FrankaObjLang
Robot-only66.658.259.460.148.350.444.120.27.029.363.1
Ego2R+Robot (1:3)65.0 –1.658.3 +0.160.3 +0.958.6 –1.549.3 +1.049.6 –0.843.7 –0.417.6 –2.64.5 –2.536.8 +7.562.2 –0.9
Ego2R+Robot (3:1)65.5 –1.160.9 +2.761.8 +2.462.0 +1.949.2 +0.951.6 +1.247.6 +3.531.4 +11.25.6 –1.440.0 +10.763.1 +0.0
Ego2R+Robot (1:1)70.3 +3.765.8 +7.665.8 +6.462.4 +2.352.0 +3.756.3 +5.951.2 +7.125.0 +4.85.3 –1.739.6 +10.368.5 +5.4
Figure 3: Pipeline value and embodiment scaling. Success rate on RoboTwin Randomized.
Figure 3: Pipeline value and embodiment scaling. Success rate on RoboTwin Randomized.
Table 3: Supported robot morphologies.
RobotDOFGripper (mm)Reach (m)
Panda70–801.272
Kinova Gen370–851.337
IIWA70–851.411
Sawyer714–791.420
FR370–801.272
xArm770–851.290
UR5e60–851.236
UR10e60–851.627
Jaco60–1251.200
ViperX615–870.911
WidowX611–550.787
ARX-L560–880.855
Piper60–700.883
YAM64–750.866
Aloha-Agilex67–1020.853
Figure 4: Real robot results. Success rates (%) on five tasks on the ARX ACone platform.
Figure 4: Real robot results. Success rates (%) on five tasks on the ARX ACone platform.
Table 4: Real robot scoring.
TaskStep 1Step 2Step 3Step 4
Put Fruits33.333.333.3
Put Blocks25252525
Fold Towel5050
Sweep Trash25252525
Insert Screw25252525
Figure 5: Real robot rollouts. Key frames from five evaluation tasks on the ARX ACone platform.
Figure 5: Real robot rollouts. Key frames from five evaluation tasks on the ARX ACone platform.
Table 5: Per-task results on RoboTwin including Pi0.5 (success rate %).
TaskPi0.5Robot-onlyEgo2R (1:3)Ego2R (3:1)Ego2R (1:1)
CleanRandCleanRandCleanRandCleanRandCleanRand
adjust_bottle62.018.094.077.092.079.0100.072.089.091.0
beat_block_hammer48.016.063.027.064.056.057.018.065.071.0
blocks_ranking_rgb74.016.056.060.064.063.049.043.078.060.0
blocks_ranking_size32.00.030.022.046.021.043.07.052.016.0
click_alarmclock44.056.096.093.0100.087.0100.085.0100.0100.0
click_bell32.040.0100.095.0100.094.0100.093.0100.0100.0
dump_bin_bigbin72.070.054.073.072.069.081.076.086.072.0
grab_roller94.046.098.071.068.048.091.064.089.063.0
handover_block16.00.05.02.018.04.039.09.036.09.0
handover_mic26.04.069.013.086.034.083.017.097.023.0
hanging_mug10.04.014.016.014.09.012.09.010.010.0
lift_pot8.02.093.028.084.014.095.044.093.044.0
move_can_pot28.00.047.050.030.040.042.085.047.065.0
move_pillbottle_pad60.044.063.060.068.069.041.067.074.082.0
move_playingcard_away90.052.074.058.088.092.088.042.092.063.0
move_stapler_pad22.06.023.019.034.021.030.013.043.031.0
open_laptop68.020.077.061.074.056.064.046.075.058.0
open_microwave26.08.077.059.042.029.037.032.050.025.0
pick_diverse_bottles56.018.060.037.058.053.071.050.070.050.0
pick_dual_bottles82.014.091.059.080.077.083.055.097.054.0
place_a2b_left60.010.040.055.058.042.054.048.073.044.0
place_a2b_right58.014.042.049.052.041.053.051.064.053.0
place_bread_basket68.044.075.055.072.064.076.059.079.062.0
place_bread_skillet86.046.076.041.076.050.080.061.087.053.0
place_burger_fries90.078.096.083.098.081.097.088.096.088.0
place_can_basket40.00.049.025.038.09.034.015.034.016.0
place_cans_plasticbox94.074.090.068.054.068.097.059.070.059.0
place_container_plate96.058.086.076.092.079.093.073.093.081.0
place_dual_shoes54.012.050.030.034.027.035.017.035.019.0
Figure 6: 15 supported robot morphologies. 3D models of all 15 robots.
Figure 6: 15 supported robot morphologies. 3D models of all 15 robots.

실제로 확인된 결과

  • RoboTwin 무작위 설정에서 Ego2R와 실제 로봇 데이터를 1:1로 섞은 모델이 53.5% 성공률로 로봇 전용 대비 2.6%포인트 높았고, 정상(클린) 설정에서는 68.1%를 유지했다.
  • 시각 요소별로 배경 +4, 조명 +8, 로봇 색상 +6, 카메라 위치 +6의 성공률 개선이 1:1 비율에서 관찰됐다.
  • 낯선 물체 일반화는 29%에서 40%로(3:1 비율에서 +11) 개선됐고, 말투를 바꾼 지시문에 대한 성공률은 1:1 비율에서 69%에 도달했다.
  • 다른 로봇 종류로 교체하는 테스트에서 ARX는 44%에서 51%로, UR5는 3:1 비율에서 31%로 개선됐으나 Franka는 7% 미만에 머물렀다.
  • 실제 ARX ACone 로봇 5개 과제에서, 텔레오퍼레이션 시연과 합성 데이터를 섞은 모델이 로봇 전용 대비 모든 과제에서 더 높은 점수를 기록했고, 블록 넣기와 나사 끼우기에서 개선 폭이 가장 컸다.
Figure 7: Pretraining data composition. Slices show per-source sampling weights (training mix); panel titles give the total data volume. (a) Robot (∼6,565 h). (b) Ego2R (∼18,561 h).
Figure 7: Pretraining data composition. Slices show per-source sampling weights (training mix); panel titles give the total data volume. (a) Robot (∼6,565 h). (b) Ego2R (∼18,561 h).

어디에 쓸 수 있나

  • 실제 로봇 시연 수집이 어려운 신규 로봇 팔이나 신규 작업에, 이미 촬영된 사람 손 조작 영상을 활용해 사전학습 데이터를 늘리는 데 참고할 수 있다.
  • 새로운 배경·조명·물체·언어 표현이 자주 바뀌는 서비스 로봇 환경에서, 다양성이 큰 사람 영상 데이터를 보조 학습원으로 검토할 수 있다.
  • 여러 로봇 기종(예: 협동로봇 팔, 휴머노이드 팔)을 동시에 지원해야 하는 프로젝트에서, 하나의 사람 영상을 여러 로봇 형태로 동시에 변환하는 방식을 참고할 수 있다.
Figure 8: Ego play → Ego2R synthesis on real-world scenes. Top: original egocentric human manipulation. Bottom: Ego2R pipeline output with ACone robot overlay.
Figure 8: Ego play → Ego2R synthesis on real-world scenes. Top: original egocentric human manipulation. Bottom: Ego2R pipeline output with ACone robot overlay.

한계와 남은 검증

  • 손동작을 단순한 평행 그리퍼(집게) 움직임으로만 변환하기 때문에, 손가락을 세밀하게 움직이는 정교한 조작(다지 로봇손 등)에는 그대로 적용하기 어렵다.
  • 영상 합성 과정이 인페인팅과 깊이 기반 합성에 의존해, 심한 가림이나 복잡한 조명 조건에서는 합성 화질이 떨어질 수 있다.
  • 평가는 RoboTwin2.0이 다루는 작업 범위에 한정되어 있어, 더 넓은 작업과 로봇 구성으로 일반화되는지는 추가 검증이 필요하다.
  • Franka Panda처럼 학습 데이터의 로봇 형태와 기구학적 차이가 큰 로봇에서는 교체 성공률이 7% 미만으로 낮아, 모든 로봇 종류에 동일하게 이득이 가는 것은 아니다.
Figure 9: Comparison with Pi0.5 across RoboTwin settings.
Figure 9: Comparison with Pi0.5 across RoboTwin settings.

왜 중요한가

로봇 학습에 가장 큰 병목은 값비싸고 느린 실제 로봇 시연 수집인데, 이미 세상에 넘쳐나는 사람의 1인칭 조작 영상을 자동으로 로봇용 데이터로 바꿀 수 있다면 데이터 확보 비용을 크게 낮출 수 있다. 특히 처음 보는 배경·조명·로봇 종류·물체·지시 문구에도 잘 버티는 능력(분포 밖 일반화)이 이런 방식으로 향상된다는 점은 실제 서비스 로봇 배치에 직접적인 의미가 있다.

이 논문의 용어

  • 1인칭(에고센트릭) 영상 · 사람이 머리나 몸에 카메라를 달아 자신의 시점에서 손으로 물건을 다루는 모습을 찍은 영상
  • VLA 모델(비전-언어-행동 모델) · 카메라 영상과 언어 지시를 입력받아 로봇이 취할 동작을 직접 출력하는 인공지능 모델
  • 역기구학(IK) · 로봇 팔 끝이 원하는 위치·자세에 오도록 각 관절의 각도를 계산하는 방법
  • 분포 밖 일반화(OOD generalization) · 학습 때 보지 못한 배경, 물체, 로봇 종류, 표현 방식 등 낯선 상황에서도 성능을 유지하는 능력
  • 엔드이펙터(EEF) · 로봇 팔 끝에 달린 그리퍼(집게) 등 실제로 물체와 접촉하는 부위

저자 · Ye Wang

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL LAB 최신 기사

그림 출처: Ye Wang et al., arXiv:2608.02580, arxiv-nonexclusive