집안일을 하는 사람의 눈, 몸, 손, 소리, 촉감을 동시에 녹화하는 장비로 로봇 학습용 데이터를 만들었다
집안일을 하는 사람의 눈, 몸, 손, 소리, 촉감을 동시에 녹화하는 장비로 로봇 학습용 데이터를 만들었다
ACE는 실제 가정집을 촬영 스튜디오로 바꿔, 사람이 요리하고 정리하는 모습을 1인칭 영상, 3인칭 다중 시점 영상, 전신·손 모션, 물체 위치, 소리, 촉각 압력까지 모두 같은 시간·공간 기준으로 동시에 기록하는 시스템이다. 이렇게 모은 ACE-Data-0은 150시간, 200가지 작업, 50명 참가자, 17M프레임, 7만5000개 상호작용 장면으로 구성된 대규모 데이터셋이다. 연구팀은 이 데이터로 촉각 예측, 몸·손 동작 복원, 손-물체 상호작용 추정이라는 세 단계 벤치마크를 만들어 30여 개 기존 방법을 평가했다.
METAL LAB 해설 도표
ACE 데이터 수집 구조
증거 상태측정 결과와 예정된 검증이 함께 있음
- 두 가지 촬영 설치손 조작용 탁상 규모(근접 카메라 8대+모션캡처 16대)와 전신 이동용 방 규모(광각 카메라 8대+모션캡처 12대)를 동시에 운영
- 다중 센서 동시 녹화1인칭 헤드셋 영상, 3인칭 다중 시점 영상, 전신·손 모션캡처, 물체 6자유도 궤적, 오디오, 촉각 압력 장갑을 같은 시간·공간 기준으로 기록
- 자동 주석 생성추적된 실제 물리 상태로부터 카메라 캘리브레이션, 자세 투영, 물체 메시·궤적, 텍스트 설명을 자동 생성
- 3단계 벤치마크 평가촉각 신호 예측(신호), 전신·손 자세 복원(구성요소), 1인칭·3인칭 손-물체 상호작용 추정(상호작용) 순으로 30여 개 방법을 테스트
무엇을 했나
- 기존 데이터셋들은 1인칭 영상만 있거나(Ego4D, EPIC-Kitchens 등), 정밀한 몸·물체 동작은 있지만 1인칭 시점이나 소리·촉각이 빠져 있는 등(BEHAVE, GRAB, ARCTIC 등) 정보가 조각나 있었다는 문제를 지적했다.
- 이를 해결하기 위해 탁상 규모(정밀한 손 조작용, 8대 근접 카메라와 16대 모션캡처 카메라)와 방 규모(전신 이동용, 8대 광각 카메라와 12대 모션캡처 카메라) 두 가지 설치를 만들고, 참가자는 모션캡처 슈트와 촉각 장갑, 4개 어안렌즈가 달린 헤드셋을 착용해 촬영했다.
- 모든 센서 신호는 하드웨어 또는 소프트웨어로 시간 동기화되고 공통 좌표계에 정렬되어, 같은 순간의 영상·소리·동작·촉각이 서로 어긋나지 않게 기록된다.
- 수집된 ACE-Data-0에는 카메라 캘리브레이션, 전신·손 자세와 각 카메라 화면에의 투영, 물체의 3D 메시와 6자유도 위치, 텍스트 설명 등 풍부한 주석이 자동으로 붙어 있다.
- 이 데이터로 촉각 신호 예측, 사람 전신·손 동작 추정, 1인칭·3인칭 영상에서의 손-물체 상호작용 추정이라는 세 단계 벤치마크를 만들어 30여 개 최신 방법을 평가했다.

| Dataset | Year | Hours | #Frames | #Subj | #Obj | #Tasks | Ego | #Exo | Body | Hand | Obj. 6D | Tactile | Audio | Sync | Setup | LH |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Egocentric video | ||||||||||||||||
| Ego4D [33] | 2022 | 3670 | – | 931 | – | Open | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | – | In-the-wild | ✓ |
| EPIC-KITCHENS-100 [19] | 2021 | 100 | 20M | 37 | – | Open | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | – | Kitchens | ✓ |
| HoloAssist [95] | 2023 | 166 | – | 222 | 16 | 20 | ✓ | ✗ | ✗ | (✓) | ✗ | ✗ | ✓ | – | Desktop | ✓ |
| Ego-Exo4D [34] | 2024 | 1286 | – | 740 | – | 8 Dom. | ✓ | 4–5 | (✓) | ✗ | ✗ | ✗ | ✓ | ✓ | In-the-wild | ✓ |
| EgoLife [100] | 2025 | 266 | – | 6 | – | Open | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | ✓ | ✗ | Shared house | ✓ |
| HD-EPIC [73] | 2025 | 41 | 4.46M | 9 | – | 69 | ✓ | ✗ | ✗ | ✗ | (✓) | ✗ | ✓ | – | Home kitchens | ✓ |
| Hand–object interaction | ||||||||||||||||
| ContactPose [7] | 2020 | – | 2.9M | 50 | 25 | 2 | ✗ | 3 | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | Table-top | ✗ |
| HO-3D [36] | 2020 | – | 78K | 10 | 10 | – | ✗ | 1–5 | ✗ | ✓ | ✓ | ✗ | ✗ | ✗ | Table-top | ✗ |
| GRAB [88] | 2020 | – | 1.6M | 10 | 51 | 4 | ✗ | ✗ | ✓ | ✓ | ✓ | (✓) | ✗ | – | Mocap lab | ✗ |
| DexYCB [15] | 2021 | – | 582K | 10 | 20 | 1 | ✗ | 8 | ✗ | ✓ | ✓ | ✗ | ✗ | ✗ | Table-top | ✗ |
| H2O [52] | 2021 | – | 571K | 4 | 8 | 36 | ✓ | 4 | ✗ | ✓ | ✓ | ✗ | ✗ | ✓ | Table-top | ✗ |
| OakInk [101] | 2022 | – | 230K | 12 | 100 | 5 | ✗ | 4 | ✗ | ✓ | ✓ | ✗ | ✗ | ✓ | Table-top | ✗ |
| HOI4D [61] | 2022 | 22 | 2.4M | 9 | 800 | 54 | ✓ | ✗ | ✗ | ✓ | ✓ | ✗ | ✗ | – | Indoor rooms | ✗ |
| ARCTIC [22] | 2023 | – | 2.1M | 10 | 11 | 2 | ✓ | 8 | ✓ | ✓ | ✓ | ✗ | ✗ | ✓ | Mocap lab | ✗ |
| TACO [60] | 2024 | – | 5.2M | 14 | 196 | 151 | ✓ | 12 | ✗ | ✓ | ✓ | ✗ | ✗ | ✓ | Table-top | ✗ |
| HOT3D [3] | 2024 | 13.9 | 3.7M | 19 | 33 | Open | ✓ | ✗ | ✗ | ✓ | ✓ | ✗ | ✗ | – | Lab rooms | ✗ |
| OakInk2 [110] | 2024 | – | 4.0M | 9 | 75 | 150 | ✓ | 3 | (✓) | ✓ | ✓ | ✗ | ✗ | ✓ | Table-top | (✓) |
| GigaHands [26] | 2025 | 34 | 183M | 56 | 417 | Open | ✗ | 51 | ✗ | (✓) | (✓) | ✗ | ✗ | ✗ | Table-top | ✗ |
| Full-body HOI, human-scene interaction, and daily motion | ||||||||||||||||
| BEHAVE [5] | 2022 | – | 15K | 8 | 20 | – | ✗ | 4 | ✓ | ✗ | ✓ | ✗ | ✗ | ✓ | Lab rooms | ✗ |
| InterCap [41] | 2022 | – | 67K | 10 | 10 | – | ✗ | 6 | ✓ | (✓) | ✓ | ✗ | ✗ | ✓ | Lab room | ✗ |
| CHAIRS [44] | 2022 | 17.3 | – | 46 | 81 | 32 | ✗ | 4 | ✓ | ✓ | ✓ | ✗ | ✗ | ✓ | Lab room | – |
| EgoBody [113] | 2022 | – | 220K | 36 | – | 5 Cat. | ✓ | 3–5 | (✓) | (✓) | ✗ | ✗ | ✗ | ✓ | Indoor rooms | ✗ |
| Aria Digital Twin [69] | 2023 | 6.6 | – | – | 398 | Open | ✓ | ✗ | (✓) | ✗ | ✓ | ✗ | ✓ | – | Apartment, office | ✗ |
| OMOMO [54] | 2023 | 10 | – | 17 | 15 | – | ✗ | ✗ | ✓ | ✗ | ✓ | ✗ | ✗ | – | Lab room | ✗ |
| HIMO [65] | 2024 | – | 4.1M | 34 | 53 | – | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | – | Mocap lab | ✗ |
| TRUMANS [45] | 2024 | 15 | 1.6M | 7 | 20 | – | ✗ | ✗ | ✓ | ✗ | (✓) | ✗ | ✗ | – | Scene mockups | ✗ |
| ParaHome [50] | 2024 | 8.1 | – | 38 | 22 | – | ✗ | 70 | ✓ | ✓ | ✓ | ✗ | ✗ | ✓ | Home room | ✓ |

| Device | Role | Qty | Resolution / rate | Notes |
|---|---|---|---|---|
| OptiTrack PrimeX 22 | Optical motion capture | 28 | 2048×1088, 60 Hz | IR tracking: 41 body markers, objects, ego rig |
| ZED One | Exocentric RGB capture | 8 | 1920×1080, 30 FPS | GMSL2 to a single Jetson Orin host; shared frame trigger |
| GoPro | Exocentric RGB capture | 8 | 1920×1080, 30 FPS | Rigidly mounted on stands; audio-triggered recording |
| ACE-Ego-Head-V02 Lite | Egocentric capture | 4 cameras | 4×1088×1280, 20 FPS | One headset: front/back fisheye pairs, IMU, 5 markers |
| Manus | Hand pose | 2 gloves | 60 Hz | Per-finger articulation, both hands |
| ACE-Sense-Glove Lite | Contact pressure | 2 gloves | – | Full-palm pressure map, both hands |
| Jetson Orin | Recording host | 1 | – | Ingests all ZED One streams; NatNet-coordinated |
| Motive host (PC) | Mocap host, sync reference | 2 | – | Renders the optical clock for cross-system sync |

| Method | Temp Acc. ↑ | C-IoU ↑ | V-IoU ↑ | CoP ↓ |
|---|---|---|---|---|
| PressureVision [32] | 0.0093 | 0.0007 | 0.0000 | 10.9807 |
| EgoPressureDiff [109] | 0.2912 | 0.0197 | 0.0025 | 8.5152 |
| TouchAnything [115] | 0.7095 | 0.1646 | 0.1357 | 6.5846 |

| Method | PA-MPJPE ↓ | PA-PVE ↓ | MPJPE ↓ | PVE ↓ | WA-MPJPE ↓ |
|---|---|---|---|---|---|
| — Single-view exocentric, per-frame — | |||||
| Multi-HMR [4] | 110.5 | – | 115.3 | – | – |
| Multi-HMR2 [24] | 85.5 | – | 92.8 | – | – |
| SAM-3D-Body [103] | 71.0 | – | 76.4 | – | – |
| PyMAF-X [111] | 94.7 | 177.5 | 99.9 | 177.0 | – |
| PARE [51] | 98.7 | 132.3 | 102.0 | 134.8 | – |
| CameraHMR [70] | 78.7 | 98.7 | 85.7 | 105.2 | – |
| OSX [59] | 59.2 | 73.7 | 62.5 | 76.6 | – |
| — Single-view exocentric, temporal — | |||||
| SMPLer-X [11] | 57.0 | 70.2 | 59.8 | 71.7 | – |
| SMPLest-X [107] | 55.7 | 65.8 | 58.8 | 67.6 | – |
| Humans-in-4D [31] | 77.1 | 94.4 | 79.6 | 96.4 | – |
| GVHMR [84] | 88.0 | 104.1 | 96.3 | 112.0 | 217.1 |
| WHAM [85] | 131.1 | 160.2 | 144.0 | 166.4 | 243.1 |
| EasyMoCap [21, 86] | 103.4 | 155.8 | 106.0 | 156.1 | 256.2 |
| — Single-view exocentric, scene-aware — | |||||
| Phy-SIC [68] | 64.3 | 78.9 | 71.3 | 84.6 | – |
| UniSH [55] | 80.0 | 111.2 | 82.8 | 114.0 | 196.3 |
| JOSH [62] | 64.0 | 89.2 | 69.9 | 95.0 | 245.1 |
| Human3R [16] | 60.1 | 75.4 | 63.5 | 80.6 | 180.2 |
| — Multi-view exocentric — | |||||
| MAMMA [18] | 70.1 | 86.8 | 74.8 | 89.6 | 230.8 |
| U-HMR [57] | 134.4 | 176.0 | 150.2 | 179.2 | – |
| HSfM [67] | 92.8 | 133.8 | 93.8 | 134.8 | – |
| — Egocentric — | |||||
| EgoEgo [53] | 159.6 | 245.3 | 163.4 | 263.9 | 306.2 |
| EgoAllo [106] | 131.7 | 196.8 | 147.9 | 220.3 | 252.2 |

| Method | PA-MPJPE ↓ | MPJPE ↓ | F@5 ↑ | F@15 ↑ | AUCJ ↑ | Traj. err. ↓ |
|---|---|---|---|---|---|---|
| WildHands [76] | 11.2 | 12.6 | 0.175 | 0.774 | 0.776 | – |
| Dyn-HaMR [108] | 18.9 | 21.1 | 0.042 | 0.413 | 0.624 | 98.2 |
| HaWoR [112] | 13.8 | 17.4 | 0.130 | 0.666 | 0.729 | 102.1 |

| Method | PA-MPJPE ↓ | MPJPE ↓ | F@5 ↑ | F@15 ↑ | AUCJ ↑ | Traj. err. ↓ |
|---|---|---|---|---|---|---|
| HORT [17] | 10.8 | 12.3 | 0.276 | 0.776 | 0.784 | – |
| HaMeR [72] | 9.6 | 10.4 | 0.281 | 0.848 | 0.812 | – |
| HaPTIC [105] | 10.0 | 10.7 | 0.247 | 0.838 | 0.804 | 63.0 |
| WiLoR [75] | 9.1 | 9.9 | 0.313 | 0.854 | 0.819 | – |
| OmniHands [58] | 10.7 | 11.5 | 0.211 | 0.814 | 0.791 | – |

실제로 확인된 결과
- 1인칭 영상 기반 손 동작 추정에서 프레임별 방법(WildHands)이 관절 자세 정확도는 가장 좋았지만, 비디오 기반 방법(Dyn-HaMR, HaWoR)은 카메라 움직임 추정 오차 때문에 전역 궤적 오차가 98~102mm로 크게 나타났다.
- 3인칭 영상 기반 손 동작 추정에서는 다섯 방법의 관절 자세 정확도가 PA-MPJPE 9.1~10.8mm로 비슷했고, WiLoR가 9.1mm로 가장 좋았으며 HaMeR이 9.6mm로 근접했다.
- 고정된 3인칭 카메라를 이용한 HaPTIC은 궤적 오차가 63mm로, 1인칭 방법들의 98~102mm보다 훨씬 낮아, 고정 시점이 궤적 추정에 유리함을 보였다.
- 물체를 함께 복원하는 HORT는 조작 프레임에서 PA-MPJPE 10.8mm를 기록해 다른 방법들과 비슷한 수준이었고, 물체 정보를 함께 쓰는 것이 뚜렷한 이득이나 손해를 주지는 않았다.
- 1인칭과 3인칭을 비교했을 때 3인칭 방법들이 자세와 궤적 모두에서 더 나은 결과를 보였는데, 이는 고정 카메라가 안정적인 기준 좌표계를 제공하기 때문으로 분석됐다.

어디에 쓸 수 있나
- 가정용 로봇이나 휴머노이드의 모방학습·정책학습에 쓸 수 있는 동기화된 시각-동작-촉각 데이터로 활용
- 1인칭 영상만으로 손 동작이나 촉각을 추정하는 모델의 성능을 검증하는 벤치마크로 사용
- 1인칭·3인칭 영상을 함께 쓰는 손-물체 상호작용 인식 연구의 출발점으로 활용

한계와 남은 검증
- 현재 두 곳의 가정집에서만 촬영되어 실내 구조, 가구, 조명의 다양성이 제한적이다.
- 추적 대상은 사전에 3D 스캔하고 마커를 부착한 물체로 한정되어, 문 여닫힘 같은 관절 기구나 액체, 변형되는 재질의 상태 변화는 기록되지 않는다.
- 모션캡처 슈트, 촉각 장갑, 헤드셋, 마커가 영상에 그대로 보여 데이터셋 특유의 시각적 흔적이 남을 수 있다.
- 1인칭과 3인칭 스트림을 함께 활용하거나 헤드셋의 측정된 움직임 정보, 물체 자세를 보조 입력으로 주는 등의 실험은 아직 수행되지 않고 향후 연구로 제안됐다.

왜 중요한가
로봇이나 AI가 사람처럼 손으로 물건을 다루는 법을 배우려면 시각, 동작, 소리, 촉감이 같은 순간에 어떻게 얽혀 있는지 보여주는 데이터가 필요한데, 기존 자료는 이런 정보가 흩어져 있어 학습에 한계가 있었다. ACE는 실제 가정에서 이 모든 신호를 동시에 정확히 기록하는 방법을 제시해, 모방학습이나 세계모델 같은 로봇 학습 연구에 쓸 수 있는 토대를 마련했다.

이 논문의 용어
- 1인칭(egocentric)/3인칭(exocentric) 영상 · 사람이 직접 착용한 카메라로 찍은 시야(1인칭)와 외부에 고정된 카메라로 찍은 시야(3인칭)
- 6자유도(6-DoF) 포즈 · 물체의 3차원 위치(앞뒤·좌우·상하)와 회전(세 방향의 기울기)을 합쳐 6개 값으로 나타낸 자세 정보
- MANO · 손의 관절과 형태를 3D로 표현하는 표준 손 모델
- PA-MPJPE · 크기·위치·회전을 각각 맞춘 뒤 관절 위치 오차를 재는 지표, 손가락 자세 정확도를 주로 측정
- 모션캡처(OptiTrack) · 몸이나 물체에 붙인 마커를 여러 카메라로 추적해 정밀한 3D 동작을 기록하는 장비

최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다
- 단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구
- AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다
METAL LAB 최신 기사
그림 출처: Yukang Cao et al., arXiv:2607.28625, arxiv-nonexclusive