
이미지: METAL
요약
- 월드랩스가 실제 로봇 작업 하나를 가상환경 수천 변형으로 재현해 훈련하는 R2S2R 엔진을 공개했다
- 이 엔진으로 훈련한 제어 모델은 ALOHA를 포함한 5개 로봇 플랫폼에서 각 1시간씩 사람 개입 없이 작동했다
- 기술은 지난 7월 월드랩스가 인수한 SceniX에서 나왔으며, 로봇 개발의 병목이 실제 하드웨어 테스트에 있다는 문제의식에서 출발했다
- 개발사
- World Labs (페이페이 리 창업)
- 엔진명
- Real-to-Sim-to-Real (R2S2R)
- 기반 기술
- SceniX — 2026년 7월 월드랩스가 인수
- 변형 요소
- 조명, 물체 위치·개수, 환경, 마찰 등 물리 속성, 카메라 각도
- 테스트 결과
- ALOHA 포함 5개 로봇 플랫폼에서 각 1시간씩 무개입 작동
- 테스트 작업 예
- 냉장고에 전선 감기, 시험관 재배치, 얇은 물체 분리
로봇 동작 하나가 수천 개로 불어난다
로봇 팔이 케이블을 구멍에 꽂는 동작 하나를 실제로 찍으면, 월드랩스의 새 엔진은 이걸 조명·물체 위치와 개수·주변 환경·마찰 같은 물리 속성·카메라 각도까지 바꿔가며 수천 개의 가상 변형으로 불린다. 페이페이 리가 세운 스타트업 월드랩스가 8월 15일 공개한 이 시뮬레이션 엔진의 이름은 'Real-to-Sim-to-Real', 줄여서 R2S2R이다. 로봇과 센서, 작업 환경, 시연 영상을 그대로 캡처한 뒤 겉모습만 비슷한 게 아니라 물리적으로 똑같이 반응하는 가상 세계로 재구성하는 방식이다. 이 기술은 월드랩스가 지난 7월 인수한 스타트업 SceniX에서 나왔다.
공개된 예시에는 케이블을 정리해 배선하는 작업, 탄성 있는 케이블 끝을 구멍에 끼우는 작업, 두 손으로 상자에 물건을 채우는 작업이 포함됐다. 딱딱한 물체와 움직이는 물체, 형태가 변하는 물체까지 다뤄야 하는 과제들이다.
가상과 현실을 나란히 놓고 맞춰본다
생성한 가상 세계가 실제와 얼마나 비슷한지 검증하는 방법도 함께 공개됐다. 월드랩스는 같은 동작 순서를 시뮬레이션과 실제 로봇에서 동시에 실행한 뒤 관찰값, 물체의 움직임, 결과를 서로 비교한다. 이 비교 과정이 곧 시뮬레이션이 실제 하드웨어의 대역 역할을 할 수 있는지 판단하는 기준이 된다.

5개 로봇에서 한 시간씩, 사람 없이
이렇게 가상에서만 훈련한 제어 모델은 실제 로봇으로 옮겨 테스트를 거쳤다. 첫 번째 시험대는 ALOHA였다. 스탠퍼드가 만든 오픈소스 양팔 로봇으로, 작은 조작 팔 두 개로 원격 조종하는 방식이다. 상업용 시스템보다 훨씬 저렴하고 설계도가 전부 공개돼 있어 로봇공학 연구에서 기준 플랫폼처럼 쓰인다.
ALOHA를 포함해 총 5개의 서로 다른 로봇 플랫폼에서 각 모델이 한 시간씩 사람 개입 없이 작동했다고 월드랩스는 밝혔다. 작업은 두 손으로 냉장고에 전원 코드를 감는 것부터 시험관을 정밀하게 재배치하는 것, 마커나 연필처럼 얇은 물체를 뒤엉킨 더미에서 골라내는 것까지 다양했다. 회사는 이 시스템이 특정 제어 모델이나 로봇 종류에 묶여 있지 않다고 설명했다. 한 번 재구성한 가상 세계를 나중에 다른 모델, 다른 로봇에도 재사용할 수 있다는 얘기다.
| 테스트 플랫폼 | 무개입 작동 시간 | 대표 작업 |
|---|---|---|
| ALOHA (스탠퍼드 오픈소스) | 1시간 | 원격 조종 기반 정밀 조작 |
| 추가 플랫폼 4종 | 각 1시간 | 전선 감기, 시험관 재배치, 얇은 물체 분리 |

왜 지금 이 방식인가
월드랩스는 로봇 배치가 늦어지는 이유가 모델 구조 자체보다 로봇이 안정적으로 작동하기 위해 필요한 경험의 양이라고 짚었다. 실제 세계 데이터는 수집 비용이 크고 통제하기 어려우며, 온라인 영상조차 물체 종류와 물리 조건, 실패 상황을 체계적으로 담지 못한다는 것이다. 언어 모델은 텍스트만 있으면 대량으로 평가할 수 있지만, 로봇 제어 모델은 그동안 실제 하드웨어에서 돌려봐야만 성능을 확인할 수 있었다. 월드랩스는 시뮬레이션이 현실과 똑같은 성공률을 낼 필요는 없다고 본다. 중요한 건 같은 질문에 답할 수 있는가다 — 모델이 어디서 실패하는지, 어느 버전이 더 나은지를 가려낼 수 있으면 된다는 논리다.
에디터의 시선
로봇공학이 지난 1~2년 새 가장 자주 듣는 말은 '데이터가 부족하다'였다. 다이나 로보틱스가 인간 영상 100만 시간을 학습시킨 것도, NVIDIA가 영상 기반 월드모델 개념을 밀어붙인 것도 결국 같은 병목을 다른 방식으로 뚫으려는 시도였다. 월드랩스의 R2S2R은 이 병목을 정면으로 다르게 공략한다. 데이터를 더 많이 모으는 대신, 이미 있는 데이터 하나를 물리적으로 정확한 가상 세계로 늘려서 재사용하겠다는 접근이다. 언어 모델이 인터넷의 텍스트를 거의 공짜로 흡수했던 것과 달리 로봇은 물리 세계에서 몸으로 부딪혀야 데이터를 얻는데, 그 비용을 시뮬레이션으로 우회하겠다는 발상 자체는 새롭지 않지만 SceniX 인수 이후 이 정도 완성도로 내놓은 곳은 드물다.
실무적으로 보면 체감이 갈리는 지점은 '시뮬레이션이 현실과 얼마나 닮았느냐'가 아니라 '같은 질문에 답할 수 있느냐'로 기준을 낮춘 부분이다. 이 크기의 로봇 스타트업을 취재하다 보면 항상 같은 결론에 닿는다 — 시뮬레이터의 완벽한 물리 재현은 몇 년째 요원했지만, 모델 랭킹을 매기고 실패 지점을 찾아내는 용도로는 지금 수준의 시뮬레이션도 충분히 쓸모가 있다는 것. 월드랩스는 그 낮은 기준선을 정확히 겨냥한 셈이다.
국내에서 로봇 파운데이션 모델을 다루는 팀이라면 이 발표에서 눈여겨볼 대목은 재사용성이다. 한 번 재구성한 가상 세계를 다른 모델, 다른 로봇에 그대로 적용할 수 있다는 주장이 사실이라면, 로봇 플랫폼마다 처음부터 시뮬레이션 환경을 새로 짜야 했던 비용을 상당 부분 줄일 수 있다. 다만 다섯 개 플랫폼에서 각 한 시간씩이라는 검증 기간은 실험실 수준의 증명이지 상용 배치의 근거로 보기엔 이르다.
앞으로 몇 달간은 이 R2S2R 방식이 다른 로봇 스타트업의 파운데이션 모델 훈련 파이프라인에 얼마나 빨리 흡수되는지가 관전 포인트다. 로봇 학습이 실제 하드웨어 의존에서 벗어나는 속도가 곧 이 업계 전체의 개발 주기를 결정할 것이다.





댓글