비전-언어-액션 모델
Vision-Language-Action Model
로봇이 눈으로 본 장면과 사람의 말을 이해해 곧바로 움직임 명령까지 만들어내는 인공지능 구조
쉽게 말하면
비전-언어-액션 모델(VLA)은 로봇이 카메라로 본 장면과 사람이 말이나 글로 준 지시를 함께 이해한 뒤, 팔다리를 어떻게 움직일지까지 직접 계산해내는 하나로 이어진 시스템이다.
비유하면 관광 가이드와 비슷하다. 가이드는 눈으로 주변 풍경을 보고(비전), 손님이 하는 말을 알아듣고(언어), 실제로 발을 옮겨 길을 안내한다(액션). VLA도 마찬가지로 카메라로 컵을 보고 "컵을 들어"라는 지시를 받으면, 팔 관절을 몇 도씩 움직여야 하는지까지 한 번에 뽑아낸다.
보통 이런 모델은 사진과 글을 이해하도록 미리 훈련된 기존 인공지능 위에, 몸을 움직이는 부분을 새로 얹어서 만든다. 다만 이 방식은 장면을 말로 설명하는 데는 강하지만, 물건을 쥐었을 때 어떻게 눌리고 변형될지 같은 물리적 변화를 예측하는 데는 약하다는 지적이 있다. 이 때문에 최근에는 글 대신 영상으로 물리 현상을 미리 학습한 모델로 바꾸려는 시도도 나오고 있다.
