METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 용어사전ㅂ기사에 자주 나오는 기술 용어

비전-언어-액션 모델

Vision-Language-Action Model

로봇이 눈으로 본 장면과 사람의 말을 이해해 곧바로 움직임 명령까지 만들어내는 인공지능 구조

쉽게 말하면

비전-언어-액션 모델(VLA)은 로봇이 카메라로 본 장면과 사람이 말이나 글로 준 지시를 함께 이해한 뒤, 팔다리를 어떻게 움직일지까지 직접 계산해내는 하나로 이어진 시스템이다.

비유하면 관광 가이드와 비슷하다. 가이드는 눈으로 주변 풍경을 보고(비전), 손님이 하는 말을 알아듣고(언어), 실제로 발을 옮겨 길을 안내한다(액션). VLA도 마찬가지로 카메라로 컵을 보고 "컵을 들어"라는 지시를 받으면, 팔 관절을 몇 도씩 움직여야 하는지까지 한 번에 뽑아낸다.

보통 이런 모델은 사진과 글을 이해하도록 미리 훈련된 기존 인공지능 위에, 몸을 움직이는 부분을 새로 얹어서 만든다. 다만 이 방식은 장면을 말로 설명하는 데는 강하지만, 물건을 쥐었을 때 어떻게 눌리고 변형될지 같은 물리적 변화를 예측하는 데는 약하다는 지적이 있다. 이 때문에 최근에는 글 대신 영상으로 물리 현상을 미리 학습한 모델로 바꾸려는 시도도 나오고 있다.

기사에서 이렇게 나와요

기사에서는 "기존 비전-언어-액션(VLA) 모델은 사전학습된 비전-언어모델에 행동 모듈을 추가하는 방식"이라고 설명한다. 여기서 오해하기 쉬운 점은 VLA가 로봇을 움직이는 유일한 방법이라는 생각이다. 실제로는 여러 접근 중 하나이며, 이 기사에서 엔비디아는 언어 대신 영상으로 물리 현상을 배우는 다른 방식을 대안으로 제시했다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기