멀티모달 에이전트
Multimodal agent
텍스트뿐 아니라 이미지·오디오·영상·3D 모델 등 여러 형식의 자료를 주고받으며 실제 작업을 수행하는 AI 에이전트
쉽게 말하면
멀티모달 에이전트는 글자만 주고받는 게 아니라 사진도 보고, 소리도 듣고, 영상도 만들고, 입체 모형까지 다루는 일 잘하는 비서다. 예전 챗봇이 질문에 문장으로 답하는 데 그쳤다면, 이 비서는 새의 울음소리를 듣고 종을 구분하거나, 심장 초음파 영상을 보고 이상 여부를 짚어내거나, 부엌 사진을 보고 가구 배치도를 그려주는 식으로 여러 감각을 동시에 쓴다.
문제는 이런 결과물엔 정답이 하나로 딱 떨어지지 않는다는 점이다. 수학 문제처럼 숫자를 맞히거나 코드처럼 실행해서 통과·실패를 가르는 방식이 안 통한다. 그래서 이 능력을 평가할 때는 사람이나 다른 에이전트가 결과물끼리 맞대결을 붙여 어느 쪽이 더 나은지 점수를 매기는 방식을 쓰기도 한다.
결국 멀티모달 에이전트는 텍스트 하나로는 해결이 안 되는, 여러 형태의 자료가 뒤섞인 실무 업무를 대신 처리하도록 만든 AI인 셈이다.
기사에서 이렇게 나와요
직접 해보기
함께 볼 용어
이 용어가 나온 기사
- 구글 리서치, 웨어러블 데이터서 우울증 관련 바이오마커 후보를 우선순위화하는 AI 공개AI · 2026.08.22
- 메타, AI 에이전트 평가용 WildArtifactBench 과제 10개 첫 공개AI · 2026.08.21
- 메타, 로컬 에이전트용 300억 파라미터 개방형 모델 공개AI · 2026.08.10
- 메타 Muse Spark 1.2, 지능 지수 54점으로 공동 3위AI · 2026.08.09
- 그록 4.6 공개…최상위 성능에 절반 가격AI · 2026.08.13
- 메타 유료 에이전트 Hatch, 10월 신모델 Watermelon과 등장AI · 2026.08.26
