자기지도 파운데이션 모델
Self-supervised Foundation Model
정답이 붙지 않은 원시 데이터에서 스스로 패턴을 찾아 학습한 뒤 여러 과제에 두루 쓰이는 밑바탕 모델.
쉽게 말하면
자기지도 파운데이션 모델은, 선생님이 채점해준 문제집 없이 스스로 문제와 답을 만들어가며 실력을 키운 다음, 여러 다른 시험에 두루 써먹을 수 있는 밑바탕 실력을 뜻한다.
비유하자면 이런 식이다. 보통 공부는 「이 문제의 정답은 이것」이라고 누가 표시해준 문제집으로 한다. 그런데 이 표시 작업, 즉 라벨을 붙이는 일은 사람 손이 많이 가고 비용도 크다. 자기지도 방식은 이 라벨 없이, 데이터 자체의 앞뒤 관계나 가려진 부분을 스스로 맞혀보는 연습을 반복해 감을 익힌다. 예를 들어 혈당 신호를 하루 종일 쭉 늘어놓고 중간중간 비어 있는 구간을 채워 넣는 연습만 시켜도, 모델은 몸속 대사 패턴이 어떻게 흘러가는지 스스로 익히게 된다.
이렇게 익힌 감각은 한 가지 문제에만 쓰이지 않고 여러 과제에 재사용할 수 있어서 파운데이션(기반) 모델이라 부른다. 구글 리서치가 내놓은 GlucoFM이 그런 사례다. 라벨 붙은 임상 데이터 없이 혈당 측정기의 원시 신호만 보고 학습했는데도, 당뇨병 위험이나 인슐린 저항성처럼 서로 다른 여러 예측 과제에서 기존 모델보다 나은 성능을 냈다.
기사에서 이렇게 나와요
기사에서는 「라벨이 붙은 임상 데이터 없이 원시 혈당 신호만 학습했는데도」라는 표현으로 이 개념을 설명한다. 오해하기 쉬운 부분은, 자기지도 학습이 「아무 기준 없이 마구잡이로 배운다」는 뜻이 아니라는 점이다. 데이터 안에서 스스로 정답에 해당하는 부분을 만들어내(예: 빈칸 채우기) 학습하기 때문에, 사람이 붙인 라벨만 없을 뿐 학습 자체는 체계적으로 이뤄진다.
