METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 용어사전G기사에 자주 나오는 기술 용어

GQA 구조

Grouped Query Attention

여러 개의 질문 헤드가 답변 자료 헤드를 그룹으로 묶어 공유해 연산과 메모리를 줄이는 어텐션 설계 방식

쉽게 말하면

GQA(Grouped Query Attention)는 AI 모델이 문장을 읽고 이해할 때 쓰는 계산 구조를 가볍게 줄이는 설계 방식이다. AI 모델은 문장을 이해하려고 단어마다 여러 개의 질문(쿼리)을 던지고, 그 질문에 답할 자료(키와 값)를 따로 준비해 대조한다. 원래는 질문 하나당 답변 자료도 하나씩 마련해야 해서 자료를 저장하고 불러오는 부담이 컸다.

GQA는 이 부담을 줄이려고 여러 개의 질문을 몇 개 그룹으로 묶어, 한 그룹이 같은 답변 자료를 나눠 쓰게 한다. 마치 회의에서 32명의 질문자가 각자 개인 비서를 두는 대신, 8명의 비서를 4명씩 그룹으로 나눠 공유하는 것과 비슷하다. 질문자 수는 그대로지만 준비해야 할 자료의 양이 줄어드니, 계산도 빨라지고 저장 공간도 덜 든다.

기사에 나온 보조 초안 모델처럼 크기가 작은 모델을 빠르게 돌려야 할 때 특히 자주 쓰이는 구조다. 질문과 답변 자료의 비율을 얼마나 촘촘히 묶느냐(예: 32개 질문 헤드가 8개 답변 헤드를 공유)에 따라 속도와 정확도의 균형이 달라진다.

기사에서 이렇게 나와요

기사는 "32개 쿼리 헤드가 8개 KV 헤드를 공유하는 GQA 구조"라고 설명한다. 여기서 오해하기 쉬운 점은 GQA가 이번에 새로 나온 기술이라는 인상인데, 사실 GQA는 이미 여러 대형 언어 모델에서 흔히 쓰이는 표준 설계이며, 이 기사에서는 속도를 높이는 보조 모델(초안 모델)의 크기를 줄이는 데 활용됐을 뿐이다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기