GQA 구조
Grouped Query Attention
여러 개의 질문 헤드가 답변 자료 헤드를 그룹으로 묶어 공유해 연산과 메모리를 줄이는 어텐션 설계 방식
쉽게 말하면
GQA(Grouped Query Attention)는 AI 모델이 문장을 읽고 이해할 때 쓰는 계산 구조를 가볍게 줄이는 설계 방식이다. AI 모델은 문장을 이해하려고 단어마다 여러 개의 질문(쿼리)을 던지고, 그 질문에 답할 자료(키와 값)를 따로 준비해 대조한다. 원래는 질문 하나당 답변 자료도 하나씩 마련해야 해서 자료를 저장하고 불러오는 부담이 컸다.
GQA는 이 부담을 줄이려고 여러 개의 질문을 몇 개 그룹으로 묶어, 한 그룹이 같은 답변 자료를 나눠 쓰게 한다. 마치 회의에서 32명의 질문자가 각자 개인 비서를 두는 대신, 8명의 비서를 4명씩 그룹으로 나눠 공유하는 것과 비슷하다. 질문자 수는 그대로지만 준비해야 할 자료의 양이 줄어드니, 계산도 빨라지고 저장 공간도 덜 든다.
기사에 나온 보조 초안 모델처럼 크기가 작은 모델을 빠르게 돌려야 할 때 특히 자주 쓰이는 구조다. 질문과 답변 자료의 비율을 얼마나 촘촘히 묶느냐(예: 32개 질문 헤드가 8개 답변 헤드를 공유)에 따라 속도와 정확도의 균형이 달라진다.
