멀티토큰 예측
multi-token prediction
AI가 답을 만들 때 한 글자씩이 아니라 여러 글자를 한꺼번에 예측해 답변 속도를 높이는 기법
쉽게 말하면
멀티토큰 예측은 AI가 답변을 만들 때 다음에 올 글자(토큰)를 한 번에 여러 개씩 미리 예측하는 기법이다.
보통 AI는 문장을 만들 때 단어를 하나 뱉고, 그걸 다시 읽어들여 다음 단어를 만들고, 또 그걸 읽어들여 그다음 단어를 만드는 식으로 한 걸음씩 나아간다. 한 글자씩 손으로 타이핑하는 사람과, 다음에 나올 몇 글자를 미리 머릿속에 떠올려두고 한 번에 손을 놀리는 사람을 비교하면 이해가 쉽다. 후자가 같은 시간에 더 많은 글자를 써낼 수 있는 것처럼, 멀티토큰 예측을 쓰면 AI도 같은 시간에 더 많은 답을 만들어낼 수 있다.
결과적으로 답변이 나오는 속도가 빨라지고, 같은 일을 하는 데 드는 전기도 아낄 수 있다. 다만 여러 개를 한꺼번에 짚어내는 만큼 예측이 어긋날 위험도 있어서, 실제로는 미리 짚은 것을 다시 확인하는 절차를 함께 쓰는 경우가 많다. 답변 속도를 끌어올리는 여러 기법 중 하나로 이해하면 된다.
기사에서 이렇게 나와요
기사에서는 "Jalapeño가 멀티토큰 예측이나 추측 디코딩 같은 가속 기법을 쓰지 않고 이 수치를 냈다"는 식으로 등장해요. 즉 이런 속도 개선 기법을 아직 안 썼는데도 좋은 성능을 냈다는 뜻이고, 반대로 나중에 이런 기법을 더하면 지금보다 더 빨라질 여지가 남아 있다는 의미로 읽으면 된다. 멀티토큰 예측 자체가 특정 회사만의 기술은 아니라는 점도 오해하기 쉬운 부분이다.
